¿Qué es Data Mining?

Data Mining forma parte de lo que hemos descrito en anteriores entradas de este blog como Business Analytics.

Es un proceso formado por metodologías, modelización y técnicas matemáticas y estadísticas que tiene por objetivo extraer información y conocimiento procedente de diversas fuentes, internas y externas y, de este modo, reforzar la toma de decisiones dentro de una organización.

La información extraída, desconocida de antemano, se refiere a asociaciones y relaciones que nos indicará, por ejemplo, qué, cómo y cuándo se venden nuestros productos.

El conocimiento nos ofrecerá patrones históricos y tendencias mediante la utilización de técnicas predictivas. Tanto la información como el conocimiento se extraerá de los datos y estarán
alineados con los objetivos de negocio. Dentro de Data Mining o minería de datos, coexisten especialidades como Text Mining dedicado al análisis de sentiment analysis, social network analysis y que son fundamentales para aplicaciones como reputation managment y la recomendación de contenidos.

Dada la importancia de Text Mining dedicaremos una próxima entrada en el blog para explicar en profundidad y mayor detalle cómo funciona está técnica.

Hemos intentado definir Data Mining. Para llevarlo a cabo necesitamos de una metodología. Una metodología que ordene los diferentes procesos y nos sirva de guía en los pasos a seguir en cada situación.

CRISP (cross industry standard process for data) es una metodología que nos servirá para ejecutar el proceso de data mining.

La metodología CRISP agrupa la actividad en seis grupos:
1.- Conocimiento del negocio: Naturaleza, características y objetivos de la empresa.
2.- Conocimiento de los datos: Trabajo y familiarización de los datos. Estructura, propiedades, procedencia, etc.,
3.- Preparación de los datos: Limpieza, construcción de un dataset, integración de datos procedentes de diversas fuentes (incluso heterogéneas)
4.- Modelo: Aplicación de técnicas de minería de datos, estadísticas, Machine Learning, etc.
5.- Evaluación del modelo: Verificación de los resultados de la aplicación del modelo. Elegir entre diferentes técnicas que dan solución a un mismo problema, etc.
6.- Implementación del modelo: Integrar los modelos aplicados con los sistemas operativos de la organización para su correcto funcionamiento.

Para concluir, reiterar las actividades propias de data mining y que nos aportarán una mayor ventaja competitiva:

  • Clasificación de documentos
  • Patrones y reglas de asociación
  • Optimización de procesos
  • Modelos predictivos que nos indiquen que sucederá en el futuro
  • Extrapolación.

En conclusión, podemos afirmar que la minería de datos, entendida como una actividad a desarrollar de manera continuada, nos aportará ventajas competitivas en una economía exigente y en proceso de cambios que afectan al conjunto de las empresas y organizaciones.

Address
304 North Cardinal St.
Dorchester Center, MA 02124

Work Hours
Monday to Friday: 7AM - 7PM
Weekend: 10AM - 5PM