Ciencia de datosData Science
Todo el proceso de sacar respuestas útiles de los datos
- La ciencia de datos es la disciplina que se ocupa de sacar respuestas útiles a partir de datos dispersos.
- Sigue un orden. Fluye así: definir la pregunta, recopilar, limpiar, explorar, construir un modelo y comunicar.
- La mayor parte del tiempo no se va en el modelo, sino en la limpieza. La parte vistosa ocupa apenas el final.
- El aprendizaje automático es una herramienta más dentro de este trabajo. Muchas veces la respuesta cabe en unas filas de una tabla y un gráfico.
- El último paso es convencer. Si el resultado no se traduce en una decisión, el análisis no ha terminado.
Contenido
1La analogía
Lo único que queda en la escena de un crimen es un puñado de pistas sueltas: registros de llamadas, recibos, la grabación de una cámara en la esquina. Ninguna pista por sí sola dice nada. Hay que reunirlas, ponerlas en orden y revisar dónde no encajan para que aparezca lo que pasó ese día. Sacar una respuesta a partir de pistas dispersas es lo que hace la ciencia de datos.
Lo que más tiempo toma en una investigación no es deducir, sino ordenar. Hay que corregir relojes que no coinciden, unir a la misma persona registrada con nombres distintos y descartar pistas cuyo origen no está claro. Si este trabajo se hace a la ligera, ninguna deducción posterior, por brillante que sea, sirve de algo.
Una buena investigación empieza por la pregunta. "Qué pasó ese día" y "va a volver a pasar" son preguntas distintas, y las pistas que hay que reunir también cambian.
2En detalle
Primero se acota la pregunta
Pedir que alguien "le eche un vistazo a los datos" todavía no es una pregunta. El trabajo empieza cuando se acota hasta un punto que los datos puedan responder. "Por qué bajaron los clientes últimamente" no tiene respuesta, pero "entre quienes se registraron el mes pasado, ¿es más alto que antes el porcentaje que nunca volvió en la primera semana?" sí la tiene.
Al acotar la pregunta también queda claro qué se va a hacer según lo que se descubra. Si el resultado no cambia la decisión pase lo que pase, ese análisis sobra. Saltarse esta comprobación es la razón por la que a veces se pasan semanas armando una tabla que después no sirve para nada.
Casi todo el tiempo se va en recopilar y limpiar
Los datos del mundo real no llegan en una tabla ordenada. Hay casillas vacías, filas repetidas, unidades mezcladas y marcas de hora en husos distintos. Es común que la misma persona quede registrada con un nombre al inscribirse y con otro al pagar.
Esta parte parece aburrida, pero decide el resultado. Unos pocos valores mal cargados pueden mover el promedio entero, y las filas duplicadas inflan cualquier resultado. Por bueno que sea el modelo que se ponga después, si el material de partida está torcido, la respuesta también sale torcida.
Al limpiar también conviene revisar cómo se generaron los datos. Si solo queda registro de quien abrió la aplicación, esos datos no bastan para concluir que "la gente abre la aplicación seguido".
Primero se mira con los ojos
Antes de aplicar un modelo hay una etapa en la que los datos se convierten en gráficos. Mirar solo promedios y sumas deja pasar demasiado. Un mismo promedio puede esconder un grupo compacto o dos grupos separados en los extremos, y son historias completamente distintas.
En esta etapa aparecen valores raros y agrupaciones inesperadas: una fila con una edad de 200 años, un registro que se corta en seco cierto día de la semana, dos grupos de usuarios claramente distintos. Estos hallazgos, que llegan antes que cualquier respuesta, son los que arman la siguiente pregunta.
El modelo es la herramienta que se saca al final
Un modelo hace falta cuando hay que anticipar lo que va a pasar. Antes de eso, si una comparación simple o una división en grupos ya responde la pregunta, con eso alcanza, y además es más fácil de explicar.
Aquí es donde más se tropieza: confundir causa con correlación. Que dos cifras se muevan juntas no significa que una provoque la otra. Así como más ventas de helado coinciden con más accidentes de agua sin que el helado sea la causa, es frecuente que una tercera razón oculta mueva a las dos a la vez.
Para confirmar una causa hace falta comparar directamente separando condiciones: dividir a los usuarios en dos grupos, mostrarle a uno solo una pantalla distinta y comparar los resultados.
Comunicar también forma parte del trabajo
Cuando termina el análisis, queda convencer. Hay que transmitir juntos qué se descubrió, qué conviene hacer con eso y hasta dónde se puede confiar en la conclusión.
Quien conoce bien los números nunca se salta este último punto: avisa si la muestra es pequeña y puede fallar, o si hubo alguna circunstancia propia de ese período que se mezcló en los datos. Separar qué tan seguro y qué tan incierto es cada tramo ayuda mucho más a decidir que una conclusión presentada con total confianza.
3Con más precisión
La ciencia de datos está en el cruce de la estadística, la programación y el conocimiento del área en cuestión. Ninguna de las tres sola basta. Con solo estadística no se sabe qué significa una cifra sobre el terreno, y con solo conocimiento del área es fácil confundir una diferencia por azar con un hallazgo real. Los títulos varían de una empresa a otra —analista de datos, ingeniero de datos, ingeniero de aprendizaje automático— pero en la práctica las tareas se solapan bastante.
La analogía también tiene sus límites. Una investigación busca la única verdad de un hecho que ya ocurrió, mientras que la ciencia de datos busca tendencias a partir de muchos casos y sus conclusiones siempre cargan algo de incertidumbre. Por eso se habla más en términos de "parece estar relacionado en esta medida" que de "esto es la causa". Otra diferencia: las pistas de un caso quedan ahí de todos modos, pero los datos pueden estar sesgados desde el origen según quién los recogió y cómo. Por más fino que sea el cálculo, con datos torcidos la respuesta también sale torcida.
4Pruébalo
- Curso intensivo de aprendizaje automático de Google (en coreano) ailearn.space Sigue en un curso gratuito, paso a paso, el orden completo de dividir datos, explorarlos y construir un modelo
- MLU-Explain (conceptos de aprendizaje automático explicados con animaciones) ailearn.space Ves en movimiento cómo se dividen los datos y qué se mide. Las trampas que los números solos no muestran se hacen visibles
5Malentendidos comunes
Es fácil pensar que la ciencia de datos es lo mismo que construir modelos de IA, pero en realidad la mayor parte del tiempo se va en definir la pregunta y limpiar los datos.
Es fácil creer que con muchos datos la respuesta aparece sola, pero en realidad acumular datos sin saber cómo se recogieron solo aumenta la confianza en conclusiones equivocadas.
Es fácil pensar que si dos cosas se mueven juntas una causa la otra, pero en realidad suele haber una tercera razón oculta que mueve a ambas.
7Resumen en una línea
En resumenLa ciencia de datos reúne y ordena datos dispersos como si fueran pistas, saca de ahí una respuesta y lleva esa respuesta hasta convertirla en una decisión.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02