Prompt análisis y exploración de datos

Inicio » Prompts » Prompt análisis y exploración de datos

Este prompt está diseñado para realizar un análisis exploratorio completo de un conjunto de datos antes de modelar nada. Sirve para evaluar la calidad del dataset, detectar nulos, duplicados y atípicos, estudiar distribuciones y correlaciones, identificar sesgos y proponer nuevas variables.

Puedes copiarlo y pegarlo directamente en tu herramienta de inteligencia artificial. Después, sustituye los campos entre corchetes por el objetivo del análisis, la descripción del negocio, la estructura del dataset y las preguntas que quieres responder.

Para qué sirve este prompt

El EDA es la fase que todo el mundo tiene claro que hay que hacer y casi nadie hace entera. Se mira la forma del dataset, se pintan cuatro histogramas y se salta al modelo, y los problemas aparecen después: una variable con el 40% de nulos, dos columnas que miden lo mismo, un sesgo de recogida que nadie detectó. Este prompt impone el recorrido completo y en orden.

  • Evaluar la calidad del dataset antes de cualquier análisis avanzado.
  • Detectar valores nulos, duplicados, inconsistencias y variables constantes.
  • Describir cada variable con la estadística que le corresponde.
  • Identificar outliers univariantes y multivariantes, con su posible causa.
  • Estudiar correlaciones, multicolinealidad y variables redundantes.
  • Proponer nuevas variables que puedan mejorar futuros modelos.
  • Documentar las limitaciones y los sesgos del análisis.

Prompt listo para copiar y pegar en tu IA

Copia el siguiente prompt completo y pégalo en tu IA. Después, completa los campos del contexto. Pídele el código y ejecútalo tú: si le pasas solo una muestra y te devuelve estadísticos, esos números pueden estar estimados y no calculados.

Prompt para copiar:

ROL

Actúa como un Científico de Datos Senior, con más de 20 años de experiencia en análisis exploratorio de datos, estadística aplicada, machine learning, inteligencia de negocio y visualización. Has trabajado en proyectos de finanzas, salud, marketing, industria, retail, telecomunicaciones, energía y administración pública. Eres experto en descubrir patrones ocultos, identificar anomalías, evaluar la calidad de los datos y convertir la información en conocimiento accionable.


TAREA

Realiza un EDA completo, riguroso y profesional sobre el conjunto de datos que te proporciono.

Antes de comenzar:

- Comprende el objetivo del análisis.
- Analiza la estructura del conjunto de datos.
- Identifica el tipo de cada variable.
- Detecta problemas de calidad de datos.
- Evalúa el tamaño y la complejidad del dataset.
- Si falta información importante sobre el negocio o el origen de los datos, pídeme únicamente lo imprescindible.

Después:

- Analiza la calidad del dataset.
- Identifica valores nulos, duplicados y atípicos, y detecta inconsistencias.
- Analiza la distribución de cada variable.
- Estudia las relaciones entre variables e identifica las correlaciones relevantes.
- Detecta posibles sesgos.
- Evalúa la necesidad de transformar variables.
- Identifica oportunidades de ingeniería de características.
- Extrae conclusiones útiles para las fases posteriores del proyecto.


CONTEXTO

Objetivo del análisis:
[predicción / segmentación / clasificación / análisis descriptivo / optimización de procesos / detección de fraude]

Descripción del negocio:
[a qué se dedica y qué decisión depende de esto]

Fuente de los datos:
[de dónde salen y cómo se recogen]

Archivo o base de datos:
[CSV / Excel / SQL / API / Data Warehouse]

Número aproximado de registros:
[nº de filas]

Número de variables:
[nº de columnas]

Variable objetivo (si existe):
[cuál y de qué tipo]

Descripción de las variables:
[PEGAR AQUÍ NOMBRE, TIPO Y SIGNIFICADO DE CADA UNA]

Periodo temporal cubierto:
[desde cuándo hasta cuándo]

Frecuencia de actualización:
[diaria / mensual / puntual]

Calidad conocida de los datos:
[problemas que ya conoces]

Hipótesis iniciales:
[lo que esperas encontrar]

Preguntas de negocio que se desean responder:
[las concretas]

Herramientas preferidas:
[Python / R / SQL / Power BI / Tableau / Excel]

Observaciones adicionales:
[cambios de sistema, huecos conocidos, contexto]


RESTRICCIONES Y EXPECTATIVAS

Basa todas las conclusiones en evidencia estadística y no hagas inferencias sin respaldo en los datos.

Explica los resultados de forma comprensible.

Diferencia claramente entre hechos, hipótesis e interpretaciones.

Detecta los problemas de calidad antes de cualquier análisis avanzado.

Justifica todas las recomendaciones.

Utiliza las métricas estadísticas apropiadas para cada tipo de variable.

Prioriza la claridad visual en la interpretación de resultados.

Señala las limitaciones del análisis.

Identifica los riesgos que puedan afectar a futuros modelos predictivos.


FORMATO DE SALIDA


1. RESUMEN EJECUTIVO

Objetivo del análisis, descripción general del dataset, principales hallazgos, nivel estimado de calidad de los datos, riesgos detectados y recomendaciones iniciales.


2. DESCRIPCIÓN DEL CONJUNTO DE DATOS

Tabla con: Variable | Tipo | Descripción | Valores únicos | Valores nulos

Más un resumen de número de registros, número de variables, tipos de datos y tamaño del dataset.


3. ANÁLISIS DE CALIDAD DE DATOS

Valores nulos, duplicados, registros inconsistentes, variables constantes, errores de formato y calidad general. Propón acciones correctivas para cada problema.


4. ESTADÍSTICA DESCRIPTIVA

Para variables numéricas: media, mediana, moda, desviación estándar, varianza, percentiles, rango, mínimo, máximo, asimetría y curtosis, con su interpretación.

Para categóricas: frecuencias, distribuciones, categorías dominantes y rarezas.


5. DISTRIBUCIÓN DE VARIABLES

Para cada una: tipo de distribución, normalidad, concentración, dispersión y transformaciones recomendadas. Indica qué gráfico sería el más adecuado.


6. DETECCIÓN DE VALORES ATÍPICOS

Outliers univariantes y multivariantes, posibles causas, impacto sobre el análisis y recomendaciones de tratamiento.


7. RELACIONES ENTRE VARIABLES

Correlaciones, dependencias, multicolinealidad, relaciones lineales y no lineales, variables redundantes y variables con mayor capacidad explicativa. Incluye una tabla resumen de correlaciones relevantes.


8. SEGMENTACIÓN PRELIMINAR

Si procede, posibles grupos naturales de datos: características comunes, diferencias principales y utilidad para análisis posteriores.


9. INGENIERÍA DE CARACTERÍSTICAS

Nuevas variables que podrían mejorar futuros modelos: cómo generarlas, qué información aportarían e impacto esperado.


10. VISUALIZACIONES RECOMENDADAS

Qué gráficos convienen para interpretar los datos y por qué cada uno.


11. HALLAZGOS PRINCIPALES

Patrones encontrados, tendencias, anomalías, variables más importantes, riesgos y oportunidades, explicando cómo pueden influir en el negocio.


12. RECOMENDACIONES PARA EL SIGUIENTE PASO

Qué hacer antes de construir modelos: limpieza, normalización, escalado, codificación, eliminación de variables, balanceo de clases, imputación o creación de nuevas variables.


13. LIMITACIONES DEL ANÁLISIS

Limitaciones del dataset, posibles sesgos, variables ausentes, calidad de la información y riesgos para la interpretación.


14. CHECKLIST FINAL

Verifica que se ha comprendido el objetivo de negocio, que se han analizado todas las variables, que se ha evaluado la calidad del dataset, que se han detectado nulos, duplicados y atípicos, que se han analizado distribuciones y correlaciones, que se han identificado posibles sesgos y que el dataset está preparado para las siguientes fases.

Cómo usarlo bien

La diferencia entre un EDA real y una descripción plausible de lo que debería salir está en si el código se ejecuta o no. Ese es el punto crítico de este prompt y conviene tenerlo claro desde el principio.

  • Pídele el código, no los resultados: si le pasas una muestra y te devuelve estadísticos, esos números pueden estar estimados.
  • Usa un entorno con ejecución de código si el dataset es grande.
  • Explica el negocio, no solo las columnas: sin saber qué decisión depende del análisis, el EDA sale correcto y a la vez inútil.
  • Cuenta cómo se recogieron los datos: la mayoría de los sesgos serios no están en el fichero, están en quién quedó fuera de la muestra.
  • Cuidado con los datos personales: si trabajas con datos reales de clientes, pacientes o empleados, usa un entorno autorizado por tu empresa.
  • Revisa qué propone hacer con los outliers: eliminarlos por defecto es un error frecuente, porque en fraude o mantenimiento predictivo el atípico es justo lo que buscas.
  • Lee el apartado de limitaciones con atención: es el más valioso del informe y el que más se salta todo el mundo.

Herramientas recomendadas

Para este prompt lo importante es que la herramienta pueda ejecutar código sobre tus ficheros. Sin eso obtienes un guion de análisis, que también sirve, pero no es lo mismo que un análisis.

  • Claude: muy sólida aquí, porque ejecuta código sobre tus ficheros y mantiene el hilo en un análisis de catorce apartados.
  • ChatGPT: práctica por su intérprete de código, que permite subir el CSV y trabajar sobre los datos reales.
  • Gemini: cómoda si los datos están en Google Sheets o BigQuery.
  • GitHub Copilot: útil para escribir y depurar el código del EDA directamente en tu entorno de trabajo.
  • Jupyter: el sitio natural para ejecutar el análisis y dejarlo documentado.
  • Power BI: si el destinatario del análisis es negocio y necesita verlo en un cuadro de mando.
  • DBeaver: para explorar la base de datos antes de exportar nada.

Ideal para

  • Científicos y analistas de datos que arrancan un proyecto nuevo.
  • Quien recibe un dataset ajeno y necesita entenderlo antes de tocarlo.
  • Equipos de BI que preparan datos para un cuadro de mando.
  • Estudiantes y perfiles junior que quieren un EDA completo como guía de trabajo.
  • Empresas que van a construir su primer modelo predictivo.
  • Consultoras que auditan la calidad de los datos de un cliente.
  • Cualquier profesional que sospeche que sus datos no están tan limpios como creía.

* Este prompt es una herramienta de apoyo para realizar análisis exploratorios con ayuda de inteligencia artificial. Ejecuta siempre el código tú mismo: los estadísticos que aparezcan en el texto sin haber procesado el fichero son ilustrativos, no resultados. Y si trabajas con datos personales reales, hazlo en un entorno autorizado por tu empresa.

A tu medida

¿Necesitas algo hecho para ti?

Pídeme tu skill

Te creamos una skill a medida para automatizar tu trabajo con IA.

Pedir mi skill

Pídeme tu prompt

Te preparamos el prompt exacto para conseguir el resultado que buscas.

Pedir mi prompt

Pídeme tu artefacto

Calculadoras, mini-apps y herramientas interactivas creadas con IA para ti.

Pedir mi artefacto
¿Quieres aprender IA con ayuda? Solicita formación con un experto de ComparexIA. Quiero formación con un experto

AVISO LEGAL — Prompts y recursos de inteligencia artificial

Los prompts publicados en ComparexIA son instrucciones de texto de carácter orientativo, diseñadas como punto de partida para facilitar el uso de herramientas de inteligencia artificial. Su resultado puede variar significativamente en función de la herramienta utilizada, la versión del modelo, la configuración aplicada y el contexto específico de cada usuario.

ComparexIA no garantiza que los prompts publicados produzcan resultados concretos, precisos, completos ni adecuados para un fin determinado. El contenido generado por cualquier herramienta de IA a partir de estos prompts es responsabilidad exclusiva del usuario que lo utiliza y, en su caso, de la propia herramienta de inteligencia artificial empleada.

El usuario es el único responsable del uso que haga del contenido generado, de su revisión previa a cualquier publicación o uso profesional, y de verificar que dicho contenido cumple con la legislación aplicable y con las condiciones de uso de la plataforma o herramienta de destino.

ComparexIA no asume ninguna responsabilidad por errores, inexactitudes, sesgos o cualquier otro perjuicio derivado del uso de los prompts aquí publicados ni del contenido que las herramientas de IA generen a partir de ellos.

Si para acceder a determinados prompts o recursos se te solicita que facilites tus datos personales a través de un formulario, dichos datos serán tratados por ComparexIA conforme a lo establecido en nuestra Política de Privacidad. En ningún caso la facilitación de datos personales es requisito obligatorio para acceder al contenido informativo general del portal.

¿Necesitas ayuda con inteligencia artificial? Te ayudamos a encontrar la herramienta adecuada para tu proyecto.
Scroll al inicio