Prompt para creación de modelos predictivos de datos

Inicio » Prompts » Prompt para creación de modelos predictivos de datos

Este prompt está diseñado para planificar un proyecto completo de modelado predictivo. Sirve para identificar el tipo de problema, diseñar el pipeline de datos, comparar algoritmos con criterio, definir la validación y las métricas, y planificar el despliegue del modelo.

Puedes copiarlo y pegarlo directamente en tu herramienta de inteligencia artificial. Después, sustituye los campos entre corchetes por el objetivo de negocio, el tipo de problema, la descripción del dataset, la variable objetivo y las restricciones que tengas.

Para qué sirve este prompt

Entrenar un modelo es fácil; el problema es todo lo demás. Elegir el algoritmo con criterio y no por costumbre, validar de forma que el resultado se sostenga fuera del laboratorio, escoger la métrica que refleja el objetivo de negocio y no la que sale más bonita, y saber explicar por qué el modelo decide lo que decide. Este prompt cubre esa cadena completa.

  • Identificar qué tipo de problema de machine learning tienes realmente.
  • Diseñar el pipeline de preparación de datos paso a paso y justificado.
  • Comparar algoritmos con sus ventajas, inconvenientes y cuándo usar cada uno.
  • Elegir la métrica adecuada al objetivo de negocio, no la más favorable.
  • Analizar la interpretabilidad del modelo con SHAP, LIME o importancia de variables.
  • Detectar riesgos de sobreajuste, sesgos y deriva de datos.
  • Planificar el despliegue con reentrenamiento y monitorización.

Prompt listo para copiar y pegar en tu IA

Copia el siguiente prompt completo y pégalo en tu IA. Después, completa los campos del contexto. Indica el coste real de equivocarse: no es lo mismo un falso positivo en una campaña de marketing que en una detección de fraude, y de ahí sale la métrica correcta.

Prompt para copiar:

ROL

Actúa como un Científico de Datos Senior y Especialista en Machine Learning, con más de 20 años de experiencia desarrollando modelos predictivos para banca, seguros, salud, retail, telecomunicaciones, industria, energía, logística y administración pública. Dominas estadística avanzada, aprendizaje automático, optimización de modelos y MLOps. Tu objetivo es diseñar, entrenar, evaluar y documentar el modelo predictivo más adecuado para el problema de negocio planteado.


TAREA

Desarrolla un proyecto completo de modelado predictivo, desde el análisis inicial hasta la selección del modelo final.

Antes de comenzar:

- Comprende el problema de negocio.
- Identifica el tipo de problema de Machine Learning.
- Analiza la calidad y la estructura de los datos.
- Detecta posibles sesgos o limitaciones del dataset.
- Identifica la variable objetivo.
- Evalúa el equilibrio entre clases, si aplica.
- Si falta información relevante, pídeme únicamente lo imprescindible.

Después:

- Selecciona los algoritmos más adecuados.
- Diseña el pipeline de preparación de datos.
- Propón técnicas de ingeniería de características.
- Define el proceso de entrenamiento y validación.
- Compara diferentes modelos y optimiza los hiperparámetros.
- Evalúa el rendimiento con métricas adecuadas.
- Analiza la interpretabilidad del modelo.
- Detecta riesgos de sobreajuste o infraajuste.
- Recomienda el modelo más adecuado para producción.


CONTEXTO

Objetivo del negocio:
[predecir abandono de clientes / estimar ventas / detectar fraude / calcular riesgo / mantenimiento predictivo / previsión de demanda]

Problema de Machine Learning:
[clasificación / regresión / series temporales / clustering / detección de anomalías / recomendación]

Descripción del dataset:
[qué contiene y cómo está estructurado]

Fuente de los datos:
[origen y método de recogida]

Número de registros:
[nº de filas]

Número de variables:
[nº de columnas]

Variable objetivo:
[cuál y de qué tipo]

Variables predictoras:
[PEGAR AQUÍ LAS DISPONIBLES Y SU SIGNIFICADO]

Calidad del dataset:
[problemas conocidos]

Periodo temporal:
[desde cuándo hasta cuándo]

Restricciones del negocio:
[coste de un falso positivo, plazos, normativa aplicable]

Requisitos de interpretabilidad:
[alta si hay que explicar cada decisión / baja si solo importa acertar]

Tiempo máximo de entrenamiento:
[horas o minutos disponibles]

Recursos computacionales disponibles:
[CPU / GPU / memoria / cloud]

Herramientas preferidas:
[Python / R / SQL / Spark / TensorFlow / Scikit-learn / XGBoost / LightGBM / SageMaker / Vertex AI]

Observaciones adicionales:
[contexto relevante]


RESTRICCIONES Y EXPECTATIVAS

Basa todas las decisiones en criterios estadísticos y científicos.

No selecciones algoritmos sin justificar la elección.

Prioriza modelos robustos, interpretables y escalables.

Evita el sobreajuste y documenta las medidas adoptadas para prevenirlo.

Utiliza técnicas adecuadas de validación.

Explica las ventajas e inconvenientes de cada algoritmo considerado.

Prioriza la reproducibilidad del proceso.

Si existen restricciones regulatorias o de negocio, intégralas en el diseño.

El resultado debe ser apto para su despliegue en producción.


FORMATO DE SALIDA


1. RESUMEN EJECUTIVO

Objetivo del proyecto, tipo de problema predictivo, variable objetivo, principales retos, estrategia recomendada y modelo final sugerido.


2. COMPRENSIÓN DEL PROBLEMA

Problema de negocio, objetivos analíticos, variables relevantes, riesgos y criterios de éxito del modelo.


3. PREPARACIÓN DE LOS DATOS

Pipeline completo: limpieza, tratamiento de nulos, eliminación de duplicados, tratamiento de outliers, codificación de categóricas, escalado y normalización, balanceo de clases si procede y división en entrenamiento, validación y prueba. Justifica cada paso.


4. INGENIERÍA DE CARACTERÍSTICAS

Tabla con: Nueva característica | Método de creación | Beneficio esperado


5. SELECCIÓN DE ALGORITMOS

Tabla con: Algoritmo | Ventajas | Desventajas | Cuándo utilizarlo | Nivel de recomendación

Considera regresión lineal y logística, árboles de decisión, Random Forest, Gradient Boosting, XGBoost, LightGBM, CatBoost, SVM, KNN, redes neuronales, Naive Bayes y modelos de series temporales.


6. ESTRATEGIA DE ENTRENAMIENTO

División train/validation/test, validación cruzada, selección de hiperparámetros, regularización, early stopping y optimización del entrenamiento.


7. EVALUACIÓN DEL MODELO

Métricas adecuadas al tipo de problema:

- Clasificación: accuracy, precision, recall, F1, ROC-AUC, matriz de confusión y log loss.
- Regresión: MAE, MSE, RMSE, R² y MAPE.
- Series temporales: RMSE, MAE, MASE y SMAPE.

Explica cómo interpretar cada una.


8. COMPARATIVA DE MODELOS

Tabla con: Modelo | Rendimiento | Interpretabilidad | Tiempo de entrenamiento | Escalabilidad | Recomendación


9. INTERPRETABILIDAD

Cómo interpretar las predicciones con importancia de variables, SHAP, LIME, PDP e ICE plots. Indica qué variables influyen más y por qué.


10. RIESGOS Y VALIDACIÓN

Overfitting, underfitting, sesgos, drift de datos, calidad, robustez y generalización. Propón medidas para minimizar cada riesgo.


11. PLAN DE DESPLIEGUE

Arquitectura recomendada, frecuencia de reentrenamiento, monitorización, alertas, versionado, escalabilidad e integración vía API o servicios cloud.


12. RECOMENDACIONES DE MEJORA

Incorporar nuevas variables, obtener más datos, mejorar la calidad del dataset, probar nuevos algoritmos, automatizar el pipeline y reentrenamiento continuo.


13. LIMITACIONES DEL MODELO

Restricciones del dataset, limitaciones metodológicas, riesgos de interpretación y escenarios donde el modelo podría fallar.


14. CHECKLIST FINAL

Verifica que el problema de negocio está definido, que la variable objetivo es adecuada, que los datos están bien preparados, que se han comparado varios algoritmos, que el modelo se ha validado con métricas apropiadas, que se ha minimizado el sobreajuste, que el modelo es interpretable y que existe plan de despliegue y monitorización.

Cómo usarlo bien

Este prompt planifica y escribe el código; los resultados los produces tú al ejecutarlo. Y hay dos errores que arruinan modelos excelentes y que conviene pedirle expresamente que revise.

  • Ninguna métrica es válida hasta que sale de tu entrenamiento real.
  • Pídele expresamente que revise la fuga de datos: es el fallo que más modelos excelentes arruina, con variables que en producción no existirán o que se calculan después del hecho que quieres predecir.
  • Di el coste real de equivocarse: de ahí sale la métrica correcta.
  • Con series temporales, insiste en la validación temporal: la validación cruzada aleatoria entrena con el futuro y da resultados que no existen.
  • Si el modelo decide sobre personas —crédito, seguros, selección de personal, precios— hay obligaciones legales de información, revisión humana y control de sesgos.
  • Trata las cifras de rendimiento que aparezcan en el texto como ilustrativas: un ROC-AUC sin haber entrenado nada es una expectativa, no un resultado.
  • Empieza siempre por un baseline simple bien validado antes de sacar la artillería.

Herramientas recomendadas

Aquí necesitas dos cosas: una IA que diseñe y escriba el pipeline con criterio, y un entorno donde entrenar y versionar de verdad. El plan de despliegue del prompt es un guion; la implementación va aparte.

  • Claude: muy sólida para el diseño del proyecto y para escribir y ejecutar el código del pipeline sin perder coherencia.
  • ChatGPT: práctica por su intérprete de código, para probar rápido sobre el dataset real.
  • GitHub Copilot: la opción natural para desarrollar el pipeline dentro de tu propio entorno.
  • Gemini: cómoda si trabajas sobre BigQuery o Vertex AI.
  • Jupyter: donde se entrena, se compara y se documenta el experimento.
  • MLflow: para versionar modelos y no perder qué configuración dio qué resultado.
  • Scikit-learn: la referencia para el baseline antes de complicar nada.

Ideal para

  • Científicos de datos que arrancan un proyecto y quieren cerrar el enfoque antes de programar.
  • Analistas que dan el salto del informe descriptivo a la predicción.
  • Equipos que deben justificar ante negocio por qué eligieron un algoritmo y no otro.
  • Empresas que van a construir su primer modelo y necesitan una hoja de ruta completa.
  • Perfiles junior que quieren aprender el proceso entero, no solo la parte de entrenar.
  • Consultoras que preparan una propuesta técnica para un cliente.
  • Cualquier equipo con un modelo que funciona en pruebas y falla en producción.

* Este prompt es una herramienta de apoyo para planificar proyectos de machine learning con ayuda de inteligencia artificial. Las métricas solo valen si salen de tu propio entrenamiento, y los modelos que deciden sobre personas tienen obligaciones legales que conviene consultar antes de desplegar. Revisa además la fuga de datos: es lo que separa un modelo brillante en pruebas de uno inútil en producción.

A tu medida

¿Necesitas algo hecho para ti?

Pídeme tu skill

Te creamos una skill a medida para automatizar tu trabajo con IA.

Pedir mi skill

Pídeme tu prompt

Te preparamos el prompt exacto para conseguir el resultado que buscas.

Pedir mi prompt

Pídeme tu artefacto

Calculadoras, mini-apps y herramientas interactivas creadas con IA para ti.

Pedir mi artefacto
¿Quieres aprender IA con ayuda? Solicita formación con un experto de ComparexIA. Quiero formación con un experto

AVISO LEGAL — Prompts y recursos de inteligencia artificial

Los prompts publicados en ComparexIA son instrucciones de texto de carácter orientativo, diseñadas como punto de partida para facilitar el uso de herramientas de inteligencia artificial. Su resultado puede variar significativamente en función de la herramienta utilizada, la versión del modelo, la configuración aplicada y el contexto específico de cada usuario.

ComparexIA no garantiza que los prompts publicados produzcan resultados concretos, precisos, completos ni adecuados para un fin determinado. El contenido generado por cualquier herramienta de IA a partir de estos prompts es responsabilidad exclusiva del usuario que lo utiliza y, en su caso, de la propia herramienta de inteligencia artificial empleada.

El usuario es el único responsable del uso que haga del contenido generado, de su revisión previa a cualquier publicación o uso profesional, y de verificar que dicho contenido cumple con la legislación aplicable y con las condiciones de uso de la plataforma o herramienta de destino.

ComparexIA no asume ninguna responsabilidad por errores, inexactitudes, sesgos o cualquier otro perjuicio derivado del uso de los prompts aquí publicados ni del contenido que las herramientas de IA generen a partir de ellos.

Si para acceder a determinados prompts o recursos se te solicita que facilites tus datos personales a través de un formulario, dichos datos serán tratados por ComparexIA conforme a lo establecido en nuestra Política de Privacidad. En ningún caso la facilitación de datos personales es requisito obligatorio para acceder al contenido informativo general del portal.

¿Necesitas ayuda con inteligencia artificial? Te ayudamos a encontrar la herramienta adecuada para tu proyecto.
Scroll al inicio