Prompts para datos y análisis: CSV, SQL y gráficos con IA
TL;DR
Cómo pedir análisis de datos a un agente: describir el dataset con schema y semántica, pedir limpieza antes que análisis, definir la pregunta de negocio, exigir código reproducible y verificar números con una segunda pasada. Plantillas para CSV, SQL y gráficos.

Por qué importa
Esta nota se enfoca en la decisión práctica para builders: qué cambia, qué riesgo agrega y cómo aplicarlo sin romper operación.
Pedirle a un agente "analiza estos datos" es la forma más rápida de obtener números bonitos e incorrectos. Los agentes de datos son excelentes ejecutores y pésimos adivinadores: si no describes el dataset, la limpieza y la pregunta de negocio, rellenan los huecos con suposiciones. Esta guía cubre el prompt de análisis en cinco capas —dataset, limpieza, pregunta, reproducibilidad y verificación— con plantillas que funcionan para CSV, SQL y gráficos.
Capa 1: describe el dataset como si fuera para un colega
Antes de pedir cualquier análisis, describe qué recibe el agente. Un buen bloque de contexto:
Dataset: ventas_2026.csv
- 12,400 filas, 8 columnas, exportado de {sistema}
- Columnas:
- fecha: fecha de venta (YYYY-MM-DD)
- tienda: nombre de la tienda (texto libre, puede tener
variaciones: "GT-PB", "gt_pb", "Puerto Barrios")
- sku: código de producto
- cantidad: unidades vendidas (entero, puede ser 0)
- monto_usd: monto total (float, 2 decimales)
- cliente_id: id del cliente, puede estar vacío
- canal: "presencial" | "online" | "whatsapp"
- devolucion: 1 si la venta se devolvió, 0 si no
- Problemas conocidos: hay filas duplicadas de marzo y algunos
montos negativos por notas de crédito sin marcar.
Ese bloque vale más que diez instrucciones de análisis: el agente sabe qué preguntar, qué limpiar y qué significa cada campo. La semántica de columnas (qué es texto libre, qué es categoría, qué puede estar vacío) es lo que más evita errores de interpretación.
Capa 2: limpieza antes que análisis
El error clásico: pedir el análisis directo sobre datos sucios y recibir conclusiones sobre filas duplicadas. La limpieza se pide explícita y separada:
Paso 1 - Limpieza. Ejecuta y reporta:
1. Filas duplicadas: cuenta y elimina (deja la primera).
2. Montos negativos: sepáralos en una tabla de notas de crédito
y exclúyelos del análisis de ventas, salvo que indique lo
contrario.
3. Valores vacíos: reporta cuántos hay por columna. No los
rellenes con promedios sin preguntar.
4. Variaciones de tienda: normaliza con el mapeo que te doy.
5. Guarda el dataset limpio como ventas_2026_limpio.csv.
Reporta cuántas filas quedaron y qué cambió en cada paso.
Pedir el reporte de limpieza tiene dos efectos: verificas que el agente entendió los datos y dejas rastro de qué se excluyó. Un análisis sin su limpieza documentada no es reproducible.
Capa 3: la pregunta de negocio
"Analiza las ventas" es una invitación al ruido. La pregunta de negocio define qué calcular y por qué:
Pregunta de negocio: ¿qué tiendas y canales crecieron más entre
Q1 y Q2 de 2026, y cuánto del crecimiento viene de ventas
nuevas versus de menor tasa de devolución?
Métricas que necesito:
- Ventas netas por tienda por mes (monto_usd menos devoluciones)
- Crecimiento Q1 vs Q2 en % por tienda y por canal
- Tasa de devolución por tienda en cada trimestre
Formato de salida: tabla markdown por tienda + una tabla resumen
por canal, y 3 hallazgos en lenguaje de negocio (máximo 2 líneas
cada uno).
Nota cómo la pregunta separa la métrica (ventas netas) del análisis (qué explica el crecimiento). Eso obliga al agente a calcular lo que pediste, no lo que le pareció interesante.
Capa 4: exige código reproducible
Los agentes de datos no deberían entregarte solo números: deberían entregarte el código que los produce. La guía de structured outputs de OpenAI insiste en salidas definidas; para análisis, el equivalente es pedir el script:
Para cada cálculo, entrega el código que lo produce (Python o SQL,
según el caso):
- Python: pandas + matplotlib, sin dependencias extra, con el
CSV como única entrada. Documenta la ruta del archivo.
- SQL: consultas con comentarios de qué responde cada una.
Al final, incluye un bloque "Reproducir": los comandos exactos
para correr todo de nuevo, incluyendo cómo se generó cada tabla
y gráfico.
Con el código en mano, la verificación es directa: corres el script y confirmas los números. Si el agente no puede darte el código (porque hizo el cálculo "en su cabeza"), ese es el momento de desconfiar: los números que no se pueden reproducir no son análisis, son anécdotas.
Capa 5: verificación con segunda pasada

La verificación se pide también en el prompt, y no es opcional:
Paso final - Auditoría. Revisa tu propio análisis:
1. Recalcula las tres métricas principales por una vía distinta
(p. ej. SQL si usaste pandas, o sumas agrupadas manuales).
2. Compara totales: la suma de las filas del dataset limpio
debe cuadrar con los totales del reporte.
3. Busca valores que no pueden ser: montos negativos sin nota
de crédito, tasas de devolución > 100%.
4. Reporta cualquier discrepancia en una sección "Auditoría",
sin corregirla en silencio.
El propósito no es que el agente se atrape a sí mismo siempre: es que cualquier discrepancia quede declarada en vez de escondida. Con eso, tú decides si el número es confiable.
Del análisis al gráfico
Para gráficos, añade especificaciones de visualización:
Genera 2 gráficos:
1. Barras apiladas: ventas netas por tienda por mes (tiendas en
el eje X, meses como series).
2. Línea: tasa de devolución mensual, con etiquetas de valores.
Reglas: colores accesibles, títulos que digan el hallazgo ("Las
ventas de GT-PB crecieron 34% en Q2"), sin gridlines
innecesarias. Exporta a PNG a 150 dpi.
Un gráfico con título de hallazgo comunica más que uno con título descriptivo: la visualización debe responder la pregunta, no solo mostrar datos. La guía de conectar bases de datos a un agente cubre cómo montar el acceso del agente a tus datos, y la base de formatos de salida y roles está en la guía de prompt engineering para agentes. El hub de guías de construcción de agentes tiene más patrones de agentes de datos y análisis.

El resumen de esta guía en una frase: describe el dataset, limpia primero, define la pregunta de negocio, exige código reproducible y verifica los números con una segunda pasada. Con esas cinco capas, el análisis con IA pasa de ser una opinión con formato a ser evidencia que puedes defender.
Artículos relacionados
Sigue explorando Herramientas y otras lecturas para builders.

Prompts para investigación y análisis: resumir, comparar y extraer

Prompts para programar con agentes: Claude Code, Copilot y Cursor

System prompts para agentes: cómo escribir el cerebro de tu agente
