Guía10 min

Prompts para datos y análisis: CSV, SQL y gráficos con IA

TL;DR

Cómo pedir análisis de datos a un agente: describir el dataset con schema y semántica, pedir limpieza antes que análisis, definir la pregunta de negocio, exigir código reproducible y verificar números con una segunda pasada. Plantillas para CSV, SQL y gráficos.

OpenAI
Escritorio de análisis con hoja de cálculo, consulta SQL y gráficos generados

Por qué importa

Esta nota se enfoca en la decisión práctica para builders: qué cambia, qué riesgo agrega y cómo aplicarlo sin romper operación.

Pedirle a un agente "analiza estos datos" es la forma más rápida de obtener números bonitos e incorrectos. Los agentes de datos son excelentes ejecutores y pésimos adivinadores: si no describes el dataset, la limpieza y la pregunta de negocio, rellenan los huecos con suposiciones. Esta guía cubre el prompt de análisis en cinco capas —dataset, limpieza, pregunta, reproducibilidad y verificación— con plantillas que funcionan para CSV, SQL y gráficos.

Capa 1: describe el dataset como si fuera para un colega

Antes de pedir cualquier análisis, describe qué recibe el agente. Un buen bloque de contexto:

Dataset: ventas_2026.csv
- 12,400 filas, 8 columnas, exportado de {sistema}
- Columnas:
  - fecha: fecha de venta (YYYY-MM-DD)
  - tienda: nombre de la tienda (texto libre, puede tener
    variaciones: "GT-PB", "gt_pb", "Puerto Barrios")
  - sku: código de producto
  - cantidad: unidades vendidas (entero, puede ser 0)
  - monto_usd: monto total (float, 2 decimales)
  - cliente_id: id del cliente, puede estar vacío
  - canal: "presencial" | "online" | "whatsapp"
  - devolucion: 1 si la venta se devolvió, 0 si no
- Problemas conocidos: hay filas duplicadas de marzo y algunos
  montos negativos por notas de crédito sin marcar.

Ese bloque vale más que diez instrucciones de análisis: el agente sabe qué preguntar, qué limpiar y qué significa cada campo. La semántica de columnas (qué es texto libre, qué es categoría, qué puede estar vacío) es lo que más evita errores de interpretación.

Capa 2: limpieza antes que análisis

El error clásico: pedir el análisis directo sobre datos sucios y recibir conclusiones sobre filas duplicadas. La limpieza se pide explícita y separada:

Paso 1 - Limpieza. Ejecuta y reporta:
1. Filas duplicadas: cuenta y elimina (deja la primera).
2. Montos negativos: sepáralos en una tabla de notas de crédito
   y exclúyelos del análisis de ventas, salvo que indique lo
   contrario.
3. Valores vacíos: reporta cuántos hay por columna. No los
   rellenes con promedios sin preguntar.
4. Variaciones de tienda: normaliza con el mapeo que te doy.
5. Guarda el dataset limpio como ventas_2026_limpio.csv.

Reporta cuántas filas quedaron y qué cambió en cada paso.

Pedir el reporte de limpieza tiene dos efectos: verificas que el agente entendió los datos y dejas rastro de qué se excluyó. Un análisis sin su limpieza documentada no es reproducible.

Capa 3: la pregunta de negocio

"Analiza las ventas" es una invitación al ruido. La pregunta de negocio define qué calcular y por qué:

Pregunta de negocio: ¿qué tiendas y canales crecieron más entre
Q1 y Q2 de 2026, y cuánto del crecimiento viene de ventas
nuevas versus de menor tasa de devolución?

Métricas que necesito:
- Ventas netas por tienda por mes (monto_usd menos devoluciones)
- Crecimiento Q1 vs Q2 en % por tienda y por canal
- Tasa de devolución por tienda en cada trimestre

Formato de salida: tabla markdown por tienda + una tabla resumen
por canal, y 3 hallazgos en lenguaje de negocio (máximo 2 líneas
cada uno).

Nota cómo la pregunta separa la métrica (ventas netas) del análisis (qué explica el crecimiento). Eso obliga al agente a calcular lo que pediste, no lo que le pareció interesante.

Capa 4: exige código reproducible

Los agentes de datos no deberían entregarte solo números: deberían entregarte el código que los produce. La guía de structured outputs de OpenAI insiste en salidas definidas; para análisis, el equivalente es pedir el script:

Para cada cálculo, entrega el código que lo produce (Python o SQL,
según el caso):
- Python: pandas + matplotlib, sin dependencias extra, con el
  CSV como única entrada. Documenta la ruta del archivo.
- SQL: consultas con comentarios de qué responde cada una.

Al final, incluye un bloque "Reproducir": los comandos exactos
para correr todo de nuevo, incluyendo cómo se generó cada tabla
y gráfico.

Con el código en mano, la verificación es directa: corres el script y confirmas los números. Si el agente no puede darte el código (porque hizo el cálculo "en su cabeza"), ese es el momento de desconfiar: los números que no se pueden reproducir no son análisis, son anécdotas.

Capa 5: verificación con segunda pasada

Flujo de análisis de datos: descripción del dataset, limpieza, pregunta de negocio, código reproducible y auditoría

La verificación se pide también en el prompt, y no es opcional:

Paso final - Auditoría. Revisa tu propio análisis:
1. Recalcula las tres métricas principales por una vía distinta
   (p. ej. SQL si usaste pandas, o sumas agrupadas manuales).
2. Compara totales: la suma de las filas del dataset limpio
   debe cuadrar con los totales del reporte.
3. Busca valores que no pueden ser: montos negativos sin nota
   de crédito, tasas de devolución > 100%.
4. Reporta cualquier discrepancia en una sección "Auditoría",
   sin corregirla en silencio.

El propósito no es que el agente se atrape a sí mismo siempre: es que cualquier discrepancia quede declarada en vez de escondida. Con eso, tú decides si el número es confiable.

Del análisis al gráfico

Para gráficos, añade especificaciones de visualización:

Genera 2 gráficos:
1. Barras apiladas: ventas netas por tienda por mes (tiendas en
   el eje X, meses como series).
2. Línea: tasa de devolución mensual, con etiquetas de valores.

Reglas: colores accesibles, títulos que digan el hallazgo ("Las
ventas de GT-PB crecieron 34% en Q2"), sin gridlines
innecesarias. Exporta a PNG a 150 dpi.

Un gráfico con título de hallazgo comunica más que uno con título descriptivo: la visualización debe responder la pregunta, no solo mostrar datos. La guía de conectar bases de datos a un agente cubre cómo montar el acceso del agente a tus datos, y la base de formatos de salida y roles está en la guía de prompt engineering para agentes. El hub de guías de construcción de agentes tiene más patrones de agentes de datos y análisis.

Verificación práctica para la guía de prompts para datos y análisis

El resumen de esta guía en una frase: describe el dataset, limpia primero, define la pregunta de negocio, exige código reproducible y verifica los números con una segunda pasada. Con esas cinco capas, el análisis con IA pasa de ser una opinión con formato a ser evidencia que puedes defender.