Noticia7 min

Gemini API estrena logs y datasets: el paso que faltaba para depurar agentes con Interactions

Google añadió registros y datasets en AI Studio para llamadas de Gemini, incluidas las Interactions API salvo Managed Agents. La mejora permite revisar trazas, compartir ejemplos y construir evaluaciones sobre ejecuciones reales.

Gemini
Flujo editorial de un agente Gemini que convierte interacciones registradas en trazas y casos de evaluación

Por qué importa

Esta nota se enfoca en la decisión práctica para builders: qué cambia, qué riesgo agrega y cómo aplicarlo sin romper operación.

Google añadió el 17 de julio de 2026 una pieza de observabilidad que muchos agentes necesitan antes de entrar en producción: registros y datasets para llamadas de Gemini API dentro de AI Studio. La guía oficial incluye GenerateContent, BatchGenerateContent, StreamGenerateContent y llamadas a Interactions API, aunque deja fuera a Managed Agents.

La noticia no es un panel bonito. Es que una interacción que antes desaparecía en los logs de tu aplicación puede convertirse en material para depurar, comparar y evaluar. Para un equipo que construye un agente con herramientas, esa diferencia separa “el modelo respondió raro” de “esta trayectoria falló después de la segunda llamada y entregó un resultado sin evidencia”.

Un agente Gemini convierte una conversación de herramientas en una traza editorial con entradas, salidas y puntos de revisión

Qué queda registrado

Google explica que los registros se consultan desde el panel Logs and Datasets de AI Studio. Las llamadas a Interactions API incluyen un enlace directo a previous_interaction_id, útil para seguir la continuidad de una sesión cuando el agente encadena pasos. La plataforma también puede mostrar información de uso y permite seleccionar ejemplos para compartir feedback o construir un dataset.

Hay dos límites que cambian la decisión de arquitectura:

  • El almacenamiento de logs está disponible para proyectos en el nivel pagado de Gemini API.
  • Las preferencias de logging se pueden activar o desactivar por proyecto desde AI Studio; no debes asumir que registrar una interacción equivale a conservarla para siempre.

En la práctica, el log de proveedor no reemplaza tu propio registro de auditoría. El proveedor puede ayudarte a inspeccionar la llamada al modelo, pero tu sistema todavía debe guardar el identificador de usuario, la versión de las instrucciones, las herramientas que se ofrecieron, las aprobaciones y el resultado de negocio.

La conversación larga necesita una forma de reconstruirse

Interactions API permite encadenar turnos con un identificador anterior, una comodidad importante para agentes que mantienen estado del lado del servidor. El problema aparece cuando una ejecución combina varios actores: el modelo, un tool call, una API externa y una persona que aprueba una acción.

Si solo guardas el texto final, no puedes responder preguntas operativas como estas:

  1. ¿Qué contexto recibió el modelo antes de elegir la herramienta?
  2. ¿Qué versión del esquema devolvió la herramienta?
  3. ¿Qué dato externo cambió entre el primer y el segundo intento?
  4. ¿La persona aprobó la acción exacta o una versión anterior?

El dataset de AI Studio sirve para estudiar ejemplos, pero el contrato completo debe vivir en tu aplicación. Conserva una referencia a cada interacción, los nombres de las herramientas y un hash de la configuración que produjo la ejecución. Evita guardar secretos o datos personales en bruto solo porque el panel facilita la captura.

Una mesa de evaluación separa trazas de producción, ejemplos anonimizados y casos de prueba antes de enviar feedback al modelo

Un piloto que sí produce señal

Empieza con un agente de lectura: clasificar tickets, resumir documentos o preparar una respuesta con citas. Define diez casos reales y etiqueta tres resultados: correcto, útil pero incompleto, y peligroso o incorrecto. Después usa los logs para localizar el paso exacto que cambia entre esas categorías.

Mide la tasa de herramientas elegidas correctamente, llamadas repetidas, respuestas sin evidencia, latencia por interacción y correcciones humanas. Si compartes feedback con Google, elimina identificadores y separa el dataset de evaluación del log operacional. Los casos de prueba deben tener una expectativa conocida; una colección de conversaciones interesantes no es todavía una evaluación.

La intención de búsqueda es concreta: Gemini API logs, Gemini Interactions API observability, AI Studio datasets y logs para agentes Gemini. La demanda se infiere de la documentación oficial actualizada, la nota de lanzamiento y el problema recurrente de depurar agentes multi-turno; no hay volumen SEO conectado para inventar.

Si estás ordenando por primera vez herramientas, memoria y evaluación, el curso gratis ayuda a separar la ejecución del criterio de éxito. La actualización de Google baja el costo de observar una interacción; el equipo todavía debe decidir qué evidencia conservar y quién puede verla.