Harness Agent DLC conecta trazas, evals y despliegue para sacar agentes del piloto
Harness presentó el 21 de julio de 2026 un ciclo de vida para agentes con AgentTrace y abrió su SDK de instrumentación y sus evals. Esto es lo que cambia para builders que necesitan probar y operar agentes con evidencia.

Por qué importa
Esta nota se enfoca en la decisión práctica para builders: qué cambia, qué riesgo agrega y cómo aplicarlo sin romper operación.
El 21 de julio de 2026, Harness presentó Agent DLC, una propuesta para tratar a los agentes como software que necesita un ciclo completo de entrega: construir, probar, desplegar, observar y gobernar. La novedad no es solo el nombre. La compañía también anunció que abrirá los componentes base de AgentTrace, incluido un SDK de instrumentación y una capa de evaluación para usar fuera de su plataforma.
Para un equipo pequeño, la pregunta útil no es si hace falta comprar otro panel. Es si el agente puede dejar una evidencia que conecte una ejecución fallida con el test que debe evitar que vuelva a producción. Ese puente es el centro de la propuesta.
Del prompt al artefacto operable
El anuncio de Harness Agent DLC agrupa varias piezas conocidas de entrega de software alrededor de una ejecución agentic. AI Configs permite gestionar prompts y cambios de modelo en runtime con la misma lógica de flags de una aplicación; AI Asset Catalog busca agentes, skills y plugins en los repositorios y los asocia con un responsable; y AgentTrace registra el recorrido de una sesión con varios pasos.
La idea tiene una consecuencia práctica: el prompt deja de ser el único artefacto que se versiona. También debes poder identificar qué modelo, tool, recuperación, permiso y regla produjo una respuesta. Si el sistema cambia de ruta entre dos ejecuciones, una traza es más útil que una captura de la respuesta final.

Según la página técnica de AgentTrace, su harness-sdk emite spans estándar de OpenTelemetry y puede instrumentar OpenAI, Anthropic y LiteLLM. El resultado incluye llamadas al modelo, invocaciones de tools, recuperación, orquestación, tokens, latencia, costo y atribución del modelo. La decisión relevante para un builder es que el formato de salida es OTLP: la telemetría puede viajar a un backend compatible, no solo a un producto propietario.
Evals con criterio explícito
El segundo componente abierto es harness-evals. El repositorio propone puntuar cinco dimensiones por separado: corrección, fundamentación, seguridad, trayectoria y rendimiento. Cada métrica tiene una escala de 0 a 1, umbral y resultado de aprobación o fallo; además puede bloquear CI mediante códigos de salida, pisos absolutos y comparación contra una línea base.

Separar las dimensiones importa. Un agente puede responder con datos correctos y aun así tomar una ruta insegura; puede ser seguro pero gastar demasiados tokens; o puede terminar la tarea con una trayectoria imposible de auditar. Un promedio único escondería esas diferencias. La propia documentación de Harness presenta la trayectoria y la seguridad como señales que no conviene mezclar sin criterio.
No hay que confundir esta apertura con una validación independiente del producto. Las capacidades descritas son la propuesta del proveedor y el SDK para Python es el componente más maduro; Harness indica que los paquetes para Node.js, Go y Java siguen en desarrollo. Antes de adoptar el stack, conviene probar la instrumentación con tu proveedor, tu esquema de tools y tu sistema de trazas.
Qué copiar en un proyecto pequeño
Puedes aplicar el patrón sin migrar todo tu CI:
- Asigna una identidad a cada ejecución. Guarda modelo, versión de prompt, conjunto de tools y commit del agente.
- Traza la trayectoria, no solo la respuesta. Registra llamadas, reintentos, recuperación, latencia y costo con un estándar exportable.
- Evalúa por dimensiones. Define umbrales distintos para corrección, seguridad, costo y trayectoria.
- Convierte una incidencia en regresión. Cuando una ejecución falle en producción, conserva el caso y ejecútalo antes del siguiente deploy.
- Mantén aprobación para escrituras sensibles. Una buena traza explica lo ocurrido; no reemplaza un permiso humano.
La demanda se infiere, sin una herramienta SEO conectada, por el anuncio fechado, los repositorios públicos y consultas como Harness AgentTrace, harness-evals, agent observability y evals para agentes. Agente IA puede competir porque traduce la noticia a una regla concreta para builders de Latinoamérica: un agente listo para producción no es el que responde bonito, sino el que deja un recorrido reproducible y un umbral que pueda detener el siguiente deploy.
Si estás armando ese contrato desde cero, el curso gratis sirve para separar herramientas, validación y manejo de errores antes de subir la autonomía.