Guía9 min

Benchmarks de agentes de IA explicados: qué mide SWE-bench, Terminal-Bench y el resto

Resumen

Guía para leer benchmarks de agentes de IA sin confundirse: qué mide SWE-bench Verified (500 issues reales de GitHub), qué mide Terminal-Bench (66 tareas en terminal con agente y sandbox), qué dicen los números de resolución y costos reales de 2026, y cómo pasar del leaderboard a la decisión para tu caso.

SWEAA
Tabla comparativa abstracta de benchmarks de agentes con barras de resolución y etiquetas de costo

Qué resuelve

Esta pieza se queda en la decisión práctica: qué instalar, qué riesgo agrega y cómo aplicarlo sin romper operación.

Los leaderboards de agentes se leen como marcadores de fútbol y se malinterpretan igual: el primer lugar no siempre gana lo que tú estás jugando. SWE-bench, Terminal-Bench, LiveCodeBench y las comparativas de Artificial Analysis miden cosas distintas, con metodologías distintas, y ninguna de ellas es "qué tan bueno es este agente para mi negocio". Esta guía explica qué mide cada benchmark importante de agentes en 2026, cómo leer sus números —resolución, costo, varianza— y cómo convertir un leaderboard en una decisión práctica para tu stack.

Esta pieza complementa, no reemplaza, la guía de cómo usar benchmarks para elegir modelo: allá está el método de decisión; aquí está el mapa de qué es cada benchmark.

SWE-bench: issues reales de GitHub

SWE-bench toma issues reales de repositorios open source de Python y le pide al agente producir el parche que los resuelve. La validación es objetiva: el parche se aplica, corre la suite de tests del repo y solo cuenta como resuelto si los tests pasan. No hay juez de opinion: o los tests pasan o no pasan.

Las variantes que vas a ver en el leaderboard:

VarianteQué esPara qué mirarla
SWE-bench Full (2,294 instancias)El dataset original completoContexto histórico; poco usado para rankings actuales
SWE-bench Verified (500 instancias)Subconjunto validado por humanos: issues claros, tests confiablesEl estándar de facto para comparar agentes de código
SWE-bench MultilingualIssues en otros lenguajes (Go, Rust, Java, etc.)Si tu stack no es Python
SWE-bench MultimodalIssues con capturas e interfacesAgentes que trabajan con UI

Cómo leer el número: el % resuelto de SWE-bench Verified con entradas arriba de 75% en 2026 significa que el agente resuelve tres de cada cuatro issues limpias de repos Python bien mantenidos. No significa que resuelva el 75% de tus tickets: Verified filtra issues ambiguas y con tests frágiles, que son justamente las más comunes en código heredado.

Terminal-Bench: el agente solo en una terminal

Terminal-Bench, del Laude Institute y Stanford, mide otra cosa: al modelo conectado a un agente en un sandbox real de terminal que debe compilar código, configurar servidores, arreglar scripts y ejecutar tareas end-to-end sin que un humano supervise cada paso. La versión 4.0 tiene 66 tareas públicas y el leaderboard reporta tasa de resolución, costo total de la corrida y tokens consumidos por experimento.

La diferencia metodológica importa: en SWE-bench el agente opera dentro de un scaffold probado contra un formato de tarea conocido; en Terminal-Bench el harness es parte del experimento y las tareas exigen más autonomía sostenida. Por eso los rankings no se traducen entre sí: un modelo puede brillar en uno y desplomarse en el otro.

Los números del leaderboard de Terminal-Bench 4.0 en septiembre de 2026 lo muestran bien: Claude Code con Opus 5 lidera con ~52% de resolución a un costo de ~$6,000 por corrida completa del benchmark, mientras que combinaciones con Luna rondan 17% a ~$350. Lo útil no es el ranking: es el patrón resolución por dólar — el margen entre gastar $350 y gastar $6,000 compra muchas tareas reales que no requieren al modelo puntero.

Mapa visual del flujo operativo: benchmarks de agentes de IA, qué mide cada uno

El resto del mapa en una tabla

BenchmarkQué mideSeñal útilCeguera típica
SWE-bench VerifiedParches que pasan tests en issues realesCapacidad de código con validación objetivaRepos Python limpios; no cubre código heredado tuyo
Terminal-BenchTareas end-to-end en terminal con sandboxAutonomía sostenida y costo de corrida66 tareas: varianza alta, pocas muestras
LiveCodeBenchProblemas de programación competitiva nuevosResistencia a contaminación de entrenamientoNo es trabajo de agente: es un problema cerrado
MLPerf InferenceThroughput y latencia de inferencia en hardwareCosto y velocidad de servir el modeloNo mide calidad del agente
Artificial AnalysisComparativa multi-eje de modelos y proveedoresPrecio/latencia por modelo en un solo lugarAgrega benchmarks de terceros; verificar metodología
Evals propios (ver guía de evals)Tus tareas, tus datos, tu presupuestoLa única señal que decideRequiere invertir tiempo en construirla

Verificación práctica para leer leaderboards: resolución, costo y varianza antes de decidir

Tres reglas para leer cualquier leaderboard

  1. Busca el intervalo, no el punto. Terminal-Bench publica el intervalo de confianza del 95% en cada barra. Cuando dos modelos se solapan, el ranking entre ellos es ruido. Si el leaderboard no publica varianza, desconfía del orden fino.
  2. El costo es parte del score. Un 51% a $6,000 y un 37% a $2,500 son decisiones distintas según tu presupuesto. En agentes, el costo de la corrida completa escala con la autonomía: más pasos, más tokens, más dinero.
  3. Verifica quién corrió el experimento. Los resultados marcados como verificados por el equipo del benchmark valen más que auto-reportes de laboratorios. SWE-bench distingue las corridas revisadas por su equipo; úsalas como ancla.

Del benchmark a tu decisión

El camino corto y honesto: usa los leaderboards para armar una lista corta de dos o tres candidatos, no para elegir el ganador. Después corre evals propios con 20-50 de tus tareas reales y decide con esa señal. Los benchmarks te dicen quién es competitivo en general; tus evals te dicen quién resuelve tu trabajo.

Si tu caso es elegir entre modelos de coding concretos, la comparativa Claude Code vs Codex cubre los dos harness más usados con ese criterio. Y si vas a montar tu propio pipeline de evaluación, el curso gratuito de instalación de agentes te deja la base operativa para ejecutarlo.

Preguntas frecuentes

¿Cuál benchmark es "el oficial" para agentes de código? No hay uno. SWE-bench Verified es el más citado para parcheo de código; Terminal-Bench es el referente para autonomía en terminal. La pregunta correcta es cuál se parece más a tu tarea.

¿Los modelos están contaminados con los datasets? SWE-bench filtra por fecha de release y verifica que las issues sean posteriores al corte de entrenamiento del modelo; LiveCodeBench se construye con problemas continuamente nuevos justamente para eso. Aun así, la contaminación es un riesgo vivo: por eso los evals propios siguen siendo la decisión final.

¿Por qué el mismo modelo da números tan distintos entre harnesses? Porque el harness —el andamiaje que conecta modelo con herramientas— es parte del resultado. Un scaffold mal calibrado desperdicia al mejor modelo; un buen scaffold disfraza a uno mediocre. Compara siempre agente y modelo como el par que son.