Benchmarks de agentes de IA explicados: qué mide SWE-bench, Terminal-Bench y el resto
Resumen
Guía para leer benchmarks de agentes de IA sin confundirse: qué mide SWE-bench Verified (500 issues reales de GitHub), qué mide Terminal-Bench (66 tareas en terminal con agente y sandbox), qué dicen los números de resolución y costos reales de 2026, y cómo pasar del leaderboard a la decisión para tu caso.

Qué resuelve
Esta pieza se queda en la decisión práctica: qué instalar, qué riesgo agrega y cómo aplicarlo sin romper operación.
Los leaderboards de agentes se leen como marcadores de fútbol y se malinterpretan igual: el primer lugar no siempre gana lo que tú estás jugando. SWE-bench, Terminal-Bench, LiveCodeBench y las comparativas de Artificial Analysis miden cosas distintas, con metodologías distintas, y ninguna de ellas es "qué tan bueno es este agente para mi negocio". Esta guía explica qué mide cada benchmark importante de agentes en 2026, cómo leer sus números —resolución, costo, varianza— y cómo convertir un leaderboard en una decisión práctica para tu stack.
Esta pieza complementa, no reemplaza, la guía de cómo usar benchmarks para elegir modelo: allá está el método de decisión; aquí está el mapa de qué es cada benchmark.
SWE-bench: issues reales de GitHub
SWE-bench toma issues reales de repositorios open source de Python y le pide al agente producir el parche que los resuelve. La validación es objetiva: el parche se aplica, corre la suite de tests del repo y solo cuenta como resuelto si los tests pasan. No hay juez de opinion: o los tests pasan o no pasan.
Las variantes que vas a ver en el leaderboard:
| Variante | Qué es | Para qué mirarla |
|---|---|---|
| SWE-bench Full (2,294 instancias) | El dataset original completo | Contexto histórico; poco usado para rankings actuales |
| SWE-bench Verified (500 instancias) | Subconjunto validado por humanos: issues claros, tests confiables | El estándar de facto para comparar agentes de código |
| SWE-bench Multilingual | Issues en otros lenguajes (Go, Rust, Java, etc.) | Si tu stack no es Python |
| SWE-bench Multimodal | Issues con capturas e interfaces | Agentes que trabajan con UI |
Cómo leer el número: el % resuelto de SWE-bench Verified con entradas arriba de 75% en 2026 significa que el agente resuelve tres de cada cuatro issues limpias de repos Python bien mantenidos. No significa que resuelva el 75% de tus tickets: Verified filtra issues ambiguas y con tests frágiles, que son justamente las más comunes en código heredado.
Terminal-Bench: el agente solo en una terminal
Terminal-Bench, del Laude Institute y Stanford, mide otra cosa: al modelo conectado a un agente en un sandbox real de terminal que debe compilar código, configurar servidores, arreglar scripts y ejecutar tareas end-to-end sin que un humano supervise cada paso. La versión 4.0 tiene 66 tareas públicas y el leaderboard reporta tasa de resolución, costo total de la corrida y tokens consumidos por experimento.
La diferencia metodológica importa: en SWE-bench el agente opera dentro de un scaffold probado contra un formato de tarea conocido; en Terminal-Bench el harness es parte del experimento y las tareas exigen más autonomía sostenida. Por eso los rankings no se traducen entre sí: un modelo puede brillar en uno y desplomarse en el otro.
Los números del leaderboard de Terminal-Bench 4.0 en septiembre de 2026 lo muestran bien: Claude Code con Opus 5 lidera con ~52% de resolución a un costo de ~$6,000 por corrida completa del benchmark, mientras que combinaciones con Luna rondan 17% a ~$350. Lo útil no es el ranking: es el patrón resolución por dólar — el margen entre gastar $350 y gastar $6,000 compra muchas tareas reales que no requieren al modelo puntero.

El resto del mapa en una tabla
| Benchmark | Qué mide | Señal útil | Ceguera típica |
|---|---|---|---|
| SWE-bench Verified | Parches que pasan tests en issues reales | Capacidad de código con validación objetiva | Repos Python limpios; no cubre código heredado tuyo |
| Terminal-Bench | Tareas end-to-end en terminal con sandbox | Autonomía sostenida y costo de corrida | 66 tareas: varianza alta, pocas muestras |
| LiveCodeBench | Problemas de programación competitiva nuevos | Resistencia a contaminación de entrenamiento | No es trabajo de agente: es un problema cerrado |
| MLPerf Inference | Throughput y latencia de inferencia en hardware | Costo y velocidad de servir el modelo | No mide calidad del agente |
| Artificial Analysis | Comparativa multi-eje de modelos y proveedores | Precio/latencia por modelo en un solo lugar | Agrega benchmarks de terceros; verificar metodología |
| Evals propios (ver guía de evals) | Tus tareas, tus datos, tu presupuesto | La única señal que decide | Requiere invertir tiempo en construirla |

Tres reglas para leer cualquier leaderboard
- Busca el intervalo, no el punto. Terminal-Bench publica el intervalo de confianza del 95% en cada barra. Cuando dos modelos se solapan, el ranking entre ellos es ruido. Si el leaderboard no publica varianza, desconfía del orden fino.
- El costo es parte del score. Un 51% a $6,000 y un 37% a $2,500 son decisiones distintas según tu presupuesto. En agentes, el costo de la corrida completa escala con la autonomía: más pasos, más tokens, más dinero.
- Verifica quién corrió el experimento. Los resultados marcados como verificados por el equipo del benchmark valen más que auto-reportes de laboratorios. SWE-bench distingue las corridas revisadas por su equipo; úsalas como ancla.
Del benchmark a tu decisión
El camino corto y honesto: usa los leaderboards para armar una lista corta de dos o tres candidatos, no para elegir el ganador. Después corre evals propios con 20-50 de tus tareas reales y decide con esa señal. Los benchmarks te dicen quién es competitivo en general; tus evals te dicen quién resuelve tu trabajo.
Si tu caso es elegir entre modelos de coding concretos, la comparativa Claude Code vs Codex cubre los dos harness más usados con ese criterio. Y si vas a montar tu propio pipeline de evaluación, el curso gratuito de instalación de agentes te deja la base operativa para ejecutarlo.
Preguntas frecuentes
¿Cuál benchmark es "el oficial" para agentes de código? No hay uno. SWE-bench Verified es el más citado para parcheo de código; Terminal-Bench es el referente para autonomía en terminal. La pregunta correcta es cuál se parece más a tu tarea.
¿Los modelos están contaminados con los datasets? SWE-bench filtra por fecha de release y verifica que las issues sean posteriores al corte de entrenamiento del modelo; LiveCodeBench se construye con problemas continuamente nuevos justamente para eso. Aun así, la contaminación es un riesgo vivo: por eso los evals propios siguen siendo la decisión final.
¿Por qué el mismo modelo da números tan distintos entre harnesses? Porque el harness —el andamiaje que conecta modelo con herramientas— es parte del resultado. Un scaffold mal calibrado desperdicia al mejor modelo; un buen scaffold disfraza a uno mediocre. Compara siempre agente y modelo como el par que son.
Lecturas relacionadas
Sigue explorando Benchmarks y otras piezas para builders.

DigitalOcean abre Model Evaluations: menos fe en el playground y más pruebas sobre costo, latencia y routing

Open Agent Leaderboard: por fin ya puedes comparar sistemas de agentes y no solo modelos

Como usar benchmarks de IA para elegir modelo de agente sin autoenganarse
