RuBench prueba coding agents con tareas escritas en ruso: el producto desplegado importa más que el modelo
El benchmark RuBench, publicado el 7 de julio de 2026, evalúa Claude Code y Codex CLI en 25 reparaciones reales de repositorios con solicitudes redactadas originalmente en ruso, tres corridas por configuración y oráculos privados.

Por qué importa
Esta nota se enfoca en la decisión práctica para builders: qué cambia, qué riesgo agrega y cómo aplicarlo sin romper operación.
Un benchmark de coding agents suele fallar antes de empezar: mide una tarea en inglés, una sola corrida y el nombre del modelo, aunque el usuario real interactúe con un producto que tiene CLI, políticas, fallbacks, herramientas y límites propios. RuBench, publicado el 7 de julio de 2026, intenta corregir una parte de ese problema con 25 tareas de mantenimiento de repositorios y solicitudes redactadas originalmente en ruso, no traducidas desde un issue inglés.

Qué mide y por qué importa el idioma
Las tareas provienen de aiohttp, aiogram, Laravel, NestJS y Fastify, con Python, PHP, TypeScript y JavaScript. Las especificaciones imitan el pedido de un cliente: describen síntomas, comportamiento esperado y restricciones. Los agentes trabajan en copias aisladas y se validan con pruebas de regresión de los mantenedores, que se mantienen fuera del espacio de trabajo.
El idioma no es un adorno. Un builder latinoamericano sabe que una solicitud de mantenimiento no siempre llega en inglés pulido: puede mezclar español, nombres de APIs, mensajes de error y contexto de negocio. Si el benchmark solo usa instrucciones estandarizadas en inglés, deja fuera una fuente de variación que sí existe en producción.
RuBench no afirma resolver la evaluación multilingüe para todos los idiomas. Su aporte es más acotado: demostrar que la especificación original, el repositorio y el producto que ejecuta el agente forman parte de la medición.
El resultado que sí se puede leer
El estudio ejecuta cada tarea tres veces por configuración. Reporta pass@1, intervalos de confianza a nivel de tarea, tokens, costo equivalente y duración. En su tabla principal, Claude Code con Opus 4.8 alcanza 78.7%, Sonnet 5 74.7%, Codex CLI con GPT-5.5 66.7% y Haiku 4.5 53.3%.
La advertencia metodológica es tan importante como los porcentajes: con solo 25 tareas, las diferencias entre Opus, Sonnet y Codex no son concluyentes. El propio artículo dice que el margen entre las configuraciones fuertes cae dentro del ruido estadístico. El resultado válido no es “un modelo ganó”; es que ningún agente saturó el conjunto y que la configuración desplegada cambia la lectura.

El hallazgo incómodo: el producto puede cambiar el modelo
RuBench auditó una configuración con Fable 5 de Claude Code fuera de concurso y encontró que el producto sustituyó silenciosamente el modelo por Opus 4.8 en cinco de 25 tareas debido a un fallback de seguridad. Eso vuelve peligrosa la frase “probamos el modelo X” si no se conserva la trayectoria y el identificador del modelo que realmente respondió.
Para una evaluación propia, guarda al menos:
- versión del CLI o harness;
- modelo solicitado y modelo ejecutado por turno;
- commits y estado inicial del repositorio;
- comandos, errores de tools y reintentos;
- costo, tokens y tiempo por tarea;
- criterio de aprobación que una persona pueda repetir.
El benchmark también mantiene privados los oráculos y publica un manifiesto SHA-256. Esa decisión limita la inspección inmediata, pero ayuda a evitar que el agente memorice la respuesta o vea las pruebas exactas.
Cómo usar la lección sin copiar el benchmark
No necesitas 25 tareas para empezar. Selecciona cinco incidencias reales y recientes, redacta solicitudes en el idioma de tu equipo y oculta las pruebas que usarás para calificar. Ejecuta tres veces cada combinación agente-modelo, registra fallos de herramientas y reporta intervalos en vez de ordenar modelos por una diferencia mínima.
La búsqueda benchmark coding agents, RuBench, Codex CLI benchmark y Claude Code benchmark tiene demanda visible en el artículo primario, sus tablas reproducibles y la conversación de builders sobre costo y fiabilidad; no hay volumen SEO conectado. Si estás preparando tu primer agente con herramientas y validación, el curso gratis ayuda a separar la ejecución de la evaluación.
La conclusión útil es sobria: el objeto que debes medir no es el modelo aislado. Es el sistema desplegado —CLI, permisos, fallback, herramientas, contexto, pruebas y persona que revisa— enfrentado a tareas que se parecen a las que tu equipo realmente recibe.