Comparativas y decisiones
Las guías para elegir sin adivinar: comparativas de modelos, benchmarks, plataformas y ecosistemas de agentes con criterios explícitos. En lugar de listas genéricas, cada artículo explica qué medir, qué diferencia hay en la práctica y en qué caso conviene cada opción. Si estás decidiendo entre proveedores, modelos o arquitecturas, estas piezas te dan el marco para comparar con datos y no con ruido. Incluyen benchmarks oficiales, análisis de plataformas como OpenAI, Google Gemini, Claude, AWS, Vercel o Cloudflare, y lecturas del ecosistema para entender hacia dónde va la industria sin depender de un solo anuncio. El criterio de elección siempre conecta con el caso de uso: presupuesto, latencia, privacidad y mantenimiento son parte de la ecuación, no solo el nombre del modelo.

Mejores prompts por modelo: Claude vs Gemini vs OpenAI en la práctica
No hay un prompt universal: qué pedir distinto a Claude, Gemini y OpenAI según sus fortalezas, cómo adaptar un prompt al cambiar de modelo y tres prompts de referencia por modelo para resumir, programar y analizar, con criterios para comparar resultados.

Cómo crear un agente de IA para tu empresa (pymes): guía práctica
Guía práctica para crear un agente de IA en una pyme: cómo identificar el primer proceso de alto valor, qué datos necesitas, privacidad y GDPR, implementación con n8n o la API de OpenAI, presupuesto realista y cómo medir el retorno de inversión en el primer trimestre.

Agente de IA para trading: qué funciona, qué no y cómo empezar
Qué funciona y qué no en agentes de IA para trading: separar el hype de la realidad, análisis de noticias frente a ejecución automatizada, riesgos reales, backtesting honesto, datos necesarios y las razones más comunes por las que la mayoría de estos proyectos fallan antes del tercer mes.

Agentes de IA open source vs propietarios: qué elegir en 2026
Agentes de IA open source frente a propietarios: criterios de decisión con costo, privacidad y self-hosting, calidad y ecosistema, casos donde el open source gana y donde no, y cómo probar modelos como DeepSeek y Llama localmente con Ollama antes de elegir.

Claude Code desde cero en español: comandos, skills, MCP y subagentes
Guía de Claude Code en español: qué es, cómo instalarlo y autenticarte, comandos esenciales, skills, servidores MCP, subagentes, hooks y modo headless para automatizar tareas de código, con tabla de comandos, ejemplo de skill y checklist de verificación antes de usarlo en proyectos reales.

DeepSeek Harness y los agentes autónomos: qué son y cómo probarlos
Qué es DeepSeek Harness, el runtime de código abierto en preview que convierte modelos en agentes autónomos con plugins: cómo se compara con OpenAI Agents SDK y LangChain, cómo probarlo con la API de DeepSeek, sus costos y los casos donde todavía conviene usar otro framework.

ChatGPT vs Claude vs Gemini para construir agentes: qué elegir según tu caso
Criterios concretos para elegir entre OpenAI, Anthropic y Google al construir agentes: confiabilidad del function calling, contexto, latencia, costo por tarea y ecosistema de cada proveedor, con tabla comparativa, recomendaciones por caso de uso y un método de prueba con los tres modelos contra tus propios casos en un solo día.

n8n vs Make vs Zapier para automatizaciones con IA: comparativa con criterios
Comparativa práctica de n8n, Make y Zapier para automatizaciones y agentes con IA: ejecución local vs nube, costo por ejecución, operación o tarea, nodos de agente y capacidades de IA, self-hosting, límites de cada plan y una decisión condicionada según tu perfil de desarrollador, operaciones o integración rápida.

BackendForge pone a los coding agents frente a un backend real: pasar el build no basta
BackendForge, publicado el 13 de julio de 2026, evalúa agentes sobre 56 servicios backend definidos con OpenAPI y pruebas HTTP. El mejor resultado baja de 55.4% con un oráculo base a 28.6% con validación reforzada.

Salesforce abre Agent Script: reglas deterministas y razonamiento agentic en el mismo contrato
Agent Script y el nuevo Agentforce Builder llegaron a disponibilidad general. Salesforce también liberó el parser, linter, compilador, LSP e integraciones del toolchain bajo Apache 2.0, una señal útil para builders que necesitan agentes más verificables.

Mistral OCR 4 añade bloques estructurados: el cambio útil para agentes que leen documentos
Mistral OCR 4 incorpora include_blocks para devolver títulos, tablas, imágenes, ecuaciones y código con bounding boxes y orden de lectura. Eso mejora el puente entre PDF, RAG y tools, pero exige validar la extracción.

AWS congela Bedrock Agents Classic: qué revisar antes de migrar tus agentes a AgentCore
AWS puso Amazon Bedrock Agents en modo mantenimiento y dejará de aceptar cuentas nuevas el 30 de julio de 2026. La migración a AgentCore cambia el runtime, la identidad y el contrato de herramientas.

GitHub cierra Models el 30 de julio: qué migrar antes del próximo brownout
GitHub retirará por completo Models el 30 de julio de 2026, incluidos el catálogo, el playground, la API de inferencia y BYOK. Esta es la checklist para descubrir dependencias, probar un reemplazo y no dejar un agente apuntando a un endpoint muerto.

Google Discovery Bench cambia la evaluación de agentes: mide cuándo la consulta se vuelve demasiado ambigua
Google Cloud presentó en julio un enfoque para evaluar agentes de recuperación con consultas de ambigüedad calibrada. Discovery Bench y su bucle iSQR buscan mostrar dónde cae un agente, no solo si aprobó un benchmark.

Hugging Face propone medir si una librería es usable por agentes, no solo si su API funciona
Hugging Face publicó el 18 de junio de 2026 un benchmark específico para probar agentes sobre transformers. Mide coincidencia, tokens, tiempo, errores y marcadores de comportamiento para saber si una CLI, una skill o una mejora de documentación realmente reduce trabajo.

Kimi K3 llega a AI Gateway con contexto de un millón de tokens y visión nativa
Kimi K3 combina razonamiento híbrido, entrada multimodal y contexto de un millón de tokens; así pueden evaluarlo los builders desde AI Gateway.

RuBench prueba coding agents con tareas escritas en ruso: el producto desplegado importa más que el modelo
El benchmark RuBench, publicado el 7 de julio de 2026, evalúa Claude Code y Codex CLI en 25 reparaciones reales de repositorios con solicitudes redactadas originalmente en ruso, tres corridas por configuración y oráculos privados.

Meta abre Muse Spark 1.1 a builders: API, subagentes y un millón de tokens
Meta lanzó el 9 de julio de 2026 la preview pública de Meta Model API con Muse Spark 1.1. La novedad útil para builders es la combinación de tool calling, subagentes paralelos, computer use y contexto de un millón de tokens, con controles que todavía debes diseñar tú.

Real World VoiceEQ mide la calidad humana de la voz: por qué un buen WER no basta para tu agente
Hugging Face presentó Real World VoiceEQ con más de un millón de valoraciones humanas, más de 40 modelos y más de 60 métricas de ASR, TTS, speech-to-speech y comprensión. El benchmark obliga a evaluar escucha, emoción y contexto acústico.

Hugging Face y Cerebras prueban Gemma 4 para voz en tiempo real: la latencia ya es parte del producto
Hugging Face mostró el 1 de julio de 2026 una arquitectura abierta speech-to-speech con Cerebras y Gemma 4. Para builders de agentes de voz, la noticia no es solo el modelo: es diseñar ASR, LLM, TTS y WebSocket como un loop de baja latencia y fallback claro.

LeRobot 0.6.0 cierra el loop de robots: imaginar, evaluar y corregir ya entra al workflow
Hugging Face publicó LeRobot v0.6.0 el 7 de julio de 2026 con world models, reward models, seis benchmarks nuevos y `lerobot-rollout` para convertir fallas reales en datos de entrenamiento. Para builders, la noticia útil es tratar robótica como un ciclo de agente verificable, no como demo aislada.

Hugging Face lanza FFASR: el benchmark que obliga a probar agentes de voz lejos del micrófono perfecto
Hugging Face y Treble presentaron FFASR, un leaderboard de ASR far-field con condiciones acústicas realistas. Para builders de agentes de voz, la señal es clara: medir solo audio limpio ya no alcanza para decidir qué modelo escucha producción.

GPT-5.6 Sol entra en preview: ultra mode, subagentes y una nueva vara para Codex
OpenAI presentó el 26 de junio de 2026 la familia GPT-5.6 con Sol, Terra y Luna. Para builders, la señal no es solo otro modelo: ultra mode, max reasoning, Terminal-Bench 2.1 y safeguards cambian cómo se prueban agentes de coding.

Mistral Leanstral 1.5 baja la barrera de verificación formal: agentes que prueban código, no solo escriben tests
Mistral lanzó Leanstral 1.5 el 2 de julio de 2026 con 119B parámetros totales, 6B activos y licencia Apache 2.0. La señal para builders es práctica: formal verification empieza a entrar al loop agentic con Lean, MCP y Vibe.

Braintrust mete GLM-5.2 en scorers y gateway: cómo evaluar modelos abiertos sin cambiar todo tu stack
Braintrust anunció en julio de 2026 GLM-5.2 como modelo integrado para playgrounds, prompts, scorers y gateway. El valor para builders no es probar otro modelo: es medir costo, tokens y calidad dentro del mismo loop de evals.

Fable 5 vuelve a Vercel AI Gateway: el detalle importante son fallbacks y retención
Vercel restauró el 1 de julio de 2026 el acceso a Claude Fable 5 en AI Gateway después de que Anthropic reactivó el modelo. Para builders, el cambio útil no es solo disponibilidad: es diseñar fallback cuando el clasificador de seguridad bloquee tareas normales.

Claude Sonnet 5 baja el costo de agentes largos: qué cambia frente a Opus
Anthropic lanzó Claude Sonnet 5 el 30 de junio de 2026 con foco en coding, herramientas y trabajo agentic a precio de Sonnet. Para builders, el punto es decidir qué tareas pasan a Sonnet y cuáles siguen necesitando modelos más caros.

GitHub Copilot retirará Gemini 2.5 Pro y Gemini 3 Flash: cómo migrar agentes sin perder señal
GitHub avisó el 2 de julio de 2026 que Gemini 2.5 Pro y Gemini 3 Flash saldrán de Copilot el 31 de julio. Para builders, el punto no es solo cambiar un selector: es probar políticas, costos y calidad antes de que los agentes hereden otro modelo.

Vercel AI Gateway estrena routing rules: el cambio útil es migrar modelos sin redeploy
Vercel lanzó routing rules para AI Gateway el 2 de julio de 2026. Para equipos con agentes, la novedad práctica es poder reescribir o bloquear modelos desde el gateway cuando un proveedor cae, se encarece o queda fuera de política.

Hugging Face lleva Every Eval Ever a model pages: menos screenshots de benchmarks, más procedencia
Hugging Face anunció el 30 de junio de 2026 que Every Eval Ever y Community Evals ya son interoperables. Para builders, el cambio útil es poder leer resultados de modelos con metadatos, badges y enlaces de procedencia, no solo con una tabla copiada.

Claude Code 2.1.198 junta Chrome y subagentes en background: qué cambia para builders
La versión 2.1.198 de Claude Code hace general Claude in Chrome, corre subagentes en background por defecto y agrega notificaciones para sesiones que terminan o necesitan input.

Gemini Omni Flash llega a la API: video corto editable para agentes, no solo marketing
Google puso Gemini Omni Flash en preview público el 30 de junio de 2026. La pieza útil para builders es que usa Interactions API para generar y editar videos cortos con estado conversacional.

Kog Laneformer 2B apuesta por latencia primero: por qué un modelo pequeño sí puede importar para coding agents
Kog publicó el 24 de junio de 2026 Laneformer 2B, un modelo de coding de 2.3B parámetros diseñado alrededor de inferencia rápida. La señal para builders no es reemplazar modelos frontier, sino separar subtareas donde latencia, costo y throughput pesan más que razonamiento máximo.

Anthropic agrega response inclusion: menos contexto muerto para agentes que buscan y ejecutan código
Anthropic añadió response_inclusion a la API para controlar qué bloques de web search, web fetch y code execution vuelven en la respuesta. Para builders, es una mejora de costo, latencia y trazabilidad en flujos agentic.

Amazon Bedrock AgentCore Harness llega a GA: el agente empieza a necesitar banco de pruebas, no solo prompt
AWS llevó AgentCore Harness a disponibilidad general en junio de 2026. Para equipos que operan agentes, la señal es clara: tools, memoria, modelos y ejecuciones necesitan pruebas repetibles antes de entrar a producción.

OpenAI depreca Agent Builder y Evals: si tu agente vive en la UI, ya necesitas plan de salida
OpenAI notificó el 3 de junio de 2026 la deprecación de Agent Builder y Evals. Agent Builder está programado para apagarse el 30 de noviembre, y Evals pasará a solo lectura el 31 de octubre antes del cierre.

GLM-5.2 aterriza con 1M de contexto: por qué los agentes de coding open source ya no compiten solo por precio
Z.ai publicó GLM-5.2 el 17 de junio de 2026 con licencia MIT, contexto de 1M de tokens y foco explícito en tareas largas de coding. Para builders, la pregunta práctica es cuándo probarlo en rutas de agentes largos sin perder control de latencia, costo y evaluación.

GLM 5.2 llega a Vercel AI Gateway con 1M de contexto: útil para agentes largos, peligroso si lo usas como basurero
Vercel sumó GLM 5.2 a AI Gateway el 16 de junio de 2026. El punto fuerte es el contexto de 1M tokens y foco en tareas long-horizon, pero para builders la decisión real sigue siendo qué contexto entra, cuánto cuesta y cómo se compara contra modelos ya probados.

GitLab abre más modelos open source para Duo Agent Platform Self-Hosted: cuándo sí conviene y cuándo no
GitLab anunció el 21 de mayo de 2026 más modelos open source para Duo Agent Platform Self-Hosted, con foco en entornos air-gapped y regulados. La novedad útil no es otra tabla de compatibilidad: es poder rutear agentes por modelo y plataforma sin entregar código a terceros por defecto.

Agents' Last Exam mide trabajo real: por qué 2.6% de pass rate debería frenar el hype
UC Berkeley publicó Agents' Last Exam el 3 de junio de 2026 y Hugging Face lo destacó como paper del día. El benchmark cubre tareas largas, económicas y verificables en 13 industrias; la señal útil para builders es que los agentes siguen lejos de trabajo autónomo robusto.

OpenAI lanza Partner Network: la señal útil son especializaciones en Codex, agentes y ciberseguridad
OpenAI presentó el 14 de junio de 2026 su Partner Network con una inversión de 150 millones de dólares y una meta de 300 mil consultores certificados. Para builders, la parte práctica es que las especializaciones en Codex, agentes y ciberseguridad van a cambiar cómo se compra e integra IA empresarial.

Cohere Command A+ llega open source: por qué importa para agentes empresariales que no quieren depender solo de API cerrada
Cohere lanzó Command A+ como modelo open source MoE para tareas agentic, multimodales y multilingües. Para builders, la señal útil es combinar pesos abiertos, entrada visual, tool use y despliegue privado cuando el control operativo pesa tanto como el benchmark.

Cloudflare pone Kimi K2.5 en Workers AI: el costo de agentes largos ya es decisión de arquitectura
Cloudflare anunció que Workers AI ya sirve Kimi K2.5, un modelo open source de contexto largo para tool calling, visión y salidas estructuradas. Para builders, la señal útil no es solo el modelo: es combinar inferencia, cache, async y runtime de agentes en la misma plataforma.

Kimi K2.7 Code llega a Vercel AI Gateway: cuándo probarlo en agentes de coding y cuándo esperar
Vercel agregó Kimi K2.7 Code de Moonshot AI a AI Gateway el 12 de junio de 2026. El modelo apunta a tareas largas de programación, DevOps y optimización con entrada multimodal y thinking siempre activo.

DiffusionGemma cambia la conversación de latencia local: generación paralela para agentes que no pueden esperar token por token
Google presentó DiffusionGemma el 10 de junio de 2026 como un modelo abierto experimental que usa difusión discreta para generar bloques de texto en paralelo. La señal útil para builders no es reemplazar Gemma 4, sino probar cuándo la latencia local pesa más que la máxima calidad.

Anthropic y DXC llevan Claude a sistemas regulados: la noticia está en el modelo operativo, no en el logo
Anthropic anunció una alianza global con DXC para integrar Claude en bancos, aerolíneas, aseguradoras y gobierno. Para builders, la señal útil es cómo escalar agentes con FDEs, OASIS, revisión humana y subagentes de seguridad.

OpenAI apaga prompt objects: por qué tus prompts de agentes deberían vivir en código
OpenAI confirmó que los prompt objects de la API se apagarán el 30 de noviembre de 2026. Para builders, la migración útil no es copiar texto: es versionar prompts como parte del sistema, con pruebas, revisión y despliegue.

Fabric Data Agent ya corre Python con Code Interpreter: por qué esta preview sí cambia el tipo de preguntas que un agente de datos puede resolver
Microsoft activó en junio de 2026 el Code Interpreter Tool para Fabric Data Agent. La parte útil para builders no es otro chat sobre datos: es sumar análisis estadístico, cálculos y visualización en un sandbox Python auditable, con NL2SQL mejorado y observabilidad en Foundry alrededor.

OpenAI y Codex ya están GA en Amazon Bedrock: dónde sí baja fricción y dónde el detalle del endpoint te puede romper el rollout
AWS confirmó el 1 de junio de 2026 la disponibilidad general de GPT-5.5, GPT-5.4 y Codex en Amazon Bedrock. Lo útil para builders no es solo correr OpenAI sobre AWS: es combinar Responses API, aislamiento, auditoría y consumo contra compromisos existentes sin olvidar que el path y el estado de sesión cambian.

Claude Fable 5 y Mythos 5: por qué Anthropic ya te obliga a diseñar fallback, retención y contexto largo con más disciplina
Anthropic lanzó el 9 de junio de 2026 Claude Fable 5 y Claude Mythos 5. La señal útil para builders no es solo otro modelo fuerte para coding: es que ahora el despliegue serio pasa por fallback explícito, 1M de contexto, adaptive thinking siempre activo y nuevas restricciones de retención.

STATE-Bench por fin mide si la memoria mejora un agente de verdad y no solo el chat
Microsoft publicó el 19 de mayo de 2026 STATE-Bench, un benchmark abierto para medir memoria en agentes sobre tareas empresariales con estado. La señal útil no es otro test de recall: es poder ver si la memoria sube confiabilidad, baja costo y mejora la experiencia del usuario en flujos reales.

GPT-5.5: qué cambia de verdad para coding agents, computer use y trabajo largo
OpenAI lanzó GPT-5.5 el 23 de abril de 2026 y lo abrió en API el 24 de abril. La novedad útil no es solo otro modelo más listo: es subir autonomía y computer use sin empeorar la latencia por token.

OpenAI cierra Agent Builder y Evals: cómo decidir entre Agents SDK y Workspace Agents sin migrar a ciegas
OpenAI confirmó el 3 de junio de 2026 que Agent Builder y Evals dejarán de estar disponibles desde el 30 de noviembre de 2026. La noticia útil no es solo el cierre: es elegir bien si tu siguiente paso va por Agents SDK o por Workspace Agents en ChatGPT.

Gemini ya entra al Foundation Models framework y a Xcode: por qué eso sí cambia apps agentic en Apple
Google anunció el 8 de junio de 2026 que Gemini se integra con el Foundation Models framework de Apple vía Firebase Apple SDK y también aparece dentro de Xcode. La señal útil no es solo otro conector: es poder alternar modelo local y cloud bajo la misma API para apps agentic y flujos de desarrollo.

Vercel publica tráfico real de AI Gateway y deja una pista incómoda: los agentes ya mueven 59% del volumen
Vercel publicó el 12 de mayo de 2026 su AI Gateway production index con datos de más de 200 mil equipos. La lectura útil no es coronar un modelo ganador: es entender que el tráfico agentic ya domina el volumen, que gasto y volumen no apuntan al mismo laboratorio y que los equipos serios ya enrutan sobre más de 30 modelos.

AWS ya te deja cerrar la laptop sin matar Codex o Claude Code: qué cambia al hospedar coding agents en AgentCore
AWS publicó el 8 de junio de 2026 una guía para correr Claude Code, Codex, Kiro y otros coding agents sobre Amazon Bedrock AgentCore. La novedad útil no es otra demo de cloud agents: es juntar microVM aislada, workspace persistente, MCP gobernado y observabilidad en un runtime que sí soporta trabajo largo.

WebTailBench V2 refresca 609 tareas para agentes web: por qué este benchmark sí evita parte del humo en computer use
Microsoft actualizó WebTailBench a V2 el 12 de mayo de 2026 con tareas refrescadas y rúbricas nuevas para su suite de 609 pruebas. La novedad útil no es otro leaderboard: es un benchmark más vivo para medir agentes web sobre trabajos que sí se parecen a reservas, compras, búsquedas de empleo y comparaciones reales.

OpenEnv quiere volverse la capa comun para entrenar agentes: por qué eso sí importa fuera del laboratorio
Hugging Face movió OpenEnv a una gobernanza comunitaria el 8 de junio de 2026 y lo está empujando como interfaz común para agentic RL. La novedad útil no es otro framework de moda: es bajar el costo de entrenar y evaluar agentes sobre entornos reutilizables.

Microsoft Foundry IQ ya sirve como capa de conocimiento para agentes: dónde sí evita otro RAG artesanal
Microsoft publicó el 2 de junio de 2026 la ampliación de Foundry IQ con serverless retrieval, Web IQ, knowledge bases GA y un MCP server oficial. La señal útil para builders no es otro nombre comercial: es una capa más seria para grounding, SLA y gobernanza.

OpenAI lanza Deployment Company: por que el cuello de botella ahora es meter agentes dentro del negocio
OpenAI presentó el 11 de mayo de 2026 su Deployment Company para desplegar FDEs dentro de organizaciones y conectar modelos con datos, controles y procesos reales. La noticia útil para builders no es corporativa: es que la pelea por IA ya se movió del demo al rediseño operativo.

ChatGPT workspace agents suma controles, app templates y respuestas en Slack: menos demo, más operación
OpenAI añadió el 28 de mayo de 2026 nuevos controles para workspace agents en Enterprise y Edu, junto con app templates para GitHub Enterprise, Snowflake y Databricks. La novedad útil no es una feature suelta: es que el agente empieza a parecerse más a un producto gobernable que a un experimento compartido.

Claude Code enciende dynamic workflows por defecto el 8 de junio: cómo limitar quién puede lanzar corridas largas antes de pagar el susto
Anthropic activó dynamic workflows por defecto para organizaciones Enterprise de Claude Code el 8 de junio de 2026. La señal útil para builders no es que existan subagentes: es cómo gobernar acceso, roles y apagado global antes de que una sesión de horas quede abierta para todos.

Vercel AI Gateway ya puede bloquear proveedores por equipo: el detalle útil es frenar agentes aunque cambien el request
Vercel agregó Provider Allowlist a AI Gateway el 28 de mayo de 2026. La mejora importante para builders no es otro switch de compliance: es convertir la lista aprobada de vendors en una garantía de enrutamiento, incluso contra agents o BYOK mal configurados.

GitHub Copilot code review ya gasta minutos y créditos: cómo evitar que la revisión automática te salga más cara de lo que parece
GitHub endureció la parte operativa de Copilot code review desde el 1 de junio de 2026. La noticia útil para builders no es que revise PRs: es que ahora mezcla AI credits, GitHub Actions minutes, runners y presupuestos en el mismo loop.

Claude ya puede usar tu computadora en Cowork: por qué el límite real no es el modelo, sino permisos y pantalla
Anthropic abrió computer use en Claude Cowork y Claude Code como research preview para planes Pro y Max. La señal útil no es que el agente haga clics: es cómo prioriza conectores, navegador y pantalla, y qué riesgos asumes cuando no hay sandbox entre el modelo y tus apps.

OpenAI ya puso fecha final a Assistants API: qué migrar primero a Responses y qué no tocar a ciegas
OpenAI dejó claro que Assistants API se apagará el 26 de agosto de 2026. La noticia útil para builders no es solo la fecha: es entender qué cambia al pasar de assistants, threads y runs a prompts, conversations y responses sin romper tools, estado y observabilidad.

ADK Arena compara 51 frameworks de agentes: por qué elegir toolkit ya no debería hacerse por moda
El paper ADK Arena, publicado el 4 de junio de 2026, evalúa 51 frameworks Python para agentes con una metodología LLM-as-a-Developer. La señal útil no es coronar un ganador único: es mostrar cuánta fricción y variabilidad introduce el framework antes de que el agente siquiera resuelva la tarea.

MCP-Persona pone a prueba agentes con apps personales reales: malas noticias para cualquiera que confunda demo con producto
El paper MCP-Persona, publicado el 1 de junio de 2026, propone el primer benchmark centrado en tools MCP personalizadas sobre cuentas y bases locales. La señal útil no es otro leaderboard: es mostrar que los agentes todavía tropiezan cuando el contexto es realmente personal.

Nemotron 3 Ultra llega a Vercel AI Gateway: por qué sí merece una prueba sería en agentes largos
Vercel agregó Nemotron 3 Ultra a AI Gateway el 4 de junio de 2026. La parte útil no es otro modelo más en el menú: es poder probar un MoE abierto con 1M de contexto y framing agentic dentro del mismo plano de costos, failover y observabilidad.

Cloudflare ya opera Agent Lee en producción: menos tabs, más contexto de cuenta y write actions con aprobación
Cloudflare presentó el 15 de abril de 2026 Agent Lee, un asistente dentro del dashboard que ya atiende miles de usuarios diarios. La señal útil para builders no es otro chat en consola: es una arquitectura que mezcla contexto de cuenta, MCP, ejecución con código y aprobación explícita para writes.

Google lleva ADK a Kotlin y Android: por qué eso acerca agentes híbridos al edge de verdad
Google anunció el 21 de mayo de 2026 ADK for Kotlin y ADK for Android 0.1.0. La señal útil para builders no es otro SDK móvil: es poder repartir trabajo entre nube y dispositivo con herramientas, memoria y MCP dentro del mismo marco.

Codex ya deja compartir plugins en workspaces Enterprise: menos setup repetido y más gobernanza real
OpenAI activó el 5 de junio de 2026 el plugin sharing para workspaces Enterprise elegibles en Codex. Lo útil para equipos no es solo compartir un paquete: es mover skills, integraciones y configuración a una capa reutilizable con controles de admin.

OpenAI mete moderation scores dentro de Responses y Chat Completions: menos pegamento y mejores guardrails para agentes
OpenAI agregó el 4 de junio de 2026 soporte para moderation scores en generation requests de Responses API y Chat Completions API. La mejora útil para builders no es otra casilla de seguridad: es juntar input, output y señales de riesgo dentro del mismo loop operativo.

DigitalOcean abre Model Evaluations: menos fe en el playground y más pruebas sobre costo, latencia y routing
DigitalOcean abrió Model Evaluations en public preview el 4 de junio de 2026. La señal útil para builders no es otro panel de métricas: es poder comparar modelos y routers sobre el mismo dataset antes de cambiar tráfico real.

EVA-Bench Data 2.0 sube la vara para agentes de voz: 3 dominios, 121 tools y 213 escenarios
ServiceNow AI publicó EVA-Bench Data 2.0 el 4 de junio de 2026 en Hugging Face. La novedad útil no es otra tabla de resultados: es una base más sería para evaluar agentes de voz que sí usan herramientas, políticas y contextos de negocio reales.

SageMaker mete multi-turn RL para agentes: como afinar modelos pequenos contra tareas reales y no solo contra prompts sueltos
AWS anuncio el 3 de junio de 2026 que SageMaker AI ya soporta multi-turn reinforcement learning para personalizacion de modelos agenticos. La parte fuerte para builders no es otra técnica de tuning: es entrenar contra secuencias completas de decisiones usando tu propio entorno de herramientas.

RAMP pone a los agentes a construir un compilador y casi todos se caen: por que este benchmark merece más atencion
RAMP reaparecio en la conversacion de builders el 4 de junio de 2026 con un benchmark de seis etapas seriales sobre un compilador real. La noticia no es otro scoreboard: es mostrar como se derrumban los agentes cuando hay estado persistente, dependencias y costos reales.

Codex 0.137.0 mete créditos, permisos por entorno y plugins más legibles: por que eso si cambia operaciones
OpenAI publico Codex 0.137.0 el 4 de junio de 2026 con limites mensuales de créditos para enterprise, permisos con identidad de entorno, `codex plugin list --json` y mejoras para multiagente. La noticia no es el TUI: es gobernar mejor sesiones reales.

Claude Code v2.1.152 endurece skills y hooks: menos herramientas por defecto, menos sesiones rotas
Anthropic publico Claude Code v2.1.152 el 27 de mayo de 2026 con `disallowed-tools` para skills, recarga de skills en caliente, hooks nuevos y fallback model de sesion. La señal útil para builders es control más fino sin reiniciar ni perder el hilo cuando el modelo falla.

WildClawBench pone a los agentes a trabajar de verdad: tareas largas, tools reales y ningun modelo pasa del 63%
WildClawBench aparecio el 11 de mayo de 2026 como benchmark de 60 tareas largas y multimodales corriendo dentro de runtimes CLI reales como OpenClaw, Claude Code, Codex y Hermes Agent. La lectura útil para builders es brutal: cambiar de harness puede mover hasta 18 puntos y ni el lider rompe el 63%.

JetBrains abre Mellum2: un modelo rapido para subagentes, RAG y coding sin pagar latencia de frontier
JetBrains publico Mellum2 el 1 de junio de 2026 como modelo open-weight de 12B con 2.5B parametros activos por token, licencia Apache 2.0 y foco en tareas rápidas de pipeline como routing, RAG, tool use y coding. La lectura útil para builders no es reemplazar al modelo grande: es sacar del camino el trabajo que no necesita uno.

Amazon Bedrock rediseña su consola para APIs compatibles con OpenAI y Anthropic: donde si ahorra tiempo y donde no
AWS anuncio el 4 de junio de 2026 una consola nueva para Bedrock pensada alrededor de APIs compatibles con OpenAI y Anthropic. La mejora útil para builders no es la UI bonita: es reducir el trabajo manual entre elegir modelo, generar snippets y mover un experimento hacia producción.

Kaggle baja los benchmarks al IDE: por que esto si cambia como builders miden agentes
Kaggle anuncio el 4 de junio de 2026 desarrollo local para Benchmarks y un skill para coding agents. La novedad útil no es otra leaderboard: es poder escribir, validar y correr evals desde VS Code, Cursor o Antigravity sin quedarse encerrado en el notebook web.

ITBench-AA deja una mala noticia útil para builders: ni los mejores agentes pasan del 50% en incidentes SRE
Artificial Analysis e IBM publicaron el 27 de mayo de 2026 ITBench-AA, un benchmark para tareas agentic de IT empresarial donde los modelos frontier quedan por debajo del 50% en diagnostico SRE sobre snapshots reales de Kubernetes. La señal útil no es quien gana la tabla: es que los agentes todavía fallan bastante cuando el problema exige logs, trazas y precision de causa raiz.

Gemini mejora audio nativo para agentes de voz: donde si cambia el producto y donde todavía no
Google actualizo Gemini 2.5 Flash Native Audio a inicios de junio de 2026 con function calling más fiable, mejor seguimiento de instrucciones y conversaciones más fluidas. La mejora vale para builders porque toca el loop real de voz, no solo la demo.

Qwen 3.7 Plus entra a Vercel AI Gateway: cuando conviene para agentes multimodales y cuando no
Vercel agrego Qwen 3.7 Plus a AI Gateway el 1 de junio de 2026. El movimiento importa menos por el logo de Alibaba y más por lo que habilita: probar un modelo agentic con 1M de contexto, vision y BYOK sin salir del mismo plano operativo.

Gemini API suma Webhooks para agentes largos: menos polling inutil, mejor infraestructura
Google anuncio el 4 de mayo de 2026 Webhooks event-driven para Gemini API. La mejora no es marketing de arquitectura: baja el costo operativo de jobs largos, evita polling ciego y obliga a diseñar mejor reintentos, observabilidad y handoff entre sistemas.

OpenAI llega a AWS con Codex y Managed Agents: que cambia para equipos que ya viven en Bedrock
OpenAI y AWS anunciaron el 28 de abril de 2026 una integración que mete modelos frontier, Codex y Managed Agents dentro de Amazon Bedrock. Para equipos que ya operan sobre AWS, la novedad no es otra API: es una forma de desplegar agentes con IAM, CloudTrail, PrivateLink y compromisos de gasto ya existentes.

MLPerf Inference v6.0 mete GPT-OSS y DeepSeek-R1 interactivo: por que este benchmark si importa para builders
MLCommons presentó MLPerf Inference v6.0 el 1 de abril de 2026 con nuevos tests para GPT-OSS 120B, DeepSeek-R1 interactivo y más workloads reales. La señal útil no es quien gano hoy, sino que se esta midiendo.

Gemini API ya mezcla tools nativas y funciones propias: por que esta actualización si cambia el diseño de agentes
Google anuncio el 17 de marzo de 2026 nuevas capacidades de tooling en Gemini API: combinar built-in tools con funciones propias, circular contexto y usar IDs por tool call. La mejora no es cosmética.

OpenAI publica una guia práctica para GPT-5: la señal real es Responses API, evals y control fino
OpenAI difundio a finales de mayo de 2026 una guia práctica para construir con GPT-5. Mas que otro recurso de marketing, deja una tesis operativa clara: si quieres exprimir agentes y coding, toca migrar a Responses API, medir mejor y ajustar reasoning_effort y verbosity con disciplina.

Meta convierte un agente en ingeniero de ranking: por que REA importa más de lo que parece
Meta publico el 17 de marzo de 2026 como su Ranking Engineer Agent lleva hipotesis, jobs y debugging a un loop de varios días. La noticia vale por dos metricas concretas: 2x en accuracy y 5x en output de ingenieria.

Claude Code explica su bajon de calidad: el postmortem que todo builder de agentes deberia leer
Anthropic detallo el 23 de abril de 2026 tres cambios que degradaron Claude Code, el Agent SDK y Claude Cowork. La leccion práctica no es el bug en si, sino como evaluar latencia, memoria y prompts sin romper calidad.

Open Agent Leaderboard: por fin ya puedes comparar sistemas de agentes y no solo modelos
El Open Agent Leaderboard publicado el 18 de mayo de 2026 cambia la pregunta para builders: no basta con mirar el modelo; ahora toca medir costo, herramientas y arquitectura del agente completo.

OpenAI suma WebSocket mode a la Responses API: menos latencia para agentes con muchas tools
WebSocket mode en la Responses API reduce overhead de multiples tool calls, mejora latencia en loops agentic y obliga a pensar en reconexion, secuencialidad y observabilidad.

OpenAI lleva el Agents SDK a ejecucion cloud: que cambia para agentes reales
La actualización del Agents SDK apunta a una pieza que muchos prototipos no tienen: ejecucion controlada, archivos, herramientas y sandboxes para tareas largas.

Google prepara Managed Agents en Gemini API: memoria, herramientas y conectores
Google anuncio Managed Agents para Gemini API en I/O 2026, una apuesta por agentes administrados con herramientas especializadas y despliegue más directo.

Claude Opus 4.7 sube la apuesta para agentes de coding y tareas largas
Anthropic presenta Claude Opus 4.7 como una mejora para tareas complejas de software, flujos asincronos y trabajos de larga duracion.

Como usar benchmarks de IA para elegir modelo de agente sin autoenganarse
SWE-bench, LiveCodeBench y leaderboards ayudan, pero no reemplazan pruebas con tus tareas, tus datos y tus costos.