Guía9 min

Agente de voz con IA: cómo crearlo y desplegarlo

TL;DR

Cómo construir un agente de voz con IA: la arquitectura de transcripción, modelo y síntesis de voz, las opciones de STT y TTS de OpenAI y Gemini, los factores de latencia de una llamada en vivo, los costos por minuto y el camino alternativo por texto para validar sin gastar en telefonía.

OpenAIGemini
Persona hablando por teléfono frente a una laptop con un diagrama de voz, texto y respuesta generada

Por qué importa

Esta nota se enfoca en la decisión práctica para builders: qué cambia, qué riesgo agrega y cómo aplicarlo sin romper operación.

Un agente de voz recibe una llamada, escucha, piensa y responde hablando, sin operador humano al otro lado. El patrón de búsqueda "crear agente de voz IA" y "n8n agente de voz" creció con fuerza porque el caso de negocio es evidente: recepción 24/7, calificación de llamadas, pedidos y agendamiento. La buena noticia: la arquitectura es más simple de lo que parece —transcripción, modelo, síntesis— y se puede validar con presupuesto bajo. Esta guía te muestra cómo armarlo, qué medir y cuándo empezar por texto.

La arquitectura de un agente de voz

Un agente de voz es un pipeline de tres etapas:

  1. STT (speech-to-text): convierte el audio del usuario en texto.
  2. LLM: genera la respuesta con el contexto del negocio (modelo de lenguaje).
  3. TTS (text-to-speech): convierte la respuesta en audio.

A esto se le agregan dos capas de producción: la telefonía (recibir y emitir la llamada) y la orquestación (mantener la conversación: saber cuándo el usuario terminó de hablar, manejar silencios e interrupciones).

Pipeline de un agente de voz: audio, transcripción, modelo, respuesta y síntesis

Opciones de transcripción (STT)

ProveedorQué ofreceCuándo elegirlo
OpenAI (Whisper API)Transcripción robusta, muchos idiomasCalidad general y ecosistema OpenAI
Google Gemini (speech)Modelos multimodales con audio nativoCuando ya usas Gemini para el resto
Modelos localesWhisper self-hostedPrivacidad estricta, sin costo por minuto

La documentación de OpenAI para speech-to-text cubre el modelo Whisper, sus formatos y límites de tamaño; la de Google cubre la entrada de audio de Gemini. Para producción, el punto clave es el streaming: transcribir en fragmentos mientras la persona habla, en vez de esperar el audio completo, porque la latencia de la llamada depende de eso.

Opciones de síntesis (TTS)

Para la voz de respuesta tienes dos grandes familias: voces neurales de API (OpenAI TTS, Gemini speech generation) y plataformas especializadas de voces hiperrealistas. Los criterios de elección son:

  • Naturalidad: qué tan humana suena la voz en tu idioma.
  • Latencia: cuánto tarda en devolver el primer audio (para llamadas en vivo importa más que para videos).
  • Costo por minuto: el precio publicado por cada proveedor.
  • Control: pausas, énfasis, velocidad y manejo de nombres propios.

Empieza con la voz por defecto de tu proveedor de API; cambia a una plataforma especializada solo si las pruebas con clientes reales muestran que la voz afecta la percepción.

Latencia: el factor que decide si la llamada se siente real

En una llamada en vivo, el presupuesto total de latencia ronda los 1-2 segundos entre que el usuario termina de hablar y escucha la respuesta. El desglose típico:

  1. STT: 200-500 ms en streaming.
  2. LLM: 300-1000 ms según modelo y complejidad.
  3. TTS: 200-500 ms al primer audio.

Las técnicas que usan los sistemas en producción: transcripción parcial (responde al silencio, no al final del audio), modelos de baja latencia para turnos cortos, y síntesis por fragmentos que empieza a hablar antes de completar la frase. Si tu caso no tolera experimentos, mide cada etapa por separado antes de optimizar la más lenta.

Costos por minuto y el plan de validación

El costo de una llamada es la suma de los tres servicios por segundo de audio más la telefonía. En lugar de estimar a ciegas, la forma correcta de presupuestar es: graba 10 conversaciones de prueba, mide los minutos reales de audio por llamada y multiplica por los precios publicados de tus proveedores. La guía de cuánto cuesta un agente de IA te da la fórmula de cinco pasos aplicada a cualquier componente.

Para validar el caso de negocio sin gastar en telefonía, sigue este orden:

  1. Primero por texto: WhatsApp o chat con el mismo modelo y las mismas instrucciones. Si el agente por texto no resuelve, el de voz tampoco.
  2. Después voz simulada: transcribe grabaciones reales y evalúa las respuestas.
  3. Solo al final, llamadas reales: con un proveedor de telefonía y un número piloto.

Verificación de un agente de voz: prueba de transcripción, latencia por etapa y respuestas correctas

Problemas comunes en producción y cómo resolverlos

  • La transcripción corta palabras o no entiende el acento local: prueba otro modelo STT o agrega un paso de normalización (números, siglas, nombres propios) antes de enviar el texto al LLM.
  • El agente interrumpe al usuario: ajusta la detección de fin de turno: silencios más largos antes de responder, o respuesta solo cuando la transcripción parcial supere una confianza mínima.
  • La respuesta suena robótica en frases largas: usa TTS por fragmentos con pausas naturales, o entrena/eliges una voz con mejor prosodia en tu idioma.
  • La llamada se cae con errores de audio: revisa el manejo de codecs del proveedor de telefonía y los timeouts de cada etapa; los fallos de red en STT/TTS deben reconectar, no colgar.
  • El costo se dispara con pocas llamadas: revisa los minutos reales por llamada; las llamadas largas con silencios pagan audio que no aporta, y el streaming optimiza eso.

Registra cada llamada con sus métricas por etapa desde el día uno: sin datos de latencia y costo por llamada, no puedes decidir ni optimizar nada.

Checklist antes de desplegar

  1. El agente por texto ya resuelve el caso (si no, detente ahí).
  2. Probaste 10 grabaciones reales y la transcripción es correcta en tu idioma y acento.
  3. Mediste la latencia de cada etapa y el total cabe en 2 segundos.
  4. Definiste qué dice cuando no entiende, cuando hay silencio y cuando el usuario se enoja.
  5. El número de emergencia y el escalamiento a humano funcionan.
  6. Calculaste el costo por llamada con los minutos reales de prueba.

Alternativa por texto: el 80% del valor

Muchos casos de "agente de voz" en realidad quieren decir "agente que responde al instante". La mensajería de texto logra la misma disponibilidad 24/7 con arquitectura más simple, latencia irrelevante y costos mucho menores. Si el objetivo es recepción o calificación de leads, la guía de agente por WhatsApp te da la arquitectura completa, y el agente de ventas en n8n muestra cómo conectar la cualificación con tu CRM. Para el resto del camino de construcción, el hub de construcción de agentes cubre memoria, herramientas y despliegue, y el curso gratuito de instalación te deja el primer agente corriendo.