Llamadas de voz con IA de compañía: latencia, coste y qué las hace sentirse reales

Precios y planes

En una conversación humana, la pausa antes de una respuesta suele ser de una quinta parte de segundo. Una llamada de voz con IA tiene que oírte, pensar y hablar más o menos en esa ventana, y cada fase cuesta dinero. Eso explica casi todo lo que notas en las funciones de voz.

Podemos recibir una comisión por los enlaces de esta página. Nunca cambia una valoración.

Una llamada de voz es lo más exigente que hace una IA de compañía. El texto puede tardar unos segundos sin que a nadie le importe. El habla no: la gente nota retrasos que serían invisibles en una ventana de chat.

El problema de los 200 milisegundos

Investigadores que compararon conversaciones en diez idiomas comprobaron que la pausa típica entre que una persona termina y la otra empieza ronda los 200 milisegundos, y es notablemente parecida entre culturas. La gente empieza a preparar su respuesta antes de que el otro termine. Las pausas mucho más largas se leen como duda, confusión o desinterés.

Una IA tiene que meter toda una cadena de procesos en esa ventana para que suene natural.

Qué pasa entre tus palabras y las suyas

Cadena de una llamada de voz con IA: detectar el final de tu frase, voz a texto, el modelo de lenguaje escribiendo la respuesta y texto a voz, con los puntos donde se acumula el retraso

La cadena clásica. Los sistemas más nuevos solapan o fusionan estas fases.

  1. Detección del final de la frase. El sistema tiene que decidir que has terminado, no que solo has hecho una pausa. Si es demasiado impaciente te interrumpe; si es demasiado cauto añade silencio muerto.
  2. Voz a texto. Se transcriben tus palabras.
  3. La respuesta. El modelo de lenguaje escribe una respuesta, en personaje, con memoria.
  4. Texto a voz. La respuesta se convierte en voz, idealmente la propia del personaje y con emoción.

En los sistemas más antiguos, cada paso espera a que termine el anterior. Los más nuevos empiezan a decir la primera frase mientras se escribe el resto, o usan modelos que reciben voz y producen voz directamente, lo que elimina por completo los pasos de transcripción y de síntesis.

Por qué la voz se mide

Chat de textoMensaje de vozLlamada de voz en directo
Velocidad necesariaBastan segundosBastan segundosFracciones de segundo
Procesamiento extraNingunoSíntesis de vozReconocimiento, síntesis, detección de turnos
Duración típicaRespuestas cortasUna respuestaDe minutos a horas
Coste relativoEl más bajoModeradoEl más alto
Cómo lo venden las appsIncluidoIncluido o con créditosMinutos, niveles o créditos

Cada minuto de llamada ejecuta toda la cadena de forma continua, a menudo con versiones «en tiempo real» más caras de cada modelo. Por eso la voz suele ser lo primero que una app limita, y por eso «ilimitado» rara vez se aplica a ella; mira cómo leer las listas de funciones de las apps de novia IA.

Qué hace que una llamada parezca real

  • Latencia baja, y constante. Una pausa larga ocasional rompe la ilusión más que una media algo más lenta.
  • Gestión de interrupciones. Poder cortarla, y que ella pare y responda, es lo que separa una conversación de notas de voz alternas.
  • Coherencia de la voz. La misma voz, acento y calidez de una llamada a otra. Mis pruebas mostraron que la calidad de la voz puede variar notablemente entre personajes incluso en buenas apps.
  • Prosodia. Reír, hacer pausas, suavizar: un habla que transmite emoción en lugar de leer un texto en voz alta.
  • Memoria en modo voz. Algunas apps usan un modelo más ligero para las llamadas, así que el personaje recuerda menos por teléfono que en el chat.

Probar una función de voz antes de pagar

  1. Pregunta qué incluye: mensajes de voz, llamadas en directo o ambos, y cuántos minutos.
  2. Haz una llamada de dos minutos en una prueba o en el plan más barato, con datos celulares además de wifi.
  3. Interrúmpela a mitad de frase. ¿Se calla?
  4. Pregúntale por algo de tu chat de texto. ¿Lo sabe?
  5. Mira el coste por minuto extra o por crédito. Una llamada larga puede gastar la asignación de un mes.

La idea general sobre los costes del multimedia está en cómo funcionan las imágenes y la voz de una novia IA, y si vale la pena mejorar de plan por la voz se trata en los planes premium.

Una nota sobre el bienestar

La voz es más inmersiva que el texto, y la investigación de OpenAI y el MIT de 2025 encontró que el uso breve de voz iba con mejor bienestar, mientras que el uso diario intenso no. Conviene disfrutarla a dosis; las señales de pasarse están en cuando una IA de compañía empieza a quitarte más de lo que te da.

Preguntas frecuentes

¿Por qué hay retraso en las llamadas de voz con IA?

Hay varios pasos en secuencia: detectar que has terminado de hablar, transcribir, generar una respuesta y convertirla en voz. Cada uno suma tiempo. Los sistemas más nuevos, que manejan el habla directamente o empiezan a hablar antes de tener escrita toda la respuesta, reducen mucho el retraso.

¿Por qué las apps de IA de compañía limitan los minutos de voz?

La voz le cuesta a la empresa mucho más que el texto. El reconocimiento de voz, una respuesta más larga y una síntesis de voz de alta calidad funcionan en cada intercambio, y una llamada puede durar una hora. Medir los minutos evita que un pequeño grupo de usuarios intensivos haga que el plan no sea rentable.

¿Son lo mismo los mensajes de voz que las llamadas de voz?

No. Un mensaje de voz es una respuesta grabada que reproduces: no necesita velocidad y es mucho más barato. Una llamada en directo necesita que todo ocurra lo bastante rápido para parecer una conversación. Las páginas de precios suelen mezclar las dos cosas.