La gente da por hecho que una app de IA de compañía es una sola inteligencia que habla, dibuja y se expresa con voz. Son tres o cuatro sistemas separados conectados por la app, y casi todas las frustraciones de esta parte del producto vienen de las costuras entre ellos.
Tres motores, una interfaz
El modelo de lenguaje se encarga de la conversación. Produce texto y nada más.
El modelo de imágenes es un sistema completamente distinto, normalmente un modelo de difusión. Toma una descripción de texto y produce una imagen. Nunca ha visto tu conversación.
El sistema de voz convierte texto en audio. También es independiente, y también está ciego a todo salvo a la frase que le pasan.
Cuando le pides un selfie a tu compañera, ocurre esto: el modelo de lenguaje escribe una descripción corta de la imagen pedida, la app añade las etiquetas de aspecto guardadas del personaje, ese prompt combinado va al modelo de imágenes y vuelve una imagen. Después el chat reacciona a una imagen que no puede ver, usando la descripción que escribió.
Ese relevo es el origen de casi todas las quejas sobre lo multimedia en esta categoría.
Por qué la cara no deja de cambiar
Porque un modelo de difusión no recupera a tu personaje: genera a alguien que encaja con una descripción. «Pelo largo y oscuro, ojos verdes, veintipocos» describe millones de caras, y te sale una distinta cada vez.
Las apps lo resuelven en distinto grado:
- Etiquetas de aspecto guardadas: la misma cadena descriptiva cada vez. Barato, y solo más o menos coherente.
- Una imagen de referencia que condiciona cada generación. Mucho mejor, y el método habitual cuando las caras siguen siendo reconocibles.
- Un modelo ajustado por personaje: el más coherente y con mucho el más caro, así que suele aparecer solo en los planes superiores.
Es una diferencia real que merece probarse en una versión gratuita antes de pagar. Genera cuatro imágenes del mismo personaje en situaciones distintas. Si te salen cuatro mujeres diferentes, ninguna suscripción lo arreglará. La coherencia del personaje entre imágenes es buena parte de por qué Candy AI lidera nuestro ranking, y de por qué Secret Desires, que construye aspecto, voz y personalidad juntos y añade video corto, puntúa donde puntúa.
Por qué lo multimedia siempre se mide
El texto es barato. Generar una respuesta de chat le cuesta a la empresa una fracción de céntimo.
Una imagen cuesta bastante más por generación. La voz se factura por segundo de audio. El video es muchísimo más caro que cualquiera de los dos.
Esa diferencia de coste es toda la razón de la estructura de precios que ves en todas partes en esta categoría: cupos de mensajes generosos, topes de imágenes ajustados, minutos de voz que se venden aparte, video restringido a los planes altos. No es una escasez artificial pensada para venderte más: es la forma real de la factura que recibe la empresa, trasladada al usuario.
Por eso «ilimitado» en este mercado casi siempre significa texto ilimitado. Léelo así y las páginas de precios cobran sentido de repente. Las cuentas están en lo que cuesta de verdad generar imágenes.
Qué añade la voz y cuánto cuesta
La voz cambia la experiencia más de lo que mucha gente espera. Leer un mensaje y oírlo son cosas distintas, y el cambio es mayor de lo que sugiere la descripción técnica.
Dos cosas que comprobar antes de pagar por ella:
La latencia. Una pausa de tres segundos antes de cada respuesta rompe la ilusión por completo. Pruébala en una versión gratuita o de prueba, no a partir de un video de demostración.
Si es una llamada o un mensaje. Las notas de voz, en las que el personaje lee su respuesta en voz alta, son comunes y baratas. Las llamadas en tiempo real, en las que hablas tú y te contesta, son otro producto y normalmente otro plan. Nomi incluye llamadas de voz entre sus funciones; muchas apps anuncian «voz» y se refieren a notas.
Lo que las imágenes no harán
Dos límites que conviene conocer antes de decepcionarte:
Las manos, el texto y los detalles finos siguen siendo poco fiables en todos los generadores de esta categoría. Nadie lo ha resuelto, y una app que promete lo contrario describe su mejor resultado, no el promedio.
La imagen no conoce tu escena. El modelo de chat escribe un prompt de una línea, así que todo lo que no está en esa línea se pierde: la habitación que describiste, lo que llevaba puesto hace tres mensajes, la hora del día. Ser explícito en la petición arregla más que cualquier ajuste.
Cómo juzgar la parte multimedia en una tarde
Gasta todo el cupo de una versión gratuita en una sola sesión, en lugar de una imagen al día. Pruebas cuatro cosas:
- Coherencia: cuatro imágenes, el mismo personaje, situaciones distintas.
- Fidelidad al prompt: pide algo concreto y mira cuánto sobrevive.
- Latencia: tanto en imágenes como en voz.
- Qué cuenta contra el tope: si una generación fallida o rechazada también te cuesta.
Ese último punto es el menos documentado y el más molesto de descubrir después de pagar. Junto con el resto de lo que incluyen realmente las versiones gratuitas, es de esas cosas que solo salen cuando usas el producto como es debido.

