Si parpadeas, te lo pierdes: la barrera del sonido en la inteligencia artificial acaba de romperse gracias a ElevenLabs y su enfermiza obsesión por la latencia cero.
Llevamos meses hablando de asistentes de voz que prometen conversaciones naturales, pero siempre había un incómodo silencio de por medio. Eso se acabó. Con el sorpresivo lanzamiento de Eleven v4 y su variante extrema para desarrolladores, Eleven v4 Turbo, la compañía deja claro que el tiempo de espera es cosa del pasado. Literalmente, te responden antes de que termines de respirar. Una auténtica locura.
Y es que los números que acaban de poner sobre la mesa asustan bastante a la competencia. Estamos hablando de que el modelo Turbo ofrece unos 100 milisegundos de latencia media de inferencia. Es decir, el tiempo que tarda el cerebro del sistema en procesar lo que le pides por API y empezar a generar la respuesta es casi imperceptible para el cerebro humano.
El fin de las voces robóticas: contexto, susurros y portazos
Evidentemente, la velocidad bruta no sirve de nada si la voz suena al típico contestador automático de los años noventa. Por eso, la nueva arquitectura base de Eleven v4 ha dado un salto demencial en expresividad y calidad de audio puro. Ahora el modelo no se limita a leer texto de forma plana, sino que interpreta quién habla, qué ha pasado justo antes y cuál es la intención real detrás de cada línea de guion.
En concreto, los creadores pueden meter mano directamente en la actuación del modelo usando simples corchetes durante el prompt. Tú escribes algo como [ríe], [susurra] o incluso [portazo] en medio del texto, y el sistema genera el efecto sonoro perfectamente integrado con la voz. Las antiguas y tediosas etiquetas SSML para marcar pausas han muerto por fin. Ahora todo fluye mediante lenguaje natural. Así de simple.
Pero claro, mantener esa consistencia emocional en audiolibros o podcasts muy largos siempre ha sido un dolor de cabeza. Para solucionarlo, han metido en el horno una función de «unión de contexto» que clava el ritmo en proyectos extensos. Soporta hasta 10.000 caracteres por generación sin que el hablante cambie de tono misteriosamente a mitad de párrafo. Y sí, han devuelto a la vida las clonaciones de voz profesionales, una función muy demandada que había desaparecido incomprensiblemente en la versión v3.
Eleven v4 Turbo destroza los tiempos de OpenAI en agentes de IA
Si miramos los datos del modelo Turbo, diseñado específicamente para integrarse en llamadas en directo y flujos de agentes a través de ElevenAgents, la cosa se pone muy tensa para los rivales. Según los datos aportados, el tiempo medio hasta que el sistema emite la primera sílaba de voz es de apenas 150 milisegundos.
Básicamente, esto te permite montar un pipeline técnico con transmisión bidireccional que parece magia negra. Puedes enviarle el texto a la API de ElevenLabs a medida que un LLM (modelo de lenguaje) lo va escupiendo, y recibir el audio de vuelta antes de que termine la frase. Ni se inmuta.
A ello se le suma la dolorosa comparativa oficial que no ha dejado títere con cabeza. Esos 150 milisegundos de ElevenLabs barren del mapa los 262 milisegundos que marcaba Cartesia Sonic 3.6. Y si miramos a los gigantes de Silicon Valley, dejan en evidencia los 814 milisegundos del modelo GPT-4o mini TTS de OpenAI. Les han roto el mercado en la cara.
La letra pequeña: precios, idiomas y seguridad obligatoria
Por si fuera poco, esta bestia tecnológica soporta más de 90 idiomas y es retrocompatible con las más de 17.500 voces que ya existen en su inmensa biblioteca comunitaria. Aunque la letra pequeña aquí es que si tenías clonaciones instantáneas o profesionales antiguas guardadas en tu cuenta, te va a tocar volver a entrenarlas desde cero para aprovechar el nuevo motor. Gajes del oficio.
Y hablando de probarlo, la barrera de entrada sigue siendo ridículamente baja para que cualquiera pueda echar un vistazo. Ambos modelos están incluidos en todos los planes, metiendo de lleno el nivel gratuito, que te regala unos jugosos 10.000 créditos mensuales. Si vas en serio y necesitas acceso mediante REST, TypeScript o Python, los planes de pago arrancan desde unos simbólicos 6 dólares al mes, ofreciendo salidas de audio en MP3, WAV, PCM e incluso formato µ-law preparado para telefonía.
Finalmente, no podíamos pasar por alto el espinoso tema de los deepfakes. Clonar voces ajenas es un peligro real hoy en día. Para evitar que la plataforma se llene de estafadores, ElevenLabs exige ahora un riguroso consentimiento verificado del propietario original de la voz. Además, todo el audio generado queda rastreado bajo el clasificador de voz de IA de la compañía, para que nadie te venda humo ni te intente colar un fraude telefónico.
La pelota está ahora en el tejado de OpenAI, Google y el resto de gigantes que prometían dominar las interfaces de voz en tiempo real este año. Con tiempos de respuesta que caen por debajo del umbral de la percepción humana, ElevenLabs acaba de subir el listón a un nivel absurdamente alto. Veremos si la competencia responde rápido, o si se quedan literalmente mudos ante semejante exhibición de músculo técnico.

Me dedico al SEO y la monetización con proyectos propios desde 2019. Un friki de las nuevas tecnologías desde que tengo uso de razón.
Estoy loco por la Inteligencia Artificial y la automatización.








