Parece que la guerra por dominar la voz mediante inteligencia artificial acaba de dar un giro radical, y esta vez el golpe en la mesa lo ha dado xAI al superar frente a frente a gigantes de la talla de OpenAI y Google.
Tras semanas de expectación en el sector, la empresa de Elon Musk acaba de presentar Grok Voice Think Fast 2.0. Hablamos de su modelo de voz a voz de nueva generación, diseñado específicamente para desarrolladores que montan agentes conversacionales complejos. Y los primeros datos técnicos son, sencillamente, una auténtica locura.
Un rendimiento que saca los colores a GPT y Gemini
Si vamos directamente a los números duros, los resultados de los benchmarks no dejan lugar a dudas sobre el salto generacional. En la rigurosa prueba de Artificial Analysis para sistemas de voz a voz, Think Fast 2.0 ha reventado el marcador con un 82,9% de puntuación global. Un salto espectacular desde el 75,7% de su versión anterior.
Para ponerlo en perspectiva, esto significa que ha destronado a su mayor rival, GPT-Realtime-2.1, que se queda en un nada despreciable 79,1%. Por si fuera poco, ha dejado muy atrás al modelo Gemini 3.1 Flash de Google, hundido en un modesto 69,5%. Un repaso en toda regla.
En el terreno puramente económico, xAI ha fijado un coste de 0,08 dólares por minuto de audio. Es decir, un precio tremendamente agresivo orientado a que tanto start-ups emergentes como grandes corporaciones empiecen a migrar sus pipelines de atención al cliente hacia su ecosistema de inmediato.
La obsesión por la latencia: pensar y hablar a la vez
Lo verdaderamente rompedor de esta actualización no es solo lo inteligente que es el modelo, sino lo rápido que reacciona. El tiempo de espera hasta que el usuario escucha el primer audio ha caído en picado: de 1,25 segundos a apenas 0,70 segundos.
Básicamente, esa diferencia de apenas medio segundo es lo que separa a un robot telefónico torpe y frustrante de una charla natural que parece humana. Ni te enteras de que hay un ordenador al otro lado procesando datos.

Y aquí entra en juego la magia técnica de su arquitectura. El modelo ahora realiza el razonamiento en paralelo con el habla. Esto significa que puede invocar herramientas externas mientras está pronunciando literalmente la primera sílaba de su respuesta. Un hito técnico que mantiene a raya la latencia sin sacrificar la complejidad de las tareas.
De hecho, han conseguido reducir el uso medio de tokens de razonamiento a un 0,4x en comparación con la versión 1.0. Esto permite que las llamadas a herramientas en entornos de producción se ejecuten por completo antes de que el agente termine su frase inaugural.
Entenderte hasta con mala cobertura
Pero claro, de nada sirve tener un LLM ultrarrápido si no entiende lo que le dices cuando vas caminando por la calle. En este apartado crítico, xAI ha puesto el turbo en su motor de transcripción. La precisión ha aumentado entre 1,5 y 2 veces si lo comparamos con referentes absolutos del sector del audio, como Deepgram Nova 3 y ElevenLabs Scribe v2.
Si nos vamos a entornos verdaderamente hostiles, con ruido de fondo extremo y la típica compresión de audio de una llamada telefónica de toda la vida, la mejora puede llegar a ser de 10 veces. Todo esto medido bajo la lupa de la tasa de error de palabras (WER). Te haces una idea de lo que esto supone para un call center masivo.
Menos cháchara y más conversión de ventas
Otro detalle fascinante es cómo han pulido el comportamiento general del modelo mediante técnicas de aprendizaje por refuerzo. Ahora el sistema está entrenado para dar respuestas mucho más cortas, hacer una sola pregunta cada vez y eliminar de raíz el contenido de relleno. Va al grano para no aburrir al cliente.
Y es que la puntuación de capacidad «agentic» (su habilidad para resolver tareas complejas de forma autónoma usando herramientas) se ha disparado a un 56,5%. Con esto, barre por completo el 45,7% de GPT-Realtime y deja en pañales el 37,7% de Gemini. Estas no son solo cifras de laboratorio aburridas.

Ya lo han puesto a prueba en el mundo real. Durante un exigente test A/B en el servicio telefónico de atención al cliente de Starlink, este modelo generó mayores tasas de conversión de ventas y solucionó más dudas de soporte técnico sin necesidad de escalar a un operador humano. El sueño húmedo de cualquier departamento de atención al cliente.
Como detalle logístico vital para los programadores, tocará apuntar una fecha en el calendario: el 5 de agosto de 2026. Ese día, el alias grok-voice-latest se actualizará de forma automática a la versión 2.0. Quien quiera quedarse en la infraestructura vieja por razones de compatibilidad, tendrá que fijar el identificador «1.0» a mano en su código.
Vistos los datos en frío, parece evidente que la carrera por dominar los agentes de voz empresariales está más viva que nunca. OpenAI y Google ya no pueden dormirse en los laureles si no quieren que xAI les robe un trozo gigante del pastel B2B. La pelota está ahora en el tejado de Sam Altman y Sundar Pichai. Veremos cuánto tardan en mover ficha.

Me dedico al SEO y la monetización con proyectos propios desde 2019. Un friki de las nuevas tecnologías desde que tengo uso de razón.
Estoy loco por la Inteligencia Artificial y la automatización.








