Cien milisegundos. Eso es exactamente lo que tarda Microsoft AI en empezar a entender lo que estás diciendo con su nuevo modelo de transcripción. Tras meses de promesas sobre asistentes de voz casi humanos, los de Redmond acaban de lanzar una bestia técnica que pulveriza los tiempos de espera a los que estábamos acostumbrados. Se acabó el incómodo silencio robótico.
Y la estrategia corporativa es evidente: quieren dominar el mercado de los agentes conversacionales desde los cimientos. Para lograrlo, acaban de presentar MAI-Transcribe-2-Streaming, un sistema de voz a texto en tiempo real que ya se ha colgado la medalla de oro en Artificial Analysis por la brutal precisión de sus transcripciones, tanto finales como parciales. Los números que manejan son un auténtico disparate.
El fin de la latencia: así funciona el cerebro de MAI-Transcribe-2-Streaming
Si nos vamos a las especificaciones duras, este modelo es capaz de procesar 60 idiomas diferentes detectándolos al vuelo y de forma continua. Pero la magia negra ocurre en el cronómetro. El sistema empieza a escupir hipótesis de texto poco más de 100 milisegundos después de recibir el audio, corrigiéndolo al instante según obtiene más contexto. Una auténtica barbaridad.

Para que nos entendamos, este nivel de velocidad lo cambia todo. La generación temprana de texto permite que un agente de IA empiece a razonar tu orden o a usar herramientas antes de que tú hayas terminado de hablar. Según apuntan en su anuncio oficial, en sus pruebas internas las palabras aparecen el doble de rápido que en su competidor más cercano en tareas de dictado y subtitulado en vivo. Literalmente, la máquina se adelanta a tu voz.
Lógicamente, para que los desarrolladores se animen a integrarlo sin miedo, han fijado un precio promocional de 0,54 dólares por hora de audio hasta que acabe el año. Quieren inundar de código el ecosistema de las start-ups. Así de simple.
Voces clonadas que hablan 23 idiomas sin perder tu acento
De poco sirve escuchar a la velocidad de la luz si luego la IA te responde con voz de GPS antiguo. Por eso, Microsoft ha completado el pipeline de audio sacando a la pista dos modelos de generación de texto a voz: MAI-Voice-2.1 y su versión orientada al rendimiento extremo, MAI-Voice-2.1-Flash. La meta es crear interlocutores que parezcan personas reales respirando al otro lado del móvil.
Lo verdaderamente llamativo de este despliegue es que el modelo base domina la pronunciación de 23 idiomas y 26 configuraciones regionales manteniendo intacta tu identidad vocal. Es decir, imagínate una aplicación educativa donde un mismo avatar te enseña español, y luego salta al inglés británico adoptando el acento y las expresiones locales de forma natural, sin cambiar de timbre. Todo por un coste de 22 dólares por millón de caracteres.
El modelo Flash viene a reventar el mercado de inferencia
Pero claro, a veces no necesitas tantos detalles acústicos y priorizas el volumen de tráfico puro. Ahí es donde entra la versión Flash. Este modelo retiene las mismas voces multilingües, pero está afinado para destruir los benchmarks de latencia. Es capaz de generar hasta 45 segundos de audio con un retraso integral de apenas 150 milisegundos. Pura brujería técnica.
Si echamos un ojo a la hoja de costes, Microsoft saca pecho afirmando que MAI-Voice-2.1-Flash ofrece una inferencia un 55 % más rápida y cuesta casi un 60 % menos que otros modelos comparables en el mercado, situándose en 15 dólares por millón de caracteres. Y si vas a meterle mano al código de inmediato, en su resumen para desarrolladores ya detallan en vista previa pública cómo conectarse mediante el SDK de Azure Speech o una API WebSocket compatible con OpenAI Realtime. Te lo ponen en bandeja.
Por si esto te supiera a poco, ambas variantes te permiten clonar una voz humana a partir de unos poquísimos segundos de referencia de audio. Obviamente, con la regulación actual pisándoles los talones, los de Redmond han inyectado salvaguardas de consentimiento obligatorias por software para blindarse frente a cualquier uso fraudulento de estas clonaciones.
Un ciclo cerrado para agentes que parecen vivos
La perspectiva de Microsoft AI no es lanzar tres herramientas desconectadas, sino empaquetar un ciclo conversacional impecable. Buscan que crees agentes capaces de escuchar, procesar el prompt, ejecutar acciones y responder de viva voz dentro de un margen temporal tan humano que asusta. Para demostrar que esto funciona hoy, han colgado la demo Chatter en MAI Playground, donde los modelos trabajan sincronizados.

En cuanto a la infraestructura de despliegue, el abanico es inmenso. Puedes atacar a los modelos de voz vía OpenRouter, y tienes los tres disponibles desde Microsoft Foundry, Vercel o Azure Voice Live. Y ojo, la compatibilidad con LiveKit llegará muy pronto.
La carrera por la IA ya no consiste solo en lanzar el LLM más inteligente, sino en crear el asistente de voz que te responda sin dudar una milésima de segundo. Con estos tiempos de latencia y unos precios de derribo pensados para atraer volumen masivo, la pelota está ahora rebotando en el tejado de OpenAI. Veremos con qué nos sorprenden en los próximos meses.

Me dedico al SEO y la monetización con proyectos propios desde 2019. Un friki de las nuevas tecnologías desde que tengo uso de razón.
Estoy loco por la Inteligencia Artificial y la automatización.







