¿Pensabas que Microsoft iba a conformarse con depender de Sam Altman y OpenAI para siempre? Piénsalo otra vez. Ya sabíamos que esta luna de miel corporativa tenía los días contados, pero ahora han aparecido las pruebas definitivas. Tras colarse en un acceso anticipado bastante oculto dentro de MAI Playground, acaba de salir a la luz MAI Realtime, el primer modelo nativo de voz en tiempo real firmado enteramente por los de Redmond.
El motivo es simple: hasta ahora, la magia detrás de muchas de las conversaciones que tenías con la inteligencia artificial de Microsoft llevaba la firma de terceros. Pero este nuevo sistema cambia las reglas del juego al ser completamente bidireccional y full-duplex. Esto significa que la IA puede escucharte mientras ella misma está hablando, eliminando la necesidad de los incómodos turnos de walkie-talkie. Una auténtica locura.
En las tripas del sistema: Victoria, Grant y cero retrasos
Si miramos los detalles técnicos filtrados por TestingCatalog, todo sugiere que un grupo muy exclusivo de socios ya le está metiendo mano a la tecnología. Por el momento, el modelo cuenta con dos voces bautizadas como Victoria y Grant. Quienes lo han probado aseguran que suenan bastante más naturales y orgánicas que el actual modo de voz de Copilot. Vienen dispuestos a competir de tú a tú con pesos pesados como Sesame o el propio GPT Live.
A ello se le suma una gestión de los idiomas sencillamente brutal. El usuario puede fijar el idioma de forma manual o, si lo prefiere, dejar activa la detección automática. Y aquí viene lo interesante. Puedes empezar una frase en español, meter una expresión en inglés y terminar en francés, y el sistema cambia de idioma sobre la marcha sin perder el contexto.
Pero claro, el verdadero dolor de cabeza para cualquier IA conversacional son las interrupciones humanas. MAI Realtime ataca este problema permitiendo configurar el control de turnos mediante dos vías. Por un lado, ofrece un modo llamado Switchboard, que utiliza MAI-Ears junto a un sistema de tokens de control. Por otro, cuenta con un modo determinista que mezcla la detección pura de silencios con un endpoint semántico basado en Whisper.
En la práctica, las diferencias entre usar una configuración u otra son casi indetectables para el usuario de a pie. Lo que realmente importa es que el modelo encaja bien los cortes de voz y responde con una latencia sorprendentemente baja. Se siente como una charla telefónica normal y corriente, sin esos silencios incómodos de procesamiento. Así de simple.

La letra pequeña es que este modelo está diseñado estrictamente para hablar. Si esperabas que tu ordenador te cantara una canción o hiciera efectos de sonido graciosos, te vas a quedar con las ganas. La herramienta no genera sonidos no verbales, centrando todo su potencial de cálculo en la fluidez de las palabras.
Cortando el cordón umbilical con OpenAI
Evidentemente, este movimiento estratégico a nivel de arquitectura tiene un trasfondo financiero inmenso. Hasta el día de hoy, los modelos de voz propios que manejaba Microsoft, como MAI-Voice-2 y MAI-Transcribe-1.5, funcionaban de forma unidireccional. Separaban la síntesis del reconocimiento. Si la compañía quería ofrecer una experiencia fluida de speech-to-speech en su Azure Speech Voice Live API, no le quedaba más remedio que depender directamente del modelo GPT-Realtime de OpenAI.
Y es que aquí es donde notamos la mano del equipo de superinteligencia que capitanea Mustafa Suleyman. Durante la conferencia Build 2026 ya demostraron su capacidad al presentar siete modelos propios. Tener por fin un modelo full-duplex de la casa les otorga independencia tecnológica absoluta y les ahorra una fortuna en el pago de licencias a terceros.

De hecho, esto encaja con la tendencia reciente de la empresa. Estamos viendo cómo Microsoft sustituye progresivamente los componentes de OpenAI en todo su catálogo estrella, desde Copilot hasta Teams o el buscador Bing. Los rumores apuntan a que Microsoft Foundry será la plataforma principal para que los desarrolladores integren este modelo, mientras que los usuarios domésticos lo disfrutarán bajo la marca Copilot Voice.
Por si fuera poco, el entorno actual incluye un panel de depuración que es oro puro para los ingenieros. Esta interfaz muestra en tiempo real la latencia exacta, los pasos de procesamiento y hasta los pensamientos internos del modelo antes de hablar. Se espera que pronto se active una función para compartir estas muestras de audio cuando se abra el acceso a más gente.
Aún no han soltado prenda sobre la fecha oficial de lanzamiento, ni para el entorno de desarrollo ni para el usuario final. Pero el aviso a navegantes está lanzado. Microsoft ya tiene la tecnología en sus servidores y está lista para reclamar el trono de las interfaces de voz sin depender de nadie. La pelota está ahora en el tejado de OpenAI para demostrar si su tecnología sigue siendo imprescindible o si acaban de perder a su mejor cliente.

Me dedico al SEO y la monetización con proyectos propios desde 2019. Un friki de las nuevas tecnologías desde que tengo uso de razón.
Estoy loco por la Inteligencia Artificial y la automatización.








