¿Te has dado cuenta de que, cuando trabajas frente al ordenador, a veces es infinitamente más rápido hablar que teclear un prompt kilométrico? Google lo sabe de sobra. Tras varios meses a la sombra mediática de sus competidores, los de Mountain View preparan una actualización crítica para su inteligencia artificial. Las exclusividades móviles tienen los días contados: Gemini Live está listo para desembarcar en la versión web y de escritorio. Y no viene solo.
Según una filtración de TestingCatalog, la compañía necesita retener a los usuarios profesionales en su ecosistema. Según los últimos rastros analizados en el código fuente de la plataforma, Google ultima los detalles para integrar su avanzado modo de voz bidireccional directamente en el navegador. Un paso lógico y necesario.
De hecho, algunos desarrolladores ya han cazado un botón inactivo de Gemini Live flotando en la interfaz web reciente. A día de hoy, esta funcionalidad de conversación fluida y en tiempo real ni siquiera existe en la aplicación de escritorio, pero sabemos que está rodando a puerta cerrada. Concretamente, se encuentra en fase de pruebas dentro del selecto programa Trusted Tester de la compañía. Se masca la tensión en el sector.
El modo de voz en tiempo real de Gemini abandona tu móvil
Si hacemos memoria y rebobinamos hasta la conferencia I/O de mayo, recordaremos que ya nos soltaron varias pistas sobre estas capacidades de voz enfocadas a la nueva app de macOS. En las versiones preliminares de esa aplicación para el ecosistema Apple, se dejaron ver opciones para configurar distintas voces y una curiosa interfaz superpuesta para analizar la pantalla compartida. Las piezas del puzle encajan.
También te puede interesar:Gemini Live: Cómo Funciona la Conversación por Voz en Tiempo Real con la IA de Google
Básicamente, la visión es que puedas estar picando código o destripando una hoja de cálculo y, simplemente usando el micrófono, le pidas a la IA que te asista sin tener que cambiar de pestaña. Los indicios sugieren que el lanzamiento del modo Live ocurrirá simultáneamente tanto en web como en escritorio. Un auténtico salto cuantitativo en productividad diaria.
Las «Skills» rompen el muro de pago para democratizar la IA
Pero aquí viene el verdadero caramelo para los que exprimen los modelos del lenguaje a nivel profesional. Las filtraciones también confirman que las famosas «skills» (habilidades personalizadas) van a aterrizar por fin en los chats normales de Gemini. Hasta hace poco, este territorio estaba totalmente blindado.
Si miramos la configuración actual de Google, estas rutinas a medida son exclusivas de Gemini Spark, un agente autónomo al que solo puedes acceder si pagas mensualmente la suscripción AI Ultra. En ese entorno premium, las skills actúan como paquetes de instrucciones reutilizables para automatizar tareas aburridas y recurrentes. Te salvan de escribir el mismo contexto inicial decenas de veces.

La letra pequeña, que en esta ocasión es una excelente noticia, es que cualquier usuario de a pie podrá aprovechar este sistema. Los datos extraídos apuntan a que podrás subir tus propios paquetes de instrucciones, elegir de un catálogo oficial de herramientas predefinidas o crear unas completamente nuevas desde cero. Es más, si no quieres complicarte, Gemini podrá generar una skill automáticamente analizando tu historial de peticiones. Magia pura.
También te puede interesar:Gemini Live: Cómo Funciona la Conversación por Voz en Tiempo Real con la IA de GoogleEvidentemente, con esta jugada estratégica Google intenta tapar una fuga de usuarios masiva. Herramientas similares como los GPTs personalizados de ChatGPT o los Projects de Claude llevaban demasiada ventaja operativa. Ahora, el tablero de juego se iguala de forma drástica.
Retrasos en los modelos base y un calendario envuelto en niebla
A ello se le suma que la infraestructura para este cambio ya lleva meses asentándose. Allá por abril, vimos cómo llegaban los atajos rápidos de prompts a Chrome. Además, el entorno cerrado de Gemini Enterprise ya permite a los trabajadores corporativos utilizar estas skills en sus flujos internos. El terreno estaba asfaltado.
Pero no todo es un camino de rosas, y aquí toca ser críticos con el hardware y los cerebros matemáticos. El roadmap oficial de modelos es ahora mismo un auténtico caos. Mientras hay señales claras de que un veloz Gemini 3.6 Flash se está cocinando en los servidores, el verdadero motor de razonamiento brilla por su ausencia. Hablamos de Gemini 3.5 Pro, un modelo que arrastra retrasos constantes y que ya ha superado con creces su propia fecha de lanzamiento fijada para mediados de julio. Un resbalón innegable.

Por si fuera poco, los mentideros de Silicon Valley sugieren un plan B. Existe una alta probabilidad de que Google lance primero un modelo intermedio a modo de parche temporal para apaciguar los ánimos. Podríamos tener novedades inminentes a finales de este mismo mes de julio, aunque con esta compañía, los planes pueden dar un giro de ciento ochenta grados horas antes de un anuncio.
Poder combinar el modo conversacional en vivo desde el navegador con un ecosistema propio de skills transformaría por completo lo que entendemos hoy por Gemini. Dejaría de ser un simple buscador anabolizado para convertirse en un asistente operativo de primer nivel. La tecnología está lista y el código ya existe. Ahora solo falta que le den al botón verde de una vez por todas.

Me dedico al SEO y la monetización con proyectos propios desde 2019. Un friki de las nuevas tecnologías desde que tengo uso de razón.
Estoy loco por la Inteligencia Artificial y la automatización.











