Parece que la guerra por dominar la creación audiovisual automatizada no da tregua este año. Cuando creíamos que los modelos de generación ya habían tocado techo en esta temporada, la empresa fundada por Elon Musk pisa el acelerador a fondo.

xAI acaba de vitaminar su modelo Imagine Video 1.5 con novedades que atacan directamente a los puntos débiles de sus competidores. Hablamos de la posibilidad de generar vídeos directamente desde un prompt de texto, salida nativa en 1080p y un control absoluto sobre la escena mediante referencias cruzadas de imagen y voz.

Y es que la barrera técnica para crear contenido hiperrealista acaba de bajar varios peldaños de golpe. Hasta ahora, gran parte de los modelos del mercado te obligaban a partir de una imagen estática inicial si no querías que el resultado acabara siendo un cuadro abstracto y sin sentido.

Con esta última actualización, Grok Imagine permite generar un vídeo detallado solo describiendo la escena. Así de simple. Tú pones la imaginación y el texto, y los servidores de xAI hacen toda la magia matemática en la nube.

En concreto, esta esperada función de texto a vídeo y la salida en resolución 1080p ya están disponibles de forma generalizada para los usuarios. Puedes echarles un vistazo ahora mismo tanto en la versión web como en las aplicaciones nativas para móviles iOS y Android.

Evidentemente, esta resolución Full HD no se limita a la generación por texto. Si prefieres el flujo clásico de trabajar de imagen a vídeo, el sistema también escupirá los clips con la misma nitidez nativa sin despeinarse.

Control total: hasta siete referencias en un solo clip

Pero claro, sacar un vídeo con buena resolución ya casi no impresiona a los veteranos del sector. El verdadero dolor de cabeza de los directores creativos y agencias siempre ha sido el mismo: la consistencia temporal y espacial.

¿Cómo demonios mantienes exactamente al mismo personaje si necesitas cambiar de plano o de ángulo de cámara? Para resolverlo, xAI ha sacado la artillería pesada introduciendo la potente función de Multi-Reference.

Básicamente, el modelo admite inyectar hasta siete referencias visuales simultáneas y totalmente independientes dentro de una sola generación de vídeo. Puedes subir una fotografía concreta para fijar el rostro de tu protagonista, otra distinta para clavar el diseño de un producto que quieras vender, y una tercera imagen para definir la iluminación de la localización.

El resultado práctico de esto es brutal para la industria. Ahora puedes mantener a tu personaje principal intacto mientras cambias el entorno a tu antojo en cada toma.

O justo al revés: conservar el mismo escenario lúgubre pero poner a diferentes actores a realizar la misma acción. El modelo ni se inmuta. Es un nivel de personalización modular que rompe por completo el mercado del contenido sintético.

La voz como el pegamento narrativo definitivo

A ello se le suma otra de las grandes demandas históricas de la comunidad de creadores. La actualización estrena un sistema de referencias de voz pensado para blindar la identidad audiovisual de cualquier personaje.

Si combinas la imagen de referencia de un actor con una muestra de su voz, el sistema de inteligencia artificial se encarga de generar escenas donde la cara y el tono acústico se mantienen estables a lo largo de todo el tiempo de reproducción.

Se acabó el suplicio de tener que reconstruir la identidad visual y sonora de un protagonista recurrente en cada maldito corte de edición.

Disponibilidad, la API y la letra pequeña del lanzamiento

Si miramos los números y las fases de despliegue, la cosa va por barrios. La inmensa mayoría de estas nuevas capacidades avanzadas de referencia de imagen y voz se están lanzando de manera inicial exclusivamente en Estados Unidos.

De momento, el acceso está limitado a los suscriptores de pago de los planes SuperGrok Heavy y SuperGrok Plus a través de la web oficial de Grok Imagine y su app para iOS. No obstante, la compañía tiene previsto expandir el acceso a estas funciones al resto de niveles de suscripción y territorios de forma escalonada en los próximos días.

Por si fuera poco, los desarrolladores de start-ups de software también tienen motivos de peso para frotarse las manos. Ya pueden integrar estas flamantes referencias de imagen, la creación de texto a vídeo y el renderizado a 1080p directamente en sus propios proyectos a través de la API de xAI.

Para hacerlo, solo tienen que apuntar sus sistemas internos hacia el modelo llamado grok-imagine-video-1.5. Configurar una llamada a esta API es bastante directo: los parámetros a rellenar incluyen el prompt descriptivo, la URL de la imagen de referencia, la duración deseada del clip, la relación de aspecto y la resolución final.

La letra pequeña es que usar el sistema de consistencia de voz mediante llamadas a la API no está abierto por defecto y, de momento, requiere mandar una solicitud manual de aprobación a la empresa de Musk.

Viendo el panorama completo, queda clarísimo que la actualización del mes pasado, que se centraba casi en exclusiva en pulir el movimiento, las físicas complejas y el audio base, era solo el aperitivo preparatorio. El ecosistema de Grok Imagine ahora pone todo el foco en entregar a los usuarios las herramientas reales necesarias para dirigir escenas, y no conformarse solo con generar clips aleatorios llamativos.

0 0 votos
Valoración del artículo
Suscribirte
Notificar sobre
guest
0 Comentarios
Más Antiguos
Más Nuevos Más Votados