Han pasado meses desde que la fiebre del audio nos prometió asistentes que casi respiran al otro lado del teléfono. Pero la cruda realidad es que la mayoría se quedan muy cortos cuando les pides que hagan trabajo de verdad. Y aquí es donde Vellum acaba de dar un auténtico golpe sobre la mesa con la llegada de su nuevo modo de voz.

No hablamos de un simple loro estocástico que te lee artículos de la Wikipedia con entonación robótica. Hablamos de un asistente capaz de navegar por internet, leer tus archivos locales o cuadrar tu calendario mientras mantienes una charla natural con él. Una auténtica locura.

Un enfoque contracorriente: la arquitectura en cascada gana la partida

Casi toda la industria tecnológica está obsesionada con los modelos nativos de voz a voz, y estos chicos han decidido remar justo en la dirección contraria. El motivo es más lógico de lo que parece si rascas un poco en la superficie de la IA actual. Los modelos de audio cerrado actúan como una caja negra inexpugnable, lo que bloquea por completo la integración de herramientas, memoria a largo plazo o aprobaciones. Básicamente, no te dejan pensar con claridad antes de hablar.

Por este motivo, la empresa dirigida por su CEO Akash Sharma y los responsables tecnológicos Noa Flaherty y Sidd Seethepalli, ha optado por mantener un sistema clásico pero hipervitaminado. La voz del usuario entra y se transcribe a texto al instante mediante la tecnología de Deepgram. Luego, el cerebro del sistema procesa ese texto manteniendo intacto el mismo bucle de agente que usan para el chat escrito. Finalmente, devuelve la respuesta en un audio ultrarrealista gracias al motor de ElevenLabs. Así de simple.

También te puede interesar:Vellum Presenta una Función de Colaboración con Agentes IA en Slack para Equipos de Trabajo

Trucos de ingeniería pura para aniquilar la latencia

Sin embargo, el gran talón de Aquiles de este sistema de tres pasos siempre ha sido el insufrible retraso en la respuesta. Nadie quiere hablar con una máquina que tarda cinco segundos en contestar a un simple saludo. Para dinamitar este problema, el equipo técnico se ha sacado de la manga un mecanismo de lanzamiento especulativo brillante.

En cuanto el detector de voz nota un silencio final, el sistema arranca la generación de la respuesta en paralelo. Si resulta que solo estabas tomando aire para seguir hablando, la IA revierte el proceso sin que te des cuenta.

A ello se le suma una gestión quirúrgica del tiempo y los recursos del servidor en cada interacción humana. Cada turno de palabra arranca con un modelo ligero y rapidísimo que toma una decisión vital: responder ya, quedarse en silencio o escalar la petición a un modelo mucho más potente. Si elige esto último, el asistente te suelta un pequeño audio de espera para que sepas que está procesando la orden. Además, si está ejecutando una llamada a una herramienta pesada, te va narrando el progreso por voz sin manchar tu transcripción escrita. Una experiencia de usuario redonda.

También te puede interesar:Vellum Presenta una Función de Colaboración con Agentes IA en Slack para Equipos de Trabajo
También te puede interesar:Vellum Suma un Catálogo Abierto de Plugins para Darle Nuevas Funciones a sus Asistentes de IA

Interrupciones naturales y el salto perfecto entre dispositivos

Evidentemente, conversar con una inteligencia artificial suele ser un caos absoluto si intentas cortarla a mitad de su discurso. Las APIs genéricas del mercado fallan estrepitosamente aquí, así que desde Vellum han creado su propia solución de interrupciones desarrollada desde cero. Puedes cortar al asistente a mitad de frase, cambiar de tema de golpe o redirigirle la instrucción. La IA ajusta el contexto al vuelo, frena la síntesis de voz y sigue el hilo sin inmutarse.

Interrupciones naturales y el salto perfecto entre dispositivos

Pero claro, siempre hay riesgos técnicos, como que el propio eco de tu altavoz confunda al micrófono del navegador y corte la charla accidentalmente. Para blindar esto, han metido un seguro inteligente que exige escuchar al menos un cuarto de segundo de habla continua antes de cederte el turno de palabra. Problema resuelto.

Por si fuera poco, la plataforma brilla especialmente por su omnipresencia y capacidad de adaptación al entorno del usuario. La identidad, la memoria y el hilo de la conversación viajan siempre contigo, independientemente del hardware. Puedes empezar a pedirle tareas complejas en tu móvil mientras vas por la calle y retomar el proceso en tu ordenador Mac. De hecho, si detecta procesos de múltiples pasos muy densos, la propia IA cambia automáticamente al formato de texto porque entiende que la pantalla es más productiva.

Privacidad, más de 60 habilidades y código abierto como bandera

En el apartado más técnico y de seguridad, nos encontramos con una filosofía muy diferente a la de las grandes start-ups herméticas. El núcleo del asistente es de código abierto, lo que permite a la comunidad auditar su funcionamiento interno. Viene armado hasta los dientes con más de 60 habilidades y un sistema de permisos brutal que puedes configurar desde un acceso totalmente restringido hasta el control completo de tus aplicaciones.

Privacidad, más de 60 habilidades y código abierto como bandera

Si miramos la gestión de credenciales, vemos que el nivel de protección es exactamente el que exige este tipo de software invasivo. Las contraseñas se guardan blindadas directamente en el Keychain de macOS si lo autoalojas, o en un entorno aislado si prefieres su plataforma gestionada. Vellum te ofrece automatizar las voces integradas sin complicaciones, pero si tienes tus propias claves de ElevenLabs para usar voces clonadas a medida, el sistema te permite integrarlas en apenas unos segundos.

Queda bastante claro que el camino hacia el asistente personal definitivo no pasa solo por que tenga una voz seductora, sino por que sea verdaderamente resolutivo en tu día a día. Mientras los gigantes del sector pelean por arañar milisegundos con modelos de audio cerrados que apenas pueden ejecutar código útil, esta apuesta demuestra que juntar y optimizar las mejores piezas de software del mercado sigue siendo una estrategia letal. Veremos si la gran competencia toma nota del enfoque en cascada o si siguen empeñados en tratar de reinventar la rueda.

0 0 votos
Valoración del artículo
Suscribirte
Notificar sobre
guest
0 Comentarios
Más Antiguos
Más Nuevos Más Votados