La compañía tecnológica Google dio un paso firme en el desarrollo de la inteligencia artificial conversacional tras presentar la función Live Avatar dentro de su suite corporativa Gemini Enterprise. La nueva herramienta otorga una presencia visual y animada al modelo de diálogo Gemini 3.8 Live, lo que permite a las organizaciones interactuar con sus usuarios mediante un personaje capaz de comunicarse en 97 idiomas distintos de manera inmediata.
Detalles de la actualización
El avance principal radica en el procesamiento simultáneo de video de baja latencia y audio en tiempo real. Durante la interacción, la plataforma ajusta automáticamente la posición de los labios, el ritmo de articulación y la gesticulación facial del avatar cada vez que la persona cambia de lengua. De esta forma, el sistema elimina las pausas bruscas o los desajustes entre la imagen y el sonido, un problema recurrente en las soluciones anteriores de generación audiovisual por inteligencia artificial.
Adaptación lingüística
Además de la traducción y adaptación lingüística continua, el modelo posee la facultad de escuchar, ver mediante la cámara del dispositivo y razonar la información del entorno sin interrumpir el flujo de la conversación. A través del uso de llamadas asíncronas a herramientas externas, el avatar consulta bases de datos o realiza gestiones informáticas en segundo plano mientras mantiene el contacto verbal con el usuario. Por ejemplo, en entornos de atención al público como hoteles o aeropuertos, la plataforma puede procesar una reserva o verificar la disponibilidad de un turno sin dejar la charla en silencio.
Diseño personalizado
Google Cloud habilitó esta tecnología a través de sus puntos de acceso en Estados Unidos y la Unión Europea. Las empresas suscritas a la plataforma pueden elegir entre un catálogo de avatares prediseñados o solicitar la creación de un personaje personalizado que refleje la identidad visual de su marca. No obstante, la corporación mantiene un protocolo estricto de aprobación y verificación para la solicitud de rostros personalizados, con el objetivo de prevenir casos de suplantación de identidad o uso indebido de la imagen de terceros.
Seguridad
En materia de seguridad y autenticidad del contenido, todo el material audiovisual generado por este sistema incorpora SynthID, la marca de agua digital e imperceptible desarrollada por el equipo de Google DeepMind. Este código permite rastrear el origen sintético del video para combatir la desinformación. Con este lanzamiento, la firma apunta a revolucionar los quioscos interactivos, las aplicaciones móviles y las plataformas de soporte técnico en todo el planeta.
Visite nuestra sección Curiosidades
Mantente informado en nuestros canales de WhatsApp, Telegram y YouTube
