La nueva VLOGGER AI de Google te permite crear un avatar realista a partir de solo una foto y controlarlo con tu voz

Por
Jugo Mobile
Jugo Mobile es una plataforma dedicada a contenido de alta calidad en gaming, deportes y tecnología. Disfruta de contenido de primera y conecta con otros entusiastas...
7 minutos de lectura

Los investigadores de Google han estado trabajando horas extras recientemente, publicando una avalancha de nuevos modelos e ideas. Lo último es una forma de tomar una imagen fija y convertirla en un avatar controlable, que surge de la parte posterior de un agente de IA que juega.

VLOGGER Actualmente no está disponible para probar, pero la demostración sugiere que te permitirá crear un avatar y controlarlo usando tu voz, y parece sorprendentemente realista.

Ya puedes hacer cosas similares hasta cierto punto con herramientas como la sincronización de labios de Pika Labs, los servicios de traducción de videos de Hey Gen y Synthesia, pero esta parece ser una opción más simple y con menor ancho de banda.

¿Qué es VLOGGER?

Actualmente VLOGGER no es más que un proyecto de investigación con un par de videos de demostración pertidos, pero si alguna vez se convierte en un producto, podría ser una nueva forma de comunicarse en Teams o Slack.

Es un modelo de IA capaz de crear un avatar animado a partir de una imagen fija y mantener el aspecto fotorrealista de la persona en la foto en cada fotograma del vídeo final.

Luego, el modelo también toma un archivo de audio de la persona que habla y maneja el movimiento del cuerpo y los labios para reflejar la forma natural en que esa persona se movería si fuera ella quien dijera las palabras.

Esto incluye crear movimientos de la cabeza, expresiones faciales, miradas, parpadeos, así como gestos con las manos y movimientos de la parte superior del cuerpo sin ninguna referencia más allá de la imagen y el audio.

if (componentContainer) { var data = {"layout":"inbodyContent","header":"Get the BEST of Tom\u2019s Guide daily right in your inbox: Sign up now!","tagline":"Upgrade your life with the Tom\u2019s Guide newsletter. Subscribe now for a daily dose of the biggest tech news, lifestyle hacks and hottest deals. Elevate your everyday with our curated analysis and be the first to know about cutting-edge gadgets.","formFooterText":"By submitting your information you agree to the Terms & Conditions and Privacy Policy and are aged 16 or over.","successMessage":{"body":"Thank you for signing up. You will receive a confirmation email shortly."},"failureMessage":"There was a problem. Please refresh the page and try again.","method":"POST","inputs":[{"type":"hidden","name":"NAME"},{"type":"email","name":"MAIL","placeholder":"Your Email Address","required":true},{"type":"hidden","name":"NEWSLETTER_CODE","value":"XTG-D"},{"type":"hidden","name":"LANG","value":"EN"},{"type":"hidden","name":"SOURCE","value":"60"},{"type":"hidden","name":"COUNTRY"},{"type":"checkbox","name":"CONTACT_OTHER_BRANDS","label":{"text":"Contact me with news and offers from other Future brands"}},{"type":"checkbox","name":"CONTACT_PARTNERS","label":{"text":"Receive email from us on behalf of our trusted partners or sponsors"}},{"type":"submit","value":"Sign me up","required":true}],"endpoint":"https:\/\/newsletter-subscribe.futureplc.com\/v2\/submission\/submit","analytics":[{"analyticsType":"widgetViewed"}],"ariaLabels":{}};

var triggerHydrate = function() { window.sliceComponents.newsletterForm.hydrate(data, componentContainer); }

if (window.lazyObserveElement) { window.lazyObserveElement(componentContainer, triggerHydrate); } else { triggerHydrate(); } } }).catch(err => console.log('Hydration Script has failed for newsletterForm-articleInbodyContent-C6iMHQLEw98srZgEVcteuQ Slice', err)); }).catch(err => console.log('Externals script failed to load', err));

¿Cómo funciona VLOGGER?

Vídeo de IA de Google Vlogger

(Crédito de la imagen: Google)

El modelo se basa en la arquitectura de difusión que impulsa la conversión de texto a imagen, video e incluso modelos 3D como MidJourney o Runway, pero agrega mecanismos de control adicionales.

Vlogger sigue varios pasos para obtener el avatar generado. Primero toma el audio y la imagen como entrada, los ejecuta a través de un proceso de generación de movimiento 3D, luego un modelo de “difusión temporal” para determinar los tiempos y el movimiento, finalmente se amplía y se convierte en el resultado final.

Básicamente, construye una red neuronal para predecir el movimiento de la cara, el cuerpo, la pose, la mirada y las expresiones a lo largo del tiempo utilizando la imagen fija como primer cuadro y el audio como guía.

Entrenar el modelo requirió un gran conjunto de datos multimedia llamado MENTOR. Tiene 800.000 vídeos de diferentes personas hablando con cada parte de su cara y cuerpo etiquetada en cada momento.

¿Cuáles son las limitaciones de VLOGGER?

Esta es una vista previa de una investigación más que un producto real y, si bien puede generar un movimiento de apariencia realista, es posible que el video no siempre coincida con la forma en que la persona realmente se mueve. Sigue siendo un modelo de difusión en esencia y pueden ser propensos a comportamientos inusuales.

El equipo dice que también tiene problemas con movimientos particularmente grandes o entornos persos. Además, sólo puede manejar vídeos relativamente cortos.

¿Cuáles son los casos de uso de VLOGGER?

Persona Apple Vision Pro

(Crédito de la imagen: futuro)

Según los investigadores de Google, uno de los principales casos de uso es la traducción de vídeos. Por ejemplo, tomar un vídeo existente en un idioma concreto y editar el labio y la cara para que coincidan con el nuevo audio traducido.

Otros posibles casos de uso incluyen la creación de avatares animados para asistentes virtuales, chatbots o personajes virtuales que se ven y se mueven de manera realista en un entorno de juego.

Ya existen herramientas que hacen algo similar a esto, incluida Synthesia, donde los usuarios pueden ir a las oficinas de la empresa y crear su propio avatar virtual para realizar presentaciones, pero este nuevo modelo parece facilitar mucho el proceso.

Un uso potencial es proporcionar comunicaciones por vídeo de bajo ancho de banda. Una versión futura del modelo podría permitir chats de vídeo a partir de audio animando el avatar de la imagen fija.

Esto podría resultar particularmente útil para entornos de realidad virtual en auriculares como el Meta Quest o Apple Vision Pro, que funcionan independientemente de los modelos de avatar propios de la plataforma.

  • Se anuncia el MacBook Air M3: ya están abiertos los pedidos anticipados del ‘mejor portátil de consumo del mundo para IA’
  • Probé Google Gemini vs OpenAI ChatGPT en un enfrentamiento de 9 rondas: aquí está el ganador
  • OpenAI está construyendo AI GPT-5 de próxima generación, y el CEO afirma que podría ser superinteligente

Compartir este artículo
Seguir
Jugo Mobile es una plataforma dedicada a contenido de alta calidad en gaming, deportes y tecnología. Disfruta de contenido de primera y conecta con otros entusiastas y expertos. Explora las últimas tendencias e innovaciones en nuestra vibrante comunidad. ¡Únete a nosotros y experimenta el futuro hoy!