La pisión de investigación de Microsoft ha lanzado un nuevo modelo de inteligencia artificial que puede tomar una imagen fija y convertirla en un gif en cuestión de segundos.
Pix2Gif utiliza el mismo tipo de modelo de difusión que se encuentra en muchos de los modelos de texto a video de IA como Runway y Pika Labs, pero adopta un enfoque de “traducción de imágenes”.
En un artículo sobre el nuevo modelo disponible públicamente, los investigadores dicen que se han centrado en guiar el movimiento a través de un mensaje de texto junto con la entrada de la imagen. “Transforma espacialmente” las características de la imagen original según el mensaje de texto.
Si le das una imagen de un tren y dices “moviéndose sobre las vías”, debería parecer que el tren se está moviendo, pero como es un gif y solo dura 2 segundos, no llegará muy lejos. Es un nuevo enfoque para la generación de IA, uniendo imágenes, videos y modelos 3D.
¿Cómo accedo a Pix2Gif?

Como muchos de los modelos de IA recientes, este es más un proyecto de investigación que un producto disponible públicamente de Microsoft que podría integrarse en Copilot. Pero está disponible para probar y el código se puede descargar.
Esto significa que puede ejecutarlo localmente en su computadora portátil. Por ahora, la mejor manera es utilizar el entorno de prueba donde puedes darle una imagen, un mensaje de texto y obtener un gif.
En mis experimentos, me llevó aproximadamente un minuto generar un gif de 2 segundos a partir de una imagen fija, aunque si tienes una GPU rápida, esto puede ser considerablemente más rápido.
Todos los gifs de la historia fueron creados con la herramienta. Eran imágenes de IA generadas usando Adobe luciérnaga luego ejecuta Pix2Gif para animarlos.
¿Cuáles son los casos de uso de Pix2Gif?

El aspecto de deformación guiada por movimiento es posiblemente más interesante que la capacidad de crear un gif a partir de una imagen fija, ya que podría aplicarse a otros modelos similares a videos en el futuro y potencialmente permitir la edición de gifs.
Algo así podría incorporarse a Microsoft Designer o Paint para facilitar la animación o incluso realizar ajustes en una imagen mediante IA.
Para entrenar el modelo utilizaron 100.000 gifs animados con títulos apropiados, luego extrajeron fotogramas de los gifs y utilizaron los títulos como mensaje de texto.
No está claro de dónde provienen los gifs y podría ser por eso que se reservan como proyecto de investigación. Un modelo comercial y disponible públicamente requeriría datos con licencia, especialmente si estuvieran integrados en un producto de Microsoft.
Por ahora es una herramienta de persión pertida, una forma de experimentar cómo se vería su imagen fija si tuviera solo unos pocos fotogramas más. Personalmente, me quedo con las herramientas de vídeo de IA como Runaway, Pika Labs y el próximo OpenAI Sora.
- Olvídese de ChatGPT y DALL-E: ahora Google Bard puede generar imágenes
- Google lanza un nuevo generador de imágenes AI independiente llamado ImageFX y promete “imágenes de la más alta calidad hasta ahora”
- Puse a prueba el generador de imágenes AI de la Búsqueda de Google para agregar texto a las imágenes: fue mejor de lo esperado