OpenAI reveló a Sora al mundo el 15 de febrero de 2024 al compartir un puñado de videos notables generados por IA y un trabajo de investigación en X.
Sora no fue el primer modelo de vídeo con inteligencia artificial, pero sí el primero en mostrar niveles tan altos de consistencia, duración y realismo fotográfico.
Si bien el resultado parece impresionante, hasta ahora solo se han compartido videos generados por el personal de OpenAI en X o TikTok, aunque algunos se hicieron con indicaciones sugeridas por los fanáticos.
Aún no se ha fijado una fecha para cuando el modelo se hará público, o qué limitaciones se impondrán a su producción antes de que se integre en una herramienta como ChatGPT.
Noticias y actualizaciones de Sora (actualizado el 23 de febrero de 2024)
- OpenAI lanza un canal de TikTok para compartir videos generados por Sora
- ElevenLabs anuncia herramienta de efectos de sonido y comparte vídeo de Sora con sonido
- Sora es tan impresionante que ha avisado a todas las demás herramientas de vídeo de IA
¿Qué es OpenAI Sora?

Sora es un modelo de video generativo, similar a Runway’s Gen-2, Pike Labs Pika 1.0 y Stable Video Diffusion de StabilityAI. Convierte texto, imágenes o videos en contenido de video de IA.
Lleva el nombre de la palabra japonesa “cielo”, que según la compañía sirve para mostrar su “potencial creativo ilimitado”. Uno de los primeros clips mostraba a dos personas caminando por Tokio en la nieve.
A diferencia de algunos de los modelos anteriores, Sora parece ser mucho más capaz, capaz de generar clips de hasta un minuto de duración y con personajes y movimientos consistentes.
¿Cuál es la tecnología detrás de Sora?

La tecnología detrás de Sora es una versión adaptada de los modelos creados para DALL-E 3, la plataforma de imágenes generativas de OpenAI, pero con características adicionales para un control preciso.
Sora es un modelo de transformador de difusión, es decir, combina el tipo de modelo de generación de imágenes detrás de Stable Diffusion con los generadores basados en tokens que alimentan ChatGPT.
Un video se genera en un espacio latente y se le “elimina el ruido”, o se le da forma en parches 3D y luego se pasa por un descompresor de video para convertirlo en una salida estándar visible para humanos.
¿Con qué datos se entrenó a Sora?

OpenAI dice que entrenó su modelo en videos disponibles públicamente, contenido de dominio público y videos con derechos de autor donde había comprado la licencia por adelantado.
No ha dicho exactamente cuántos videos se incluyeron en los datos de entrenamiento y es poco probable que alguna vez revele esa información. Se cree que son millones.
La empresa utilizó un motor de conversión de vídeo a texto para crear subtítulos y etiquetas a partir de archivos de vídeo ingeridos para perfeccionar aún más a Sora en el contenido del mundo real.
Los rumores y especulaciones sugieren que OpenAI también hizo uso de contenido de video sintético, como el generado con Unreal Engine 5, ya que esto también le daría información sobre la física de los mundos dentro de los videoclips que ingiere.
¿Por qué Sora sorprendió a sus desarrolladores?
Cada modelo de IA a gran escala tiene sus peculiaridades: se comporta de manera inesperada o responde a indicaciones de una manera que casi parece lo contrario de lo que se pretendía. Sora no es diferente.
Durante la ejecución posterior al entrenamiento, Tom Brooks, un investigador de Sora, dijo que parecía haber descubierto cómo crear gráficos 3D a partir de su propio conjunto de datos sin ningún entrenamiento adicional.
Mientras tanto, Bill Peebles, otro investigador que trabaja en el modelo, dijo que creaba automáticamente diferentes ángulos de vídeo sin que se le preguntara; asumió que eso era lo que se necesitaba.
¿Qué pasa con las restricciones de contenido y la privacidad?

Durante la capacitación también hubo miembros del equipo rojo y expertos en seguridad que trabajaron para rastrear, etiquetar y prohibir casos de uso de información errónea, contenido de odio y prejuicios mediante pruebas contradictorias.
También hay etiquetas de metadatos dentro de los videos generados para etiquetarlos como creados por IA y clasificadores de texto que verificarán que las indicaciones no violen las políticas de uso.
Al igual que DALL-E 3, OpenAI dice que Sora tendrá una serie de restricciones de contenido antes del lanzamiento. Esto incluirá límites a la generación de imágenes de personas reales.
Esto también incluirá la prohibición de generar videos que muestren violencia extrema, contenido sexual, imágenes de odio, imágenes de celebridades o la propiedad intelectual de otros, como logotipos y productos. Nada de esto es posible fácilmente con DALL-E 3 y se aplicarán las mismas restricciones.
¿Cómo puedo acceder a Sora?

OpenAI aún no ha establecido datos de lanzamiento para Sora, declarando que tiene más trabajo por hacer en seguridad relacionada con el modelo. Se espera que llegue en abril o mayo.
Lo más probable es que Sora se integre en ChatGPT de manera similar a DALL-E 3 en lugar de estar disponible como un producto independiente, aunque las versiones anteriores de DALL-E tenían su propia página.
El modelo también estará disponible como una API donde los desarrolladores externos podrán integrar su funcionalidad en sus propios productos, aunque eso llegará más adelante.
Esto ya sucede con DALL-E 3. Por ejemplo, puedes utilizar el modelo OpenAI dentro de tu propio producto para crear imágenes automáticamente o, como es el caso de la plataforma de imágenes AI NightCafe, ofrecer tu propia interfaz para generar imágenes con el modelo.
- El salto de IA ‘superinteligente’ de OpenAI casi provocó el colapso de la empresa: he aquí por qué
- OpenAI está pagando a investigadores para evitar que la IA superinteligente se vuelva deshonesta
- OpenAI está construyendo AI GPT-5 de próxima generación, y el CEO afirma que podría ser superinteligente