Inicio / Tecnología e Informática / Discord Bot crea impresionantes videos de IA a partir de solicitudes de chat

Discord Bot crea impresionantes videos de IA a partir de solicitudes de chat

Runway Gen-2

El texto a video es la próxima gran novedad en IA. Vimos hace unas semanas lo increíble (y un poco aterrador) que era el comercial Pepperoni Hugspot generado por IA. Pizza Later, la persona que desarrolló este video, nos dijo que usaron una herramienta llamada Runway Gen-2 para hacer las imágenes en movimiento en ese proyecto. Con su motor de texto a video, pudieron proporcionar indicaciones simples como «un hombre, una mujer o una familia felices comiendo una porción de pizza en un restaurante, comercial de televisión» y obtener contenido fotorrealista.

Acabo de obtener acceso a la versión beta pública de Runway Gen-2 y estoy realmente impresionado con la naturaleza realista de su resultado. Si bien los videos son cortos de solo cuatro segundos cada uno, la calidad de las imágenes es impresionante y todo funciona mediante el envío de solicitudes breves a un bot en el servidor Discord de Runway ML.

Al enviar unas pocas palabras de texto al bot @Gen-2, pude obtener clips cortos y fotorrealistas (o de estilo de dibujos animados) de todo, desde una familia disfrutando de una cena de sushi hasta un robot con un grave problema con la bebida. A menudo, la salida no era exactamente lo que pedí, pero siempre fue interesante y superior a NeuralInternet Text-to-Video Playground sobre el que escribí la semana pasada.

Si bien cualquiera puede unirse al servidor, no verá la lista de salas de chat Gen-2 hasta que obtenga acceso al programa beta (para el cual muchos están en la lista de espera). Hay algunas salas donde puede chatear y compartir proyectos con otros usuarios, y luego hay tres salas llamadas Generar uno, Generar dos y Generar tres donde puede enviar mensajes directamente al bot @Gen-2. Los moderadores lo alientan a seguir enviando avisos para el mismo hilo para no estropear cada sala de chat.

Impulsando la pista Gen-2

Un aviso de Runway Gen-2 podría ser algo así como «@Gen-2 Un robot humanoide borracho que mira a la cámara y vomita pequeños tornillos de la boca». El bot responderá de inmediato con su aviso y algunos parámetros que está usando (por ejemplo, «ampliación») que puede cambiar emitiendo un nuevo aviso (más sobre eso más adelante). Luego, unos minutos más tarde, obtendrá un video de 4 segundos basado en su indicación.

Así es como se ve mi robot borracho. Todos los videos se pueden reproducir en Discord y puede descargarlos como archivos MP4. He convertido por separado todas las muestras de video que se muestran en este artículo en GIF animados para que podamos verlos más fácilmente (y sin publicidad previa).

Borracho Robot GIF

(Crédito de la imagen: futuro)

Notarás que el clip de arriba no era exactamente lo que ordené. El robot no arroja tornillos como pretendía. En cambio, solo está mirando amenazadoramente a un vaso de cerveza. Mis otros intentos en este mensaje tampoco fueron exactamente lo que quería. Cuando dejé la palabra «borracho», vi un robot que abría la boca pero no escupía nada.

Uso de imágenes con avisos de Runway Gen-2

También puede enviar imágenes al bot copiándolas y pegándolas en Discord junto con el mensaje de texto o colocando la URL de la imagen en el mensaje. Sin embargo, Runway Gen-2 no usará la imagen que cargó. Simplemente se inspirará en la imagen para crear su propio video. He subido imágenes mías muchas veces y me dieron videos de personas que se parecían un poco a mí pero que definitivamente no eran yo.

Por ejemplo, cuando subí una foto mía y no di más información, mostraba a un hombre calvo de mediana edad con lentes oscuros que no era yo, parado junto a un río y algunos edificios. Su boca se movió y el agua se movió.

(Crédito de la imagen: futuro)

El bot Runway Gen-2 es mejor para copiar la emoción o el tema de una imagen que proporcionas. Mostré una foto mía con una expresión de disgusto en mi rostro y pregunté por «este tipo mirando a la cámara y murmurando ‘oh hombre'».

Alimentarlo con un mensaje de imagen

(Crédito de la imagen: futuro)

Muchos usuarios en el servidor de Discord dicen que han obtenido excelentes resultados al generar una imagen fija con otra herramienta de IA como Midjourney o Stable Diffusion e introducir esa imagen en CLIP Interrogator 2.1 en Hugging Face, una herramienta que analiza una imagen y luego proporciona avisos. piensa referirse a esa imagen.

Probé este proceso pidiéndole a Stable Diffusion que me hiciera una imagen de un niño en la acera jugando con robots de juguete en la década de 1980. Luego llevé la imagen a CLIP Interrogator y obtuve algunos mensajes de muestra que eran bastante obvios, como «niño parado al lado al robot». Aún así, alimentar la misma imagen al mensaje no me dio exactamente lo que quería. Atrapé a un niño con dos robots parados frente a una calle, pero no era la misma calle ni el mismo niño.

niño y robots

(Crédito de la imagen: futuro)

Moverse o no moverse

La limitación de tiempo en sí misma generalmente significa que no hay mucho tiempo para el movimiento en cada clip. Pero más allá de eso, descubrí que muchos clips tenían muy poco movimiento. A menudo, era solo la cabeza de alguien que se movía o un líquido que fluía o el humo que salía de un incendio.

Una buena manera de obtener más movimiento es colocar un aviso en el que solicite un lapso de tiempo o una panorámica de algún tipo. Cuando pedí un lapso de tiempo de un volcán islandés o una panorámica de un metro de la ciudad de Nueva York, obtuve algunos resultados bastante buenos. Cuando solicité una vista panorámica del horizonte de Taipei, vi nubes que se movían pero ninguna panorámica, y la ciudad definitivamente no era Taipei.

Imagen 1 de 3

Volcán islandés IA(Crédito de la imagen: futuro)Metro panorámico Swift AI(Crédito de la imagen: futuro)vista panorámica de taipei(Crédito de la imagen: futuro)

Horizonte de Taipei (pero no lo parece)

Pedir correr, perseguir o montar puede o no hacer el trabajo. Cuando pedí una «tortuga montando una patineta», vi una especie de animal extraño parecido a una tortuga rodando por la calle a gran velocidad. Pero cuando pregunté si los boxeadores de Intel y AMD peleaban entre sí, obtuve una imagen de dos boxeadores que no se movían (y ninguno tenía los logotipos de Intel o AMD).

patineta tortuga

(Crédito de la imagen: futuro)

En qué es bueno y malo Runway Gen-2

Al igual que otros generadores de imágenes de IA, Runway Gen-2 no hace un buen trabajo al representar personajes, productos o lugares de marca muy específicos. Cuando ordené el boxeo de Mario y Luigi, obtuve dos personajes que parecen imitaciones de los personajes de Nintendo. Pedí videos de Godzilla muchas veces y obtuve algunos lagartos gigantes que incluso el fan más casual no confundiría con el Rey de los Monstruos.

Fue un poco mejor con las referencias de Minecraft. Cuando pedí una enredadera y un enderman comiendo pizza y nuevamente una enredadera comiendo en McDonald’s, obtuve enredaderas de aspecto decente pero un enderman inexacto. Al preguntar por una familia de enredaderas comiendo pizza, obtuve una familia de humanoides que parecen sacados de Minecraft. Cualquiera que haya jugado Minecraft sabe que las enredaderas son monstruos verdes con manchas negras.

Imagen 1 de 2

Enredadera de Minecraft(Crédito de la imagen: futuro)gifs animados de minecraft(Crédito de la imagen: futuro)

La herramienta es terrible con los logotipos. Le di el logotipo de Tom’s Hardware y le pedí que lo usara en un comercial y me devolvió esta cosa extraña.

solicitud de logotipo

(Crédito de la imagen: futuro)

Cuando pedí una CPU AMD Ryzen en llamas, obtuve algo que se parecía vagamente a una PCU con un logotipo que solo tienes que ver por ti mismo (abajo).

CPU AMD en llamas

(Crédito de la imagen: futuro)

Lo que Runway Gen-2 hace realmente bien es proporcionar imágenes genéricas de personas y familias haciendo cosas como comer. Puede o no hacer que coman exactamente lo que quiere. Cuando pregunté por una familia que comiera gusanos vivos, obtuve una familia que parecía estar comiendo ensalada. Una familia comiendo sushi en una pizzería de la década de 1970 parecía particularmente realista.

familia comiendo sushi

(Crédito de la imagen: futuro)

Me siento obligado a señalar que casi siempre obtengo gente blanca cuando pregunto por una persona sin especificar su origen étnico. La única vez que obtuve una familia (o persona) no blanca sin preguntar específicamente por una fue cuando pregunté por la familia comiendo sushi. Este es un problema bien conocido con los datos de entrenamiento en muchos modelos generativos de IA.

Parámetros especiales

Hay un puñado de parámetros que puede agregar al final de su solicitud en Runway Gen-2 para cambiar un poco la salida. No jugué mucho con eso.

  • –de lujo ofrece mayor resolución
  • –interpolar hace que el video sea más fluido
  • –cfg [number] controla qué tan creativa se vuelve la IA. Los valores más grandes están más cerca de lo que ordenó.
  • –pantalla verde salida del video con un área de pantalla verde que puede usar en la edición
  • –semilla es un número que ayuda a determinar el resultado. De forma predeterminada, siempre es un número aleatorio, pero si usa el mismo número nuevamente, debería obtener un resultado similar.

cosiéndolo todo junto

Si busca en Internet ejemplos de videos de Runway Gen-2, puede encontrar muchos videos que duran más de 4 segundos y tienen sonido. La gente hace estos videos encadenando varios clips diferentes de 4 segundos en un editor de video y agregando sonido y música que obtuvieron en otros lugares.

Uno de los videos más famosos de Runway Gen-2 es el comercial de pizza Pepperoni Hugspot que mencioné anteriormente. Pero en Runway ML Discord, veo a muchas personas publicando enlaces de YouTube a sus creaciones. Uno de mis favoritos es «Espagueti de terror» que fue publicado en Twitter por Andy McNamara. Y el nuevo comercial de abogados de Pizza Later es una broma.

Conclusión

Runway Gen-2 está en versión beta privada mientras escribo esto, pero la compañía ha dicho que tiene la intención de ponerlo a disposición de todos pronto, como ya lo hizo con su producto Gen-1. Como demostración técnica, es realmente impresionante y puedo ver a alguien usando sus clips cortos en lugar de videos o GIF animados.

Incluso si el tiempo se extendiera a 60 segundos, parece poco probable que esta herramienta pueda reemplazar el video grabado profesionalmente (o incluso amateur) en el corto plazo. Su incapacidad para reproducir con precisión lugares y personas muy específicos es una gran decepción, pero también es una limitación que he visto con todas las IA generadoras de imágenes hasta el momento. Sin embargo, la tecnología está ahí y, a medida que aumentan los datos de entrenamiento, puede ser aún más impresionante.