Ir directo al contenido

Prompt Hotel Lobby AI: el real, explicado línea a línea

Un buen prompt Hotel Lobby AI cumple cuatro tareas: fija la cabina naranja, cuelga un micrófono entre la pareja, asigna cada foto a un lado y dice quién rapea y quién reacciona. Abajo están los dos prompts que de verdad arma el generador de Hotel Lobby Video (hotel-lobby-video.com), no una suposición: la versión para Wan 3.0, que conserva la pista de la plantilla, y la versión para Seedance, que escribe un rap nuevo. Pégalos en tu propia herramienta, adáptalos o deja que el generador se encargue. Si tu herramienta acepta dos fotos pero no un clip de referencia, baja directo a los cinco prompts solo con fotos.

Revisado el

El prompt de Wan 3.0

Este texto sirve para dos fotos en cualquier formato, porque la proporción se manda como ajuste y no va escrita en el prompt. Primero, GPT Image 2 convierte cada foto subida en un retrato de estudio de cuerpo entero de la misma persona o animal. Después el modelo recibe cuatro adjuntos, siempre en este orden: Imagen 1 (retrato izquierdo), Imagen 2 (retrato derecho), Video 1 (el clip de referencia de Hotel Lobby, sin sonido) y Audio 1 (la pista de Hotel Lobby, recortada a la misma duración).

Prompt Hotel Lobby AI (Wan 3.0)
Sigue Video 1 de principio a fin: copia su encuadre, su ritmo y cada movimiento, gesto, giro de cabeza, expresión facial y forma de la boca, además del fondo naranja liso y el micrófono plateado que cuelga del techo entre los dos intérpretes. Mantén el encuadre de cámara de Video 1: sin acercar, sin alejar, sin paneo. No añadas ningún movimiento ni elemento de escena que no esté en Video 1.

Usa Audio 1 como música de fondo de todo el video, tal cual: es todo el sonido del video. No escribas letras nuevas, no lo vuelvas a cantar, no añadas otra música ni otras voces.

El intérprete de la izquierda es el sujeto de Imagen 1; el de la derecha es el sujeto de Imagen 2. Reemplazan por completo a las dos personas de Video 1: cara, peinado o pelaje, complexión y ropa salen de las fotos, nada de las personas de Video 1. Ninguno de los dos lleva guantes (salvo que ya los lleve en la foto): las personas muestran sus propias manos y los animales conservan sus propias patas. Ignora el fondo de las fotos.

El intérprete de la izquierda rapea la voz de Audio 1 frente al micrófono, con los labios perfectamente sincronizados con Audio 1. El de la derecha sigue los movimientos de la persona de la derecha de Video 1: reacciona y gesticula al ritmo, y solo mueve los labios en ad-libs breves.

El naranja llena todo el cuadro, sin zonas negras ni esquinas oscuras. Sin pantalla dividida, sin personas de más, sin subtítulos ni texto en pantalla. Las caras se mantienen iguales de principio a fin.

La versión de Seedance con rap IA

Seedance nunca conserva la grabación original: su banda sonora siempre es un rap que escribe él. Aun así, en la cabina de Hotel Lobby puede escuchar la plantilla mientras compone: el clip de referencia se sube sin sonido, la pista se sube aparte como audio de referencia 1 y el prompt pide un beat nuevo con el mismo ritmo, con letra nueva y sin nada de la melodía ni de las voces originales. Seedance nombra los adjuntos con palabras (“reference image 1”). La versión que ves usa el tema de ejemplo de abajo.

Prompt de rap IA para Hotel Lobby AI (Seedance, 9:16, 12 s)
Usa el video de referencia 1 para toda la actuación: copia su encuadre, su ritmo y cada movimiento, gesto, giro de cabeza, expresión facial y movimiento de la boca, el fondo naranja liso y el único micrófono plateado que cuelga entre los intérpretes. Mantén el encuadre de cámara del video de referencia 1: sin acercar, sin alejar, sin paneo. No añadas ningún movimiento ni elemento de escena que no esté en el video de referencia 1.

Intérprete de la izquierda: la persona de la imagen de referencia 1. Intérprete de la derecha: la persona de la imagen de referencia 2. Reemplazan por completo a las dos personas del video de referencia 1: cara, cabello, cuerpo y ropa salen de las fotos, nada de las personas del video de referencia 1. Si una foto no muestra nada de la ropa de una persona (solo la cara o los hombros descubiertos), vístela con ropa cotidiana sencilla que le quede bien, como una camiseta lisa y unos jeans; nunca el disfraz, la capa, el abrigo, los cinturones, los guantes ni la venda de los ojos de las personas del video de referencia 1. Los animales se quedan como están, sin ropa. Ignora el fondo de las fotos.

Banda sonora: una canción original de trap oscuro de Atlanta hecha para este video que sigue el audio de referencia 1 en su beat y su ritmo: el mismo tempo, groove, patrón de batería y rebote, sincronizado con los movimientos del video de referencia 1. Haz un beat nuevo en ese estilo con letra nueva; no reutilices la letra, la melodía ni las voces del audio de referencia 1. Escaso pero contundente: un 808 retumbante y áspero que se desliza entre notas, una caja con palmas penetrante con hi-hats secos, y un único loop de melodía inquietante con aire oriental. Ambiente oscuro, amenazante y seguro. El rap es un flow en tresillos rápido y con rebote que corre por encima del beat lento. Mezcla: la voz clara arriba, el beat justo detrás casi al mismo nivel, fuerte y contundente, nunca bajo y sin cortarse nunca entre frase y frase. El intérprete de la izquierda rapea frente al micrófono colgante una estrofa original y limpia sobre: "el 30 cumpleaños de Maya y lo mal que aparca en paralelo". Rapea en el idioma de ese tema. Voz de rap clara, labios sincronizados con cada palabra, movimientos naturales de cabeza y una boca expresiva. El intérprete de la derecha es el compañero que pone el hype: señala al rapero, reacciona, sonríe y suelta ad-libs cortos al ritmo. No uses ninguna canción existente, ninguna letra existente ni la voz de ningún artista real.

9:16. El naranja llena todo el cuadro de borde a borde, sin zonas negras ni oscuras. Sin pantalla dividida, sin personas de más, sin subtítulos ni texto en pantalla. Las caras se mantienen iguales de principio a fin.

Para qué está cada línea

  1. El movimiento sale del clip. El primer párrafo le pide al modelo que tome del Video 1 el encuadre, el ritmo, los gestos, los giros de cabeza, las expresiones y la forma de la boca, además del fondo naranja liso y el único micrófono plateado en su cable. Deja la cámara fija (sin acercar, alejar ni paneos) y prohíbe todo lo que el clip no tenga.
  2. El sonido no se toca. Audio 1 es toda la banda sonora: nada de letra reescrita, voces nuevas, música extra u otras voces.
  3. Caras y cuerpos salen de las fotos. Cada imagen pertenece a un lado, y los dos sujetos reemplazan por completo a las personas del clip: toman de las imágenes la cara, el pelo o pelaje, el cuerpo y la ropa, e ignoran el fondo. Se dice “el sujeto de la Imagen 1” y no hombre o mujer, así sirve igual para una persona que para una mascota y nunca contradice la foto. Una línea también prohíbe los guantes: los artistas del clip de referencia los llevan y los modelos suelen copiarlos en manos y patas.
  4. Cada lado tiene su tarea. El sujeto izquierdo rapea las voces del Audio 1 con el movimiento de labios a juego; el derecho imita al compañero que anima en el clip, reacciona al ritmo y solo suelta ad-libs breves.
  5. Las barandillas tapan los huecos. El naranja llena el cuadro de borde a borde, sin esquinas oscuras, sin pantalla dividida, sin gente extra, sin subtítulos, y las caras se mantienen iguales del primer al último cuadro. Estas líneas apuntan a las fallas más comunes.

Llevar el prompt a otra herramienta de video con IA

  • Tu modelo debe aceptar imágenes de referencia, un video de referencia y una pista de audio de referencia, y debe conservar esa pista. Wan 3.0 lo hace. ByteDance Seedance 2.x acepta las tres entradas pero genera su propia música, por eso el generador de Hotel Lobby Video lo usa solo para el rap IA.
  • Usa la forma de nombrar adjuntos de tu herramienta. Aquí van numerados por orden de subida (Imagen 1, Imagen 2, Video 1, Audio 1); otras esperan @Image1 o sus propias etiquetas. Sea cual sea la sintaxis, sube primero la foto izquierda y luego la derecha.
  • Deja a los sujetos en genérico. “El sujeto de la Imagen 1” encaja con cualquiera, humano o animal. Lo único que cambia el generador de Hotel Lobby Video es la disposición de las fotos (dos fotos o una de los dos) y, si subes tu propio clip, los movimientos.
  • El formato va en los ajustes, no en el texto: elige ahí 9:16, 16:9 o 1:1.
  • ¿Sin clip de referencia? Entonces tienes que describir con palabras la cabina y el movimiento en lugar de remitir al Video 1. Dreamina y herramientas parecidas publican sus propios prompts de solo texto para este caso. Lo que envía el generador son únicamente los dos prompts de arriba.

Prompts Hotel Lobby AI solo con fotos (sin clip de referencia)

Muchas herramientas de imagen a video aceptan fotos de referencia pero no un clip. Los cinco prompts de abajo describen con palabras el cuarto y la coreografía, así que se pegan tal cual en una herramienta que pida dos imágenes. Mantienen lo que hace reconocible el formato: una foto por lado, un único micrófono colgado, uno que lleva la voz y otro que reacciona, y una cámara que no se mueve. Están escritos para esta página y no son lo que envía el generador de Hotel Lobby Video; cada herramienta interpreta los prompts a su manera, así que cuenta con uno o dos reintentos. Se muestran en su versión original en inglés.

Prompt Hotel Lobby AI para una pareja

Pareja (9:16, 12 s)
Create a 12-second vertical 9:16 video from two reference photos. The person in image 1 stands on the LEFT and the person in image 2 on the RIGHT, both full body, each keeping their own face, hair, clothes and height. They are a couple performing a rap duet in a plain, evenly lit orange studio: orange wall and floor, nothing else in the room. One silver condenser microphone hangs from the ceiling on a thin cable, centered between them. The left performer raps into the microphone with confident hand gestures; the right performer laughs, points and dances on the beat, then leans in for the last line. One continuous shot from a fixed camera at chest height: no cuts, zooms or pans. No other people, no captions, no logos.

Dos mejores amigos

Mejores amigos (9:16, 12 s)
Create a 12-second vertical 9:16 video from two reference photos of two adult best friends. Image 1 is on the LEFT, image 2 on the RIGHT, both full body, keeping each face, hairstyle, outfit and body shape exactly. Setting: a plain orange studio with a seamless orange wall and floor and one silver microphone hanging from the ceiling between them. For the first half the left friend raps into the microphone while the right friend nods, grins and hypes with big gestures; for the second half they swap, and the left friend reacts. Their moves stay independent, never mirrored. Fixed camera, one continuous take, soft even light, both bodies and feet visible. No extra people, props, text or logos.

Abuelo y nieto ya adulto

Abuelo y nieto adulto (9:16, 12 s)
Create a 12-second vertical 9:16 video from two reference photos. Image 1 is an older adult on the LEFT and image 2 is their adult grandchild on the RIGHT, both full body, each keeping their own face, hair, clothes and height. They perform a rap duet in a plain orange studio with one silver microphone hanging from the ceiling between them. The grandparent raps into the microphone with slow, deliberate, confident gestures; the grandchild looks amazed, laughs and dances on the beat, then joins in for the last line. Natural, comfortable movement for both. One fixed, continuous shot with even studio light: no cuts, zooms or pans, no other people, no captions.

Personajes de caricatura o anime

Quédate con personajes que creaste tú o sobre los que tienes derechos; los personajes famosos son propiedad de otros.

Personajes ilustrados (9:16, 12 s)
Create a 12-second vertical 9:16 video from two reference images of original illustrated characters. The character in image 1 stands on the LEFT and the character in image 2 on the RIGHT, full body, each keeping its art style, colors, proportions and outfit exactly; render both in that same style. They perform a rap duet in a plain orange studio with one silver microphone hanging from the ceiling between them. The left character raps into the microphone with expressive hand gestures; the right character reacts, points and dances on the beat. One fixed camera, one continuous take, no cuts, zooms or pans. No extra characters, no text, no logos.

Prompt Hotel Lobby AI para mascotas

Perros y gatos estuvieron entre los primeros clips de Hotel Lobby que se hicieron virales, todos hechos con otras herramientas (mira algunos). Dale a cada animal una foto nítida donde se vea su cuerpo completo.

Mascotas (9:16, 12 s)
Create a 12-second vertical 9:16 video from two reference photos of pets. The animal in image 1 stands upright on its hind legs on the LEFT and the animal in image 2 on the RIGHT, each keeping its breed, face, eye color, fur pattern, size and collar. They are in a plain orange studio with one silver microphone hanging from the ceiling between them. The left animal moves its mouth to the beat and gestures with its front paws as if rapping into the microphone; the right animal bobs its head, looks at the camera and dances on the beat. Natural anatomy: four legs and one tail each, both fully visible from ears to paws. One fixed, continuous shot. No people, no extra animals, no text.

El generador de Hotel Lobby Video ya trae su prompt incorporado, para personas y animales por igual, y la página de rap de perros y gatos lo abre listo para una mascota y su compañero. Un perro al lado de una persona es la combinación más predecible; los gatos y dos animales juntos son menos seguros, así que empieza con tus fotos más claras.

Cuando el render sale mal

Lo que vesCausa probableQué cambiar
Una cara se convierte en la de un desconocidoFoto de perfil, lentes de sol o cara demasiado chica en el cuadroCámbiala por una foto de frente, bien iluminada, de la cintura para arriba
Izquierda y derecha se intercambianNada en el prompt une cada foto con un ladoIndica qué imagen es el artista izquierdo y cuál el derecho
Aparece una persona de másSe copió a alguien de la referencia o del fondo de una fotoMantén “nada de personas extra” e “ignora los fondos de las fotos”
Sale texto en pantallaEl modelo agregó subtítulos por su cuentaMantén “sin subtítulos ni texto en pantalla”
La boca y el audio se desfasanFalta el audio o empieza en silencioAdjunta la pista y recórtala para que empiece en una palabra
Bordes oscuros alrededor del naranjaSe pidió un movimiento de cámara que el clip no tieneRespeta el encuadre del clip y pide naranja de borde a borde
Otra música reemplaza la pistaEl modelo compone su propia banda sonora, como hace Seedance 2.xPasa a un modelo que conserve la pista de referencia, como Wan 3.0

¿Prefieres no escribir prompts?

Hotel Lobby Video viene con este prompt, el clip de referencia y la pista de referencia ya conectados. Agrega dos fotos y dale a crear. 12 segundos con Wan 3.0 a 480p cuestan 6 créditos.

Sin prompt: sube dos fotos

Dudas frecuentes

¿Qué debe incluir un prompt Hotel Lobby AI?

La cabina naranja, un micrófono colgado entre los dos, qué foto va a la izquierda y cuál a la derecha, y qué hace cada persona. El prompt de Wan 3.0 de arriba es el que envía el generador de Hotel Lobby Video en cada video estándar.

¿Con qué modelos de video funciona este prompt?

El primero va a Wan 3.0, que conserva la pista de referencia; la versión de rap IA va a Seedance 2.x, que compone su propia música. Los dos aceptan imágenes, video y audio de referencia. Otros modelos usan su propia sintaxis para los adjuntos y puede que no acepten las tres entradas.

Solo tengo dos fotos y ningún clip de referencia. ¿Qué prompt uso?

Uno de los cinco prompts solo con fotos: pareja, mejores amigos, abuelo y nieto, personajes o mascotas. Describen la cabina y los movimientos con palabras, así que no hace falta clip. Nombra las fotos como lo pida tu herramienta y no cambies izquierda y derecha.

¿Hay un prompt de Hotel Lobby para mi perro o mi gato?

Sí, el de mascotas de arriba: una foto por animal, cada una atada a un lado, de pie y con anatomía natural. En Hotel Lobby Video te lo puedes saltar; la [página de rap de perros y gatos](/dog-and-cat-rap-video) ya viene preparada para una mascota y su compañero. Un perro junto a una persona es la combinación más segura.

¿Estos prompts funcionan en Kling o Dreamina?

Los de solo fotos están escritos para cualquier herramienta de imagen a video que acepte dos fotos de referencia, Kling y Dreamina incluidas. No se escribieron probándolos en esas herramientas, así que espera ajustar los nombres y reintentar.

¿Puedo hacer un video Hotel Lobby AI sin escribir ningún prompt?

Sí, con un generador de dos fotos. En Hotel Lobby Video el prompt ya está incorporado y solo subes las imágenes.

Referencias

Hotel Lobby Video funciona por su cuenta: no tiene vínculo alguno con Quavo, Takeoff, Migos, Quality Control Music, Motown ni COLORS.