Salta al contenuto

Prompt Hotel Lobby AI: quello vero, riga per riga

Un buon prompt Hotel Lobby AI fa quattro cose: fissa la cabina arancione, appende un solo microfono tra i due, lega ogni foto a un lato e dice chi rappa e chi reagisce. Qui sotto trovi i due prompt che il generatore di Hotel Lobby Video (hotel-lobby-video.com) costruisce davvero, non una ricostruzione a occhio: la versione Wan 3.0, che tiene la traccia del modello, e la versione Seedance, che scrive un rap nuovo. Incollali nel tuo strumento, modificali o lascia fare al generatore. Se il tuo strumento accetta due foto ma nessuna clip di riferimento, salta ai cinque prompt solo-foto più in basso.

Ultima revisione

Il prompt Wan 3.0

Questo testo vale per due foto in qualsiasi formato, perché le proporzioni vengono inviate come impostazione e non scritte nel prompt. Prima GPT Image 2 trasforma ogni foto caricata in un ritratto in studio a figura intera della stessa persona o dello stesso animale. Poi il modello riceve quattro allegati, sempre in quest’ordine: Immagine 1 (ritratto di sinistra), Immagine 2 (ritratto di destra), Video 1 (la clip di riferimento Hotel Lobby, senza audio) e Audio 1 (la traccia Hotel Lobby, tagliata alla stessa durata).

Prompt Hotel Lobby AI (Wan 3.0)
Segui Video 1 dall’inizio alla fine: copia la sua inquadratura, i suoi tempi e ogni movimento, gesto, giro di testa, espressione e forma della bocca, insieme allo sfondo arancione uniforme e al microfono argentato che pende dal soffitto tra i due performer. Mantieni l’inquadratura di Video 1: niente zoom in avanti, niente zoom indietro, nessuna panoramica. Non aggiungere movimenti o elementi di scena che non sono in Video 1.

Usa Audio 1 come musica di sottofondo per tutto il video, così com’è: è l’intero sonoro del video. Non scrivere testi nuovi, non ricantarlo, non aggiungere altra musica o altre voci.

Il performer a sinistra è il soggetto in Immagine 1; quello a destra è il soggetto in Immagine 2. Sostituiscono completamente le due persone di Video 1: volto, capelli o pelo, corporatura e vestiti vengono dalle foto, niente dalle persone di Video 1. Nessuno dei due indossa guanti (a meno che non li abbia già nella foto): le persone mostrano le proprie mani, gli animali tengono le proprie zampe. Ignora lo sfondo delle foto.

Il performer a sinistra rappa al microfono la voce di Audio 1, con le labbra perfettamente a tempo con Audio 1. Quello a destra segue i movimenti della persona a destra in Video 1: reagisce e gesticola a tempo, muovendo le labbra solo per brevi ad-lib.

L’arancione riempie tutto il quadro, senza zone nere né angoli scuri. Niente split screen, nessuna persona in più, niente sottotitoli o scritte sullo schermo. I volti restano uguali dall’inizio alla fine.

La versione Seedance con un AI rap

Seedance non tiene mai la registrazione originale: la sua colonna sonora è sempre un rap scritto da lui. Per la cabina Hotel Lobby, però, ascolta il modello mentre scrive: la clip di riferimento viene caricata muta, la traccia arriva a parte come audio di riferimento 1, e il prompt chiede un beat nuovo sullo stesso ritmo, con testo inedito e niente della melodia o delle voci originali. Seedance indica gli allegati a parole (“immagine di riferimento 1”). La versione mostrata usa l’argomento di esempio.

Prompt AI rap Hotel Lobby (Seedance, 9:16, 12 s)
Usa il video di riferimento 1 per tutta l’esibizione: copia la sua inquadratura, i suoi tempi e ogni movimento, gesto, giro di testa, espressione e movimento della bocca, lo sfondo arancione uniforme e l’unico microfono argentato sospeso tra i performer. Mantieni l’inquadratura del video di riferimento 1: niente zoom in avanti, niente zoom indietro, nessuna panoramica. Non aggiungere movimenti o elementi di scena che non sono nel video di riferimento 1.

Performer a sinistra: la persona nell’immagine di riferimento 1. Performer a destra: la persona nell’immagine di riferimento 2. Sostituiscono completamente le due persone del video di riferimento 1: volto, capelli, corpo e vestiti vengono dalle foto, niente dalle persone del video di riferimento 1. Se una foto non mostra nessun capo di una persona (solo il viso o le spalle scoperte), vestila con abiti semplici di tutti i giorni adatti a lei, come una maglietta semplice e dei jeans; mai il costume, il mantello, il cappotto, le cinture, i guanti o la benda sugli occhi delle persone del video di riferimento 1. Gli animali restano come sono, senza vestiti. Ignora lo sfondo delle foto.

Colonna sonora: una canzone trap scura di Atlanta originale, fatta per questo video, che segue l’audio di riferimento 1 per beat e ritmo: lo stesso tempo, groove, pattern di batteria e rimbalzo, a tempo con i movimenti del video di riferimento 1. Fai un beat nuovo in quello stile con un testo nuovo; non riutilizzare testo, melodia o voci dell’audio di riferimento 1. Essenziale ma potente: un 808 martellante e graffiante che scivola tra le note, un rullante con battimani penetrante e hi-hat secchi, e un unico loop di melodia inquietante dal sapore orientale. Atmosfera scura, minacciosa e sicura. Il rap è un flow in terzine veloce e rimbalzante che corre sopra il beat lento. Mix: la voce chiara sopra, il beat subito dietro quasi allo stesso livello, forte e incisivo, mai basso e senza mai interrompersi tra una frase e l’altra. Il performer a sinistra rappa nel microfono sospeso una strofa originale e pulita su: "i 30 anni di Maya e il suo pessimo parcheggio in parallelo". Rappa nella lingua di quel tema. Voce rap chiara, labbra a tempo con ogni parola, cenni naturali della testa e bocca espressiva. Il performer a destra è il compagno di hype: indica il rapper, reagisce, sorride e aggiunge brevi ad-lib a tempo. Non usare canzoni esistenti, testi esistenti o la voce di artisti reali.

9:16. L’arancione riempie tutto il quadro da un bordo all’altro, senza zone nere o scure. Niente split screen, nessuna persona in più, niente sottotitoli o scritte sullo schermo. I volti restano uguali dall’inizio alla fine.

A cosa serve ogni riga

  1. Il movimento arriva dalla clip. Il primo paragrafo dice al modello di prendere da Video 1 inquadratura, tempi, gesti, giri di testa, espressioni e forma della bocca, insieme allo sfondo arancione spoglio e all’unico microfono argentato sul cavo. Blocca la camera (niente avvicinamenti, allontanamenti o panoramiche) e vieta tutto ciò che nella clip non c’è.
  2. Il suono resta intatto. Audio 1 è l’intera colonna sonora: nessun testo riscritto, nessuna voce nuova, niente musica o voci in più.
  3. Visi e corpi arrivano dalle foto. Ogni immagine appartiene a un lato, e i due soggetti sostituiscono del tutto le persone della clip, prendendo viso, capelli o pelo, corpo e vestiti dalle foto e ignorandone lo sfondo. La formula è “il soggetto dell’Immagine 1” e non uomo o donna, così va bene per una persona o un animale e non contraddice mai la foto. Una riga vieta anche i guanti: gli artisti della clip di riferimento li portano, e i modelli tendono a copiarli su mani e zampe.
  4. Ogni lato ha un compito. Il soggetto di sinistra rappa la voce di Audio 1 con il labiale giusto; quello di destra rifà la spalla della clip, reagendo sul beat con brevi ad-lib.
  5. Le regole finali chiudono i buchi. L’arancione riempie il quadro fino ai bordi senza angoli scuri, niente split screen, niente persone in più, niente sottotitoli, e i visi restano uguali dal primo all’ultimo fotogramma. Sono le righe che colpiscono gli errori più frequenti.

Portare il prompt in un altro strumento video AI

  • Il modello deve accettare immagini, un video e una traccia audio di riferimento, e deve tenere quella traccia. Wan 3.0 lo fa. ByteDance Seedance 2.x accetta tutti e tre gli input ma genera la propria musica, ed è per questo che il generatore di Hotel Lobby Video lo usa solo per l’AI rap.
  • Chiama gli allegati come vuole il tuo strumento. Qui sono numerati in ordine di caricamento (Immagine 1, Immagine 2, Video 1, Audio 1); altri strumenti vogliono @Image1 o tag propri. Qualunque sia la sintassi, carica prima la foto di sinistra e poi quella di destra.
  • Lascia i soggetti generici. “Il soggetto dell’Immagine 1” va bene per chiunque, persona o animale. Le uniche cose che il generatore di Hotel Lobby Video cambia sono la disposizione delle foto (due foto o una con entrambi) e, se carichi una tua clip, i movimenti.
  • Il formato si sceglie nelle impostazioni, non nel testo: lì trovi 9:16, 16:9 o 1:1.
  • Niente clip di riferimento? Allora devi descrivere a parole la cabina e i movimenti invece di rimandare a Video 1. Dreamina e strumenti simili pubblicano i propri prompt solo testo per questo caso. Gli unici testi inviati dal generatore sono i due prompt qui sopra.

Prompt Hotel Lobby AI solo-foto (senza clip di riferimento)

Molti strumenti image-to-video accettano foto di riferimento ma non una clip. I cinque prompt qui sotto descrivono a parole la stanza e la coreografia, quindi si incollano direttamente in uno strumento che prende due immagini. Restano in inglese, come li abbiamo scritti, e tengono fermo ciò che rende riconoscibile il formato: una foto per lato, un solo microfono appeso, uno che guida e uno che reagisce, una camera immobile. Sono scritti per questa pagina e non sono ciò che invia il generatore di Hotel Lobby Video; ogni strumento interpreta i prompt a modo suo, quindi metti in conto un paio di tentativi.

Prompt Hotel Lobby AI per una coppia

Coppia (9:16, 12 s)
Create a 12-second vertical 9:16 video from two reference photos. The person in image 1 stands on the LEFT and the person in image 2 on the RIGHT, both full body, each keeping their own face, hair, clothes and height. They are a couple performing a rap duet in a plain, evenly lit orange studio: orange wall and floor, nothing else in the room. One silver condenser microphone hangs from the ceiling on a thin cable, centered between them. The left performer raps into the microphone with confident hand gestures; the right performer laughs, points and dances on the beat, then leans in for the last line. One continuous shot from a fixed camera at chest height: no cuts, zooms or pans. No other people, no captions, no logos.

Due migliori amici

Migliori amici (9:16, 12 s)
Create a 12-second vertical 9:16 video from two reference photos of two adult best friends. Image 1 is on the LEFT, image 2 on the RIGHT, both full body, keeping each face, hairstyle, outfit and body shape exactly. Setting: a plain orange studio with a seamless orange wall and floor and one silver microphone hanging from the ceiling between them. For the first half the left friend raps into the microphone while the right friend nods, grins and hypes with big gestures; for the second half they swap, and the left friend reacts. Their moves stay independent, never mirrored. Fixed camera, one continuous take, soft even light, both bodies and feet visible. No extra people, props, text or logos.

Nonno o nonna con il nipote ormai grande

Nonno e nipote adulto (9:16, 12 s)
Create a 12-second vertical 9:16 video from two reference photos. Image 1 is an older adult on the LEFT and image 2 is their adult grandchild on the RIGHT, both full body, each keeping their own face, hair, clothes and height. They perform a rap duet in a plain orange studio with one silver microphone hanging from the ceiling between them. The grandparent raps into the microphone with slow, deliberate, confident gestures; the grandchild looks amazed, laughs and dances on the beat, then joins in for the last line. Natural, comfortable movement for both. One fixed, continuous shot with even studio light: no cuts, zooms or pans, no other people, no captions.

Personaggi cartoon o anime

Usa solo personaggi creati da te o di cui hai i diritti; quelli famosi appartengono a qualcun altro.

Personaggi illustrati (9:16, 12 s)
Create a 12-second vertical 9:16 video from two reference images of original illustrated characters. The character in image 1 stands on the LEFT and the character in image 2 on the RIGHT, full body, each keeping its art style, colors, proportions and outfit exactly; render both in that same style. They perform a rap duet in a plain orange studio with one silver microphone hanging from the ceiling between them. The left character raps into the microphone with expressive hand gestures; the right character reacts, points and dances on the beat. One fixed camera, one continuous take, no cuts, zooms or pans. No extra characters, no text, no logos.

Prompt Hotel Lobby AI per animali

Cani e gatti sono stati tra le prime clip Hotel Lobby a girare, tutte fatte con altri strumenti (guardane qualcuna). Dai a ogni animale una foto nitida con il corpo intero in vista.

Animali (9:16, 12 s)
Create a 12-second vertical 9:16 video from two reference photos of pets. The animal in image 1 stands upright on its hind legs on the LEFT and the animal in image 2 on the RIGHT, each keeping its breed, face, eye color, fur pattern, size and collar. They are in a plain orange studio with one silver microphone hanging from the ceiling between them. The left animal moves its mouth to the beat and gestures with its front paws as if rapping into the microphone; the right animal bobs its head, looks at the camera and dances on the beat. Natural anatomy: four legs and one tail each, both fully visible from ears to paws. One fixed, continuous shot. No people, no extra animals, no text.

Il generatore di Hotel Lobby Video ha il prompt già integrato, per persone e animali, e la pagina del rap per cani e gatti lo apre già impostato per un animale più un compagno. Un cane accanto a una persona è la coppia più prevedibile; gatti e due animali insieme sono meno sicuri, quindi parti dalle foto più chiare.

Quando il render non viene bene

Cosa vediCausa probabileCosa cambiare
Un viso diventa quello di uno sconosciutoFoto di profilo, occhiali da sole o viso troppo piccolo nel quadroUsa una foto frontale, ben illuminata, dalla vita in su
Sinistra e destra si scambianoNel prompt nulla lega ogni foto a un latoScrivi quale immagine è l’artista di sinistra e quale quello di destra
Spunta una persona in piùÈ stato copiato qualcuno dalla clip o dallo sfondo di una fotoTieni “nessuna persona in più” e “ignora lo sfondo delle foto”
Compare del testo a schermoIl modello ha aggiunto sottotitoli da soloTieni “niente sottotitoli o testo a schermo”
Bocca e audio vanno fuori sincronoAudio assente, o che parte con il silenzioAllega la traccia e tagliala in modo che inizi su una parola
Bordi scuri intorno all’arancioneÈ stato chiesto un movimento di camera che la clip non haMantieni l’inquadratura della clip e chiedi arancione da bordo a bordo
Una musica diversa prende il posto della tracciaIl modello compone la propria colonna sonora, come fa Seedance 2.xPassa a un modello che tiene la traccia di riferimento, come Wan 3.0

Preferisci non scrivere prompt?

Hotel Lobby Video ha già collegati questo prompt, la clip e la traccia di riferimento. Aggiungi due foto e premi crea. 12 secondi con Wan 3.0 a 480p costano 6 crediti.

Niente prompt: aggiungi due foto

Domande e risposte

Cosa deve contenere un prompt Hotel Lobby AI?

La cabina arancione, un microfono appeso tra i due, quale foto va a sinistra e quale a destra, e cosa fa ciascuno. Il prompt Wan 3.0 qui sopra è quello che il generatore di Hotel Lobby Video invia con ogni video standard.

Con quali modelli video funziona questo prompt?

Il primo va a Wan 3.0, che tiene la traccia di riferimento; la versione AI rap va a Seedance 2.x, che compone la propria musica. Entrambi accettano immagini, video e audio di riferimento. Altri modelli usano una sintassi propria per gli allegati e potrebbero non prendere tutti e tre gli input.

Ho solo due foto e nessuna clip di riferimento: che prompt uso?

Uno dei cinque prompt solo-foto: coppia, migliori amici, nonno e nipote, personaggi o animali. Descrivono cabina e movimenti a parole, quindi la clip non serve. Chiama le foto come vuole il tuo strumento e tieni fissi sinistra e destra.

C’è un prompt Hotel Lobby per il mio cane o il mio gatto?

Sì, quello per animali qui sopra: una foto per animale, ognuna legata a un lato, in piedi e con anatomia naturale. Su Hotel Lobby Video puoi farne a meno; la [pagina del rap per cani e gatti](/dog-and-cat-rap-video) è già impostata per un animale e un compagno. Un cane vicino a una persona è la coppia più sicura.

Questi prompt funzionano su Kling o Dreamina?

Quelli solo-foto sono scritti per qualsiasi strumento image-to-video che prenda due foto di riferimento, Kling e Dreamina compresi. Non sono stati scritti su misura per quegli strumenti, quindi aspettati di dover adattare i nomi e riprovare.

Posso fare un video Hotel Lobby AI senza scrivere nessun prompt?

Sì, con un generatore a due foto. Su Hotel Lobby Video il prompt è già integrato e tu carichi solo le immagini.

Riferimenti

Hotel Lobby Video è un servizio indipendente: nessun legame con Quavo, Takeoff, Migos, Quality Control Music, Motown o COLORS.