Prompts Hotel Lobby AI: nosso prompt exato e 5 para copiar
Quase todo prompt do Hotel Lobby AI que circula na internet é chute. Estes não são: são os prompts que o nosso gerador usa para os vídeos Hotel Lobby. O primeiro é para o nosso modelo padrão, o Wan 3.0, que mantém a faixa do Hotel Lobby; o segundo é a versão Seedance, que escreve um rap original. Copie, adapte para a sua ferramenta ou pule essa parte e deixe o gerador fazer o trabalho. Mais abaixo estão cinco prompts para ferramentas que aceitam só duas fotos: um casal, melhores amigos, avós e netos, personagens ilustrados e pets.
Revisado em
O prompt do Hotel Lobby AI
Esta é a versão para duas fotos, em qualquer formato: a proporção vai para o modelo como configuração, não no texto. Antes da renderização, cada foto é redesenhada como um retrato de estúdio de corpo inteiro da mesma pessoa ou do mesmo pet (GPT Image 2), e o modelo recebe quatro anexos, nesta ordem: a Imagem 1 é o retrato da esquerda, a Imagem 2 o da direita, o Vídeo 1 o clipe de referência do Hotel Lobby sem o som e o Áudio 1 a faixa do Hotel Lobby, cortada na mesma duração.
Siga o Vídeo 1 do começo ao fim: copie o enquadramento, o ritmo e cada movimento, gesto, virada de cabeça, expressão facial e formato da boca, além do fundo laranja liso e do microfone prateado pendurado no teto entre os dois artistas. Mantenha o enquadramento de câmera do Vídeo 1: sem aproximar, sem afastar, sem panorâmica. Não acrescente nenhum movimento ou elemento de cena que não esteja no Vídeo 1.
Use o Áudio 1 como música de fundo do vídeo inteiro, exatamente como está: ele é todo o som do vídeo. Não escreva letra nova, não cante de novo, não acrescente outra música nem outras vozes.
O artista da esquerda é quem aparece na Imagem 1; o artista da direita é quem aparece na Imagem 2. Eles substituem por completo as duas pessoas do Vídeo 1: rosto, cabelo ou pelo, corpo e roupa vêm das fotos, nada das pessoas do Vídeo 1. Nenhum dos dois usa luvas (a não ser que já esteja de luvas na foto): pessoas mostram as próprias mãos e animais mantêm as próprias patas. Ignore o fundo das fotos.
O artista da esquerda faz o rap da voz do Áudio 1 no microfone, com a boca perfeitamente sincronizada com o Áudio 1. O da direita segue os movimentos da pessoa da direita no Vídeo 1: reage e gesticula no ritmo, mexendo a boca só em ad-libs curtos.
O laranja preenche o quadro inteiro, sem áreas pretas nem cantos escuros. Sem tela dividida, sem pessoas a mais, sem legendas nem texto na tela. Os rostos ficam iguais do começo ao fim.A versão Seedance, com rap feito por IA
No Seedance o som é sempre um rap com IA: o próprio modelo escreve uma música nova. Na cabine do Hotel Lobby ele ouve a faixa de Hotel Lobby enquanto escreve: o clipe de referência sobe sem som, a faixa sobe à parte como áudio de referência 1, e o prompt pede uma batida nova que siga o ritmo dela, com letra nova e sem a melodia nem as vozes dela. Os anexos são citados por extenso (“imagem de referência 1”). Este prompt é para o tema de exemplo que aparece no texto. O prompt pede o rap no idioma do tema; com um tema escrito em português, o rap sai em português.
Use o vídeo de referência 1 para a apresentação inteira: copie o enquadramento, o ritmo e cada movimento, gesto, virada de cabeça, expressão facial e movimento da boca, o fundo laranja liso e o único microfone prateado pendurado entre os artistas. Mantenha o enquadramento de câmera do vídeo de referência 1: sem aproximar, sem afastar, sem panorâmica. Não acrescente nenhum movimento ou elemento de cena que não esteja no vídeo de referência 1.
Artista da esquerda: a pessoa da imagem de referência 1. Artista da direita: a pessoa da imagem de referência 2. Eles substituem por completo as duas pessoas do vídeo de referência 1: rosto, cabelo, corpo e roupa vêm das fotos, nada das pessoas do vídeo de referência 1. Se uma foto não mostrar nenhuma roupa de uma pessoa (só o rosto ou os ombros nus), vista essa pessoa com roupas simples do dia a dia que combinem com ela, como uma camiseta lisa e jeans; nunca o figurino, a capa, o casaco, os cintos, as luvas ou a venda nos olhos das pessoas do vídeo de referência 1. Os animais ficam como estão, sem roupa. Ignore o fundo das fotos.
Trilha sonora: uma música original de trap sombrio de Atlanta feita para este vídeo que segue o áudio de referência 1 na batida e no ritmo: o mesmo andamento, groove, padrão de bateria e balanço, no tempo dos movimentos do vídeo de referência 1. Faça uma batida nova nesse estilo com letra nova; não reutilize a letra, a melodia nem as vozes do áudio de referência 1. Enxuto mas pesado: um 808 retumbante e áspero que desliza entre as notas, uma caixa com palmas cortante com hi-hats secos, e um único loop de melodia sinistra com toque oriental. Clima sombrio, ameaçador e confiante. O rap é um flow em tercinas rápido e com balanço por cima da batida lenta. Mixagem: a voz clara por cima, a batida logo atrás quase no mesmo volume, alta e marcante, nunca baixa e sem nunca parar entre uma frase e outra. O artista da esquerda faz no microfone pendurado um verso original e limpo sobre: "os 30 anos da Maya e a baliza terrível dela". Faça o rap no idioma desse tema. Voz de rap clara, boca sincronizada com cada palavra, movimentos naturais de cabeça e boca expressiva. O artista da direita é o parceiro que anima: aponta para quem está rimando, reage, sorri e solta ad-libs curtos no ritmo. Não use nenhuma música existente, nenhuma letra existente nem a voz de nenhum artista real.
9:16. O laranja preenche o quadro inteiro de ponta a ponta, sem áreas pretas ou escuras. Sem tela dividida, sem pessoas a mais, sem legendas nem texto na tela. Os rostos ficam iguais do começo ao fim.O que cada parte faz
- Os movimentos. O primeiro parágrafo entrega tudo ao Vídeo 1: o enquadramento, o ritmo e cada movimento, gesto, virada de cabeça, expressão e formato de boca, o fundo laranja liso e o único microfone prateado pendurado entre as duas pessoas. Ele mantém a câmera parada (sem aproximar, recuar nem girar) e proíbe qualquer coisa que o clipe não tenha.
- O som. O Áudio 1 é a trilha sonora inteira e fica como está: sem letra nova, sem cantar de novo, sem outra música nem outras vozes.
- As identidades. Cada imagem fica presa a um lado, e quem aparece nas duas imagens substitui por completo as duas pessoas do clipe: rosto, cabelo ou pelo, corpo e roupa vêm das imagens, e o fundo é ignorado. O prompt diz “quem aparece na Imagem 1”, e não homem ou mulher, então serve para uma pessoa ou um pet e nunca contradiz a foto. Ele também proíbe luvas: os dois dançarinos do nosso clipe de referência usam luvas, e o modelo copiava as luvas para mãos e patas.
- Os papéis. Quem está à esquerda rima a voz do Áudio 1, com a boca sincronizada; quem está à direita copia o parceiro que anima no clipe, reagindo e gesticulando no beat, só com ad-libs curtos.
- As proteções. Laranja de ponta a ponta sem bordas ou cantos pretos, sem tela dividida, sem pessoas extras, sem legendas, com os rostos iguais do começo ao fim. Essas linhas evitam as falhas mais comuns.
Como usar em outra ferramenta de vídeo com IA
- Você precisa de um modelo que aceite imagens de referência, um vídeo de referência e uma faixa de áudio de referência, e que mantenha a faixa. O Wan 3.0 faz isso; o ByteDance Seedance 2.x aceita os três, mas criou uma música nova nos nossos testes.
- Dê aos anexos os nomes que a sua ferramenta espera. Aqui eles são numerados na ordem de envio (Imagem 1, Imagem 2, Vídeo 1, Áudio 1); algumas ferramentas pedem @Image1 ou tags próprias. Mantenha a ordem: foto da esquerda primeiro, foto da direita depois.
- Mantenha as pessoas neutras. “Quem aparece na Imagem 1” serve para qualquer pessoa ou pet da imagem; o nosso gerador só muda a disposição das fotos (duas fotos ou uma dos dois) e, com um clipe seu, os movimentos.
- O formato não fica no texto: escolha 9:16, 16:9 ou 1:1 nas configurações da ferramenta.
- Sem clipe de referência, descreva a cabine e os movimentos com palavras, em vez de apontar para o Vídeo 1. Ferramentas como o Dreamina publicam os próprios prompts só de texto para isso. Nós só testamos as versões acima.
Prompts Hotel Lobby AI para duas fotos, sem clipe de referência
Muitas ferramentas de vídeo com IA aceitam fotos de referência, mas não um clipe de referência. Estes cinco prompts descrevem a cabine e os movimentos com palavras, então você pode colar cada um numa ferramenta de imagem para vídeo que aceite duas fotos. Eles mantêm as regras que fazem o formato funcionar: uma foto para cada lado, um único microfone pendurado, uma pessoa conduz enquanto a outra reage, e a câmera nunca se mexe. Escrevemos esses prompts para este guia e não os testamos. Cada ferramenta lê prompts de um jeito um pouco diferente, então conte com uma ou duas tentativas a mais. Os prompts ficam em inglês porque as ferramentas de vídeo com IA seguem prompts em inglês de forma confiável; se a sua ferramenta preferir português, você pode traduzi-los.
Prompt Hotel Lobby AI para um casal
Create a 12-second vertical 9:16 video from two reference photos. The person in image 1 stands on the LEFT and the person in image 2 on the RIGHT, both full body, each keeping their own face, hair, clothes and height. They are a couple performing a rap duet in a plain, evenly lit orange studio: orange wall and floor, nothing else in the room. One silver condenser microphone hangs from the ceiling on a thin cable, centered between them. The left performer raps into the microphone with confident hand gestures; the right performer laughs, points and dances on the beat, then leans in for the last line. One continuous shot from a fixed camera at chest height: no cuts, zooms or pans. No other people, no captions, no logos.Para melhores amigos
Create a 12-second vertical 9:16 video from two reference photos of two adult best friends. Image 1 is on the LEFT, image 2 on the RIGHT, both full body, keeping each face, hairstyle, outfit and body shape exactly. Setting: a plain orange studio with a seamless orange wall and floor and one silver microphone hanging from the ceiling between them. For the first half the left friend raps into the microphone while the right friend nods, grins and hypes with big gestures; for the second half they swap, and the left friend reacts. Their moves stay independent, never mirrored. Fixed camera, one continuous take, soft even light, both bodies and feet visible. No extra people, props, text or logos.Para avós e netos
Create a 12-second vertical 9:16 video from two reference photos. Image 1 is an older adult on the LEFT and image 2 is their adult grandchild on the RIGHT, both full body, each keeping their own face, hair, clothes and height. They perform a rap duet in a plain orange studio with one silver microphone hanging from the ceiling between them. The grandparent raps into the microphone with slow, deliberate, confident gestures; the grandchild looks amazed, laughs and dances on the beat, then joins in for the last line. Natural, comfortable movement for both. One fixed, continuous shot with even studio light: no cuts, zooms or pans, no other people, no captions.Para personagens de anime ou desenho
Use personagens que você desenhou ou cujos direitos você tem; personagens conhecidos pertencem a outras pessoas.
Create a 12-second vertical 9:16 video from two reference images of original illustrated characters. The character in image 1 stands on the LEFT and the character in image 2 on the RIGHT, full body, each keeping its art style, colors, proportions and outfit exactly; render both in that same style. They perform a rap duet in a plain orange studio with one silver microphone hanging from the ceiling between them. The left character raps into the microphone with expressive hand gestures; the right character reacts, points and dances on the beat. One fixed camera, one continuous take, no cuts, zooms or pans. No extra characters, no text, no logos.Prompt Hotel Lobby AI para pets
Gatos e cachorros estiveram entre os primeiros clipes virais do Hotel Lobby, feitos com outras ferramentas (veja aqui). Use uma foto nítida de cada animal, com o corpo inteiro aparecendo.
Create a 12-second vertical 9:16 video from two reference photos of pets. The animal in image 1 stands upright on its hind legs on the LEFT and the animal in image 2 on the RIGHT, each keeping its breed, face, eye color, fur pattern, size and collar. They are in a plain orange studio with one silver microphone hanging from the ceiling between them. The left animal moves its mouth to the beat and gestures with its front paws as if rapping into the microphone; the right animal bobs its head, looks at the camera and dances on the beat. Natural anatomy: four legs and one tail each, both fully visible from ears to paws. One fixed, continuous shot. No people, no extra animals, no text.No nosso gerador você não precisa de nenhum destes prompts, nem para pessoas nem para pets: o prompt já vem pronto, e a página de vídeo de rap com pets prepara o gerador para o seu pet e a dupla dele. Testamos um cachorro ao lado de uma pessoa; gatos e dois pets juntos ainda não foram testados.
Problemas comuns e como resolver
| Problema | Causa provável | Solução |
|---|---|---|
| Os rostos mudam ou parecem de outra pessoa | Foto de perfil, óculos escuros ou rosto pequeno na foto | Use fotos de frente, bem iluminadas, da cintura para cima |
| As duas pessoas trocam de lado | O prompt não prende cada foto a um lado | Diga qual imagem é a pessoa da esquerda e qual é a da direita |
| Aparece uma terceira pessoa | O modelo copia gente da referência ou do fundo de uma foto | Mantenha “sem pessoas a mais” e “ignore o fundo das fotos” |
| Aparecem palavras na tela | O modelo coloca legendas | Mantenha “sem legendas nem texto na tela” |
| A boca não bate com o áudio | Nenhum áudio anexado, ou o áudio começa em silêncio | Anexe a faixa e faça ela começar numa palavra |
| Bordas pretas em volta do laranja | O prompt pede um movimento de câmera que o clipe não tem | Mantenha o enquadramento do clipe e peça laranja de ponta a ponta |
| Uma música nova no lugar da faixa | O modelo cria a própria trilha (o Seedance 2.x fez isso nos nossos testes) | Use um modelo que mantenha a faixa de referência, como o Wan 3.0 |
Ou pule o prompt
No Hotel Lobby Video este prompt, o clipe de referência e a faixa de referência já vêm prontos. Você adiciona duas fotos e cria. Um vídeo de 12 s no Wan 3.0 em 480p custa 6 créditos.
Dúvidas frequentes
Qual é o melhor prompt para a trend do Hotel Lobby AI?
Um que deixe fixos a cabine, o único microfone pendurado, qual foto fica de qual lado e o que cada pessoa faz. O prompt acima é o que o nosso gerador usa em todos os vídeos.
Com qual modelo de IA esse prompt funciona?
Usamos o primeiro com o Wan 3.0, que mantém a faixa de referência, e a versão do rap com IA no Seedance 2.x, que cria a própria música. Os dois aceitam imagens de referência, um vídeo de referência e uma faixa de áudio de referência. Outros modelos precisam da própria sintaxe de menção e talvez não aceitem os três.
Existe um prompt Hotel Lobby AI para pets?
Sim, o prompt para pets acima, para ferramentas que aceitam duas fotos: uma foto de cada animal, cada uma presa a um lado, em pé com anatomia natural. No Hotel Lobby Video você não precisa de prompt: a [página de vídeo de rap com pets](/dog-and-cat-rap-video) já vem pronta para o seu pet e a dupla dele. Testamos um cachorro ao lado de uma pessoa; gatos e dois pets juntos ainda não foram testados.
Posso colar estes prompts no Dreamina, no Kling ou em outra ferramenta?
Os cinco prompts só com fotos foram escritos para ferramentas de imagem para vídeo que aceitam duas fotos de referência. Chame as fotos do jeito que a sua ferramenta chama e mantenha esquerda e direita fixas. Não testamos esses prompts em outras ferramentas.
Preciso de um prompt para fazer um vídeo Hotel Lobby AI?
Não em um gerador de duas fotos. No Hotel Lobby Video o prompt já vem pronto; você só adiciona as fotos.
Referências
Próxima leitura
Como fazer a trend do Hotel Lobby: 3 jeitos, passo a passo
Três caminhos para a trend do Hotel Lobby AI (gerador de duas fotos, prompt em um modelo de vídeo, template de editor), com passos, custos, opções grátis e dicas
Melhores geradores de vídeo Hotel Lobby AI (04/10/2026)
Uma comparação com data dos geradores de vídeo da trend (Hotel Lobby Video, Rap Duo AI, LightX, Dreamina, Media.io, Summrs, Fuzana, Kapwing), feita a partir das páginas de cada um
Quais são as melhores fotos para Hotel Lobby AI?
Um checklist de fotos para Hotel Lobby AI: o que escolher, o que o redesenho faz com a sua foto, duas fotos ou uma, e o que fotos melhores não resolvem
O Hotel Lobby Video é um produto independente, sem qualquer ligação com Quavo, Takeoff, Migos, Quality Control Music, Motown ou COLORS.
