直接看内容

Hotel Lobby AI 提示词:真实原版逐行拆解

一段好用的 Hotel Lobby AI 提示词要办成四件事:固定住橙色录音棚,在两人中间吊一支麦克风,把每张照片对应到一侧,再写明谁说唱、谁做反应。下面是 Hotel Lobby Video(hotel-lobby-video.com)生成器真正拼出来的两段提示词,不是猜出来的:Wan 3.0 版会保留模板音轨,Seedance 版会现写一段新说唱。你可以贴进自己的工具、拿去改写,或者干脆交给生成器。如果你的工具只收两张照片、不收参考视频,直接跳到后面的五段纯照片提示词。

最近更新:

Wan 3.0 提示词

这段文字适用于两张照片、任意画幅,因为画面比例是作为参数单独发送的,不写在提示词里。第一步,GPT Image 2 会把每张上传的照片重绘成同一个人(或同一只动物)的全身棚拍照。之后模型收到四个附件,顺序固定:图1(左侧人像)、图2(右侧人像)、视频1(静音的 Hotel Lobby 参考视频)和音频1(剪到同样长度的 Hotel Lobby 音轨)。

Hotel Lobby AI 提示词(Wan 3.0)
全程参照视频1:照搬它的取景、节奏和每一个动作、手势、转头、表情和嘴型,以及纯橙色背景和两人之间从天花板垂下的那支银色麦克风。保持视频1的机位取景,不要推近、拉远或平移。不要加入视频1里没有的动作或场景元素。

全程使用音频1作为整条视频的背景音乐,原样保留:它就是视频的全部声音。不要新写歌词,不要重唱,不要加入其他音乐或人声。

左边的表演者是图1里的主体,右边的表演者是图2里的主体。他们完全替换视频1里的两个人:脸、发型或毛发、身材和衣服都来自照片,视频1里的人一样都不要。两位表演者都不戴手套(照片里本来戴着的除外):人露出本来的手,动物的前爪保持本来的爪子。忽略照片的背景。

左边的表演者对着麦克风说唱音频1的人声,嘴型与音频1精确同步。右边的表演者照着视频1右边那个人的动作:跟着节拍做反应和手势,只做简短的附和口型。

橙色铺满整个画面,没有黑色或暗角。不要分屏,不要多余的人,画面上不要字幕或文字。人脸从头到尾保持一致。

带 AI 说唱的 Seedance 版

Seedance 从不保留原版录音,它的配乐永远是自己写的一段说唱。不过在 Hotel Lobby 录音棚里,它写歌时仍能“听到”模板:参考视频去掉声音后上传,音轨单独作为参考音频1上传,提示词要求它按同样的节奏做一段新伴奏,歌词全新,不用原曲的旋律和人声。Seedance 用文字称呼附件(“参考图片1”)。下面展示的版本用的是后文那个示例话题。

Hotel Lobby AI 说唱提示词(Seedance,9:16,12 秒)
全程参照参考视频1的表演:照搬它的取景、节奏和每一个动作、手势、转头、表情和嘴型,以及纯橙色背景和两人之间悬挂的那支银色麦克风。保持参考视频1的机位取景:不要推近,不要拉远,不要平移。不要加入参考视频1里没有的动作或场景元素。

左边的表演者:参考图片1里的人。右边的表演者:参考图片2里的人。他们完全替换参考视频1里的两个人:脸、发型、身材和衣服都来自照片,参考视频1里的人一样都不要。照片里完全看不到某个人的衣服时(只有脸、或者光着肩膀),给这个人穿适合他的普通便装,比如简单的 T 恤和牛仔裤;绝不要参考视频1里那两个人的戏服、披风、外套、皮带、手套和蒙眼布。动物保持原样,不加衣服。忽略照片的背景。

配乐:一首为这条视频原创的暗黑亚特兰大 trap 歌曲,节拍和节奏跟着参考音频1走:同样的速度、律动、鼓点和弹跳感,卡准参考视频1里的动作。按这个风格做一段新的伴奏、写新歌词;不要重复使用参考音频1的歌词、旋律和人声。精简但有力:砸地、粗砺、在音符之间滑动的 808,尖锐的军鼓加拍手配利落的踩镲,再加一条阴森、带东方色彩的旋律循环。情绪暗、有压迫感、自信。说唱是快速、有弹性的三连音 flow,跑在缓慢的节拍上面。混音:人声清楚地在最上面,伴奏紧跟其后、几乎一样响,有力、有冲击感,从不变小,两句之间也不断。左边的表演者对着悬挂的麦克风说唱一段原创、干净的歌词,主题是:“Maya 的 30 岁生日和她糟糕的侧方停车”。用这个主题的语言来唱。说唱人声清晰,嘴型与每个字同步,自然地点头,嘴部表情丰富。右边的表演者是助兴搭档:指着说唱的人,做反应、微笑,跟着节拍加简短的附和。不要使用任何现成的歌曲、现成的歌词或任何真实歌手的声音。

9:16。橙色从一边铺到另一边,填满整个画面,没有黑色或暗的区域。不要分屏,不要多余的人,画面上不要字幕或文字。人脸从头到尾保持一致。

每一行为什么这么写

  1. 动作取自参考视频。开头一段让模型从视频1里照搬构图、节奏、手势、转头、表情和口型,连同空荡荡的橙色背景和吊在线上的那支银色麦克风。镜头被锁死(不推近、不拉远、不平移),视频里没有的东西一律不许出现。
  2. 声音原封不动。音频1 就是全部配乐:不改词,不加新人声,不加别的音乐或说话声。
  3. 脸和身体取自照片。每张照片固定对应一侧,两位主体完全替换掉视频里的人,脸、发型或毛发、身形和衣服都来自照片,照片的背景则不管。提示词写的是“图1中的主体”,而不是男人或女人,这样人和宠物都适用,也不会和照片打架。还有一句禁止戴手套:参考视频里的表演者戴着手套,模型很容易把它照抄到人手和爪子上。
  4. 两侧各有分工。左边的主体唱音频1 里的人声,口型对上;右边的主体模仿视频里那位助阵的人,踩着节拍做反应,只偶尔喊一两句。
  5. 最后用几条护栏堵住漏洞:橙色铺满画面直到四边,不留暗角,不分屏,不多出人,不加字幕,从第一帧到最后一帧脸都不变。这几句专门针对最常出现的翻车。

把提示词搬到别的 AI 视频工具

  • 你的模型必须能接收参考图片、参考视频和参考音轨,而且要保留那条音轨。Wan 3.0 可以。字节跳动的 Seedance 2.x 三种输入都收,但会自己生成音乐,所以 Hotel Lobby Video 生成器只用它做 AI 说唱。
  • 附件的叫法按你的工具来。这里按上传顺序编号(图1、图2、视频1、音频1);别的工具可能要写 @Image1 或它自己的标签。不管语法如何,先传左边的照片,再传右边的。
  • 主体别写死。“图1中的主体”谁都能套,人或动物都行。Hotel Lobby Video 生成器唯一会改的,是照片的排法(两张单人照,或一张合照),以及你上传自己片段时的动作。
  • 画幅写在设置里,不写在文字里:在那里选 9:16、16:9 或 1:1。
  • 没有参考视频?那就得用文字描述录音棚和动作,没法再指着视频1 说事。Dreamina 等工具针对这种情况发布了自己的纯文字提示词。生成器真正发送的只有上面两段。

纯照片的 Hotel Lobby AI 提示词(不用参考视频)

很多图生视频工具收参考照片,却不收参考视频。下面五段提示词用文字把房间和编排讲清楚,能直接贴进只收两张图的工具。它们守住了这个格式的辨识点:每侧一张照片、一支吊麦、一人领唱一人反应、镜头不动。这些是为本页写的,不是 Hotel Lobby Video 生成器发送的内容;各工具理解提示词的方式不同,做好重试一两次的准备。

情侣版 Hotel Lobby AI 提示词

情侣(9:16,12 秒)
根据两张参考照片,生成一条 12 秒、9:16 的竖屏视频。左边是图1中的人,右边是图2中的人,两人全身出镜,脸、头发、衣着和身高都和各自的照片保持一致。这是一对情侣,在一间朴素、照明均匀的橙色摄影棚里对唱一段说唱:墙面和地板都是橙色,屋里再无他物。正中间用一根细缆线从天花板吊着一支银色电容麦克风。左边的人对着麦克风说唱,手势干脆有自信;右边的人一边笑一边伸手指他,踩着节拍跳舞,到最后一句时探身凑近麦克风。机位固定在胸口高度,整段一个镜头:不剪切,不变焦,不摇镜。画面里没有其他人,没有字幕,没有标志。

一对好朋友

好朋友(9:16,12 秒)
根据两位成年挚友的两张参考照片,生成一条 12 秒、9:16 的竖屏视频。图1在左,图2在右,两人全身出镜,每个人的长相、发型、服装和身材都与照片一模一样。场景是一间朴素的橙色摄影棚,墙和地面无缝连成一片橙色,两人之间从天花板垂下一支银色麦克风。前一半时间,左边的朋友对着麦克风说唱,右边的朋友点头、咧嘴笑,用大幅度的动作给他打气;后一半两人对调,左边的朋友改为做反应。两人的动作彼此独立,绝不做成镜像。机位固定,一镜到底,光线柔和均匀,两人的身体和双脚都在画面内。不要多余的人、道具、文字或标志。

祖辈和成年的孙辈

祖辈和成年孙辈(9:16,12 秒)
根据两张参考照片,生成一条 12 秒、9:16 的竖屏视频。左边是图1中的一位长辈,右边是图2中他已成年的孙辈,两人全身出镜,各自保留照片里的脸、头发、衣着和身高。两人在一间朴素的橙色摄影棚里对唱说唱,中间从天花板垂下一支银色麦克风。长辈对着麦克风说唱,动作缓慢、稳重又有底气;孙辈一脸不敢相信,笑着踩节拍跳舞,到最后一句时也跟着唱起来。两人的动作都自然、不吃力。固定机位,一个连续镜头,棚内光线均匀:不剪切,不变焦,不摇镜,没有其他人,没有字幕。

卡通或动漫角色

只用你自己创作或拥有权利的角色;知名角色是别人的财产。

手绘角色(9:16,12 秒)
根据两张原创插画角色的参考图,生成一条 12 秒、9:16 的竖屏视频。左边站着图1中的角色,右边站着图2中的角色,都是全身出镜,画风、配色、比例和服装都严格沿用原图,并且两个角色都用这同一种画风来呈现。两人在一间朴素的橙色摄影棚里对唱说唱,中间从天花板垂下一支银色麦克风。左边的角色对着麦克风说唱,手部动作夸张生动;右边的角色做出反应,伸手指向对方,踩着节拍跳舞。固定机位,一个连续镜头,不剪切,不变焦,不摇镜。不要多出来的角色,不要文字,不要标志。

宠物版 Hotel Lobby AI 提示词

最早火起来的 Hotel Lobby 视频里就有猫和狗,都是用别的工具做的(看几条)。每只动物给一张清晰、全身入镜的照片。

宠物(9:16,12 秒)
根据两张宠物参考照片,生成一条 12 秒、9:16 的竖屏视频。左边是图1中的动物,用后腿直立;右边是图2中的动物。两只动物各自保留照片里的品种、脸型、眼睛颜色、毛色花纹、体型和项圈。它们在一间朴素的橙色摄影棚里,中间从天花板垂下一支银色麦克风。左边的动物随着节拍张合嘴巴,用前爪比划,仿佛正对着麦克风说唱;右边的动物跟着节拍晃脑袋,看向镜头,随节拍扭动。身体结构要正常:每只四条腿、一条尾巴,从耳朵到爪子完整地出现在画面里。固定机位,一个连续镜头。没有人,没有多余的动物,没有文字。

Hotel Lobby Video 生成器内置了提示词,人和动物都适用;猫狗说唱页面打开时已经按“一只宠物加一位搭档”设好。狗配人是结果最稳定的组合;猫,或者两只动物同框,把握小一些,所以先从最清楚的照片开始。

生成翻车时怎么办

你看到的可能的原因怎么改
脸慢慢变成了陌生人侧脸、戴墨镜,或脸在画面里太小换一张正脸、光线好的半身照
左右两人换了位置提示词里没把每张照片和一侧对应起来写明哪张图是左边的表演者,哪张是右边的
画面里多出一个人参考视频里的人或照片背景里的人被照抄了保留“不要多余的人”和“忽略照片背景”
屏幕上冒出文字模型自作主张加了字幕保留“画面上不要字幕或文字”
嘴型和声音对不上没附音频,或音频开头是空白附上音轨,并剪到从第一个字开始
橙色四周出现黑边要求了参考视频里没有的运镜沿用参考视频的构图,并要求橙色铺满画面
音轨被换成了别的音乐模型会自己作配乐,Seedance 2.x 就是这样换成会保留参考音轨的模型,比如 Wan 3.0

不想自己写提示词?

Hotel Lobby Video 已经把这段提示词、参考视频和参考音轨全部接好。放进两张照片,点生成就行。Wan 3.0、480p、12 秒,要 6 积分。

不用写提示词:放两张照片就行

问答

Hotel Lobby AI 提示词里应该写什么?

橙色录音棚、两人中间的一支吊麦、哪张照片在左哪张在右,以及每个人做什么。上面的 Wan 3.0 提示词,就是 Hotel Lobby Video 生成器每条标准视频都会发送的那一段。

哪些视频模型能跑这段提示词?

第一段发给 Wan 3.0,它会保留参考音轨;AI 说唱版发给 Seedance 2.x,它会自己作曲。两者都接收参考图片、参考视频和参考音频。其他模型的附件写法各不相同,也未必三种输入都收。

我只有两张照片,没有参考视频,该用哪段?

用五段纯照片提示词里的一段:情侣、好朋友、祖孙、角色或宠物。它们用文字描述录音棚和动作,所以不需要视频。照片按你的工具要求的方式命名,左右别搞混。

有给我家猫狗用的 Hotel Lobby 提示词吗?

有,就是上面的宠物版:每只动物一张照片、各占一侧、后腿站立、身体结构自然。在 Hotel Lobby Video 上可以不用它,[猫狗说唱页面](/dog-and-cat-rap-video)已经预设好一只宠物加一位搭档。狗配人是最稳妥的组合。

这些提示词在可灵(Kling)或 Dreamina 里能用吗?

纯照片的几段是写给任何能收两张参考照片的图生视频工具的,可灵和 Dreamina 都算在内。但它们不是针对这两个工具专门写的,所以要准备好改写法、多试几次。

完全不写提示词,能做 Hotel Lobby AI 视频吗?

能,用两张照片生成器就行。在 Hotel Lobby Video 上提示词是内置的,你只需要上传照片。

参考资料

Hotel Lobby Video 为独立运营的工具,跟 Quavo、Takeoff、Migos、Quality Control Music、Motown 以及 COLORS 都没有任何合作或从属关系。