H3提示词Skill读后心得两三点
读了下H3的提示词Skill(https://github.com/MiniMax-AI/MiniMax-H3/blob/main/skills/h3-prompt-writing/),大概有些心得和大家分享一下。要先生成好的视频提示词,先判断任务类型。材料只有文字时,提示词按 T2VA 写,直接从三个字段开始。一旦有了第一帧,Picture 1 就成了 0.00 秒的画面起点,这时用 I2VA,后面要写画面里的人和物如何继续动。首尾两帧都给出时,FL2VA 要把中间路径补齐,让开头状态一步步走到结尾状态。只拿到最后一帧的情况下,L2VA 得先推一个合理的前置状态,再让动作和构图落到尾帧,和参考图对上。
图片对齐说明放第一行。I2VA 要写 Picture 1 在 0.00 秒被完整参考,FL2VA 要把 Picture 1 对到 0.00 秒,把 Picture 2 对到最终时长 S.SS 秒。L2VA 只写 Picture 1 对到最终镜头的 S.SS 秒。这一行后面空一行,正文才进入 integrated_multimodal_description、overall_soundscape 和 non_diegetic_music 三个字段。
三个字段按顺序写。integrated_multimodal_description 写时间线上看得见和听得见的东西。它从风格和人物写起,接着写动作和镜头,也写台词和同期声。overall_soundscape 用一到四句概括全片的声音。它写环境声和动作声,也写没有语义的人声。non_diegetic_music 用一到三句写观众能听到而角色听不到的音乐。它写乐器和节奏,再补速度和音量变化。没有配乐时写 N/A,用户明确要求完全静音时才把 overall_soundscape 写成 N/A。
镜头要编号。Shot 1 不加时间。后面的镜头用递增时间,时间要落在总时长内,并写到毫秒。普通切换用 cuts to 或 transitions to。只是距离或小角度变化时,优先写摄像机运动,比如第二镜头只把画面从门口摇到桌上,就不必新开一个镜头。
摄像机运动写动作,不堆标签。一个完整表达可以包含运动类型、幅度和速度。幅度小写 with small amplitude,速度慢写 at slow speed,普通中幅和常速可以省。比如 The camera pushes in with small amplitude at slow speed toward the folded letter in her hands. 这句写的是镜头缓慢小幅度推近她手里的信。
有人说话时给稳定 ID。说话者按出场顺序用 (S1) 和 (S2) 标记,多人一起说时换成 (S1,S2)。台词放 <d> 里,保留原字和标点,不翻译。画外音要写 says in an off-screen voiceover,并补一句角色嘴唇闭合。屏幕里出现的招牌或字幕放英文双引号,连原文和标点也一起保留。
案例能帮检查细节。面包店例子属于 T2VA,从开门和放面包写起,再补蒸汽和切片声。火车窗例子属于 I2VA,先保留 Picture 1 里的女人和车厢布局,再写她抬眼看灯,折信。雨中骑车的 FL2VA 例子要补两张图之间的路径,写她松开把手,再举伞打开伞面,最后落到 Picture 2。碎杯的 L2VA 例子从完整玻璃杯写起,让手指碰杯沿,杯子坠落,地上散开碎片,最后碎片位置对上 Picture 1。
写完后先查图片时间有没有写准,再查字段有没有写全。镜头时间要递增,台词和屏幕文字都要按原样保留。
- 点赞
- 收藏
- 关注作者
评论(0)