MiniMax H3 提示词必须用严格格式吗?图片、视频和音频的多素材模板怎么写?一文详解
2026/08/11

MiniMax H3 提示词必须用严格格式吗?图片、视频和音频的多素材模板怎么写?一文详解

海螺3提示词怎么写?这份 MiniMax H3 教程用六段公式拆解素材定义、保留关系、分镜时间轴、台词、环境声和配乐,并附可直接改写的完整模板。

我把网上流传的 MiniMax H3 六段提示词模板和官方 API 文档并排看了一遍,发现了一个必须讲清的区别。

六段结构确实好用。素材一多,它能逼着人把角色、场景、动作、运镜和声音逐项分开。但它不是 API 的强制语法。MiniMax 官方示例可以直接提交自然语言提示词;官方另有一个 H3-Context-IR 接口,专门把文字、图片、视频和音频整理成更完整的结构化提示词。

所以,这篇文章不会把模板包装成“少一个字段就跑不动”的玄学格式。我把它当成一套复杂项目的制作清单:简单任务可以删减,Omni-Reference 多素材任务再完整展开。

六段模板到底管什么

先把 API 层和提示词层分开。H3 可以接收文字、图片、视频和音频,但不是任意组合:首尾帧属于图生视频;参考图片、参考视频和参考音频属于 reference-to-video;官方 API 不允许把这两类输入放在同一个请求里。

MiniMax 官方视频生成文档公开的素材角色包括:

  • first_framelast_frame:首帧和尾帧图片
  • reference_imagereference_videoreference_audio:参考图片、视频和音频
  • 一条必填的文本提示词

这些是 API 请求里的 role。而 <Subject1><Picture1><Video1><Audio1> 是我们写在提示词里的别名,目的是让前后指代不乱。它们不是 API 枚举值。

这些别名不会与上传素材自动绑定。本文约定按同类素材的上传顺序编号,并在提示词开头明确说明每个标签指向什么;这只是写作约定,官方并未保证会对这类 XML 风格标签做特殊解析。

fully_preservedattribute_transfer 这类保留关系也是同理:适合拿来整理约束,但官方 API 不会把它们当成独立字段校验。模型读到的仍然是一段文本。

一句话概括:

API 角色负责把素材传进去;提示词标签负责说明每份素材提供什么、不能带入什么,以及在哪个镜头生效。

MiniMax H3 Omni-Reference 六段提示词结构

完整结构分六部分:

  1. subject_definitions:定义人物、物体、场景、动作和声音来源。
  2. summary:交代成片目标,并给每份素材分配任务。
  3. retention_analysis:写清哪些特征必须保留,哪些可以改,哪些只做弱参考。
  4. detailed_description:按播放顺序写出每个镜头真正能看到、听到的内容。
  5. overall_soundscape:描述画面世界里真实存在的声音。
  6. non_diegetic_music:描述只有观众能听见的配乐。

这个顺序的价值在于不漏项:先盘点素材,再决定约束,最后写分镜。模型未必要求你按这个次序,但人按这个次序写,出错会少很多。

第一段:定义 Subject,不要只报文件名

文件只是容器。真正要复用的是文件里的某个元素。

一张人物图可以提供脸、发型、服装和身材比例;一张室内图可以提供空间布局;一段视频可能只提供“走到窗边坐下”的动作,里面的演员、背景、声音都不该带进新视频。

可以这样拆:

subject_definitions:

<Subject1> is the night-shift editor whose facial identity, short dark
hair, navy overshirt, and body proportions come from <Picture1>.

<Subject2> is the apartment interior from <Picture2>, including the
floor-to-ceiling window, low sofa, reading lamp, and city view.

<Subject3> is the slow walk-and-sit motion from <Video1>, transferred
to <Subject1>. Do not copy the performer or background from <Video1>.

<Audio1> is the voice-timbre reference for <Subject1> (S1). It provides
vocal tone and pacing only; do not copy its original words.

这几行把四件事说死了:

  • <Picture1> 负责人物身份和穿着。
  • <Picture2> 负责房间。
  • <Video1> 只交动作,不交演员和背景。
  • <Audio1> 只参考音色和说话节奏,不复制原台词。

图片需要控制构图或外观时,可以单独定义 <PictureN>。如果它必须成为真正的首帧或尾帧,请改用图生视频请求,并给图片设置 first_framelast_frame;不要再与 reference_videoreference_audio 混在同一个请求里。如果图片只是提供脸或衣服,把它写进 Subject 定义就够了。

<VideoN> 更适合表示整段视频关系,例如续写原视频、修改原视频、参考剪辑节奏或运镜。如果只取其中一个动作,就把动作抽出来定义成 Subject,并顺手写清不要继承什么。如果续写本身就是目的——你在把分段串成 60 或 120 秒的成片——H3 长视频规划器可以替你把每段提示词写好。

第二段:Summary 不是剧情简介

“一个男人雨夜回家,看着窗外”只能算故事梗概。

模型更需要的是制作说明:成片多长、谁出现、每份素材各管什么。

summary:

[reference generation + audio reference] Create a 12-second cinematic
interior scene in which <Subject1> enters <Subject2>, sits beside the
window, and speaks one quiet line. <Picture1> supplies identity,
<Picture2> supplies the environment and composition, <Video1> supplies
the walk-and-sit motion, and <Audio1> supplies voice timbre only.

方括号里的任务类型可以保留,方便自己或团队成员快速检查,但它只是提示词里的辅助标记,不能代替 API 的素材 role

最忌讳的是一句 “Use Video1 for everything”。一份素材承担三个任务,就把三个任务分别列出来;有明确不需要的内容,也一起写掉。

第三段:给每条参考关系定强弱

同一张图里,人脸可能不能动,衣服却可以换;同一段视频里,动作需要迁移,运镜只想借一点节奏。所有参考都写成“完全保留”,最后很容易互相打架。

视觉素材通常可以分成四种关系:

  • fully_preserved:身份、产品结构、服装、场景布局或关键帧必须稳定。
  • partially_preserved:保留指定部分,同时允许改动已说明的特征。
  • attribute_transfer:把动作、表情、服装或其他属性迁移给另一个主体。
  • weak_reference:只借氛围、色彩、构图或节奏,不要求逐项一致。

音频方面,公开 API 提供的是 reference_audio。提示词可以要求参考音色、语气、节奏或声音质感,但这不等于逐样本复制原信号。必须原样保留的录音,应留到后期合成。

前面的雨夜公寓可以这样写:

retention_analysis:

<Subject1> (Shots 1-3): fully_preserved — retain facial identity, short
dark hair, navy overshirt, and body proportions.

<Subject2> (Shots 1-3): partially_preserved — retain room layout,
window position, sofa, and lamp; change the exterior from sunset to rain.

<Subject3> (Shots 1-2): attribute_transfer — transfer only the walking,
turning, and sitting motion to <Subject1>.

<Video1> (timing): weak_reference — borrow the unhurried pace, not its
camera angle, performer, environment, or audio.

<Audio1>: reference — follow the low, tired timbre and measured delivery;
do not copy the original signal or words.

标签后面那半句比标签本身更重要。不要只写“完整保留角色”,要点名脸、发型、服装、身材比例和标志性配饰。

第四段:把故事改成镜头里能看见的东西

detailed_description 才是正文。

“他疲惫地回到家”无法直接拍。换成下面这种写法,画面才有执行顺序:

[Shot1] A medium-wide shot faces the apartment entrance. <Subject1>,
the short-haired editor in a navy overshirt, enters from frame left and
closes the door with his right hand. His shoulders hang low. The camera
makes a slow handheld pan to the right. Wet shoes squeak once on the floor.

每个镜头按下面的顺序写,基本不会乱:

  1. 景别和构图
  2. 主体在画面里的位置;第一次出现时补关键识别特征
  3. 一个主要动作
  4. 能看见的状态变化,例如表情、姿势、灯光或物体位置
  5. 运镜;不运镜就明确写静态机位
  6. 本镜头发生的声音和台词

第一镜头可以不写时间。后面的镜头写切换时刻:

[Shot2] At 00:04.000, cut to a side medium shot...
[Shot3] At 00:08.000, cut to a close-up...

时间戳表示新镜头从什么时候开始,不是动作要持续多久。要反过来检查:这个时间段内,动作真的做得完吗?

四秒钟让人物穿过一个小房间再坐下,勉强合理;四秒内让他进门、脱外套、烧水、接电话、走到窗边、坐下、说台词再反应,动作一定会丢。

一个短镜头只放一个主要动作。复杂事件拆镜头。

台词和说话者编号

有台词时,可以给每个声音来源固定编号:

<Subject1> (S1) says in a low, tired voice,
<d>[Chinese] 我还以为雨停了。</d>

同一个角色后面继续说话,仍然用 (S1)。画外音要写明 speaking off-screen。不要写“他说了一句关于雨的话”,直接把完整台词放进去。

<d>...</d> 和语言标签不是官方 API 的硬性语法,但实用:台词边界清楚,语言不容易猜错,旁白也不容易混进人物对白。

第五段:环境声只写画面世界里的声音

overall_soundscape 写的是角色也能听到的声音:

overall_soundscape:

Low apartment room tone, steady rain against the window, one wet shoe
squeak, soft fabric movement, a distant elevator bell, and the ceramic
click of a mug touching the side table.

别把完整台词重复到这里。台词跟着具体镜头写,口型和时间才有落点。

“电影感环境音”还是太虚。雨点打窗、冰箱低鸣、纸张摩擦、电梯提示音、远处车流,这些才是能落地的声音。

第六段:把观众听到的配乐单独列出来

non_diegetic_music 是画面里的角色听不到的配乐:

non_diegetic_music:

A sparse felt-piano motif at a slow tempo, very low in the mix. Hold
silence under the spoken line, then return with one unresolved note as
the final close-up holds.

通常写清四件事就够了:乐器、速度、情绪方向、什么时候停或变化。不需要配乐就写 N/A,或者直接写 no non-diegetic music

可直接复制的六段模板

subject_definitions:

<Subject1> is [人物、动物、物体、动作或场景], whose
[身份 / 外观 / 动作] comes from <Picture1> or <Video1>.
<Picture2> is the [构图 / 外观] reference for [ShotN].
<Video1> supplies [整段运镜 / 剪辑节奏 / 源视频 / 续写关系].
<Audio1> supplies [音色 / 语气 / 节奏 / 声音质感].

summary:

[任务类型] Create a [时长]-second video showing [人物、场景和核心事件].
[素材] supplies [一项明确任务].

retention_analysis:

<Subject1> (Shots [N-N]): [fully_preserved / partially_preserved /
attribute_transfer / weak_reference] — [必须保留和允许修改的具体特征].
<Audio1>: [reference / weak_reference] — [参考什么,不得复制什么].

detailed_description:

The target video uses [一个主风格] with [光线、色彩和质感].

[Shot1] A [景别] shows [构图]. <Subject1> is at [画面位置].
[一个主要动作]. [能看见的状态变化]. The camera [运镜或静止].
[环境声或台词].

[Shot2] At [镜头开始时间], cut to [构图]. [一个主要动作].
<Subject1> (S1) says in [声音描述],
<d>[语言] 完整台词。</d> The camera [运镜或静止].

[Shot3] At [镜头开始时间], cut to [构图]. [一个主要动作].
The shot ends on [明确的最后一帧状态].

overall_soundscape:

[室内底噪、天气、脚步、衣物、道具碰撞和其他真实声音].

non_diegetic_music:

[乐器、速度、情绪、音量和音乐变化;不需要就写 N/A].

没有的素材直接删。只上传一张图片,不需要硬凑 <Video1><Audio1>。模板是检查清单,不是填表比赛。

如果图片必须作为真正的首帧或尾帧,请退出这套 reference 模板,改用带对应 API 角色的图生视频请求。

八个最常见的坑

1. 上传一张图就把它当关键帧

人物身份图不等于首帧。先判断你要的是脸、衣服,还是这张图的完整构图。只有画面本身要锁住,才把它当关键帧。

2. 只取动作,却让整段 Video 参与生成

要手势就定义手势并迁移。直接笼统引用整段视频,演员、背景、运镜和声音都可能被一起带进来。

3. 只写“参考这张图”

到底参考脸、衣服、房间布局、运镜还是音色?必须点名。

4. 一份素材包办所有事情

“Use Video1 for everything”最容易制造冲突。外观、动作、节奏、运镜和声音分开写。

5. 只讲剧情,不写画面

“发生了一场紧张的面试”是故事。人物站位、先后动作、表情变化、运镜和台词时间才是分镜。

6. 一个镜头塞太多动作

先减动作,再加风格。一个做完整的四秒动作,比八个半截动作更有用。

7. Subject 和说话者编号前后乱跳

角色一旦是 <Subject1>(S1),整条提示词都别改。

8. 把参考音频当成原样配乐

“希望保留这段录音”和“只参考它的音色”是两种不同意图。公开的参考角色不保证原信号会被精确复用;必须原样留下的录音,应在后期合成。

三步写完一条复杂提示词

第一步:先做素材账本

每个文件都补全一句话:“这份素材提供___,但不能提供___。”大部分素材冲突,在生成前就能抓出来。

第二步:先拆分镜,再补风格

按总时长切成几个合理区间。每段只放一个主要动作,并写出镜头最后停在哪里。骨架定完,再加光线、色彩和质感。

第三步:一次只改一个约束

依次检查人物一致性、动作是否做完、台词时间、最后一帧能否接下一条片。哪项失败就改对应那一句。整段推倒重写,下一次即使变好,也不知道是哪条指令起作用。

最后结论

MiniMax H3 接收提示词时,并不要求必须出现六个标题。真正需要六段结构的,是面对一堆人物图、场景图、动作视频、声音参考和保留条件时容易写乱的人。

先给素材分工,只锁真正重要的特征;再把事件拆成按时间播放的可见镜头;环境声和配乐分开。任务简单就删减,任务复杂再完整展开。

如果只用文字,或使用本站界面当前提供的图片输入,可以先在 MiniMax H3 生成器测试提示词,也可以去海螺3 提示词库找结构。涉及参考视频、参考音频或本站界面未提供的素材角色时,请使用官方 API,并查看 MiniMax H3 API 指南。想先了解模型边界,可以继续读海螺3 是什么MiniMax H3 与 Seedance 对比

免费试用

立即用 GPT Image 2.5 生成你的第一段视频

支持文生视频与图生视频,并提供可直接使用的提示词案例,帮助你快速开始创作。无需下载,打开浏览器即可使用。