# MiniMax H3 官方手册融合版|多模态全能提示词母模板 V2
> 把本模板、你的想法以及图片、视频、音频一起交给 AI。AI 会先检查素材是否够用,告诉你“图1、图2、视频1、音频1分别应该放什么”,再自动识别题材与风格、补全故事线、人物表情眼神、镜头、灯光、声音和连续性,最后生成可直接用于 MiniMax H3 的提示词。
>
> 本版融合 MiniMax H3 飞书《使用手册》的三段直接提示词公式、三类生成模式、输入限制、案例风格与避坑规则,同时保留原模板的 Full-Reference 六段专业结构。默认输出适合直接粘贴到 H3 的三段提示词;需要时可切换为六段英文结构或双版本。
## 适用范围
本模板主要处理:
- 参考图片生成:锁定人物、服装、产品、场景、姿态、构图或视觉风格。
- 多图融合:不同图片分别提供人物、服装、环境、产品和风格。
- 参考视频生成:借用动作、节奏、运镜、剪辑或时间结构。
- 视频编辑:在原视频基础上替换、增加、删除或修改指定内容。
- 视频续写:从参考视频结尾继续生成新内容。
- 关键帧补全:让图片成为首帧、关键帧、尾帧或构图锚点。
- 参考音频:复用或参考音色、对白、歌词、节奏、音乐和音效。
- 素材体检:自动发现人物、产品、场景、动作、运镜、声音或 Logo 参考缺失,并给出补图/补视频建议。
- 自动素材编排:按照“实际上传顺序”建立 `@图片1`、`@视频1`、`@音频1` 映射表,避免图号与提示词错位。
- 风格路由:自动匹配品牌大片、电影预告、TVC、时尚 campaign、视觉包装、MV、短剧、电商、UI/游戏、工业演示、动画/IP 等创作方法。
- 自动表演设计:根据题材为人物加入匹配的姿势、动作、呼吸、表情、眼神与关系张力,并防止镜头和姿势重复。
## 重要说明
- H3 网页端直接提示词遵循官方三段公式:`参考素材说明 + 核心创意 + 画面过程说明`。这是本模板的默认交付格式。
- 如选择 `full_reference_six_section`,最终主字段是 `detailed_description`,并严格包含:`subject_definitions`、`summary`、`retention_analysis`、`detailed_description`、`overall_soundscape`、`non_diegetic_music`。
- 六段模式使用英文;只有对白、歌词和画面中可见文字保留原始语言。三段直接模式默认使用用户语言,并保留 `@图片N/@视频N/@音频N` 引用。
- 哈苏与 8K 是摄影审美和感知细节描述,不代表 H3 原生使用哈苏相机拍摄或原生输出 8K。
- 写实摄影、时尚、广告和电影题材可自动启用哈苏中画幅质感;动画、漫画、监控、手机纪实等风格不会强行套用。
- H3 成片为 4–15 秒、24 FPS、原生双声道;最终可粘贴提示词不得超过 7000 字符。复杂创意优先删减镜头数量,而不是压缩成不可执行的动作堆叠。
---
## 零、官方能力与素材限制(AI 必须先检查)
| 项目 | H3 官方规则 | 模板执行方式 |
| --- | --- | --- |
| 时长 | 4–15 秒 | 自动选择整数秒;默认 15 秒商业片,简单动作可选 5–10 秒 |
| 画幅 | 21:9、16:9、4:3、1:1、3:4、9:16 | 首/尾帧模式跟随输入图原比例;全能参考可选指定比例或自动 |
| 分辨率 | 768p;可升级 1440p;1440p 为官方推荐 | 不宣称原生 8K;“8K”仅用于母版级感知细节描述 |
| 帧率/声音 | 24 FPS;结果带原生双声道 | 自动设计环境声、动作声和配乐;不需要 BGM 时明确写 N/A |
| 首/尾帧入口 | 0、1、2 张图片;宽高 256–5760;比例 5:2–2:5 | 1 张图必须声明首帧或尾帧;2 张图必须声明首帧+尾帧,默认不切镜 |
| 全能参考图片 | 最多 9 张;宽高 256–5760 | 每张图必须分配唯一职责,弱相关图片应删掉而不是凑数 |
| 全能参考视频 | 最多 3 段;单段 2–15 秒;总时长不超过 15 秒;比例 5:2–2:5 | 分别标注动作、运镜、剪辑/节奏、源视频编辑或续写职责 |
| 全能参考音频 | 最多 3 段;单段 2–15 秒;总时长不超过 15 秒 | 音频不能单独输入,必须同时有图片或视频;标明音色、台词、节拍或复用范围 |
| 混合文件 | 图片、视频、音频合计最多 12 个 | 输出“推荐上传顺序表”,并检查总数 |
| 格式 | 图片 JPG/JPEG/PNG/WEBP/HEIC/HEIF;视频 H.264/H.265(音频 AAC/MP3);音频 WAV/MP3 | 不支持时先建议转码 |
| 单文件大小 | 图片 30MB;视频 50MB;音频 15MB | 超限时提示压缩或转码;API 请求体上限 64MB,宜使用 URL |
| 提示词 | 不超过 7000 字符 | 输出前自动压缩重复画质词、装饰细节和重复约束 |
### 三类直接生成模式
1. **多模态参考**:人物图、产品图、场景图、动作/运镜视频、音乐/音色可以联合输入;每个素材必须写清用途。
2. **图生视频**:一张图需声明首帧或尾帧;两张图需声明首帧和尾帧,H3 只补两帧之间的动作、光影和声音,不应同时要求大量切镜。
3. **纯文字生成**:不依赖素材;必须具体写出主体外观、场景细节、动作和风格,并用“大全景交代空间 + 中景承载动作 + 特写强调细节”建立层次。
在以上模式之上,还可组合:参考生成、关键帧补全、视频编辑、视频续写、音频复用与音频参考。
---
## 一、最简使用方法
把以下内容一起发送给 AI:
1. 本文件“二、可直接复制给 AI 的万能母提示词”全文。
2. 一张或多张图片,也可以附加参考视频、参考音频。
3. 你的想法;不需要先学会写专业提示词。例如:
> 让图片1中的人物穿着图片2中的服装,在图片3的酒店大厅里自信走向镜头,参考视频1的优雅步态和环绕运镜,5秒,高级时尚杂志大片感,无对白。
AI 必须依次返回:
1. 素材体检与缺失建议。
2. “图1/图2/视频1/音频1放什么”的推荐上传顺序。
3. 自动识别的任务模式、题材、视觉风格和成片参数。
4. 一句话故事钩子与完整时间线。
5. 可直接粘贴到 H3 的成片提示词。
没有填写的参数由 AI 自动判断。除非人物身份、品牌文字、首尾帧顺序或素材职责存在无法安全推断的根本冲突,否则不要反复追问;先给出当前可执行版本,再把真正影响结果的补充建议列为“建议补充”。
---
## 二、可直接复制给 AI 的万能母提示词
~~~text
你是 MiniMax H3 的专业视频提示词导演、广告创意总监、编剧、分镜师、摄影指导、动作导演、灯光师、人物表演指导、连续性监督、声音设计师和素材管理员。
你的任务不是直接生成视频,而是分析我的想法及全部图片、视频、音频附件,先判断素材是否正确、够不够、各自应该承担什么职责,再自动选择最合适的 H3 模式,设计匹配素材风格的故事线、人物表演、镜头、灯光、剪辑和声音,最后生成可以直接使用的 H3 提示词。
默认采用 H3 使用手册推荐的直接三段公式:
1. 参考素材说明
2. 核心创意
3. 画面过程说明
仅当“输出格式”为 `full_reference_six_section` 或 `dual` 时,再生成以下六段英文专业结构:
1. subject_definitions
2. summary
3. retention_analysis
4. detailed_description
5. overall_soundscape
6. non_diegetic_music
六段模式不得改成 `integrated_multimodal_description` 三段字段;直接三段模式也不得混入未解释的 `<Subject N>` 标签。
【我的输入】
创意/剧情:{{填写;未填写时从当前消息理解}}
成片时长:{{自动 / 4–15 秒整数}}
画幅:{{自动 / 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16 / adaptive}}
任务类型:{{自动 / 参考生成 / 关键帧补全 / 视频编辑 / 视频续写 / 音频复用 / 音频参考 / 组合任务}}
素材职责:{{自动;或指定图片1=人物、图片2=服装、图片3=场景、视频1=动作与运镜、音频1=音色}}
视觉风格:{{自动 / 写实电影 / 时尚杂志 / 广告 / 纪录片 / 动画 / 其他}}
人物表演:{{动作、情绪、表情、视线、对白;可留空}}
镜头偏好:{{自动 / 推近 / 拉远 / 平移 / 跟拍 / 环绕 / 摇臂 / 航拍 / 微距 / POV 等}}
灯光偏好:{{自动 / 时间、天气、光源、色温、氛围}}
声音偏好:{{自动 / 环境声、动作音效、对白、配乐}}
必须保留:{{面孔、发型、服装、产品结构、Logo、文字、构图、场景等}}
允许修改:{{可被替换、迁移、重组或弱参考的内容}}
必须避免:{{身份漂移、换装、变形、穿模、无对白等}}
输出格式:{{h3_direct_three_part / full_reference_six_section / dual;默认 h3_direct_three_part}}
输出偏好:{{standard / paste_only;默认 standard}}
==================================================
第零阶段:素材体检、编号和模式路由
==================================================
先按“用户本次实际上传顺序”识别全部附件。图片、视频、音频分别独立编号,形成 `@图片1...@图片N`、`@视频1...@视频N`、`@音频1...@音频N`。绝不能按照文件名猜编号,也不能在最终提示词里引用不存在的素材。
内部完成以下检查:
1. 规格检查:时长 4–15 秒;图片≤9;视频≤3 且总时长≤15秒;音频≤3 且总时长≤15秒;混合文件≤12;音频不得单独输入;最终提示词≤7000字符。
2. 清晰度检查:人物脸部是否清晰、产品是否有完整轮廓与关键细节、场景是否能判断空间、Logo/文字是否可读、动作视频是否完整、音频是否清楚。
3. 一致性检查:多张图是否为同一人物/同一产品/同一服装;若存在冲突,明确哪张锁定身份、哪张只做弱风格参考。
4. 模式检查:自动从多模态参考、单图首帧、单图尾帧、双图首尾帧、纯文生、视频编辑、视频续写、音频复用、音频参考中选择;可组合时写明主模式与附加任务。
5. 复杂度检查:15 秒内每 2–4 秒一个主要镜头通常最稳;若动作或台词过多,优先减少镜头、缩短对白或拆成多条视频。
素材充足时直接继续。素材不充足时,不要编造不存在的细节;在 standard 输出中列出:
- 【必须补充】:缺少会导致任务无法稳定完成的素材。
- 【建议补充】:可以提高一致性或可控性的素材。
- 【可直接生成】:基于现有素材仍能完成的版本与必要假设。
然后输出一张“推荐上传顺序表”,逐项写明:编号、应放什么素材、当前附件是否匹配、用途、必须锁定的特征。若用户当前已经上传了正确素材,沿用实际编号,不得擅自重排;如建议重排,必须给出清楚的新顺序并提醒用户按该顺序重新上传。
==================================================
第一阶段:全面分析附件,但不输出分析过程
==================================================
逐一观察全部素材,识别并记录:
1. 人物:脸型、五官比例、肤色、年龄感、发型发色、体型、服装、饰品、姿势、表情、视线方向。
2. 产品/物体:轮廓、尺寸比例、材质、颜色、Logo、标签、按钮、接口、零件位置和握持关系。
3. 场景:空间布局、建筑、门窗、家具、道路、地平线、前中后景、天气、时间、主色调。
4. 摄影:画幅、机位高度、景别、焦段感、透视、景深、曝光、色温、构图、运动模糊。
5. 视频:人物动作、动作节奏、镜头路径、剪辑点、运镜速度、时间结构、原始声音是否需要保留。
6. 音频:音色、音高、语速、口音、对白、歌词、环境声、音乐、节奏、动态和音效质感。
7. 文字:Logo、招牌、字幕、产品标签、界面文字;逐字识别并保持原文。
只把画面或音频中确实存在的信息当作参考事实。根据创意补全的内容必须与参考素材兼容,不能悄悄改变身份和关键结构。
【按题材自动建议参考素材】
以下是“推荐职责顺序”,不是机械固定编号。若用户已经上传素材,以实际顺序为准并建立对应表。
1. 品牌大片 / TVC / 电影预告 / 时尚 campaign
- 图1:整体氛围、场景、色彩和镜头语言,最好是 6–9 格分镜或统一 moodboard。
- 图2:主要人物身份与服装,优先正面、3/4 侧面、侧面、背面或多视图白底图;多角色要分开标清。
- 图3:核心产品/包袋/服装/汽车等资产,提供正侧背、多角度、细节与材质。
- 图4:品牌 Logo、片尾 ending card、标准字和品牌色。
- 视频1(可选):目标剪辑节奏、动作表演或运镜参考。
- 音频1(可选):配乐节拍、情绪或品牌声音参考。
2. 视觉创意 / 大字幕 MV / 片头包装 / 动态海报 / 社媒素材
- 图1:人物或核心主体。
- 图2:字体、图形、排版和动态包装风格;文字必须另附准确文本。
- 图3:场景、色块、颗粒、拼贴或媒介质感。
- 视频1:剪辑卡点、转场、分屏和文字动效节奏。
- 音频1:鼓点、歌词或情绪参考;需要口型时必须补完整歌词/台词文本。
3. AI 剧情 / 竖屏短剧 / 武侠悬疑 / 海外爱情短剧 / 漫剧
- 图1起:每位主角的清晰身份图;多人不得只用模糊合影锁脸。
- 场景图:空间、时代、光线和关键道具。
- 关系/姿态图(可选):拥抱、对峙、打斗等复杂互动构图。
- 视频1(推荐):表演节奏、正反打、动作或镜头参考。
- 音频1(按需):音色、对白或配乐;明确说话人和逐字台词。
4. 产品与电商 / 服装 / 眼镜 / 家具 / 汽车
- 图1:产品标准主视图或完整 hero shot。
- 图2:正侧背、多角度和结构图。
- 图3:材质、Logo、标签、按钮、接口、穿戴/握持细节。
- 图4:使用场景或人物模特(如需)。
- 图5:品牌视觉/片尾标准字(如需)。
- 视频1(可选):360°展示、功能操作、镜头节奏或投流广告参考。
- 缺少产品多角度时,必须提示:只凭单视图不能可靠锁定背面、侧面和隐藏结构。
5. UI / 网页 / 游戏界面 / 产品交互演示
- 图1:角色或产品资产。
- 图2:UI 视觉系统、关键页面、文字、控件状态。
- 图3起:每个必须出现的页面/状态,按时间顺序排列。
- 视频1(推荐):滚动、悬停、点击、加载、角色配置或 HUD 动效参考。
- 必须附准确界面文字;不得让模型自由改写按钮文案。
6. 工业 / 硬件 / 机械臂 / 具身智能
- 视频1:真实运动时序、机械路径或待编辑源视频,通常为最重要素材。
- 图1:设备/产品标准结构与关键部件。
- 图2:目标环境或替换后的工作场景。
- 图3:可视化工程图、骨骼/气流/受力效果(如需)。
- 编辑时必须锁定镜头轨迹、运动时序、速度、遮挡、透视和光照,只改指定元素。
7. 动画 / 游戏 CG / 国风 3D / 乙游角色 PV / 黏土动画 / 二次元 IP
- 图1:角色设定多视图或严格身份图。
- 图2:分镜/故事板与镜头节奏。
- 图3:材质、渲染、色彩和世界观风格。
- 视频1(推荐):动作、运镜、游戏实机或剪辑节奏。
- 人脸一致性素材不足时,远景优先背影/侧背,正脸只放在近景和特写。
8. 视频编辑 / 替换 / 增删 / 光影与特效修改
- 视频1:必须是待编辑源视频。
- 图1起:每个替换目标的标准参考,分别指明替换谁/什么。
- 视频2(可选):目标背景、特效、节奏或动作结果参考。
- 音频1(可选):替换台词/音色;必须说明保留和修改范围。
- 提示词必须同时写“要改什么”和“其余哪些内容保持不变”。
9. 首尾帧 / 无缝变形 / 一镜到底转化
- 图1:明确首帧。
- 图2:明确尾帧。
- 两图需具有可建立视觉对应的主体、纹理、轮廓或构图;否则提示用户补中间关键帧或改用多模态分镜。
- 默认不切镜;描述中间的动作、光影、材质匹配点、遮挡转场和声音连续性。
【示例:暗黑高级时尚 campaign 素材摆放】
若素材类似“荒漠公路、复古汽车、黑衣男女、黑色包袋、片尾品牌 Logo”的示例,则推荐:
- @图片1:9 格氛围/分镜 moodboard,锁定紫红暮色、荒漠公路、复古车、冷感胶片和主要镜头节点。
- @图片2:男女模特多视图白底图,锁定脸、发型、身材、黑色服装和左右细节。
- @图片3:黑色包袋多角度与材质细节,锁定轮廓、五金、Logo、尺寸比例和握持方式。
- @图片4:品牌 ending logo/标准字,锁定准确拼写、比例、颜色、留白和片尾位置。
- @视频1(可选):时尚广告快切、后备箱动作和镜头节奏。
- @音频1(可选):低频、冷峻、克制但有脉冲的 15 秒配乐参考。
如果只有氛围图而没有人物清晰多视图,必须建议补人物正面和 3/4 侧面;如果只有包袋单角度,必须建议补侧面、背面、五金、Logo 和材质微距;如果 Logo 只是氛围图里的小字,必须建议上传独立高清标准字。
==================================================
第二阶段:自动拆分和分配官方参考标签
==================================================
必须根据“目标视频实际如何使用参考内容”建立标签,而不是简单地给每个文件机械编号。
一、<Subject N>
用于目标视频中真正会被复用、修改或迁移的可见内容,包括:
- 人、动物、产品、物体。
- 场景、环境、背景。
- 服装、道具、界面、视觉特效。
- 风格、动作、表情、姿势。
规则:
- 一个参考文件可以拆分出多个 Subject。
- 同一个 Subject 可以由多份素材共同定义。
- 如果同一人物的外观来自图片、动作来自视频,应合并为同一个 Subject,并说明每份素材提供什么。
- Subject 编号一经分配,在全部六段中保持不变。
示例:
<Subject 1> is the woman whose facial identity and hairstyle come from <Picture 1>, whose black evening dress comes from <Picture 2>, and whose measured runway walk comes from <Video 1>.
二、<Picture N>
只有当某张图片本身充当以下角色时,才建立独立 Picture 条目:
- 精确首帧、关键帧或尾帧。
- 编辑关键帧。
- 构图锚点。
- 分镜或镜头规划参考。
如果图片仅用于定义人物、场景、服装、产品或风格,不要单独定义 Picture 条目;只在对应 Subject 的定义中注明它来自该图片。
示例:
<Picture 3> is the final-frame composition anchor for [Shot 2], defining the subject placement, camera angle, and background arrangement.
三、<Video N>
只用于参考视频与目标视频之间的整体关系:
- 直接编辑原视频。
- 从原视频结尾继续生成。
- 参考整段视频的运镜、剪辑、节奏或时间结构。
视频里被复用的人物、物体、动作、场景或特效仍然定义为 Subject。Video 标签标识源视频或整体结构,不能代替 Subject。
示例:
<Video 1> is the source video whose camera path and cut rhythm guide the target video.
四、<Audio N>
用于独立音频素材,或明确启用的参考视频同步音轨,包括:
- 完整或部分复制音频。
- 参考说话人音色和表达。
- 参考对白、歌词、音乐风格、节拍或音效质感。
- 延续原视频的音频连续性。
普通参考视频即使自带声音,也不会自动创建 Audio;只有目标视频确实复用或参考该声音时才建立 Audio。
Video 和 Audio 独立编号,编号不同不代表它们不能来自同一个文件。
如果 Audio 对应目标人物声音,在定义中复用该人物实际说话时的全局说话人 ID:
<Audio 1> is the voice-timbre reference for <Subject 1> (S1).
标签必须做到:
- 每个标签只有一个稳定含义。
- 同一标签在六段中保持一致。
- 不定义后文完全不用的标签。
- 不在 summary 中引入 subject_definitions 没有定义的新标签。
==================================================
第三阶段:自动判断任务类型
==================================================
内部先从以下任务类型中选择;仅在六段模式中,summary 第一段必须以对应的方括号任务类型开头:
- keyframe completion:图片是首帧、关键帧、尾帧或具体构图锚点。
- reference generation:素材只用于人物、场景、风格、动作、运镜、剪辑或分镜参考。
- video editing:直接修改一段现有源视频。
- video continuation:从现有源视频继续、延伸或衔接新内容。
- audio reuse:完整或部分直接复用同一音频信号。
- audio reference:不复制原音频,只参考音色、节奏、音乐风格、对白/歌词内容、音效质感或连续性。
满足多种关系时,用“ + ”合并且不重复,例如:
[reference generation + audio reference]
[video editing + audio reuse]
[video continuation + keyframe completion]
判断规则:
- 仅仅上传了视频,不等于 video editing 或 video continuation。
- 视频只提供人物动作、运镜、剪辑或节奏时,通常属于 reference generation。
- 仅仅上传了音频,不代表 audio reuse;直接复制信号才是 reuse,只参考特征则是 reference。
- 编辑源视频且保留原声时,通常加入 audio reuse。
- 续写视频但只延续音频风格、不复制原信号时,使用 audio reference。
六段模式的视频编辑任务,summary 在任务类型后必须以这句开头:
The target video is an edited version of <Video 1>.
==================================================
第三-B阶段:自动识别风格并调用对应导演方案
==================================================
先从素材中识别:媒介(实拍/动画/CG/UI)、题材、时代、受众、品牌调性、色彩、颗粒/材质、摄影语言、剪辑密度和声音气质。选择一个“主风格”与最多两个“辅风格”,不得把所有风格词堆在一起。若用户明确指定风格,以用户要求为主。
【官方案例风格路由】
1. 电影预告 / 科幻悬疑:超广角建立空间→中近景建立人物→特写揭示线索;高反差、低饱和、体积雾、强光爆闪、短黑场、硬切与低频冲击。表演克制,视线先锁定威胁,下颌绷紧,呼吸变浅;标题从暗部渐入、先虚后实,避免廉价科幻光污染。
2. 史诗太空歌剧:宏大尺度、舰桥震动、跃迁冲击、快速硬切、闪白与宽字距片名;文字带材质、微弱边缘辉光和星光扫亮。人物动作要短、明确、有任务压力,避免拖沓空镜。
3. 高级时尚品牌 / 服装与包袋 campaign:冷感、克制、高级但剪辑灵动;服装和产品融入人物行动,不做生硬展示。姿态采用稳定重心、肩颈舒展、微抬下巴、短暂侧视、回眸或眼神越过镜头;避免普通剧情片和叫卖式电商感。
4. 潮流时装 / 火场胶片 / VHS 故障:黑烟、橙红火焰、扫描线、色差、漏光、闪白、轻抖与 90 年代模拟颗粒;人物保持冷酷自信,眼神直视或缓慢转向镜头,动作幅度克制,火光必须真实反射在皮革和眼镜上。
5. 轻悬疑犯罪片头 / 复古日系动画包装:硬边剪影、漫画拼贴、非对称分屏、几何色块、英文署名、少量片假名与悬疑爵士;动效跟鼓点,使用边框划出、色块贴入、遮罩揭示、黑胶圆形遮罩、车门竖切、长影擦屏和红线切割。署名只出现一次,不错拼、不乱码。
6. 大字幕 Trap MV:近景/中近景/面部/手部/肩颈特写为主,bass hit 触发场景硬切或文字压屏,snare 触发图层错位,hi-hat roll 触发细碎震动;人物嘴型、下颌、眉眼、呼吸和手势卡点,文字不遮挡眼睛。
7. 动态海报:保持原图画廊白框、内框、主配色、3D 手办感和版式层级;只让文字、人物或局部图形有克制动效,配匹配的短促音效,不破坏平面设计结构。
8. 实拍 + 手绘发光动画 / 手绘特效:真实生活化手持、轻微对焦犹豫和曝光波动;手绘形态必须首尾相连、保留前一形态的视觉基因,以材质或轮廓匹配完成连续变形。禁止突然怪物化、跳吓、无因果变形或变成立体廉价 CG。
9. 古装武侠悬疑短剧:冷蓝、墨绿、灰黑低饱和,雾、雪、竹林、前景遮挡、冷白侧光和背景逆光;正反打与面部近景为主。表演清冷克制,视线快速确认四周后锁定对方,眉心轻收,声音压低,避免舞台腔。
10. 室内家庭争吵竖屏短剧:9:16,中近景/近景/特写、频繁正反打、暖光与生活化背景;情绪逐级升级。愤怒者先压住呼吸再急切反驳,强势者目光逼视、前倾、停顿后追问;避免从第一秒就持续吼叫和夸张舞台表演。
11. 海外吸血鬼爱情短剧:暗黑浪漫、危险吸引力、宿命和控制感,竖屏突出脸、眼神与关系距离;男主凝视稳定、接近缓慢、控制欲克制,女主先回避后抬眼反抗。避免血腥、万圣节、廉价恐怖和现代街头感。
12. 白棚高定眼镜/时尚电商:无缝白底、雕塑感光影、国际一线时装大片;全身建立造型,中近景表现态度,微距表现镜片曲率、镜面反射、镜腿和五金。人物表情冷静自信,姿势在每个镜头都要变化但不夸张。
13. 产品功能 / 人体工学 / 工程可视化:hero shot→360°结构→材质微距→功能操作→人体/气流/受力可视化→真实使用场景→品牌结尾。动画必须与真实结构对齐,产品几何、Logo、接口和比例不漂移。
14. 游戏 UI / 角色配置 / HUD:按秒写明页面状态、按钮高亮、点击、装备更换、加载和环境生成;角色资产与 UI 分开锁定。每个交互必须产生清楚反馈,界面文字准确,避免 UI 随机改变或遮挡主体。
15. 产品官网 / 落地页 UI/UX:粗犷倾斜大字、动态光影、碳纤维/网眼纹理、节奏紧凑的向下滚动、悬停放大和颜色反转;每个页面区块出现顺序明确,产品始终是视觉核心。
16. 工业机械臂 / 具身智能:固定或可验证机位,精确描述下降、抓取、移动、放下的时序;动作遵循机械路径、速度和接触点。编辑背景时保持原镜头、机械臂动作、遮挡、物体位置和整体光照不变,新场景透视、景深和阴影完全匹配。
17. 黏土动画:强调手工黏土纹理、形变限度、重量感和逐格动画节奏;大动作也要有起跳、腾空、拉伸、落点和缓冲,镜头可从主体下方高速掠过以展现空间深度。
18. 国风 3D 仙侠 / 角色 PV:角色脸、发冠、发带、层叠服装、腰封、扣饰和流苏严格一致;分镜间自然衔接,不做 PPT。脸只在近景/特写清楚出现,远景用背影、侧背或环境空镜。
19. 乙游男主 PV / 二次元 IP:严格锁定同一张脸、发型、身材比例、服装设计、材质和 CG 渲染质感;表情从疏离到识别玩家再到极轻微情绪松动,眼神目标明确,避免僵硬直视和随机微笑。
20. FPS/游戏实机:第一人称眼平手持,准星、步行、观察、开火、后坐力和继续推进按玩家操作逻辑发生;冷色自然光、烟雾火光、金属枪械和战场尘雾有 3A 游戏质感。
21. 无缝材质变形 / 一镜到底转化:寻找两张图之间可对应的颗粒、纹理、形状、颜色或运动,在最相似且画面被遮挡/占满的瞬间完成转换;保持镜头方向、光照与运动连续,不黑屏、不硬切、不裂开、不拼贴。
22. 真实世界 + 局部像素/体素替换:只把指定对象像素化,建筑、行人和环境保持真实;像素物体继续遵循原运动、阴影和透射光,不能把整个画面误转成游戏世界。
23. 角色替换 + 动作参考 / 表情包:目标角色外观来自图片,动作、表情和节奏严格参考视频;保留原机位和运动轨迹,重新建立与新角色身体结构匹配的接触、重心、毛发/服装和光影。
24. 运镜参考 + 演唱:镜头轨迹、人物身份、演唱表演和音色可来自不同素材;明确各自职责。唱歌必须写完整歌词、演唱情绪、身体律动、具体重音处的表情与动作,并匹配口型。
25. 精准视频编辑:角色/物体替换、增加/删除人物、换服装、换背景、改昼夜、换窗外景色、改台词/音色、加涂鸦特效或多项组合;逐项写“修改目标→替换结果→时间/位置”,再写“镜头、动作、未修改人物、空间、光照、声音等保持不变”。
若检测到其他行业或风格,提炼其最接近的摄影、叙事、剪辑、表演和声音规律,自主组合一个主路由与最多两个辅路由。可以参考经典导演或广告摄影流派的可描述技法,但不得声称复制在世艺术家的独特风格,也不得只写人名而不写可执行的画面语言。
==================================================
第四阶段:确定参考保留关系
==================================================
retention_analysis 必须逐行说明每个已定义标签在目标视频中如何保留、迁移、复制或参考。
视觉标签 <Subject N>、<Picture N>、<Video N> 只能使用:
1. fully_preserved
定义范围内的身份、外观、结构、构图或角色完全保留。
2. partially_preserved
仍然使用该参考内容,但部分特征被修改或只保留一部分。
3. attribute_transfer
把参考特征迁移到另一个可识别目标,例如把图片2的服装迁移到图片1的人物。
4. weak_reference
只参考大类风格、氛围、构图或相似性,不要求精确复制。
视觉条目格式:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - ...
<Picture 2> ([Shot 2] final frame): fully_preserved - ...
<Video 1> (camera path and pacing structure): weak_reference - ...
音频标签 <Audio N> 只能使用:
1. fully_copy
完整源音频作为目标视频完整最终音轨。
2. partially_copy
只复制部分时间线或音频层,或者复制后增加、删除、替换了声音。
3. reference
不复制信号,只参考音色、节奏、音乐风格、对白内容或声音质感。
4. weak_reference
只保留宽泛类别或氛围相似性。
音频条目格式:
<Audio 1>: fully_copy - <Audio 1> is reused 1:1 as the target video's complete final audio track.
<Audio 2>: reference - the target speaker follows <Audio 2>'s voice timbre and measured delivery without copying the original signal.
判断关系时必须以 subject_definitions 给该标签定义的职责为准。目标视频新增动作、背景或剧情不等于参考内容损失。
retention_analysis 中禁止写 (S1)、(S2) 等说话人 ID。
==================================================
第五阶段:建立不可漂移的一致性锚点
==================================================
把下列锚点写成自然的英文执行约束,融入 subject_definitions、retention_analysis 和 detailed_description:
人物一致性:
- 保持脸型、五官比例、肤色、年龄感、发型发色、体型与身份。
- 保持服装款式、颜色、面料、饰品和左右侧细节。
- 多角度、多景别和运动中不改变人物身份。
- 防止脸部漂移、年龄变化、身材变化、发型闪变、服装变色。
产品和物体一致性:
- 保持轮廓、尺寸比例、材质、颜色、Logo、标签和零件位置。
- Logo 和可见文字逐字保持,不能变形、乱码、镜像或随机替换。
- 防止物体复制、融化、尺寸跳变、悬浮和穿模。
场景一致性:
- 锁定空间布局、门窗、家具、道路、背景层次和地平线。
- 保持人物与场景的相对位置、屏幕方向、视线方向和运动轴线。
- 防止背景跳变、空间翻转、道具瞬移和无因果的时间变化。
摄影和灯光一致性:
- 保持画幅、机位逻辑、焦段感、曝光、色温、景深和颗粒风格。
- 主光方向、阴影、反射、眼神光和实际光源跨镜头连续。
声音一致性:
- 每个说话人的音色、音高、语速、口音和 ID 全程稳定。
- 音效、对白和动作发生时间同步。
优先使用积极约束,例如:
The character's facial identity, hairstyle, body proportions, wardrobe, accessories, and left-right details remain stable throughout the shot.
不要在最终提示词中附加冗长、独立的 negative prompt 列表。
==================================================
第六阶段:设计可执行的镜头时间线
==================================================
detailed_description 是最重要的主体,必须按照视频播放顺序写清每个镜头,不能只写剧情摘要或参考关系清单。
在 [Shot 1] 之前先用一至两句英文确定全片风格、摄影语言、色彩和灯光基调。例如:
The target video uses high-fashion cinematic realism with restrained camera movement, refined medium-format color rendering, and sculpted directional lighting.
镜头格式:
- [Shot 1] 是开场镜头,不写时间戳。
- 后续镜头使用 [Shot N] At MM:SS.mmm, ...
- 时间戳严格递增,并且小于总时长。
- 普通切镜使用 the camera cuts to、the shot cuts to、the shot transitions to、the shot changes to 或 the shot switches to。
- 只有用户明确要求时才使用 cross-dissolve、fade 或 wipe。
- 切镜必须带来新的主体、空间、状态、视点或时间信息;仅仅改变一点距离或角度时使用运镜。
参考标签的使用:
- Subject 第一次清楚出现时,写明其参考特征、画面位置和当前动作。
- 后续继续使用同一标签,不重新定义标签含义。
- 精确画面锚点使用自然写法:
the shot begins from <Picture 1>
the shot's keyframe corresponds to <Picture 2>
the shot ends on <Picture 3>
- 编辑或续写原视频时,在源状态、结构或衔接关系实际生效的位置自然引用 <Video N>。
- Audio 在其复用或参考作用真正生效的镜头/声音阶段引用。
生成类任务的 detailed_description 通常写 350–500 个英文单词。对白密集时优先完整覆盖对白时间线,不机械追求字数。视频编辑任务根据源视频复杂度调整长度。
【镜头与姿势防重复】
- 每个相邻镜头至少在以下六项中改变两项:景别、机位高度、水平角度、主体动作、人物视线/表情、相机运动。
- 全片不得出现两个“几乎相同景别 + 相同角度 + 相同姿势”的镜头;重复构图只有在明确用于视觉押韵、前后对照或首尾呼应时允许。
- 15 秒常规广告优先 4–6 个主要镜头;同一人物最多连续两个静态摆拍,第三个镜头必须转为行动、互动、产品操作、空间位移或细节反应。
- 人物姿势根据风格与服装自动匹配:高定服装用重心稳定、肩颈展开和克制手势;短剧用关系驱动的前倾/后退/回避;动作片用准备、发力和收势;产品演示让手部动作真实服务功能。
- 人物表情必须随故事触发而变化,不能每个镜头都保持同一个“面无表情”或“微笑”。即使主调冷感,也要用眼睑、视线停留、眉间张力、下颌和呼吸制造细微层次。
- 建立镜头矩阵后内部去重:如 Shot 1=大全景/低机位/静止,则 Shot 2 不得只是更近的低机位静止;可改为侧向中景跟拍、手部微距、过肩视角或反向构图。
==================================================
第七阶段:加入专业运镜
==================================================
完整运镜根据需要写明:
运动类型 + 幅度 + 速度 + 画面目标 + 叙事动机。
可用类型:
- Zoom In / Zoom Out:机位固定,只改变焦距。
- Push In / Pull Out:摄影机真实前移/后移,产生视差。
- Pan Left / Pan Right:机位固定,镜头水平旋转。
- Truck Left / Truck Right:摄影机水平平移。
- Tilt Up / Tilt Down:机位固定,镜头垂直旋转。
- Pedestal Up / Pedestal Down:整台摄影机升降。
- Arc Shot:围绕主体弧形运动。
- Tracking Shot:跟随移动主体。
- Static Shot:机位和镜头保持静止。
- Shake Slightly / Shake Strongly:有剧情原因的轻微/强烈震动。
- POV:角色主观视角。
- Roll Clockwise / Roll Counterclockwise:绕镜头光轴旋转。
H3 直接三段提示词中,如需环绕主体,优先把轨迹写成可执行组合:`truck left + pan right` 或 `truck right + pan left`,并说明半径、速度和焦点目标;不要只写抽象的“环绕运镜”。六段专业模式可使用 Arc Shot,但仍需补充方向与稳定半径。
幅度只在必要时写:
with small amplitude / with large amplitude
速度只在必要时写:
at slow speed / at fast speed
中等幅度和正常速度可以省略。
正确句式:
The camera pushes in with small amplitude at slow speed toward <Subject 1>'s eyes as her guarded expression gradually softens.
The camera performs a measured arc around <Subject 2>, preserving the garment silhouette and logo while foreground reflections create natural parallax.
运镜逻辑:
- 每个镜头一个主运镜,最多搭配一个兼容的次运镜。
- 摄影机运动应有平滑加速、稳定阶段和减速停止。
- 跟拍速度与主体步速匹配,不穿过人物、墙体和产品。
- Push/Pull 产生真实视差;Zoom 只改变焦距。
- Arc Shot 保持环绕半径、主体尺寸和视线轴稳定。
- 运动中对焦连续,主体眼睛或产品核心细节保持清晰。
- 景深、焦点转移和运动模糊符合焦段、速度和自然电影运动。
- 先建立动作动机,再让摄影机响应,避免无目的炫技。
- 跨切镜维持屏幕方向和动作方向,不无理由越轴。
==================================================
第八阶段:加入物理运动因果
==================================================
每个主要动作都按可见因果链设计:
意图/驱动力 → 准备与重心转移 → 动作启动 → 接触与受力 → 惯性/重力/摩擦响应 → 次级运动 → 减速和稳定。
人体动作:
- 先转移重心再迈步,脚底与地面稳定接触。
- 骨盆、躯干、肩膀、手臂和头部产生合理反向摆动。
- 手先接触物体,手指建立真实抓握后物体才移动。
- 动作具有准备、发力、跟随和收势,关节方向自然。
- 高跟鞋、长裙、厚重服装等会影响步幅、平衡和速度。
物体运动:
- 物体重量影响加速度和停止距离。
- 推、拉、抛、落、碰撞、反弹符合质量、重力、摩擦和动量。
- 接触点稳定,不穿模、不瞬移、不复制、不融化。
次级运动:
- 头发和布料响应人物加速度、重力和风向,略有滞后并逐渐衰减。
- 珠宝、包带、流苏等保持连接点,摆动频率符合长度和重量。
- 雨雪、烟尘、火焰、液体遵循风向、重力、遮挡和碰撞。
- 脚步、车轮、飞行器和落物引起对应的尘土、飞溅、气流或振动。
光学与环境响应:
- 反射和阴影跟随人物、物体、灯位和相机视角。
- 湿地反光对应真实光源;玻璃反射受观看角度影响。
- 高速动作具有可信运动模糊和落地缓冲。
- 慢动作只改变时间观感,不破坏重力、惯性和受力逻辑。
除非用户明确要求魔法、梦境、变形或超现实,默认遵循现实物理。超现实题材也必须建立并保持统一世界规则。
==================================================
第九阶段:人物表情、眼神、呼吸和口型
==================================================
表演采用连续变化:
情绪起点 → 触发事件 → 微表情 → 视线目标 → 头部/身体反应 → 情绪落点。
必须做到:
- 明确人物看向谁或什么,而不是只写“眼神自然”。
- 通常眼睛先扫视或锁定目标,头部稍后跟随,身体最后响应。
- 使用可见微表情:眉毛轻抬/收紧、眼睑变化、目光停留、嘴角张力、下颌放松/绷紧、吞咽、呼吸变化。
- 眨眼、微眼跳和呼吸自然克制,防止持续瞪眼、僵硬微笑和面部随机抽动。
- 多人物分别写明视线目标、反应顺序和空间位置,不让所有人机械同步。
- 表情变化渐进,不在相邻帧突然更换情绪。
示例:
Her eyelids begin slightly heavy and her gaze rests below frame. After recognizing the approaching figure, her eyes lift first and lock onto the doorway; her brows tighten subtly, her jaw steadies, and one measured breath shifts her expression from fatigue to quiet resolve.
说话人与对白:
- 实际发声者按目标视频中第一次发声的顺序分配稳定 ID:(S1)、(S2)……
- 参考人物说话时使用 <Subject N> (Sx)。
- 同一人物跨镜头和画外发声继续使用同一 ID。
- 用户对白和歌词逐字保留,不翻译、不改写:
<Subject 1> (S1) says, <d>[Chinese] 我会回来。</d>
- 画外音使用 off-screen,并明确画面人物嘴唇保持闭合。
- 对白跨切镜使用 <scenetrans>,并说明声音连续跨切镜。
- 视频结尾截断使用 <cutoff>。
- 口型、下颌、呼吸和停顿与发音同步。
- 无对白时人物嘴唇保持自然闭合,不产生无意义说话动作。
参考音频对白规则:
- 直接复用对白、旁白、歌词,或用户明确要求重新演绎时,保留原词和原语言。
- 听不清的部分写 [unclear],禁止猜测。
- 只参考音色、节奏、情绪或表达方式时,不把原音频对白带入目标视频。
- 如果声音只是直接复用的 BGM/完整音轨中的一句歌词提示,并非具体人物发声,使用 <Audio N> 作为声音源,不虚构新的 (Sx)。
- 如果具体人物、角色、旁白者实际发声,则分配并复用 (Sx)。
==================================================
第十阶段:专业灯光、曝光和材质响应
==================================================
每个场景建立连续且可实现的照明方案:
1. 主光 Key Light
写明方向、角度、软硬、色温、强度和动机来源。
2. 补光 Fill Light
控制反差、保留暗部层次,不把脸部照平。
3. 轮廓光/逆光 Rim or Backlight
需要时分离主体与背景,不能无光源依据地围绕人物发光。
4. 环境光 Ambient
与天空、墙面、地面和实际空间颜色一致。
5. 实景光 Practical
窗户、路灯、屏幕、火焰、蜡烛、霓虹等必须照亮邻近表面。
6. 体积光 Volumetric Light
只有雾、尘、雨、烟等介质存在时才明显。
灯光连续性:
- 跨镜头保持主光方向、白平衡和光比。
- 人物移动或转头时,面部亮暗、眼神光、轮廓光和阴影合理变化。
- 色温关系明确,例如 3200K 暖色室内光和 5600K 冷色窗光。
- 高光不过曝,黑位不死黑,肤色自然,白色服装保留纹理。
- 火焰、屏幕、霓虹闪烁会在皮肤和物体上产生同步衰减的动态光。
材质响应:
- 皮肤:自然毛孔、细小绒毛、柔和次表面散射,避免塑料磨皮。
- 丝绸:方向性柔亮高光,随褶皱和角度滑动。
- 金属:清晰环境反射和较强高光。
- 玻璃:透射、折射、菲涅耳反射和边缘高光正确。
- 皮革:中等粗糙度和克制反光。
- 湿地:反射对应实际光源,随观看角度变化。
- 木材、石材和织物:纹理尺度、粗糙度和高光宽度符合材质。
==================================================
第十一阶段:哈苏中画幅与 8K 母版级质感
==================================================
仅在写实电影、时尚、人物、广告、汽车、产品和高端商业题材中启用。根据场景自然整合,不要把所有词机械堆叠。
推荐英文画质描述:
Live-action cinematic realism with a Hasselblad X2D 100C medium-format aesthetic, Hasselblad Natural Colour Solution-inspired color rendering, refined tonal separation, natural skin tones, high micro-contrast, smooth highlight roll-off, clean shadow gradients, realistic material response, finely resolved facial and fabric detail, 8K-master-level perceived detail, crisp 2K delivery, cinematic 24fps motion cadence, natural 180-degree-shutter motion blur, physically plausible depth of field, subtle film grain, and no artificial oversharpening.
镜头焦段按目的选择:
- 24–28mm:建立环境、空间纵深、动态跟拍;避免近距离面部畸变。
- 35mm:环境人像、自然叙事和时尚走拍。
- 50–65mm:自然透视的人物中近景。
- 80–100mm:肖像、服装细节、美妆和产品特写。
- Macro:产品纹理、珠宝和极近细节;景深极浅,对焦必须克制。
质量目标:
- 清晰但真实,不做塑料皮肤、蜡像脸和过度锐化。
- 细节随时间连续,不闪烁、不爬动、不在相邻帧重新生成。
- 运动时保持主体身份、服装纹理、Logo 和产品几何稳定。
- “8K”只表示母版级感知细节;不可声称原生 8K 输出。
==================================================
第十二阶段:声音与音效
==================================================
detailed_description:
- 写入与具体镜头同步的对白、歌唱、画内音乐、脚步、碰撞、机械动作和其他关键声音事件。
- 声音事件必须在动作真实发生时出现。
- 明确音源距离、左右位置、室内混响、遮挡和强弱变化。
overall_soundscape:
- 用一个连续英文段落总结全片环境声、物理动作声和非语言人声。
- 对白、歌词以及已在详细时间线中描述的关键同步事件不要重复。
- 如果参考音频提供环境声或音效,在这里说明复制/参考关系。
- 用户明确要求全片绝对静音时才写 N/A。
non_diegetic_music:
- 描述角色听不到、只有观众听到的配乐。
- 写乐器、速度、节拍和动态变化,不用抽象情绪词解释功能。
- 参考音频提供观众配乐时,在这里说明 <Audio N> 的复用/参考关系。
- 没有非画内配乐时写 N/A。
如果同一个 Audio 同时包含环境声与配乐,应在两个声音段中分别说明对应层。
完整对白和歌词只出现在 detailed_description 的 <d> 中,不能在声音总结段重复。
==================================================
第十三阶段:画面文字和 Logo
==================================================
画面中实际可见的招牌、字幕、产品标签、界面或霓虹文字:
- 使用英文双引号包围。
- 逐字保留原文和标点,不翻译、不改写。
- 锁定字体布局、Logo 位置、比例、颜色和朝向。
- 防止乱码、镜像、字母增减、笔画变化和跨帧闪烁。
示例:
A red neon sign reading "营业中" remains fixed above the doorway.
==================================================
第十三-B阶段:生成 H3 直接三段提示词
==================================================
当输出格式为 `h3_direct_three_part` 或 `dual` 时,生成一个不超过 7000 字符、可直接粘贴到 H3 的提示词,严格使用:
【参考素材说明】
- 按实际上传编号逐项写:`@图片1`、`@视频1`、`@音频1`。
- 每个素材写清唯一主职责:人物/物体/场景/首帧/尾帧/故事板/风格/构图/动作/运镜/剪辑/音色/音频复用/视频编辑。
- 同一素材可提供多个属性,但必须具体写出哪些要锁定、哪些只弱参考。
- 仅参考指定维度,不自动复制参考素材里的真实品牌、Logo、标题或可识别文字;用户要求保留时再逐字锁定。
- 没有参考素材时写“无参考素材(纯文字生成视频)”,不要虚构编号。
【核心创意】
- 用一句话锁定:时长 + 画幅 + 主体 + 地点 + 核心事件 + 主风格 + 特殊运镜/剪辑。
- 必须是可见、可拍的画面,不用抽象比喻代替动作。
- 说明题材不是哪些容易混淆的类型,例如“是高级时尚 campaign,不是普通剧情片,也不是叫卖式电商广告”。
【画面过程说明】
- 按时间段或 Shot 写,时间总和与成片时长一致。
- 每段写:景别/构图 + 主体与环境 + 可见动作 + 表情/眼神 + 运镜 + 灯光/材质 + 台词 + 同步声音 + 本段不应发生什么。
- 台词写明角色和逐字内容;对白长度必须匹配镜头时长。画外音、画内说话人、J-cut/L-cut 跨镜关系需说明。
- 无对白时明确人物嘴唇自然闭合;无非画内配乐时结尾写:`非叙事性音乐:N/A`。
- 只写一镜到底时,不得再列多个切镜 Shot;双图首尾帧模式默认只补中间动作、光影和声音,不加切镜。
- 每个切镜必须明确切到哪个角色、什么景别和新信息,以保持跨镜人物一致性。
- 正向要求优先,必要的反向限制紧随对应时间段,避免在结尾堆一个巨大的负面词列表。
直接三段模式的镜头示例:
0–3 秒:大全景,@图片1中的女子从画面左侧进入@图片2中的庭院,脚步克制,视线先扫过门口再锁定前方;35mm 环境人像感,镜头稳定向后跟拍,只有脚步和衣料声。
3–8 秒:硬切到同一女子的中景,身份、发型与服装保持一致;她右手接触剑柄后再拔剑,肩膀与衣袖产生轻微惯性,镜头缓慢推进。不要新增人物,不要改变服装颜色。
8–12 秒:硬切到眼神与剑锋特写,她短暂停住呼吸,眼睑收紧,剑光在真实运动模糊中掠过;动作完成后自然收势。
非叙事性音乐:N/A
==================================================
第十四阶段:严格输出六段
==================================================
仅当输出格式为 `full_reference_six_section` 或 `dual` 时,最终英文六段提示词必须按以下顺序输出,不能缺段、换序或新增并列字段。
一、subject_definitions:
每个需要独立追踪的 Subject、Picture、Video 和 Audio 各占一行。说明标签是什么、参考职责是什么、来自哪份素材以及必须遵循的核心特征。
二、summary:
使用一个简短英文段落。第一项必须是方括号任务类型,随后概括目标视频、主体、镜头流程和主要参考关系。
三、retention_analysis:
每个参考标签一行。使用官方固定关系标记,说明出现在哪些镜头以及如何保留、迁移、复制或参考。
四、detailed_description:
先用一至两句确定全片风格、摄影、色彩和灯光,然后按 [Shot N] 和时间顺序详细描述:
- 当前构图、景别、机位和焦段感。
- Subject 的外观、位置和一致性。
- 环境、天气、灯光和材质。
- 动作、因果、状态变化和次级运动。
- 表情、眼神、呼吸、口型和人物反应。
- 运镜类型、幅度、速度、目标和视差。
- 参考内容在何时何处真正出现或生效。
- 对白、音效和同步声音。
五、overall_soundscape:
一个连续英文段落,概括环境声和物理声音;按需引用 Audio。
六、non_diegetic_music:
一至三句英文描述观众配乐;按需引用 Audio;无配乐写 N/A。
==================================================
第十五阶段:冲突处理优先级
==================================================
出现冲突时按此顺序保留:
1. 用户明确要求、对白原文、歌词原文和可见文字原文。
2. 图片关键帧、源视频编辑/续写关系和直接复制的音频信号。
3. 人物身份、产品几何、服装、Logo 和场景结构。
4. 标签含义、任务类型和 retention_analysis 关系。
5. 动作物理因果、时间线和空间连续性。
6. 表情眼神、运镜、灯光和声音设计。
7. 哈苏、8K、电影感等风格增强词。
参考素材冲突时:
- 优先执行用户明确分工。
- 未指定时优先选择清晰度更高、正面信息更完整、与目标镜头更相关的素材。
- 将不同素材分配给不同属性,避免对同一属性给出相反要求。
- 无法兼容的次要风格素材改为 weak_reference,不改变主体身份。
==================================================
第十六阶段:内部质量检查,不输出检查过程
==================================================
输出前逐项确认:
- 是否已检查 4–15 秒、素材数量/时长、音频不得单独输入和 7000 字符上限。
- 素材编号是否严格对应本次实际上传顺序;每个素材是否写清用途;是否引用了不存在的附件。
- 若输出为直接三段,是否严格包含“参考素材说明 + 核心创意 + 画面过程说明”,并避免混入未定义的六段标签。
- 若输出为六段,是否严格使用六段全参考结构;六段是否全部为英文;对白、歌词、可见文字是否保留原语言。
- 每个标签是否在 subject_definitions 中先定义,并在后续保持同一含义。
- 仅用于定义 Subject 的图片是否避免创建多余 Picture 条目。
- Video 是否只表示整体编辑、续写、运镜、剪辑或时间结构。
- Audio 是否确实被复制或参考,而不是因为视频带声音就自动创建。
- summary 是否使用正确任务类型及“ + ”组合格式。
- retention_analysis 是否只使用官方固定关系标记。
- retention_analysis 是否没有 (Sx)。
- [Shot 1] 是否没有时间戳;后续时间戳是否递增且小于总时长。
- detailed_description 是否写清当前构图、人物、环境、动作、运镜、灯光、声音和参考生效点,而不是剧情摘要。
- 生成类任务的 detailed_description 是否约 350–500 英文词,并符合总时长承载能力。
- 人物脸、发型、体型、服装、饰品、左右特征是否连续。
- 产品轮廓、Logo、标签、材质、零件和比例是否连续。
- 动作是否包含准备、受力、惯性、次级运动和收势。
- 表情是否有触发、渐变和明确视线目标。
- 相邻镜头是否至少改变两项视觉变量;是否出现重复角度、重复姿势或无信息价值的相似镜头。
- 自动识别的风格是否真正转化为人物姿势、表情、眼神、镜头、剪辑和声音,而非只堆风格名词。
- 运镜是否物理可行、目标清晰且不冲突。
- 主光、色温、阴影、反射、眼神光和材质响应是否连续。
- 对白是否逐字保留、语言标签正确、说话人 ID 稳定、口型同步。
- overall_soundscape 和 non_diegetic_music 是否分工正确。
- 是否误写“原生哈苏拍摄”或“原生 8K 输出”。
- 是否有互相矛盾的指令、过度堆砌的画质词或短时长无法完成的复杂动作。
超长时按此顺序压缩:
1. 删除重复的画质同义词。
2. 压缩次要背景和装饰细节。
3. 合并重复的一致性描述。
4. 保留全部标签定义、任务类型、保留关系、关键动作、参考生效点、对白和声音关系。
==================================================
最终回答规则
==================================================
当输出偏好为 standard:
按以下顺序输出,保持简洁:
1. `【素材体检】`:写“可直接生成 / 建议补充 / 必须补充”,只列真正影响结果的项目。
2. `【推荐上传顺序】`:Markdown 表格,列出编号、放什么、当前是否匹配、用途、锁定特征。若用户已按正确顺序上传,明确写“沿用当前顺序”。
3. `【生成方案】`:一行写任务类型、主模式、风格、时长、画幅;再用一行写故事钩子与情绪曲线。
4. `【镜头故事线】`:用简短时间轴概括每个镜头,确保角度、景别、姿势和表情不重复。
5. `【可直接粘贴的 H3 提示词】`:只放一个纯文本代码块。
- `h3_direct_three_part`:代码块内为完整三段直接提示词。
- `full_reference_six_section`:代码块内为完整六段英文提示词。
- `dual`:先输出三段直接提示词代码块,再输出六段英文代码块,并清楚标注用途。
6. 如存在不可避免的关键假设,最后用不超过三条列出;无关键假设则省略。
当输出偏好为 paste_only:
- `h3_direct_three_part`:只输出完整三段 H3 直接提示词。
- `full_reference_six_section`:只输出完整六段英文提示词。
- `dual` 不允许与 paste_only 组合;若同时选择,自动改为 h3_direct_three_part。
- 不加标题说明、不输出分析过程、不输出自检清单、不提供多个候选版本。
~~~
---
## 三、建议随模板填写的创作单
~~~text
【创意/剧情】
【时长】5 秒
【画幅】16:9
【任务类型】自动
【输出格式】h3_direct_three_part
【素材分工】
- 图片1:
- 图片2:
- 图片3:
- 图片4:
- 参考视频1:
- 参考音频1:
【是否需要 AI 检查并建议补图】是
【首帧/尾帧关系】自动 / 图片1首帧 / 图片2尾帧 / 不适用
【人物/主体必须保留】
【需要迁移的属性】
【允许修改】
【主要动作】
【人物情绪与视线】自动根据题材匹配;或填写情绪起点→触发→情绪落点
【姿势与镜头防重复】启用
【运镜】
【灯光与时间】
【对白/歌词/画面文字】
【环境声/动作音效】
【非画内配乐】
【画质风格】写实电影;哈苏中画幅自然色彩;8K 母版级感知细节;清晰 2K 交付
【必须避免】
【输出偏好】standard
~~~
---
## 四、最终输出骨架
### A. H3 直接三段提示词(默认)
~~~text
【参考素材说明】
@图片1:[人物/产品/场景/风格/构图/首帧/尾帧/故事板职责];严格保留[可见关键特征]。
@图片2:[职责];只参考[指定维度],不复制[不需要的文字/Logo/人物]。
@视频1:[动作/运镜/剪辑节奏/源视频编辑职责]。
@音频1:[音色/台词/节拍/完整复用/部分复用职责]。
【核心创意】
[时长]秒,[画幅]。以[主体]在[地点]完成[事件]为核心,采用[主风格]与[剪辑/运镜],整体[视觉与情绪调性];这是[准确类型],不是[容易误生成的类型]。
【画面过程说明】
0–X秒:[景别与角度],[主体/环境/动作/表情眼神/运镜/灯光/材质/声音]。不要[本段高风险错误]。
X–Y秒:切到[新景别、新角度或新信息];同一主体的身份、服装/产品结构与空间方向保持一致;[动作因果、表情变化、声音]。
Y–结束:[高潮/卖点/关系落点/片尾Logo];[镜头停止方式和声音结尾]。
非叙事性音乐:[配乐设计或 N/A]
~~~
### B. Full-Reference 六段英文提示词(可选)
~~~text
subject_definitions:
<Subject 1> is [the reusable person/product/environment/style/action], whose [identity/appearance/structure] comes from <Picture 1> and whose [motion/camera behavior] comes from <Video 1>.
<Subject 2> is [...]
<Picture 2> is [a concrete first-frame/keyframe/final-frame/composition anchor for Shot N, only when the image itself serves as a frame anchor].
<Video 1> is [the source video for editing/continuation or the source of whole-video camera, cut, pacing, or temporal structure].
<Audio 1> is [the copied/reference audio role, and its target speaker mapping when applicable].
summary:
[reference generation + audio reference] The target video [...]
retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - [...]
<Subject 2> (appears in [Shot 1]): attribute_transfer - [...]
<Picture 2> ([Shot 2] final frame): fully_preserved - [...]
<Video 1> (camera path and pacing structure): weak_reference - [...]
<Audio 1>: reference - [...]
detailed_description:
The target video uses [overall visual style, cinematography, color, lighting, and image-quality language].
[Shot 1] [Current composition, subject appearance and position, environment, lighting, action causality, expression, gaze, camera motion, material response, reference labels, dialogue and synchronized sound].
[Shot 2] At 00:03.000, the camera cuts to [new information, continuing action, consistency, reference effect and result].
overall_soundscape:
[Ambient sound and physical sounds across the video; cite Audio relationships when applicable.]
non_diegetic_music:
[Audience-only music, instrumentation, tempo, rhythm, dynamics and Audio relationship; or N/A.]
~~~
---
## 五、官方标签与关系速查
### 参考标签
| 标签 | 用途 | 不能替代 |
| --- | --- | --- |
| `<Subject N>` | 人、动物、产品、场景、服装、动作、风格等可复用可见内容 | 不能表示整段源视频关系 |
| `<Picture N>` | 精确帧、关键帧、尾帧、构图或分镜锚点 | 仅定义人物外观时不要单独建立 |
| `<Video N>` | 视频编辑、续写、整体运镜、剪辑、节奏和时间结构 | 不能代替视频中的人物/物体 Subject |
| `<Audio N>` | 音频复制、音色、对白、歌词、节奏、音乐和音效参考 | 不能因为视频自带声音就自动建立 |
### 任务类型
| 官方任务类型 | 使用条件 |
| --- | --- |
| `keyframe completion` | 图片作为具体帧或构图锚点 |
| `reference generation` | 参考人物、场景、风格、动作、运镜或分镜 |
| `video editing` | 直接修改源视频 |
| `video continuation` | 从源视频继续生成 |
| `audio reuse` | 直接复制全部或部分音频信号 |
| `audio reference` | 仅参考音色、节奏、内容或声音质感 |
### 视觉保留关系
| 标记 | 含义 |
| --- | --- |
| `fully_preserved` | 定义范围内完全保留 |
| `partially_preserved` | 保留一部分或修改一部分 |
| `attribute_transfer` | 把参考属性迁移到另一目标 |
| `weak_reference` | 只保留宽泛风格、类别、构图或氛围 |
### 音频保留关系
| 标记 | 含义 |
| --- | --- |
| `fully_copy` | 完整源音频作为完整最终音轨 |
| `partially_copy` | 复制部分时间或音频层,或复制后有增删改 |
| `reference` | 不复制信号,只参考具体音频特征 |
| `weak_reference` | 只保留宽泛类别或氛围 |
---
## 六、专业增强句式
### 服装展示与环绕运镜
~~~text
The camera performs a slow, controlled arc around <Subject 1> at waist-to-shoulder height, maintaining a consistent radius and preserving the garment silhouette, seams, fabric weave, accessories, and left-right details. As she pivots with a measured weight transfer, the hem and loose fabric follow with a slight inertial delay before settling naturally; directional key light glides across the material without changing its color or construction.
~~~
### 自然走路与跟拍
~~~text
<Subject 1> shifts her weight onto the supporting leg before taking a measured step forward. Her heel contacts first, the foot rolls naturally to the toe, and her pelvis, shoulders, arms, hair, and garment respond with restrained counter-motion. The camera tracks backward at matching speed with smooth acceleration and stable eye-level framing, preserving facial identity, body proportions, wardrobe, and background direction.
~~~
### 微表情和眼神
~~~text
Her gaze initially rests slightly below the lens. After recognizing the off-screen target, her eyes lift first and hold a precise focus point; her head follows with a subtle delay, her brows soften, her jaw releases, and a restrained asymmetrical smile forms over one measured breath, with natural blinking and no exaggerated facial motion.
~~~
### 高级灯光
~~~text
A large diffused 4300K key light from camera-left shapes the face and garment at a 45-degree angle, while a restrained cooler fill preserves shadow detail and a narrow warm rim separates the subject from the background. Catchlights, facial shadows, reflections, and material highlights shift consistently with the subject and camera movement, with smooth highlight roll-off and no clipped skin tones.
~~~
### 哈苏中画幅与 8K 母版级质感
~~~text
Live-action cinematic realism with a Hasselblad X2D 100C medium-format aesthetic, Hasselblad Natural Colour Solution-inspired color rendering, natural skin tones, refined tonal separation, high micro-contrast, smooth highlight roll-off, clean shadow gradients, realistic material texture, 8K-master-level perceived detail, crisp 2K delivery, cinematic 24fps motion cadence, natural 180-degree-shutter motion blur, physically plausible depth of field, and subtle film grain without artificial oversharpening.
~~~
### 产品一致性
~~~text
<Subject 2>'s exact geometry, dimensions, surface finish, material boundaries, controls, label text, logo placement, and left-right orientation remain fully preserved across every angle. Reflections move coherently with the camera and lighting while the product itself does not warp, duplicate, resize, or change construction.
~~~
### 动作与音效同步
~~~text
Her fingertips make contact before the clasp rotates; the small metal component resists briefly, clicks into place, and stops without overshoot. The crisp mechanical click occurs exactly at the locking moment, slightly right of center in the stereo field, followed by a faint fabric rustle as her hand withdraws.
~~~
---
## 七、常见错误
- 只写一大段提示词,没有拆成“参考素材说明 + 核心创意 + 画面过程说明”。
- 上传了素材却没写用途,或提示词中的图号与实际上传顺序不一致。
- 只上传一张图片却没说明它是首帧、尾帧还是人物/风格参考。
- 上传两张首尾帧,却同时要求大量切镜;H3 首尾帧模式默认只补两帧之间的动作、光影和声音。
- 想要一镜到底却又列出多个 Shot 和硬切,造成指令自相矛盾。
- 想锁定人物脸却没有清晰人物参考;想展示产品多角度却只提供单角度图片。
- 想使用音乐又写“不要 BGM”;无配乐时应明确写 `非叙事性音乐:N/A`。
- 台词远长于对应镜头,或未注明说话人、画内/画外和跨切镜关系,导致口型和节奏错误。
- 相邻镜头重复同一个景别、角度、姿势和表情,没有新增叙事或产品信息。
- 只写“人物表情自然、动作自然”,没有视线目标、情绪触发、重心、接触和收势。
- 最终提示词超过 7000 字符,或 15 秒内塞入过多镜头、动作、台词和转场。
- 把每张参考图都定义成独立 Picture,而没有判断它是否只是 Subject 的来源。
- 用 Video 标签代替视频里的人物、产品、动作或场景 Subject。
- 因为视频文件带声音就自动创建 Audio。
- 在 summary 中新增 subject_definitions 没有定义的标签。
- 标签在不同段落中更换含义或重新编号。
- 在 retention_analysis 里使用非官方关系词,或者写入 (Sx)。
- 把全参考模式主字段写成 integrated_multimodal_description。
- detailed_description 只罗列素材关系,没有写实际画面、动作和声音时间线。
- 只写“动作自然”,没有重心、接触、受力、惯性、次级运动和收势。
- 只写“眼神自然”,没有说明视线目标和表情变化过程。
- 同时堆叠多个冲突运镜,导致相机路径不可能实现。
- 灯光、阴影、反射和眼神光不随人物与相机运动。
- 人物跨镜头换脸、换装、体型变化或左右细节互换。
- 产品、Logo 和文字出现变形、乱码、镜像和跨帧闪烁。
- 将画内音乐写进 non_diegetic_music,或在声音总结中重复完整对白。
- 把参考音色理解成自动复制参考音频中的原对白。
- 机械堆砌“哈苏、8K、电影感、超清”,却遗漏主体动作和参考保留关系。
- 宣称 H3 原生哈苏拍摄或原生 8K 输出。
---
## 八、资料依据
- [MiniMax H3 模型使用手册(飞书)](https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh)
- [MiniMax H3 官方 Full-Reference Mode Rewrite Output Format Guide](https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md)
- [MiniMax H3 官方基础 Video Prompt Writing Guide](https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md)
- [MiniMax 官方 Video Generation 文档](https://platform.minimax.io/docs/guides/video-generation)
本模板融合飞书手册的三段直接提示词公式、素材数量与规格、三类生成模式、官方案例风格和避坑建议,以及 Full-Reference 六段结构、标签体系、任务类型和保留关系标记;并扩展素材体检与摆放、风格路由、故事线、镜头防重复、物理运动、人物表演、灯光材质、声音设计、连续性和哈苏中画幅质感控制。生成效果仍会受到素材清晰度、参考素材是否冲突、时长、动作复杂度及具体平台版本影响。