一句话答案
MiniMax H3是一个通用多模态视频模型——文本、图片、视频、音频全部塞进一个上下文窗口,输出5至15秒的2K视频加立体声音频,而且对复杂多参考提示词的处理能力,远超大多数同类模型。
为什么MiniMax H3改变了规则
大多数视频生成模型都是单用途的:文生视频、图生视频、视频生视频各自独立。MiniMax H3架构上不同。它是一个模型处理所有输入——一张照片里的角色面孔、一段视频里的镜头语言、一段录音里的声音——全部解析成一个连贯镜头。
在fal.ai上它以三个端点运行:
| 端点 | 最佳场景 | 输入 | |---|---|---| | Text to Video | 纯提示词生成 | 仅文本 | | First & Last Frame | 有明确起点或终点画面 | 一张或两张图片 | | Reference to Video | 其余所有场景:身份、动作、风格、音频 | 最多12个文件(图片、视频、音频)|
判断规则很简单:请求里没有媒体文件 → Text to Video。图片本身就是镜头的第一帧或最后一帧 → First & Last Frame。任何被当作参考资料使用的(要保留的面孔、要匹配的视频片段、要跟唱的音乐、要编辑的 footage)→ Reference to Video。
核心提示词模式
模式一:每个参考都赋予明确职责
开发者使用Reference to Video最常犯的错误,是一股脑丢参考资料却不加说明。每个参考需要有清晰的角色。比较这两种写法:
弱: Use Image 1 as reference.
强: Use Image 1 for the subject's identity (platinum-blonde hair, narrow black vintage sunglasses, glossy black patent-leather trench coat); use Image 2 for the background texture and color palette.
来自Vintage Binocular Brand Film案例:提示词明确指定Image 1–4为顺序关键帧,每个都有不同的行为指示——一个处理布料飘动,一个处理自然行走,结尾帧处理时尚姿态。模型需要这种明确性来正确分配优先级。
模式二:写带时间码的分镜清单
MiniMax H3支持最长7000字符的提示词。充分利用这个空间。把提示词写成带时间提示的分镜序列:
Shot 1 — 超广角建立镜头。一个巨大的圆形宇宙门户几乎充满画面。
主角只是一个远处的小小人影,背对镜头,位置靠下略偏右。
湿地反射光线;门户中心一片漆黑。缓缓向前推镜头。
→ 硬切。
Shot 2 — 特写主角面部。[指示]
→ 叠化。
箭头符号(→)表示转场,在fal指南的各个案例中用法一致。直接用。
模式三:画面和声音同等用心
每次生成都自带立体声音频。别浪费了这个能力。明确告诉模型要产生什么声音:
Audio: a deep sub-bass pulse, distant metallic resonance,
and one restrained hit as the title locks into focus.
对于Reference to Video端点,可以同时输入音频片段。模型会匹配参考音频的时机和氛围。
模式四:锁定身份,然后赋予动作
要保持角色在镜头中的连贯性,提示词应先建立身份参考,再赋予动作。从Desert Fashion Campaign案例中:
Use Image 1 for the overall mood, location, and film texture; Image 2 for the talent; Image 3 for the bag; and Image 4 for the closing brand mark.
模型从Image 2开始保留 talent 的外貌特征,动作——走向车尾、打开后备箱、与旁边的人短暂互动——则在这个身份基础上展开。
模式五:视觉语言要精确描述
"电影感"这类抽象词汇对不同模型含义不同。MiniMax H3对具体描述词反应更好:
| 弱 | 强 | |---|---| | 电影感外观 | Wes Anderson风格的35mm胶片感,细粒、柔和高光光晕、克制的色彩 | | 快切 | 锐利硬切、白热闪光、瞬间黑帧、剧烈跳切至 warp 冲击 | | 优雅文字 | 宽间距电影字幕字体——非纯白——带克制的材质纹理、微妙边缘光晕 |
三大生产级应用场景
品牌影片与电影级内容
MiniMax H3能渲染文字、字幕、品牌资产和界面UI——这意味着真正的商业制作只需一段提示词就能实现。Vintage Binocular Brand Film案例非常有参考价值:
提示词锁定了双筒取景框遮罩(全程位置、比例、羽化黑色暗角、边缘虚化完全不变)——只有遮罩内部的内容在动。红色字体随对焦一起渐变清晰。视觉语言是偷窥式、Wes Anderson风格。
这种精确性——遮罩的处理方式、淡入时机、颗粒感——才是区分"模糊好看"和"可用的品牌资产"的关键。
电商与产品视频
MiniMax H3处理产品特写和界面渲染比大多数模型更好。电商场景中,Reference to Video端点可以保持产品 identity,同时将其动画化到生活场景中。关键是提供清晰的产品参考图,并明确说明产品应如何与环境互动。
风格迁移与视觉特效
将风格参考图(纹理、氛围、色彩调校)与人物参考图一起输入,模型会将视觉语言迁移到新的 footage 上。Cyber-Grunge Fashion Film案例演示了这个用法:Image 1负责纹理和氛围,Image 2负责人物外貌——模型保留了铂金长发、窄款黑色复古墨镜、漆皮风衣,同时将角色放入有橙色火光映照的新环境中。
输出规格一览
- 时长: 5至15秒
- 帧率: 24 FPS
- 分辨率: 2K(16:9到9:16比例下短边1440px;更宽幅如21:9可达约2976×1248,约370万像素)
- 音频: 原生立体声,可生成或克隆
- 提示词长度: 最长7000字符
- 参考文件: 最多12个(Reference to Video端点)
快速参考:端点选择
请求里没有媒体文件?
→ Text to Video
有明确的第一帧或最后一帧图片?
→ First & Last Frame
把任何东西当参考资料使用(面孔、视频片段、音频)?
→ Reference to Video
资源链接
- MiniMax H3 on fal.ai — Text to Video端点
- First & Last Frame端点
- Reference to Video端点
- MiniMax H3 Prompting Guide + 44 Video Examples — 官方完整指南,含全部示例提示词


