向左环绕
相机绕主体走弧线,主体始终居中,背景向右滑动。
适用场景展现产品侧面轮廓,或主体身后的空间。
快速 H3 Max 生成 · Kuca 四种创作模式
MiniMax H3 Max 面向希望减少等待、同时保持成片质感的创作者。它更准确地遵循详细提示词,提升画面完成度,并支持文生视频、图生视频、混合参考和相机运镜四种工作流。在 Kuca,你可以更快地从创意进入预览,同时使用 480P–1080P 输出、5–15 秒时长和六种现成运镜。
两个模型同属 H3 一代,因此选择的关键在于各自被调优的方向。H3 Max 偏向提示词贴合度、画面观感与运镜精度;MiniMax H3 仍是带联合生成立体声的 2K 模型。
| 对比项 | MiniMax H3 | MiniMax H3 Max |
|---|---|---|
| 调优方向 | 2K 细节与原生立体声 | 提示词贴合度、画面观感与运镜精度 |
| 分辨率 | 768P、2K | 480P、768P、1080P |
| 时长 | 4–15 秒 | 5–15 秒 |
| 参考素材 | 最多 5 张图片与 3 段音频 | 最多 9 张图片、3 段视频与 3 段音频,合计 12 个文件 |
| 运镜控制 | 写进提示词 | 六种可选的轨迹预设 |
| 生成音频 | 原生立体声,与画面一起生成 | 不生成——音频只作为参考输入 |
| 提示词长度 | 最长 7,000 字符 | 最长 50,000 字符 |
| 吞吐量 | H3 基线推理管线 | 高吞吐管线,生成等待更短 |
两个页面打开的是同一个生成器,因此在 H3 与 H3 Max 之间切换时不必重写简报。
从向左环绕、向右环绕、镜头推进、镜头拉远、镜头升高和镜头降低六种运镜中直接选择。把镜头方向变成明确设置后,提示词可以更专注于主体、动作和场景。
相机绕主体走弧线,主体始终居中,背景向右滑动。
适用场景展现产品侧面轮廓,或主体身后的空间。
同样的弧线,方向相反,背景向左滑动。
适用场景与已有素材的运动方向对齐,或跟随画面内的移动。
相机径直推向主体,画面随之收紧。
适用场景强调一张脸、一处标签或某个细节。
相机后撤,周围环境进入画面。
适用场景在收尾时交代主体真正所处的位置。
相机上升,视线向下俯看主体。
适用场景为场景开场,或展现空间的规模。
相机下降到与主体齐平的高度。
适用场景落在一个亲近的平视收尾上。
相机运镜模式只需要一张首帧和一个预设,该模式下提示词是可选项。画面比例跟随你上传的首帧。
每个 H3 Max 端点要求的输入不同,留给模型决定的空间也不同。先选定端点,参考素材才不会越堆越多。
H3 Max 能接受大量素材,但职责清晰的小素材组胜过彼此打架的大素材组。给每份文件一个任务,并在提示词里写明这个任务。
| 素材 | 负责什么 | 上限 | 常见失误 |
|---|---|---|---|
| 图片 | 身份、产品外形、服装、环境或配色。 | 最多 9 张图片。 | 上传多张几乎相同的画面,争夺同一项属性。 |
| 视频 | 一段运镜、一种节奏、一个手势,或某种材质的表现方式。 | 最多 3 段,每段 2–15 秒,合计 15 秒。 | 喂入带剪辑点、文字叠加或主体不一致的素材。 |
| 音频 | 人声、配乐、环境声或音效。 | 最多 3 段,每段 2–15 秒,合计 15 秒。 | 以为音频会被重新生成:音频是引导,而非输出。 |
| 提示词 | 主体、地点、动作、运镜、时间顺序与边界。 | 最长 50,000 字符。 | 只写一句含糊的话,或把三段情节塞进五秒里。 |
图片、视频与音频共用 12 个文件的合计上限,参考模式至少要添加其中一项。
这些数值来自生成器自身的配置。在组装镜头时顺手核对,比提交被拒之后再查要快得多。
相机运镜模式接受一张首帧和一个预设,该端点的提示词是可选项。
大多数令人失望的 H3 Max 结果,根源在简报或参考素材,而不在模型。以下是最值得优先排查的几种情况。
原因简报要么过于含糊,要么混进了几件互不相关的事。
怎么改用一个明确动作配合具体名词来描述,再用单独一句交代运镜。
原因在 5–15 秒的窗口里塞进了太多情节。
怎么改只保留一个主动作,去掉次要节拍;若还想加细节,先把时长拉长。
原因源图本身就带字、水印或杂乱的背景元素。
怎么改从干净的画面起步,把文字裁掉,或干脆让画面里不出现任何文字。
原因有两份文件在暗中争夺同一项属性,比如身份或颜色。
怎么改让每项属性只有一个来源,并在提示词里写明,然后删掉多余的那份文件。
原因在需要预设的端点里,用散文写了一个精确的运动。
怎么改切换到相机运镜,从六条轨迹里选一条,提示词只用来描述主体表现。
每份方案都列出要准备什么、提示词怎么组织,以及通常会在哪里出问题。任何一段提示词都可以直接载入生成器,再按自己的素材调整。
源素材请保持原创或已获授权。不要上传游戏素材、影视画面、标识或其他受保护的角色与品牌,也避免使用模仿特定系列作品的提示词。
MiniMax H3 Max 是速度更快、控制更直接的 H3 视频模型。它强化提示词遵循和画面质感,并支持图像、视频、音频混合参考以及六种现成运镜。
有两项素质得到提升:提示词贴合度,也就是成片对文字简报的遵循程度;以及画面观感,也就是最终画面的打光、构图与调色。H3 Max 并不是一个单纯为速度而训练的更大模型。
H3 Max 针对高吞吐推理进行了优化,因此通常能比基础 H3 工作流更快处理单个镜头。实际完成时间仍会受到分辨率、时长、参考文件和队列负载影响。
H3 Max 对提示词的响应更贴合,除图片和音频外还接受视频参考,并提供六种预设镜头轨迹。如果需要 2K 输出,或需要与画面一起生成的原生立体声,MiniMax H3 仍是更合适的选择。
480P、768P 和 1080P,默认 768P;时长可选 5 到 15 秒之间的任意整数秒。MiniMax H3 上提供的 2K 选项,H3 Max 没有。
最多 9 张图片、3 段视频和 3 段音频,合计上限 12 个文件。视频与音频每段为 2–15 秒,每类合计 15 秒额度,参考模式至少需要一份素材。
Kuca 提供向左环绕、向右环绕、镜头推进、镜头拉远、镜头升高和镜头降低六种可选运镜。相机运镜模式需要一张首帧和一个预设,提示词可以不填。
不会。在 Kuca 中音频是输入:最多 3 段 2–15 秒的参考音频,可用来固定人声、配乐、环境声或音效。如果你需要与画面一起生成的配乐,请使用 MiniMax H3。
按顺序写清六个部分:主体、地点、动作、运镜、时间顺序,以及边界条件,比如哪些内容不能出现。然后每条 5–15 秒镜头只保留一个主动作,两次尝试之间只改一个变量。
提示词含糊、把多条情节压进很短的时长、源图本身带有文字或干扰杂物,以及多份参考争夺同一项属性。本页的诊断一节逐条说明了原因和修改方式。