在开源文本转视频领域,MiniMax-H3 是今年最值得关注的发布之一。只需输入一段文本提示,它就能生成带同步音轨的短电影片段,而且你不需要自己碰 GPU 就能端到端跑通。 要直观理解这意味着什么,看看人们分享的结果就够了。最近我的信息流里全是 H3 复刻的著名电视场景——《绝命毒师》的实验室、《老友记》的咖啡厅、《办公室》的伪纪录片瞬间。 本文涵盖: - MiniMax-H3 到底是什么 - 如何自己运行它 ### MiniMax-H3 是什么? MiniMax-H3 是一个文本生成视频模型,以电影级分辨率生成短视频。与早期开源视频模型相比,有两点突出: - **声音来自同一个模型**。大多数开源文本转视频流程输出静音帧,之后还要接一个单独的音频模型。H3 则一次性生成与视觉内容对齐的音轨。 - **关键帧条件控制**。你可以传入可选的起始帧和/或结束帧图像,模型会在这两帧之间插值出运动路径。这让它从纯粹的“氛围生成器”变成可以真正执导的工具。 可调参数也都是你预期的那几个: - **Prompt**:自由文本(例如“金色时刻的 corporate glass boardroom,一个人站在窗边,不详的弦乐渐强”) - **First frame / Last frame**:可选的图像条件 - **Canvas**:分辨率和宽高比 - **Duration**:时长(秒) - **Steps**:去噪步数(步数越多越慢,但通常更干净) - **Seed**:用于复现 - **Upsample prompt**:在生成前让模型把你的提示改写成更描述性的版本。当你的提示偏向于“guy walks into diner”而不是“medium wide, 35mm, natural light, subject enters frame right”时非常有用。 MiniMaxAI/MiniMax-H3 现已通过 Hugging Face Inference Providers 提供,你可以在 Hugging Face 上免费试用,并使用你的账户直接体验。
热门跟贴