新智元报道
7月底MiniMax H3开源的时候,Artificial Analysis视频编辑榜Elo 1130分。
直冲全球第一,社区一片叫好。
不得不说,H3底子确实好。
但真拿去做量产,短板也在:多镜头一长,角色开始走样;商品多拍几组,轮廓就说不准;十几个镜头连着跑,后面越来越不像同一部片子。
从「跑得通」到「生产能用」,差的那一段是工程。
现在这段被补上了。
9月29日,RunningHub发布H3 RH Enhanced,一个基于MiniMax H3开源基座做深度后训练的增强模型。
RunningHub是海马云旗下的一站式全能创作平台,是目前全球最大的AIGC开发者创作者社区,聚集了500万以上专业创作者,覆盖140多个国家和地区。
通过 2000 组实测,H3 RH Enhanced 多镜头长时序叙事能力显著优于 Seedance2.0,整体表现直追 seedance2.5。
一秒一毛钱即可直接产出成片,降低成本。
这意味着,一个开源后训练模型,做到了闭源的效果。而成本仅为同等效果闭源模型的十分之一。
H3 RH Enhanced已经登陆 MiniMax ,面向全球B端创作者进行公开调用。现在可以在RunningHub平台上限时免费体验。
体验链接:
rhTV:
https://rhtv.runninghub.cn/projects?inviteCode=sn3gnlj9&model=484
RHSTORY:
https://story.runninghub.cn/ai-comic
2000组盲测
多镜头叙事显著优于Seedance 2.0
1 秒只要 0.1 元
发布会上的Demo都好看,问题是真实场景什么样。
RunningHub这次的评测是按业务场景铺开的:人物连续特写、多场景转场运镜、多角色互动、16镜头以上完整叙事,四类各500组,合计2000组对照样本,横向拉齐当前主流模型。
结果里最关键的一项是多镜头长叙事:8到16镜连续生成,人物身份一致性、场景元素留存、指令约束留存三项指标,RH Enhanced全部显著领先Seedance 2.0。
来看几条实测。
先看一条15秒的赛博机车追逐。同一张参考图、同一段14镜提示词,分别喂给RH Enhanced和Seedance 2.0,480P直出,音频由模型自己生成,不做任何针对性调参。
RH Enhanced这边,两辆车从起跑到冲线一直是参考图里那两辆,07号黑橙、12号白蓝,号码牌没糊过、没换过。
女主换了正面、背后、双人特写、终点定格四种机位,始终是同一张脸、同一套带橙色肩甲的机车服,背景城市也没跑偏。
声音跟画面一起生成出来:起跑前近乎安静,弹射那一拍轰鸣骤起,进隧道声画同时压暗,出隧道一起拉起。
RH Enhanced生成
Seedance 2.0单帧画质不差,护目镜里的倒计时甚至更贴提示词。
但镜头一多就松了:第4镜两辆车变成Tron风格的光环轮,已经不是参考图那款车;第5镜航拍直接换了一座城,广告牌全没了,还有明显穿模;第6镜女主的机车服从装甲款退成了普通皮衣。
不算崩,但已经不是同一部片子。
Seedance 2.0生成
十个镜头之后,RH Enhanced还认得参考图,Seedance 2.0开始凭印象重画。
再看一条电商的。电商最怕的不是画面不美,是商品变样。
这条15镜香水片,RH Enhanced全程瓶子都是参考图那一只:方正厚玻璃、满瓶琥珀液、黑盖金环,ORBIT 07标识没漂过。
模特穿过沙漠、雨夜橱窗、电梯、天台,同一张脸、同一件黑丝绒礼服。
RH Enhanced生成
Seedance 2.0同样精致,但电梯那镜,瓶子悬在了掌心上方。
Seedance 2.0生成
极端长场景:人物崩坏率降低60%以上。
16镜往上,Seedance 2.0的角色遗忘开始集中爆发,前面还好好的女主角,后面突然换了张脸,衣服变了,道具丢了。RH Enhanced在同等条件下,这类崩坏砍掉了六成以上。
我们拿两条18镜的片子试了试。
18镜、五个世界,考的就是模型记不记得她是谁。
RH Enhanced从雨巷、沙漠、雪林、地铁到空间站再回雨巷,四次正面特写是同一张脸,黄雨衣一直敞着帽、红伞一直在手、黑包一直斜挎。第1镜埋下的街角时钟,第16镜回来还挂在原处。
RH Enhanced生成
Seedance 2.0开场和结尾都不差,最后回眸那帧很像参考图。
但中段崩了:雨巷里帽子戴着,到雪林就摘了;更要命的是红伞,从雪林奔跑、进地铁到整段空间站漂浮,将近4秒、3个镜头里伞直接不见了,到舱门那镜才重新出现——
而提示词里「红伞、黑包、雨衣同时漂浮」恰恰是这段要测的东西。
Seedance 2.0生成
另一条18镜的东方奇幻,两个人加一只灵兽,三个主体得同时在线。
RH Enhanced很稳:女剑仙的白发、额心红印从特写到收尾是同一张脸,剑没离过手;黑甲将军有正面近景,脸、盔甲、披风、长枪都对得上参考图;灵兽每次出现都是同一只鹤。
最难的最后一镜也守住了:天宫半塌、碎石还在掉,女主和鹤在桥头,将军在远处残阶,三者位置一眼清楚。
RH Enhanced生成
Seedance 2.0画面同样华丽,但将军的近景只有盔甲没有脸;收尾天宫大门完好无损,「半塌」没发生。
Seedance 2.0生成
RH Enhanced能在长叙事上拉开差距,靠的是一套自研的RH长程记忆引擎。
普通模型的记性像一扇滑动的窗,镜头一多,第1镜那张脸就被挤出窗外了。
长程记忆引擎干的事,是在模型架构层面把跨帧信息钉住,让第14镜还记得第1镜的五官、服装和道具,不靠后期修补。
上线以来,RH Enhanced日均生成接近100万秒视频,相当于每天6.7万条15秒短视频,或者3300多集5分钟短剧。
RunningHub后训练做了什么
五层工程改造
让H3在量产场景更稳更快更省
RunningHub这次动的不只是权重。
从后训练、分辨率适配、采样策略、推理引擎到服务调度,五层一起改,每一层对应量产里一个绕不过去的问题。
第一层:场景定向后训练——把短剧、电商、漫剧的业务约束练进模型里。
H3基座管的是通用能力,什么都能做。
但短剧里人物频繁换装换场,电商里商品轮廓和材质一点不能变,漫剧里动作要连贯不能断,这些垂直场景各有各的细规矩,需要单独练。
RunningHub基于H3的单流Omni-Transformer架构和MM-RoPE多模态位置编码,给RH Enhanced搭了一条「场景SFT → 一致性优化 → 少步蒸馏」的训练链路。
训练数据是RunningHub围绕短剧、电商、漫剧三类真实业务构建的,每条样本都标清楚哪个是参考素材、哪个是目标人物、镜头指令指向谁。
训练时盯死四件事:人不换脸、有参考图就要像、动作做完整、运镜不乱跳,正是废片率最高的四种情况。再加上长程记忆引擎在跨帧维度上的增强,就有了前面16镜以上崩坏率下降60%的结果。
第二层:分辨率感知适配——训练分布对齐实际交付规格。
短剧、电商、漫剧的成片有自己的交付规格,跟模型默认的训练分辨率并不一样。
RunningHub按宽高比、帧数、时长给训练数据分桶,让分布直接贴着交付规格走;再做区域加权,人脸、商品轮廓、服饰结构这些决定「能不能用」的地方权重拉高,背景适当放宽。
结果是视觉Token更短、算力更省,但该清楚的脸和商品依然清楚。出来的就是成片,直接进剪辑时间线。
第三层:少步蒸馏——把几十步的质量压进几步。
视频生成本质上是从噪声一步步迭代成画面,H3默认要跑几十步,每步都是一轮完整的Transformer前向。
RunningHub用「教师—学生」式轨迹蒸馏:教师跑完整采样,学生不只学最终结果,还学教师在每个阶段的速度场方向和终点重建目标,把多步才有的质量压进少步模型里。
步数也不是一刀切,静态镜头、对话戏少给几步,大幅运动、多参考素材的镜头多给几步。
第四层:注意力与缓存协同加速——让每一步算得更快。
推理执行层,RunningHub叠了三项技术。
SageAttention2对注意力矩阵做离群值平滑和细粒度低精度运算,不丢精度地提高吞吐。
Cache-DiT是RunningHub自研的Dual Block缓存,相邻采样步之间DiT中间层特征变化不大,全部重算是浪费,它按特征变化幅度决定哪些模块复用、哪些重算,首尾模块保留实时计算,中间按阈值复用残差,并设连续复用上限防止误差累积。
torch.compile把计算图编译成融合算子,减少Python层和显存之间的来回搬运。
多卡用TP2+Ulysses4混合并行,张量并行切权重,Ulysses切长序列注意力。这个组合专门适配PCIe连接的普通多卡环境,不需要NVLink,京东上能买到的RTX级服务器就能跑。
第五层:批量服务调度——一万条一起跑,成本才压得下来。
前四层解决单条视频怎么又快又好,但量产面对的是一天几十万条。
单条再快,GPU利用率上不去、任务调度不合理、显存碎片化,综合成本照样下不来。
RunningHub的服务层把输入形状相近、采样配置兼容的任务自动分桶组batch;高频配置做参数预热和编译缓存复用,省掉冷启动;再按任务队列的实时负载在多台服务器间调度。
考核的不是一条视频几秒生成,而是GPU时间、合格成片率和批量吞吐一起算,落到每条合格成片的交付成本上。
算下来,一秒一毛钱。
海马云十年GPU工程底子,加速和超分同步就位
五层改造讲起来清楚,做起来要的是从训练到推理内核到集群调度的全栈GPU工程能力。
RunningHub的母公司海马云做了十年云渲染,国内60多个边缘节点,3000万以上月活,8到10毫秒的实时云游戏。
十年云渲染真正留下的,是大规模异构GPU集群的运营和调度经验:型号不一的卡怎么统一管,怎么让每一张都跑满,推理优化怎么压进链路里。
这套经验迁移AI推理上是通的。
云渲染的高峰集中在晚上10点以后,AI推理的高峰在早9点到晚6点,两种负载刚好错峰,实现渲推一体。同一批GPU白天推理、晚上渲染,利用率拉满,成本自然摊薄。
所以RH Enhanced对外交付的也不只是一份权重,而是后训练模型、算力和服务打包在一起的整套方案,客户拿到手就能跑。
这也是它跟同赛道其他平台的最大差别。
大多数AI视频平台做的是模型聚合,把各家API接进来供用户调用;RunningHub做的则是模型工程化改造,从权重层面一直改到服务层面。
要理解RunningHub为什么肯把手伸这么深,得先看清一件事:模型本身正在不紧缺。
开源基座一个接一个,各家能力越拉越近,很多场景下调哪个、编排谁,出来的东西差不了多少。
真正的差距往两头走了。往下,是能不能把GPU规模化地运营起来、把推理成本打下来;往上,是能不能通过后训练和私有部署,把一个行业的知识变成模型自己的本事。两头都拿住的,才站得稳。
海马云就是按这个思路:五层能力栈,中间用一个数据闭环转起来。
最底下是算力层。上面说的异构GPU调度、渲推错峰,都在这一层,RH Enhanced的推理加速和批量调度也落在这里。
往上是模型层,管三件事:后训练、模型本身、编排。海马云不从零训通用大模型,一头是像RH Enhanced这样拿开源基座做后训练,另一头是把全球主流模型统一编排起来:哪个场景该上贵的,哪个场景用性价比高的就够,怎么按业务需求组合调度。这个能力在RunningHub上看得最直接。
再往上是Harness执行层,给模型装上手和脚。模型自己只会吐文字、出图片,Harness让它能接住一整条业务链路,真正在流程里干活。落到RunningHub上,就是那套工作流和Agent引擎。
第四层是数据层,护城河最深的一层。RunningHub上每天产生上万条专业工作流,这些真实业务行为被沉淀成专家轨迹条件示范数据集,再转成垂类知识库。
应用跑出数据,数据反哺Harness和模型,模型变强,应用更好,再跑出更多数据——一个自己转起来的闭环,实现递归自我进化,外面很难照抄。
最上面是应用层,对外就三种形态:API、SDK、带界面的App。RunningHub就是这套能力栈跑通的验证:工作流、AIGC应用市场、可视化画布、API服务,全链路都走了一遍。
模型能力在商品化,壁垒往两头走:底下是把算力成本打下来,上面是把行业知识变成模型自己的能力。海马云两头都在做。
所以它推出来的不是一个模型,是一套。
此前开源的RH Lightning把H3推理提速12倍,5秒视频从349秒压到29秒,方案完整公开在GitHub上;近期发布的RH Upscale视频超分,在含火山引擎方案在内的13个参测配置中综合性能第一,Ultra模式人脸视频得分行业最优。
Lightning管速度,Enhanced管出片,Upscale管画质:RH Enhanced出成片,要1080P的再过一遍Upscale。
从生成到加速到画质增强,一条完整的AIGC视频工业管线在RunningHub平台内闭环。
还有一个信号:RH Enhanced已经获得MiniMax官方认可,上架MiniMax官网面向全球调用。基座厂商给第三方后训练方案背书,这在行业里不常见。
模型够用只是第一步
能接进生产工作流才算数
现在做AI短剧、电商视频、漫剧的团队,卡住他们的早就不是画质。
而是多镜头一拉长角色就飘、废片率高到算不过来账;是自己部署开源模型运维比API还贵,用闭源API效果好但月底账单吃不消。
RH Enhanced要解决的就是这两个数字:崩坏率和每秒成本。
多镜头稳到能批量生产,价格低到小团队用得起,打开平台就能调,不用自己伺候120GB显存的机器。
参数翻倍、榜单登顶当然更好看,但AI视频要从热点变成基础设施,得先把这两个数字打下来。
编辑:所罗门
热门跟贴