上海 AI Lab 开源 InternLumina-U2:16B MoE 统一多模态模型,同时支持华为昇腾一、它是什么:encoder-free 统一多模态二、为什么这次不一样:三件事同时落地三、对国内开发者意味着什么四、对比老一代旗舰:闭源 vs 开源

10/1,上海人工智能实验室(InternLM 团队)在 Hugging Face 开源 InternLumina-U2。Apache 2.0 协议,总参数 16B、激活 1B(架构命名 16B-A1B),主打"统一表征 + 一套权重",文本、图像、视频、3D 共用同一套解码器。

InternLumina-U2 走的是 encoder-free 路线——不用 VAE 也不用 ViT,直接在统一 token 上做理解与生成。视觉侧用 AToken 8-codebook 全离散表征(同类方案通常 4-codebook 起步,U2 翻倍),文本/图像/视频/3D 共用一套。

参数 16B 是总容量,实际推理只激活 1B 左右——和 Mixtral 一个思路,落地成本低。

开源圈不缺多模态模型,但这次有三件事是少见组合:

1. 单一权重支持四模态(文/图/视频/3D),不用为每个任务换模型;

2. AToken 8-codebook 让视觉表征稳定,离散化让生成端更容易拼接;

3. 双 checkpoint 同时覆盖华为昇腾 NPU 和 NVIDIA GPU——国内学术机构少见这种"国产硬件 + 国际硬件一次给齐"的开源动作。

第一,可以本地跑统一多模态,不用堆云端 API 烧钱;

第二,昇腾 NPU 有了"开源大模型 + 现成权重"的可用入口,HuggingFace 直接下载;

第三,技术报告 "Coming Soon",但权重与推理脚本已发 HuggingFace,先到先得。

第四,Apache 2.0 协议——商用、自部署、二次微调都允许,没有 "open weights but restricted" 的坑。

闭源侧,OpenAI GPT-4o、Google Gemini 4 Argon 都走"统一表征 + 大规模 RLHF"路线,能力领先 6-12 个月,但按 token 计费、本地化困难。

开源侧,InternLumina-U2 把"统一表征"门槛拉到 16B 总参(激活 1B),国内学术机构首次把双硬件 checkpoint 一次给齐。在 Hugging Face 上的下载量在前 48 小时已超 12k,对一个还在 Coming Soon 阶段的模型来说算非常快。

一句话总结:开源端"统一多模态 + 国产硬件"这件事,这次是真的落地了。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片