一个总参数78.1B的大模型,每个token却只激活3.46B——算下来是4.4%。这个比例来自德国团队Aleph Alpha刚发布的开源权重模型Kolibri,一个专为德语和英语打造的双语MoE模型。
它已经挂在Hugging Face上,采用Apache 2.0许可。目标场景写得很明确:公共管理、工业、航空航天这类受监管行业的主权部署。
单卡就能跑起来
能不能部署,是这类模型最实际的问题。Kolibri给出的答案是能。
FP8精度的检查点约78GB,可以跑在单张B200、B300或H200上,也可以放在2张H100 SXM5上。服务端通过vLLM启动,配套了专门的Kolibri推理和工具调用解析器。
上下文窗口最高支持1,048,576个token,用户还能按请求单独设置推理强度。默认上下文是262,144个token,想要拉满到1M窗口,需要传入--max-model-len 1048576并覆盖max_position_embeddings。
官方推荐的采样参数是temperature 1.0、top-p 0.97、top-k 128。
从数据到评估,全流程自己控
Kolibri(Kolibri-1)是一个英德双语MoE transformer,由德国的团队端到端开发。技术报告显示,Aleph Alpha团队控制了整条流水线:数据、架构、训练基础设施、后训练和评估。
训练跑在德国和芬兰的基础设施上。设计上对齐的是欧盟通用人工智能行为准则、欧盟人工智能法案和GDPR。Aleph Alpha是该准则的签署方,其数据流水线在训练前会对个人数据进行脱敏处理。
架构层面,Kolibri堆叠了50个transformer块,模型宽度为2,560。每个MoE层用sigmoid路由器给全部384个路由专家打分,每个token送往其中6个,同时始终运行1个共享专家。专家负载通过精确分位数平衡和负载误差注入来调节。
注意力机制用的是分组查询注意力,48个查询头配4个KV头。每第5个块使用不带位置编码的完整注意力,其余40个块使用滑动窗口注意力,窗口覆盖前512个token,并配合RoPE。
滑动窗口层的KV缓存是固定大小的,因此只有10层会随上下文长度增长。在同等算力下,团队报告这种混合注意力支持的序列长度是完整注意力模型的4倍。
为德语专门做的分词器
词表规模为128,000个token,用UniBPE训练。它的合并方式类似BPE,但每个合并按Unigram损失打分。
在德语文本上,Kolibri达到每token 4.90字节,而GPT-5分词器是4.35。这意味着在德语网页文本上,token数量少了11.2%。在英语上,Kolibri为每token 4.58字节,GPT-5为4.67。
24T token的训练账本
预训练覆盖了20T token,用了768张NVIDIA B200 GPU。随后是3.44T token的中期训练,序列长度为65,536。再之后是一个201B token的长上下文阶段,训练序列长度达到262,144。
Aleph Alpha还额外加入了超过2T的德语token,来源包括从网页筛选和合成生成。后训练结合了监督微调,混入MergeMix,并在超过120万个内部任务上做强化学习。Merlin-Arthur协议则训练模型在检索到的上下文不支持答案时选择弃答。
基准测试里的位置
所有模型都在同一套评估框架下测试。英语方面,Kolibri在GPQA Diamond拿到84.3,AIME 2025拿到96.9,AIME 2026拿到96.0。
在英语智能体平均分上,它与Qwen3.5 35B-A3B打平,都是63.4。但在BFCL v4上落后,得分61.4,Qwen3.5为70.5。
稠密的Qwen3.8 27B总分更高(英语80.2,德语79.9),但每个token激活的参数约为Kolibri的8倍。对比内部前代Kolibri Origin,Kolibri每张GPU解码的文本量约为2.7倍,英语得分高出21.4分。
在Aleph Alpha对比的12个MoE模型中,Kolibri拿下了英语(75.5)和德语(70.8)的最高总分。
部署命令长这样
安装aleph-alpha-inference包后,用vLLM启动:
- pip install 'aleph-alpha-inference>=1'
- vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8
- --reasoning-parser kolibri1 --tool-call-parser kolibri1
- --enable-auto-tool-choice
推理强度通过chat_template_kwargs里的reasoning_effort设置。
几个关键数字可以收在一起看:78.1B总参数、3.46B激活,每个token用384个路由专家中的6个加1个共享专家;40个滑动窗口层加10个完整注意力层撑起1M token上下文;24T token训练,德语占比超过20%;Apache 2.0的FP8权重,单张B200或H200就能通过vLLM服务。
热门跟贴