阿里发布了全模态模型 Qwen3.8-Omni-Flash,支持音频和视频理解。这款模型配备 1M-token 上下文窗口,在 WildClawBench-MMUniClawBench 两项测试上,性能接近 Gemini 3.8 Flash

模态加长上下文

打开网易新闻 查看精彩图片

全模态意味着模型能同时处理音频和视频两类输入,不再局限于纯文本。1M-token 的上下文窗口,则决定了它在单次任务里能"记住"多少内容。两个能力叠加,指向的是更复杂的多模态任务场景。

从公开的测试结果看,Qwen3.8-Omni-Flash 在 WildClawBench-MM 与 UniClawBench 上的表现,已经接近 Gemini 3.8 Flash 的水平。这两个基准的名字里都带着 MM,对应的是多模态能力评估。

对标意味着什么

阿里这次把参照系直接放在了 Gemini 3.8 Flash 上。性能"接近"是一个需要留意的措辞——它说明双方处在同一量级,但并未宣称超越。

对开发者来说,多了一个支持音频和视频理解、且上下文窗口达到 1M-token 的模型选项。具体能跑出什么效果,还要看实际接入后的表现。