阿里发布了全模态模型 Qwen3.8-Omni-Flash,同时支持音频和视频理解。这款模型配备 1M-token 上下文窗口,在 WildClawBench-MMUniClawBench 两项测试上,性能接近 Gemini 3.8 Flash

模态意味着什么

打开网易新闻 查看精彩图片

音频和视频理解被放进同一个模型,而不是拆成两条独立的产品线。对使用者来说,输入形态的边界被抹平了——一段录音、一段视频,都可以直接交给模型处理。

1M上下文与两项测试

1M-token 的上下文窗口,决定了单次能塞进多少内容。WildClawBench-MM 和 UniClawBench 是这次给出的两个参照点,Qwen3.8-Omni-Flash 在这两项上的表现,被描述为接近 Gemini 3.8 Flash。

接近,不等于超越。这个措辞本身留出了空间,也说明阿里这次把对标对象明确指向了 Gemini 3.8 Flash。