输入价格差5倍,输出价格差近8倍。阿里Qwen发布了一款多模态模型,直接对标谷歌的Gemini Flash,价格却压到了对手的零头。

这款模型叫Qwen3.8-Omni-Flash,是Qwen首个为AI智能体打造的多模态模型。它能同时处理音频和视频,自己得出结论,还能自主调用工具去剪辑vlog、翻译短视频、总结电影。上下文窗口达到100万token

打开网易新闻 查看精彩图片

价格差在哪

API定价上,Qwen3.8-Omni-Flash每百万输入token收0.15美元,每百万输出token收0.47美元。音频输入每小时不到0.01美元;720p带音频视频按每秒一帧计算,约0.20美元,不含响应费用。

对比之下,Gemini 3.8 Flash的输入价为每百万token 0.75美元,输出价3.75美元,这还是它的 introductory rate。到2027年1月1日,这个价格会翻倍。

能力对标与生态

在音频-视频任务上,Qwen称这款模型的表现接近Gemini 3.8 Flash。模型可通过Qwen Studio、Qwen Cloud和API获取。

配套的开源Qwen-MM-Plugins为Claude Code、Gemini CLI、Qwen Code等智能体增加了视频编辑、说话人识别、PDF视频笔记和可复用工作流。另有Qwen-Live Harness,支持用摄像头和麦克风进行实时交互。

一个为智能体设计的多模态模型,把价格压到对手的五分之一,同时宣称能力接近——这给做视频处理、音频分析的开发者提供了一个新的成本选项。