【CNMO科技消息】9月18日,千问新一代原生全模态模型Qwen3.8-Omni-Flash正式上线。据CNMO科技了解,该模型支持文本、图像、音频和视频输入,并支持1M长上下文处理,可在理解内容的基础上自主规划任务、调用工具并完成创作与交付。
从功能来看,Qwen3.8-Omni-Flash在延续编程、文本处理和GUI操作能力的同时,进一步扩展了音视频相关任务处理能力。针对长音视频理解,模型可面对数小时视频内容,从问题出发决定关注的画面和声音信息,并通过多轮取证定位关键内容。结合工具后,还可从会议中提炼纪要、待办事项与风险信息,并继续执行发邮件、写代码或检索多模态资料生成报告等后续任务。
在音视频创作方面,模型可用于音乐视频制作、短剧翻译和长电影解说等场景。例如,在音乐视频创作中,模型可理解歌曲结构、节奏和情绪,输出带时间戳的句级歌词;在短剧翻译中,可完成角色识别、口语化翻译、配音克隆、音轨重混与成片质检;在长电影处理中,则可完成情节提炼、解说规划、配音配乐、剪辑渲染和最终质检。
此外,该模型还可将长视频内容转化为可复用的信息资产,包括自动梳理知识点、拆解步骤,生成图文对应的PDF笔记,并进一步转化为经过校验和评测的Agent Skill。实时交互版本Qwen3.8-Omni-Flash-Realtime则可在音视频流输入过程中同步完成感知与响应,适用于口语陪练、空间音频感知和智能客服等场景。
配套方面,官方同步扩展了Qwen-MM-Plugins,新增面向音视频理解与创作的多项能力,并开源Qwen-Live Harness,用于持续、实时的音视频交互与任务执行。根据官方数据,在累计30项评测中,Qwen3.8-Omni-Flash相比上一代Qwen3.5-Omni-Plus平均得分提升超过26%;同时,API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。
目前,该模型已上线千问AI平台。
热门跟贴