9月1日消息,科大讯飞全资子公司词元星火今日推出并开源星火X2.5-4B和星火X2.5-1.7B两款端侧通用大模型。两款模型原生支持最长100万Token上下文,并围绕智能体、代码、数学和指令遵循等能力进行优化。
打开网易新闻 查看精彩图片
据了解,星火X2.5采用混合注意力架构,可在本地设备中处理长篇文档、技术资料及代码仓库等大规模信息。模型使用覆盖长文本场景的千亿Token级高质量数据进行训练,可在连续交互中保持对前文信息的理解,并完成跨章节信息关联和综合判断。
应用方面,星火X2.5可用于个人办公、代码开发、智能硬件和机器人等场景。在办公任务中,模型可完成数据分析、文档生成及翻译;代码场景下,星火X2.5-4B在部分任务中可对标参数规模大2至3倍的云端模型。智能家居测试中,星火X2.5-1.7B控制指令端到端执行正确率达到90.3%,平均响应时间为0.85秒。
训练方面,两款模型基于全国产算力平台完成全流程训练,使用约20万亿Token数据进行预训练。部署层面,模型支持英伟达、华为、海光及后摩等硬件平台,并兼容vLLM、SGLang、llama.cpp等推理框架。
目前,星火X2.5-4B和1.7B已在Hugging Face、GitHub开放模型权重、代码仓库和部署文档,模型API也已上线讯飞星辰MaaS平台。(葛嘉淼)
热门跟贴