席迎军表示,通过更大规模、更长周期、更多样任务环境的后训练,GLM-5.3进一步释放模型能力上限:编程能力较上一代提升50%,并在多项公开基准测试中取得开源模型第一;在代码审查、漏洞发现等网络安全任务中,能力也进一步提升,表现更加优秀。 据CNMO科技了解,智谱AI今日正式发布GLM-5.3模型。在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3;在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上,得分从46.2提升至66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents' Last Exam上,得分从23.8提升至28.5。 此外,GLM-5.3即日起上线ZCode、AutoClaw及GLM Coding Plan,且GLM Coding Plan额度已重置,API即将推出,完整模型权重也将在完成必要的安全评估与加固后,于未来两周内向公众开放。
席迎军表示,通过更大规模、更长周期、更多样任务环境的后训练,GLM-5.3进一步释放模型能力上限:编程能力较上一代提升50%,并在多项公开基准测试中取得开源模型第一;在代码审查、漏洞发现等网络安全任务中,能力也进一步提升,表现更加优秀。 据CNMO科技了解,智谱AI今日正式发布GLM-5.3模型。在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3;在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上,得分从46.2提升至66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents' Last Exam上,得分从23.8提升至28.5。 此外,GLM-5.3即日起上线ZCode、AutoClaw及GLM Coding Plan,且GLM Coding Plan额度已重置,API即将推出,完整模型权重也将在完成必要的安全评估与加固后,于未来两周内向公众开放。


JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图