中国商报(记者 赵熠如 王怡菲)一块能够储存整个文明智慧的晶体,无论遇到什么问题,都可以向它寻求答案——20多年前,电影《超人》中的这一幕,让传神语联创始人何恩培萌生了一个念头:地球上能否也出现这样一块“智慧晶体”?这就是传神创始之初的蓝色晶体计划。
“从今天的角度来看,这实际上很像大模型:无论你提出什么问题,它都能够给出回答。但在20多年前,并没有‘大模型’这样的概念。”何恩培在接受采访时表示。
如今,面对AI大模型行业普遍追求更大参数、更多算力的技术潮流,传神语联却走出了另一条路径:基于“根原创”的技术路线,用更小的参数实现更高的性能,同时让大模型进入语言、中医、制造等真实行业,在解决实际问题的过程中持续学习,并逐步向通用人工智能(AGI)演进。
传神语联创始人何恩培。(图片由受访者提供)
坚持底层自研路线
传神语联成立于2005年,其“根原创”的AI技术路线最早应用于翻译领域,并支撑其成为语言服务行业的龙头。
按照何恩培的说法,传神语联在早期利用神经网络解决翻译等问题时,已经逐渐形成了一套公共算法集合,并在此基础上持续发展自己的人工智能底座。
“我们没有使用开源框架,不是因为刻意排斥开源,而是因为我们在这条路上起步较早,使用自己的体系解决问题非常方便。”何恩培说。
2015年以后,人工智能开源生态迅速发展。谷歌于2015年11月正式开源TensorFlow,2017年Facebook开源了PyTorch,并在此后逐渐发展为全球广泛使用的人工智能开发框架。
当行业开始普遍转向开源框架时,传神语联内部也曾出现激烈争论。
何恩培回忆,2015年至2016年,公司股东、合作伙伴和内部团队曾讨论过:既然市场上已经有开源的算法框架,是否还有必要继续投入自己的底层技术?
“这个问题让我们纠结了一到两年,内部曾经产生过非常激烈的争论和冲突。”他说。
最终,传神语联选择继续维护和发展自己的人工智能底座。最初的原因很直接:自研框架在实际项目中使用更顺手,交付效率和灵活性也更符合公司需求。到2018年前后,随着国际科技环境的变化,底层自主研发又被赋予了新的意义——独立的AI技术路线。
“如果在思想上跟随别人,在代码上依赖开源,最终必然会削弱我们的底层创新能力,并面临被‘卡脖子’的风险。”何恩培表示。
在他看来,如果把人工智能应用比作一座建筑,算法框架就是建材地基,模型架构就是建筑原理和图纸。在现成地基上盖房子,能够提高开发效率,但也可能限制创新空间,甚至根基不稳。
“我们的团队拥有自己的建筑材料和建筑图纸,从地基构建到高楼建成,全部自主研发,具备完全自主可控的能力。”何恩培说,传神语联可以通过自己独立的技术路线实现性能更好的大模型。
11B挑战大参数模型
过去几年,模型参数规模一度成为衡量大模型能力的重要标签,从百亿参数到千亿参数乃至万亿参数,不少厂商希望通过增加模型规模、训练数据和算力资源提升性能。
何恩培对此有不同的判断:“大模型不一定越大越好。参数规模是决定大模型性能的因素之一,但不是全部。”
任度大模型先后从2.1B、9B发展至11B,目前传神语联正在研发30B和50B模型。在MMLU-Pro和GPQA-Diamond两项公开评测中,任度11B模型处于第一梯队,以头部模型1%—5%的参数规模达到了其85%—100%的性能。何恩培称,任度展现出了接近国内外头部数千亿乃至万亿参数模型的水平,极具性参比优势。
他还表示,由于自研算法框架和模型架构的差异,传神语联训练同样性能大模型所需成本约为部分头部公司的1/100至1/20;模型从9B升级至11B后,模型能力指标提升约50%至80%。
小参数路线曾给传神语联带来不小的市场压力。何恩培回忆,任度2.0公开面向市场时只有21亿参数,团队内部曾担心,如实公布参数规模,会让市场质疑它是否能够被称为“大模型”。但传神语联最后仍选择公布真实规模,而该版本模型随后在当年SuperCLUE相关评测中进入全球前十。
除小参数高性能外,传神语联强调的另一项能力是持续学习。
何恩培认为,当前一些大模型在训练完成后,就处于能力冻结状态,不能持续学习,除非继续进行训练。目前绝大多数“记忆”方法,更多是“记住了新信息”,并不等同于把新知识重新学习压缩进入神经网络,不具备永久记忆能力。
为此,传神语联在2024年11月公开发布任度双脑大模型,一个“推理大脑”负责分析和回答问题,另一个“动态学习大脑”负责持续吸收新知识。2025年3月,传神语联发布了任度双脑深度思考大模型-T1。
在他看来,AGI不仅要能够推理和完成任务,还要和人类习惯、道德法律对齐,这就要求大模型应当像人一样在真实环境中持续积累经验。模型是否拥有持续学习能力,可能比单纯扩大参数更接近AGI的核心问题。
在行业应用中培养AGI
对于如何走向AGI,何恩培既不认同单纯“堆参数”的思路,也不赞成单纯使用“虚拟数据”的发展路线。
他认为,当前主流路线是不断增加训练数据、算力和参数,期待模型能力积累到某个阶段后自然产生通用人工智能。但如果模型长期停留在实验室和互联网数据中,缺乏真实社会规则和物理世界的约束,即便实现了AGI,也可能陷入不可控和不安全局面。
“这就像教育孩子一样,不能等到孩子快18岁时才突然让他接触社会,才开始提要求,那已经太晚了。”何恩培说,“必须在成长过程中让他参与真实社会,并对他进行引导。”
基于这一判断,传神语联提出“在落地过程中实现AGI”。
也就是说,不是先在实验室里制造一个能力足够强大的通用模型,再寻找行业用途,而是让模型先进入翻译、中医、制造、教育等具体场景,在解决真实问题的过程中接触人类积累的知识、规则和经验,并持续学习。
“进入实际应用场景,大模型在落地服务过程中就会与客观现实磨合,在学习进步的同时受到现实世界约束。”何恩培表示,“任度大模型之所以能够在行业落地,得益于其独特的模型架构(moH)。这使得任度大模型具备持续学习的功能,也是通向AGI必备的功能。”
中医是传神语联重点进入的第二个垂直领域。与标准化程度较高的西医数据不同,中医存在众多流派,不同名医的辨证思路和用药方式也各有特点。传神素问中医大模型的解决思路是,借助任度大模型的动态学习网络,为不同名医建立数字孪生体,用于传承教育、辅助预问诊、复诊跟踪以及大健康服务。
“素问不仅可以回答问题,还具备了辅助诊疗决策能力。”何恩培说。
制造业则是传神语联下一步重点拓展的方向。何恩培表示,公司计划从复杂推理场景切入,例如生产排产、复杂问题推演等。“一家制造企业往往同时面对多条生产线、复杂客户结构、供应链体系等问题,任何一个排产策略的调整,都会对生产周期、资金占用成本、供应能力等产生连锁影响。我们目前正从这类场景开始切入。”何恩培说。
按照传神语联给自己设定的目标,未来三年,任度大模型力争稳定进入全球第一梯队头部,在三个行业实现深度落地,并进一步赋能五至八个行业。
在何恩培看来,基于算法框架(PyTorch)和模型架构(Transformer)的路线是目前大家认为通向AGI的主流路线。“但它是唯一路线吗?它一定能够通往AGI吗?”他说,“AI是人类历史上最伟大的革命,人类通向AGI的科技树上应该有分支,而不是一根独苗,那是很危险的。”
“传神任度技术路线应该算一个分支。实践证明,我们‘根原创’构建的算法框架(zANN)和模型架构(moH),也是通往AGI的可选路径之一。”何恩培说。
热门跟贴