过去一年,大模型行业的主战场先是参数和榜单,后来是 Coding 和 Agent。但百灵大模型负责人西亭认为,真实世界里还有大量任务没有被很好解决:金融、医疗、法律、日常工作流,这些任务未必像 Coding 一样有标准数据和清晰答案,却更接近普通人的生活。模型如果要走向真实世界,就不能只会回答问题,还要能把任务做扎实。
外滩大会期间,网易科技等媒体与蚂蚁集团基础智能技术部负责人、百灵大模型负责人西亭,阿福模型技术负责人进捷,百灵金融模型负责人月引,百灵语言基座负责人零幺,围绕百灵3.0、金融和医疗模型,以及模型进入真实世界的标准,进行了交流。
西亭反复提到“智效比”。在百灵的语境里,这不是单纯降低推理成本,而是把能力、速度、成本和可靠性放在一起看。西亭说,“生成的快并不代表整个任务完成的快”,真正要看的是一个任务总共花了多少钱、用户等了多久、中间重复多少次、最后结果是否可靠。
因此,百灵3.0没有把叙事放在更大参数上,而是开源 Tiny、Flash 等小尺寸模型,并在其上做金融、医疗专项增强。百灵语言基座负责人零幺把技术目标概括为,“用更低的 FLOPs 撬动更大的智能”。用户并不关心模型有多少参数,而是关心它能不能在可承受成本下真正完成任务。
更关键的是,百灵把金融和医疗看成模型进入真实世界的压力测试。因为这两个行业都足够复杂,也足够不容许模型胡说。
在医疗场景里,阿福模型技术负责人进捷说,用户问“我今天生病了,该怎么办”,真实任务并不是得到一段回答,而是解决健康问题。阿福因此从问答走向服务连接:AI 先做初步分析,必要时接入真人医生,再连接后续问诊、购药或健康管理。西亭提到,医疗模型的重要启示是,“多问一句会比着急给一个答案重要得多”。专业并不是立刻作答,而是知道信息是否充分、风险是否可控、什么时候需要医生复核。
金融场景同样如此。百灵金融模型负责人月引说,Ling-3.0-flash-Fin 选择行研作为切口,是因为它足够难、强专业,并且其中有可校验部分。金融模型不能只是写一份漂亮研报,而要找到准确完整的信源,区分事实、假设、分析和推断,保留计算路径,让结果可追溯、可审计、可编辑。她说,行研里有些估值建模可以校验,但最终推断带有主观性,所以模型必须先从可验证部分入手。
西亭表示,一个好的 Agent,“不仅仅是帮用户知道下一步应该怎么做,它更重要的是要知道哪一步它不能做”。
零幺解释,今天很多模型都有迎合用户的倾向,因为多数评测鼓励模型给答案,而不是承认不知道。但金融、医疗不允许这种“蒙一个答案试试”的逻辑。月引也说,在严肃场景里,她宁愿模型说“不知道”,也不希望它给出几十种口径让用户自己猜。
所以,百灵对真实世界模型的判断标准,不是单点能力,而是智效比、专业性、开放性,以及反馈闭环。模型要理解专业流程,能调用工具,能留下证据,能接受复核,也能在不确定时停下来。
这比单纯冲榜更难,但也更接近大模型下一阶段的竞争。百灵想证明的是:AGI 不只有 Coding 一条路。真正进入真实世界的模型,既要聪明,也要可靠;既要会做事,也要知道边界。对金融和医疗这样的场景来说,克制本身就是能力。(袁宁)
热门跟贴