超级推理模型正面对垒：谷歌版o1发布次日，OpenAI o1下一代o3登场|agi|chatbot|openai|人工智能|大模型|知名企业|谷歌|超级推理模型

本文作者：李丹

来源：硬AI

圣诞节前，人工智能巨头上演了一场精彩的推理模型攻防战。谷歌和OpenAI正面对垒，谷歌刚发布自家的先进推理模型挑战OpenAI的o1，第二天，OpenAI就推出了升级版的最强推理模型o3。

美东时间12月20日周五，在为期12个工作日的线上新品发布活动最后一日，OpenAI宣布了“压轴大作”：o1的下一代模型o3，而且一开始就要推出两个版本，一个正式的o3，还有一个相对较小的精简版o3-mini。

OpenAI的CEO Sam Altman在直播中提到，OpenAI本次12日的活动第一天官宣了上线正式版o1、所谓满血o1。活动最后一天又有o3亮相，首尾都由介绍推理模型呼应，也算是一种精心设计。

逻辑上说，o1的下一代应该命名为o2，至于为什么新模型叫o3，之前媒体称，OpenAI是为了避免和名为O2的英国电信服务商冲突。Altman也确认了这点，说出于对O2的尊敬，并没有起同样的名字。

直播中，Altman称o3是“一个非常、非常聪明的模型”。OpenAi的评估结果也显示，无论在软件工程、编写代码，还是竞赛数学、掌握人类博士级别的自然科学知识能力方面，o3都明显高出o1一筹。同时测试显示，o3在OpenAI实现通用人工智能（AGI）这一奋斗目标上取得了突破，最高的测试成绩达到了类人水平。

o3软件工程测试准确率比o1高近47% 竞赛数学高15% 人类博士专家级生化物高近13%

今年9月，OpenAI 发布o1的预览版o1 preview时称，o1是第一个具备真正通用推理能力的大模型，它的核心能力推理在测试化学、物理和生物学专业知识的基准GPQA-diamond上得到了充分体现。据OpenAI评估，o1在该测试中全面超过了人类博士专家，准确率达到78.3%，而人类专家的得分为69.7%。

本周五的直播中，OpenAI展示了o3的测评表现：

根据OpenAI8月推出的SWE-bench Verified代码生成评估基准，在软件工程的能力测评中，o3的准确度得分71.7，即准确率71.7%，远超得分48.9的o1和得分41.3的o1 preview。也就是说，o3的准确率比o1正式版高将近47%，比o1预览版高将近74%。
在竞争性编程网站Codeforces的竞争性代码测评中，o3取得2727的Elo评分，o1评分1891，o1 preview评分1258。这个测评结果显示，竞争性代码方面，o3的评分比o1正式版高44%，是o1预览版的两倍多。

经过2024年AIME数学竞赛的题目测试，o3的准确度得分为96.7、即准确率96.7%，o1和o1 preview分别得分83.8和56.7。从竞赛数学的角度看，o3的准确率比o1正式版高15%，比o1预览版高近71%。
以人类博士专家的测试考验，在测试化学、物理和生物学专业知识的基准GPQA-diamond上，o3的准确度得分为87.7，即准确率87.7%，o1和o1 preview分别得分78.0和78.3。o3的准确率比o1高将近13%，比o1预览版高12%。