2月19日,Google正式发布Gemini 3.1 Pro。

作为Gemini 3系列的旗舰迭代版本,官方将其定位为面向最复杂任务的高阶推理模型。

打开网易新闻 查看精彩图片

该版本依托MoE混合专家架构,实现了核心能力跃升,在推理、长上下文、编程、智能体、多模态五大维度上,都刷新了行业基准,成为当前AI模型竞赛中兼具性能与性价比的标杆产品。

Artificial Analysis 的评估表明,Gemini 3.1 Pro 已经跃居榜首,再次成为世界上功能最强大、性能最佳的 AI 模型。

打开网易新闻 查看精彩图片

Gemini 3.1 Pro的核心突破集中在抽象推理能力的翻倍提升。

第三方独立评测显示,在ARC-AGI-2这一衡量模型处理全新逻辑模式的严苛基准上,模型得分从Gemini 3 Pro的31.1%跃升至77.1%,性能提升超两倍,远超Claude Opus 4.6的68.8%与GPT-5.2的52.9%。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

Google CEO Sundar Pichai公开评价,这一成绩标志着核心推理能力的里程碑式进步, 让高级推理从实验室能力变为解决真实复杂挑战的实用工具。

打开网易新闻 查看精彩图片

在学术与科学推理场景中,GPQA Diamond科学知识基准测试拿下94.3%的行业最高分,Humanity’s Last Exam高级学术推理测试零工具辅助得分44.4%,均领先同期主流旗舰模型。

权威AI评测机构THE DECODER指出,该模型在科学知识与复杂逻辑理解上的表现,已接近专业领域人类专家水平。

同时,幻觉率较上一代降低38%,大幅提升了高价值场景的可靠性。

长文本处理能力也是Gemini 3.1 Pro的核心优势之一。

新版本模型支持100万token输入上下文与6.5万token输出长度,可一次性处理整本书籍、数小时会议记录、完整代码库等超大规模文本,而无需拆分任务。

打开网易新闻 查看精彩图片

OfficeChai实测数据显示,在处理百万级token长文档时,信息提取准确率保持在90%以上,输出完整技术手册、行业研报等长文本的连贯性与完整性优于同类模型,解决了传统模型长文本处理碎片化、信息丢失的痛点。

编程与工程能力方面,Gemini 3.1 Pro在LiveCodeBench Pro竞赛级编程测试中ELO评分达2887,SWE-Bench Verified工程代码修复通过率80.6%,与Claude Opus 4.6持平并显著高于GPT-5.2,Terminal-Bench 2.0终端编程得分68.5%,较上一代提升11.6个百分点。

此外,Gemini 3.1 Pro智能体能力实现近翻倍提升。

APEX-Agents长链任务测试中,其得分33.5%,较Gemini 3 Pro的18.4%大幅增长,领先Claude Opus 4.6的29.8%与GPT-5.2的23.0%,可自主完成多步骤规划、API对接、工具调用、复杂业务流程执行等任务。

打开网易新闻 查看精彩图片

第三方测试显示,Gemini 3.1 Pro医疗领域任务准确率从47%提升至67%,法律任务准确率从57%提升至74%,具备落地行业智能体的核心能力。

多模态方面,Gemini 3.1 Pro支持文本、图像、视频、音频一体化输入输出,Video-MMMU视频理解基准得分87.6%,可精准解析视频内容、理解多模态逻辑关联。

打开网易新闻 查看精彩图片

下面是一些针对各方面能力的演示案例。

1.SVG 生成效果

之前 Gemini 3 Pro 在生成复杂 SVG 图形时,经常会出现结构混乱、细节缺失的问题。

同样的需求,Gemini 3.1 Pro不管是图形的层次感、细节的处理,还是代码的优雅程度,都有明显提升。

这种提升背后,就是抽象推理能力的体现。

谷歌还制作了一个经典的“鹈鹕骑自行车”SVG,与之前的效果进行对比,此次测试了其他动物的效果。

打开网易新闻 查看精彩图片

有网友评测,其输入一句话的Prompt,3.1 Pro在短短3分钟内,输出一个11秒的SVG动画。

打开网易新闻 查看精彩图片

在另一个SVG测试中,3.1 Pro生成的“海豹顶皮球”在视觉表现力上也堪称惊艳。

打开网易新闻 查看精彩图片

2.3D 地图构建

这个任复杂度很高,需要理解地理数据、处理三维坐标、调用可视化库,还要考虑性能优化。

打开网易新闻 查看精彩图片

结果显示,不仅代码结构清晰,还主动考虑到了数据加载、渲染优化、交互设计这些细节。

再如这两个:

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

3.复杂系统整合

3.1 Pro 能运用其强大的推理能力,在复杂的 API 接口和用户友好的设计之间架起桥梁。

比如,该模型搭建了一个实时航空仪表盘,成功接入公共遥测数据流,将国际空间站的运行轨道直观地呈现出来。

Google DeepMind 首席科学家 Jeff Dean 也转发了一个是用 3.1 Pro 模拟城市规划、设计全新城市的应用,从零生成可交互的规划界面 demo。

打开网易新闻 查看精彩图片

4. 交互式设计

3.1 Pro 能编写出复杂的 3D 椋鸟群飞模拟代码。它不仅能生成视觉代码,还能打造出沉浸式的互动体验 —— 用户可以通过手势追踪来控制鸟群的飞行,同时听到根据鸟群动作实时变化的生成式配乐。

再如3.1 Pro展示的一颗种子从发芽到长成大树的全过程。

打开网易新闻 查看精彩图片

另一个案例是,把《呼啸山庄》的文学氛围转化成一个现代个人网站,模型没有简单概括情节,而是分析了小说的整体基调,设计出了贴合主人公气质的界面风格。

打开网易新闻 查看精彩图片

定价方面,与Gemini 3 Pro一致,20万token以内输入2美元/百万token、输出12美元/百万token,超过200K token输入4美元/百万token、输出18美元/百万token,性价比显著高于竞品。

打开网易新闻 查看精彩图片

目前,Gemini 3.1 Pro已通过Google AI Studio、Gemini API、Vertex AI向开发者与企业开放,消费端可通过Gemini App、NotebookLM体验,Google AI Pro订阅用户可直接使用高阶能力。