2月19日,Google正式发布Gemini 3.1 Pro。
作为Gemini 3系列的旗舰迭代版本,官方将其定位为面向最复杂任务的高阶推理模型。
该版本依托MoE混合专家架构,实现了核心能力跃升,在推理、长上下文、编程、智能体、多模态五大维度上,都刷新了行业基准,成为当前AI模型竞赛中兼具性能与性价比的标杆产品。
Artificial Analysis 的评估表明,Gemini 3.1 Pro 已经跃居榜首,再次成为世界上功能最强大、性能最佳的 AI 模型。
Gemini 3.1 Pro的核心突破集中在抽象推理能力的翻倍提升。
第三方独立评测显示,在ARC-AGI-2这一衡量模型处理全新逻辑模式的严苛基准上,模型得分从Gemini 3 Pro的31.1%跃升至77.1%,性能提升超两倍,远超Claude Opus 4.6的68.8%与GPT-5.2的52.9%。
Google CEO Sundar Pichai公开评价,这一成绩标志着核心推理能力的里程碑式进步, 让高级推理从实验室能力变为解决真实复杂挑战的实用工具。
在学术与科学推理场景中,GPQA Diamond科学知识基准测试拿下94.3%的行业最高分,Humanity’s Last Exam高级学术推理测试零工具辅助得分44.4%,均领先同期主流旗舰模型。
权威AI评测机构THE DECODER指出,该模型在科学知识与复杂逻辑理解上的表现,已接近专业领域人类专家水平。
同时,幻觉率较上一代降低38%,大幅提升了高价值场景的可靠性。
长文本处理能力也是Gemini 3.1 Pro的核心优势之一。
新版本模型支持100万token输入上下文与6.5万token输出长度,可一次性处理整本书籍、数小时会议记录、完整代码库等超大规模文本,而无需拆分任务。
OfficeChai实测数据显示,在处理百万级token长文档时,信息提取准确率保持在90%以上,输出完整技术手册、行业研报等长文本的连贯性与完整性优于同类模型,解决了传统模型长文本处理碎片化、信息丢失的痛点。
编程与工程能力方面,Gemini 3.1 Pro在LiveCodeBench Pro竞赛级编程测试中ELO评分达2887,SWE-Bench Verified工程代码修复通过率80.6%,与Claude Opus 4.6持平并显著高于GPT-5.2,Terminal-Bench 2.0终端编程得分68.5%,较上一代提升11.6个百分点。
此外,Gemini 3.1 Pro智能体能力实现近翻倍提升。
APEX-Agents长链任务测试中,其得分33.5%,较Gemini 3 Pro的18.4%大幅增长,领先Claude Opus 4.6的29.8%与GPT-5.2的23.0%,可自主完成多步骤规划、API对接、工具调用、复杂业务流程执行等任务。
第三方测试显示,Gemini 3.1 Pro医疗领域任务准确率从47%提升至67%,法律任务准确率从57%提升至74%,具备落地行业智能体的核心能力。
多模态方面,Gemini 3.1 Pro支持文本、图像、视频、音频一体化输入输出,Video-MMMU视频理解基准得分87.6%,可精准解析视频内容、理解多模态逻辑关联。
下面是一些针对各方面能力的演示案例。
1.SVG 生成效果
之前 Gemini 3 Pro 在生成复杂 SVG 图形时,经常会出现结构混乱、细节缺失的问题。
同样的需求,Gemini 3.1 Pro不管是图形的层次感、细节的处理,还是代码的优雅程度,都有明显提升。
这种提升背后,就是抽象推理能力的体现。
谷歌还制作了一个经典的“鹈鹕骑自行车”SVG,与之前的效果进行对比,此次测试了其他动物的效果。
有网友评测,其输入一句话的Prompt,3.1 Pro在短短3分钟内,输出一个11秒的SVG动画。
在另一个SVG测试中,3.1 Pro生成的“海豹顶皮球”在视觉表现力上也堪称惊艳。
2.3D 地图构建
这个任复杂度很高,需要理解地理数据、处理三维坐标、调用可视化库,还要考虑性能优化。
结果显示,不仅代码结构清晰,还主动考虑到了数据加载、渲染优化、交互设计这些细节。
再如这两个:
3.复杂系统整合
3.1 Pro 能运用其强大的推理能力,在复杂的 API 接口和用户友好的设计之间架起桥梁。
比如,该模型搭建了一个实时航空仪表盘,成功接入公共遥测数据流,将国际空间站的运行轨道直观地呈现出来。
Google DeepMind 首席科学家 Jeff Dean 也转发了一个是用 3.1 Pro 模拟城市规划、设计全新城市的应用,从零生成可交互的规划界面 demo。
4. 交互式设计
3.1 Pro 能编写出复杂的 3D 椋鸟群飞模拟代码。它不仅能生成视觉代码,还能打造出沉浸式的互动体验 —— 用户可以通过手势追踪来控制鸟群的飞行,同时听到根据鸟群动作实时变化的生成式配乐。
再如3.1 Pro展示的一颗种子从发芽到长成大树的全过程。
另一个案例是,把《呼啸山庄》的文学氛围转化成一个现代个人网站,模型没有简单概括情节,而是分析了小说的整体基调,设计出了贴合主人公气质的界面风格。
定价方面,与Gemini 3 Pro一致,20万token以内输入2美元/百万token、输出12美元/百万token,超过200K token输入4美元/百万token、输出18美元/百万token,性价比显著高于竞品。
目前,Gemini 3.1 Pro已通过Google AI Studio、Gemini API、Vertex AI向开发者与企业开放,消费端可通过Gemini App、NotebookLM体验,Google AI Pro订阅用户可直接使用高阶能力。
热门跟贴