GPT-6 Astra正式发布,真的开始替你干活了!
当地时间 9 月 3 日,OpenAI 正式发布新一代旗舰模型
GPT-6 Astra。
这一次,OpenAI 给它的定位非常直接:目前最智能、最对齐的模型。
不同于前代以聊天问答、文案生成为主的 AI 产品,GPT‑6 Astra 最大的变革,是完成了从“回答问题”到“独立干活”的跨越,进化成一款真正意义上的 AI 智能体 Agent。
本次升级最重磅的能力就是“Computer Use 计算机自主操控”。
过去的大模型即便生成办公文档,也需要我们手动复制内容、一步步操作软件;
而 Astra 可以直接接管电脑,自主操作各类软件程序。
线上表单填报、CRM 客户数据更新、日程整理、全网资料调研、邮件文档撰写等常规办公任务,它可以从头到尾独立闭环完成。
不止普通办公软件,像 KiCad 电路板设计、Blender 三维建模、虚幻引擎 5 交互场景搭建、Ableton 音乐混音等专业工作流,Astra 也能上手实操。
从一张设计图生成可自由探索的房屋 3D 交互场景,真正打通创意从构思到落地的最后一环。
困扰开发者许久的“长任务失忆”痛点,这次也被彻底攻克。
新版本升级了 Codex 代码工具,引入全新的跨窗口笔记记忆系统。它不再依靠简单压缩总结保存对话历史,而是可以长期记录、检索过往任务里的修改要求、测试结果。
就算一项编程工作连续进行数小时,也不会遗忘最初定下的开发限制。
同时 Astra 还学会了任务预判,等待你回复期间,可以先行推进不受影响的工作,大幅减少无效等待时间。
在硬核科研与编程领域,Astra 交出了一份亮眼答卷。
软件工程基准测试成绩大幅领先前代模型,能够生成质量更高、迭代次数更少的生产级代码。
数学推理能力实现飞跃,FrontierMath 高阶数学测试得分高达 97.6%,甚至已经协助科研人员推进素数间隔难题的研究。
在基因数据分析、科研图表绘制等科研场景,也可以深度参与实验流程,为研究者提供决策参考。
但超高能力背后,随之而来的还有不容忽视的安全风险。
Astra 成为 OpenAI 首个达到“关键网络安全能力阈值”的模型,测试中已经成功挖掘出两个此前从未被发现的零日漏洞。
这项能力是一把双刃剑,既能帮助企业排查系统隐患,也存在被恶意滥用的风险。
因此 OpenAI 采用分级开放策略:普通用户版本会限制高危网络安全请求,只有经过严格审核的安全团队,才可解锁完整权限。
安全性对齐层面同样迎来重大突破。
在无防护测试下,前代模型越权执行任务的比例高达 48%,而 Astra 越过任务边界的概率降到了 0%。不过新的问题随之而来。
Astra 完成复杂任务时思考步骤更加精简,人类想要监控它的推理过程反而变得更加困难。
商业化方面,Astra 定价相比前代明显上涨,输入每百万 Token 10 美元,输出则达到 50 美元。
OpenAI 表示,未来 AI 服务的评判标准,或将从单条 Token 单价,转向“完成一项完整工作的总成本”。开放节奏上,它会优先面向企业内测,后续逐步向 ChatGPT Plus、Pro、企业版用户开放。
不管怎么说,下一轮 AI 竞争的重点,可能已经不是谁的模型更会聊天,而是谁的 AI,能真正替人把事情做完。
本文由极果用户极果原创