百万词元输入2美元起:SpaceXAI发布Grok 4.7,大模型价格战转向“长任务”与知识工作
9月22日,SpaceXAI发布新一代模型Grok 4.7,主打编程和知识工作场景。官方称,该模型采用更大规模基础模型,并通过更长时间的强化学习训练,是公司目前最强的编码和知识处理模型。更值得行业关注的是价格:每百万词元输入起价2美元,输出起价6美元,高速版本速度翻倍、价格翻倍。与此同时,Grok 4.7已通过Cursor、Grok Build、Grok API以及第三方编程工具、模型路由服务和云平台开放。这意味着,大模型竞争正在从“参数规模”和“榜单分数”,进一步转向长任务能力、单位任务成本、安全合规与分发生态的综合较量。
从官方披露的信息看,Grok 4.7并非简单迭代。它使用了比Grok 4.6更大的基座模型,并接受更长时间的强化学习训练。训练数据更加侧重需要数小时完成的复杂任务,同时针对自我验证和长上下文管理进行了优化。与Grok 4.6相比,新模型能够在困难任务上持续更长时间,并加强对自身输出结果的检查能力。
这背后的信号很明确:大模型正在从“问答工具”转向“工作代理”。过去,行业评测往往关注模型能否回答一道题、生成一段代码或总结一篇文章。但在编程和知识工作中,真实任务往往需要多轮交互、跨文件理解、工具调用、结果验证和反复修正。Grok 4.7把“长任务”和“自我验证”作为优化重点,瞄准的正是这类高价值场景。
在CursorBench 4.0测试中,Grok 4.7面向长时间运行的编程任务,在价格与性能方面处于同类模型前列。官方还表示,该模型在GDPval和AA Briefcase两项基准测试中均较Grok 4.6有所提升。这两项测试要求AI完成律师、护士、金融分析师等专业人士日常工作中的相关任务,Grok 4.7的表现已达到与其他前沿模型相近的水平。此外,SpaceXAI针对Grok Bot harness进行了原生训练,使模型在对话、一般知识工作、文档和演示文稿生成方面有所改进。
定价方面,Grok 4.7每百万词元输入起价2美元,输出起价6美元。按当前汇率粗略换算,约合人民币13.4元和40.2元。官方同时表示,该模型的运行速度和定价与Grok 4.6相同;在同类模型对比中,则给出“两倍速度、一半价格”的竞争定位。高速版本输出速度翻倍,但价格也翻倍。
安全能力也被放到了更重要的位置。SpaceXAI为Grok 4.7采用了全新安全防护体系,官方称其在拒答和抵抗越狱攻击方面达到公司目前测试中的最高水平。在LatchBio生物安全基准测试中,该模型取得62.4%的成绩;在HackerBench v0.3测试中,仅允许3.3%的高风险双重用途提示通过,同时较少阻止合法的安全工作。公司已开始向部分网络安全合作伙伴提供邀请制访问权限,用于红队能力和防御研究。
2美元/百万词元背后:价格战进入“任务成本”阶段
单纯看每百万词元输入2美元,容易把Grok 4.7理解为一轮新的低价促销。但对通信行业和科技产业观察者而言,更关键的是定价背后的“任务成本”逻辑。
编程和知识工作不是一次性问答。一个复杂编程任务可能涉及数十个文件、多轮工具调用、长上下文保持、测试验证和失败重试;一份专业文档或演示文稿,也可能需要检索、归纳、生成、校对和格式调整。这些过程消耗的词元数量远高于普通聊天。如果模型能够在长任务中保持稳定,并且单位词元价格足够低,企业才可能把AI代理真正嵌入生产流程。
因此,Grok 4.7的价格策略不只是“便宜”,而是试图降低智能体规模化运行的门槛。输入价格低,有利于长上下文和大量资料注入;输出价格控制在一定区间,则影响最终生成内容的成本。高速版价格翻倍,意味着在时延敏感场景中,企业需要为响应速度支付溢价。这种分层定价也说明,大模型服务正在从统一API走向按性能、时延、任务复杂度分级的运营模式。
另一个值得注意的变化是分发渠道。Grok 4.7不仅通过Grok API开放,还进入Cursor、Grok Build,并支持第三方编程工具、模型路由服务及云平台。对企业客户而言,未来不太可能只依赖单一模型,而是通过模型路由,根据成本、时延、安全等级和任务类型动态调度不同模型。模型越强、越便宜,路由和调度层的价值反而越突出。
价格战的本质,也不是简单的补贴竞赛。它考验的是推理效率、底层架构、强化学习训练方法、算力调度和工程化服务能力。谁能以更低成本稳定完成长任务,谁就更接近企业级市场的真实需求。
全球AI竞争格局:从“模型秀”走向“工作流入口”
Grok 4.7的发布,反映出全球前沿模型竞争正在发生几个明显变化。
第一,评测重点正在从通用知识问答转向职业任务和长周期任务。GDPval、AA Briefcase等基准测试模拟律师、护士、金融分析师等专业工作,说明厂商开始用“能否完成工作”而非“能否答对题目”来衡量模型。CursorBench 4.0面向长时间编程任务,也体现了编码智能体成为必争之地。
第二,安全与合规正在从附加项变成企业采用的前提。Grok 4.7在生物安全和网络安全领域强调双重用途场景的平衡:既不能阻止合法安全研究,又要拒绝高风险请求。HackerBench和LatchBio等测试的出现,说明前沿模型的竞争已经延伸到安全评测、红队测试和风险控制。对于金融、医疗、政务、通信等行业客户而言,模型能否通过安全审计,往往比榜单排名更重要。
第三,模型本身正在商品化,价值向工作流、数据、合规和算力调度转移。当多家前沿模型能力接近、价格持续下探,企业选择模型时会更加关注生态集成、工具链、数据隔离、服务等级和行业适配。云平台、模型路由服务、编程工具和API聚合层,将成为连接模型与产业场景的关键节点。
第四,价格竞争会向上游传导。更低的词元价格意味着推理效率必须提升,这会推动芯片、服务器、光模块、IDC、液冷、边缘计算和算力网络持续演进。对通信产业而言,模型越便宜、调用越频繁,网络时延、带宽保障和算力调度的重要性就越高。
中国通信产业的机会:把“token”变成可运营服务
中国大模型市场过去两年已经经历多轮价格调整,云厂商和AI企业不断降低API调用门槛,推动大模型从少数头部客户走向更广泛的开发者群体。在这一过程中,通信产业并非旁观者。三大运营商依托算力网络和智算中心,正在构建从算力、模型到行业应用的体系。中国移动“九天”、中国电信“星辰”、中国联通“元景”等,均面向政企和行业场景推进大模型布局。
Grok 4.7带来的启示在于,下一阶段竞争不只是“有没有模型”,而是能否把模型能力转化为可运营、可计费、可安全交付的服务。
对运营商和云服务商而言,至少有三方面机会。
一是模型路由与算力调度。企业客户可能需要同时调用多个模型,根据成本、时延、安全等级和任务类型进行动态选择。运营商可以依托云网融合、边缘节点和算力网络,把不同模型调度到最合适的算力位置,形成“连接+算力+模型+安全”的一体化服务。
二是行业智能体。编程和知识工作是Grok 4.7的重点,但通信行业自身还有网络运维、客服、营销、研发、安全等大量场景。长任务、自我验证、长上下文管理和文档生成能力,可以映射到故障工单处理、根因分析、网络优化方案生成、招投标文档撰写和客户服务等环节。模型不一定要直接对外销售,而可以嵌入行业工作流,成为提效工具。
三是安全评测与托管服务。Grok 4.7在拒答、抗越狱、双重用途提示控制上的设计,说明安全能力正在成为模型服务的一部分。运营商和大型云厂商具备合规、数据隔离、安全运营和政企服务经验,可以发展模型安全评测、红队测试、内容风控和托管运营服务,帮助行业客户降低采用风险。
当然,中国厂商仍需在长上下文推理成本、强化学习长任务训练、工具生态和开放API体系上持续投入。全球前沿模型在算法创新和开发者生态上仍有优势,但中国市场的应用场景密度、工程化能力和算力网络基础,同样提供了独特空间。
Grok 4.7以每百万词元输入2美元起的价格进入市场,不只是又一场价格战的开端。它更像一个坐标:大模型正在从“能回答”走向“能持续完成复杂工作”,从按词元计费走向按任务价值计费。未来竞争的关键,不是谁的单次回答更惊艳,而是谁能以可接受成本、安全合规地嵌入企业工作流。对通信产业来说,机会正在连接、算力、调度、安全和行业场景之间展开。
热门跟贴