新智元报道
Agentic AI,应该运行在什么样的计算底座上?
几天过去,WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感,变成一道真正的工程题。
让一台设备在本地跑起大模型,已经不算最难的部分。更难的是,当Agent要持续读取文件、保留记忆、调用工具,并在后台长期运行时,芯片能否在功耗、延迟和成本的约束下保持稳定。
这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要,但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态,再漂亮的峰值也可能只够完成一次Demo。
我们注意到,本周,新加坡公司Acrab举行了一场线上发布会,并发布了Agent Box,这也许给出了一个可供拆解的样本。
在这场发布会里,这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。
这些关键词指向同一个判断:端侧AI正在从「运行一个模型」,走向「长期运行一套智能系统」。
芯片要解决的,也不再只是算力够不够,而是数据如何流动、任务如何调度、软硬件如何持续协同。
所以,当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来,真正值得追问的问题反而更清楚了:当Agent从一次调用变成持续工作之后,端侧芯片究竟要重做什么?
从一次推理到持续工作
Agent改变了端侧负载
聊天机器人通常完成一轮问答。Agent接到一个任务后,可能先搜索资料、读取文件,再调用代码、浏览器、日历或办公软件;完成一部分后检查结果,保留任务状态,等待下一次触发。一次任务往往涉及多轮模型调用,也会在不同模型、工具和应用之间反复切换。
Acrab在发布会中展示了一个相对完整的任务流程:用户提出想为孩子制作一份太空主题礼物,系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度;当环境里出现新的状况,它又可以连接其他智能设备进行处理。
这段演示的意义不在于某一次回答有多聪明,而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说,Agent不再只是「调用一次模型」,而是在模型、数据、软件和设备之间持续切换。
这种工作方式首先放大了端云之间的分工。
单次推理的费用可能不高,但调用变得高频、持续之后,Token就会从技术指标变成真实账单;一次网络等待对聊天影响有限,放进多步任务中却会逐层累积;Agent要掌握更完整的个人上下文,数据反复往返云端,也会扩大暴露面。
因此,端侧和云端并不是非此即彼。更加现实的结构是:高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地;超过设备能力边界的复杂推理,再调用云端资源。
真正的变化在于,端侧不再只承载一次模型推理,而要承载一套不能轻易中断的智能系统。
它既要运行大模型,也要处理长上下文、多任务和工具调用;性能必须足够强,功耗和成本又不能失控,Runtime、工具链和Agent生态也必须同时跟上。
端侧大模型解决的是模型能不能装进设备,Agentic AI要解决的,则是模型、记忆、工具和应用能不能在设备里长期协同。
只堆NPU不够
CPU、内存和软件栈必须一起重做
过去在CPU或SoC里增加一块NPU,就能让终端多出语音识别、图像处理等AI能力。但当Agent从附加功能变成设备的核心,简单增加峰值算力已经不够。
原因在于,Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU,任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作,则高度依赖CPU。任务路径越动态,CPU与NPU之间的协调就越重要。
Acrab CEO Ken Phua将这种变化概括为:「CPU再次回到AI时代的中心。」
在他的判断中,AI正在进入异构计算环境,执行效果不只取决于NPU性能,更取决于CPU与NPU能否无缝协同。
这也是Acrab少数值得展开的团队线索。
Ken Phua曾在Arm UK带领亚太应用工程团队,并参与全球IP策略制定,之后担任Arm China联席CEO。
这段经历的意义并不只是行业履历,而是解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置,重新定义Agent工作负载。
Acrab没有把GΞLIX 1定义为一颗传统AI处理器,而是将它作为端侧AI时代的计算平台。
硬件侧以GΞLIX 1为核心;软件侧覆盖大模型、优化后的Runtime、完整工具链,以及连接模型、工具、设备和服务的Agent编排层;在此基础上,公司还提供面向典型场景的Agent参考设计,帮助开发者和生态伙伴更快构建应用。
Agent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center,可以在本地运行千亿参数级模型,即使没有网络连接,也能保持核心能力。
Acrab取自Agentic Compute、Reasoning、Action与Brain的首字母,也恰是天文学中一个多恒星系统的名字——正如其设计哲学:让不同的计算单元,像恒星系统一样协同运转。
公司以此为目标,为Agent打造一颗能思考与行动的大脑,构筑下一代计算平台。
总部位于新加坡的Acrab,已累计融资超过3.5亿美元,投资方包括淡马锡旗下全球风投平台Vertex(祥峰投资)、新加坡知名科技投资机构K3 Ventures等。
其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证,目前正走向首次行业导入和规模化生产。
融资可以为重工程购买时间,但真正决定路线能否成立的,仍然是系统能否交付。
从这个角度看,「CPU重新回到中心」并不意味着NPU不再重要。
恰恰相反,它意味着AI计算已经复杂到,无法再依靠一颗孤立的加速器解决所有问题。
700 TOPS之外
Prefill和数据通路决定真实体验
很多时候,大模型推理的瓶颈并不只是计算单元不够快,而是数据来不及送到计算单元。
芯片即使拥有很高的峰值算力,如果内存带宽跟不上,NPU仍然要停下来等待。
Agent会进一步放大数据搬运问题。它需要频繁读取历史记录,在不同模型和软件之间传递数据,并持续保存任务状态。每一次复制都会增加延迟和功耗,任务运行得越久,系统设计的重要性就越高。
GΞLIX 1的设计重点,正是把模型需要的数据尽量留在距离计算单元更近的位置,并减少CPU、NPU、内存和不同操作系统之间的来回搬运。
按照Acrab公开的架构,GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽,芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心,以及针对Attention计算设计的专用加速模块。
Acrab称,后者可以将相关计算效率提高到三倍。
更大的片上缓存,可以让关键数据离计算单元更近;共享L2 Cache让参数和中间特征在计算单元之间高效共享;统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。
Acrab还采用多系统统一内存架构,让不同操作系统更高效地共享内存。对于只运行一个模型的设备,这可能只是效率优化;对于需要不断跨应用、跨工具工作的Agent,它会直接影响任务能不能顺畅推进。
这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时,往往需要再次处理新增信息。任务链越长,Prefill效率对整体体验的影响就越明显。
在Acrab披露的一组自测中,GΞLIX 1运行260亿参数Gemma模型,使用40K KV Cache和1万Token输入,Prefill速度超过每秒1416个Token;在相同负载下,其表现是某主流通用桌面平台的7倍以上。
Acrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。
数据显示,GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间,同时呈现出更低的功耗和更具竞争力的整机成本。
Acrab选择强调Prefill和数据通路,本身说明了一种产品取向:端侧Agent芯片不能只追求模型输出得有多快,还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。
用户不会关注一条推理链路内部经过了多少层缓存,也不会在每次交互前查看TOPS。用户真正感受到的只有三件事:它能否迅速理解、能否持续运行,以及拥有它是否足够划算。
从芯片到平台
真正的竞争在参数之外
今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备,还没有形成统一的产品形态。
家庭场景更强调个人记忆、内容和设备协同,企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。
终端越碎片化,计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景,还需要提供Runtime、模型适配、开发工具和Agent框架,帮助客户把底层算力转化为能够交付的产品。
这也是Agentic AI芯片比普通推理芯片多出来的一道题:芯片性能决定模型能不能运行,软件栈决定开发者能不能把它用起来,Agent生态则决定设备最终能够完成什么任务。任何一层缺失,都可能让一颗参数漂亮的芯片停留在Demo阶段。
Acrab试图把这些环节同时抓在手里。好处是产品定义更加完整,风险也很直接:战线很长。
芯片要证明性能、稳定性和规模化交付能力,软件栈要追上模型的快速迭代,Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后,权限隔离、插件安全和操作审计也必须同步解决。
因此,Acrab能否成为Agentic AI时代的计算平台,最终不取决于发布会上跑出了多少Token,也不取决于Agent Box能够演示多少个任务。
更关键的验证是:开发者能否在这套平台上快速做出产品;Agent连续工作数小时之后,性能、功耗和稳定性能否同时成立;当模型和Agent框架继续变化时,底层软硬件能不能跟上。
架构创新决定一家芯片公司的能力上限,工程化和生态则决定这个上限能不能变成订单。
WAIC上密集出现的新终端,说明行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小;下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。
Acrab押注的正是这一变化。
Agent Box不是终点,而是一次平台能力的公开测试。
端侧芯片需要「重做」,不是因为TOPS不重要,而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立,最终要看这套芯片、软件和终端能否进入真实工作流。
热门跟贴