一份早报里塞进十条动态,多数会被快速划过。但这一期的密度不太一样:从搜索成本结构、长时程智能体评测,到科学计算和机器人落地,几条线索指向同一个方向——智能体正在从演示走向工程化。
搜索的账本要重算
Parag Agrawal 在访谈中提出,智能体频繁使用网络会改变搜索的成本结构。他的建议是按获益向内容所有者付费,并提到推送式搜索这类新形态。这套逻辑的落点很直接:当调用方从人变成智能体,谁为内容买单、按什么标准买单,都需要重新定义。
评测和基础设施成了主战场
Supercell 的研究指出,长时程智能体需要的是实验而非仅靠提示词,主张通过可控场景评估行为。Roland Gavrilescu 则强调产品循环,把失败沉淀为评测。这两条放在一起看,行业的注意力正从调提示词转向系统化评测。
基础设施侧的动作同样具体。Perplexity 用 Rust 重写 CobbleDB 取代 DynamoDB,延迟降低 5 倍。GEPA 方法用反思式提示优化击败强化学习;Morph 利用智能体优化 GPU Kernel,实现 3 倍提速。三条路径不同,目标一致:把效率从模型层挪到工程层。
科学计算与机器人:从演示到实用
Claude Science 独立计算出 N=4 超杨-米尔斯理论的九圈振幅,并获同行核验。这类结果的意义在于,模型开始参与需要严格验证的复杂物理计算。
具身智能这边,Skydio 展示了单操作员多无人机自主飞行技术栈;Dyna Robotics 通过数据金字塔和主动学习,实现商用机器人的高成功率。一句金句概括了难点:机器人演示容易,可靠落地很难。
此外,千问 AI 平台发布了面向 Agent 的新服务方式。十条动态里,这条最像基础设施的补位——当智能体成为调用主体,平台层的服务形态也得跟着改。
热门跟贴