你没法拿一家真公司的数据,去安全地测试企业级Agent。Eon团队的做法是:既然真公司不能碰,那就造一家假的给它用。

Era今天上线,免费。你描述一家公司,它就把这家公司生成出来,写进Salesforce、Zendesk、Jira、Slack和Gong里,背后是厂商兼容的MCP和REST接口。换句话说,Agent面对的不是几张mock表,而是一整套像真的一样的企业环境。

打开网易新闻 查看精彩图片

企业Agent测试的三个老坑

Rohan Paul在X上把问题拆得很清楚:企业Agent通常只在三种环境里被测——mock、窄口径的合成数据集,或者生产环境。这三种各自藏着不同的东西。

mock藏的是真实复杂度。你mock出来的接口永远比真系统干净,Agent在mock里跑通,不代表它在真实工单流转里不迷路。

窄口径合成数据集藏的是覆盖面。数据是造出来的,但只覆盖了你想测的那一小块,边界情况全被绕过去了。

生产环境藏的是风险。你拿真客户数据测一个还没验证过的Agent,出了问题不是回滚一行代码就能解决的。

Era想当第四种选项。

为什么它的判分不需要人来当裁判

Era最值得看的一点,是判分方式。

因为Era写下了每一条记录,所以每个问题的确切答案可以用代码算出来,不需要语言模型参与。这意味着打分环节既不需要人工,也不需要模型当裁判。

这一点为什么重要?企业Agent的评测长期卡在"谁来判对错"上。用模型判分,判分本身就不稳定;用人判分,成本高且不可复现。Era把答案的ground truth握在自己手里,评测就从主观演示变成了可复现的基准。

Rohan Paul也点了这一层:确定性的判分部分尤其有意思。如果你能重置同一个企业状态、拿到确切的真实答案,Agent评测就更接近可复现的benchmark,而不是一场主观demo。

重置、换模型、再跑一遍

Era的另一个动作是让开发者能重置这家公司,换一个模型或换一段prompt,然后重跑完全相同的任务。

这个循环解决的是一个很实际的问题:在早先的失败上做post-training,到底有没有帮上忙?

没有可重置的环境,这个问题没法干净地回答——每次重跑,环境都变了,你分不清是模型变好了还是任务变简单了。Era把企业状态固定住,变量就只剩模型和prompt。

Rohan Paul提到,能换模型和prompt再重跑,这件事本身就很有价值。

还没解决的两个问题

Rohan Paul也提了两个开放问题,值得摆出来。

第一个:一个任务能不能有一个Agent不被允许看到的已知答案?如果Agent正确地表示自己没有权限访问,给它打分,会和"它有没有找到正确记录"形成互补。这测的是另一类能力——知道自己不知道什么。

第二个:测试改进时,能不能把整段公司历史留出来?重放同一间办公室有用,但Agent终究得在别的地方活过第一天。

这两个问题Era目前没有给出答案,但它们指向的是同一个方向:企业Agent的评测,正在从"跑个demo看看"往"可复现、可对比、可重置"上走。

Era覆盖的系统包括Salesforce、Slack、Jira、Zendesk、Gong和Deel。你描述一家公司,它生成一家公司,然后你在里面反复折腾你的Agent——不用碰任何真实客户的数据。