τ^τ-Bench把智能体构建本身设为任务
Sierra与普林斯顿大学联合发布τ^τ-Bench基准,测试开发者智能体能否独立交付可用的客服智能体。开发者智能体会拿到真实业务记录、掌握需求的客户、生产API、待继承代码库,以及服务成本与模型限制。
打开网易新闻 查看精彩图片
最终交付的客服智能体要用保留的模拟用户部署评分,覆盖4个领域共53个任务。
τ^τ-Bench把智能体构建本身设为任务
Sierra与普林斯顿大学联合发布τ^τ-Bench基准,测试开发者智能体能否独立交付可用的客服智能体。开发者智能体会拿到真实业务记录、掌握需求的客户、生产API、待继承代码库,以及服务成本与模型限制。
最终交付的客服智能体要用保留的模拟用户部署评分,覆盖4个领域共53个任务。
热门跟贴