整理 |梦依丹

出品 | CSDN(ID:CSDNnews)

0.2 元。

一句自然语言,生成一个完整可运行的 AI 应用,Token 成本仅约 2 毛钱。

这个数字足够反常识,也很难不让人继续追问:究竟是怎么做到的?

给出这个案例的人叫郑耀威。

你可能还不熟悉这个名字,但如果做过大模型微调,大概率听说过他参与打造的开源项目——LlamaFactory。

在 GitHub 获得超过 7 万 Star 的大模型微调框架,被全球开发者广泛用于大模型的高效微调与部署,相关研究成果也已在阿里云、英伟达等企业场景中得到应用。

郑耀威本人是 PrismShadow(千影光流)联合创始人兼 CTO、北京航空航天大学计算机学院博士研究生。

而现在,他又把目光投向了一个更难的问题:Agent 做出来之后,怎么让它自己变强?

围绕这个问题,郑耀威和团队打造了一套新的开源智能体自进化引擎——PenguinHarness。

11 月 20—21 日,由 CSDN 与奇点智能研究院联合举办的「2026 奇点智能技术大会」将在北京万达文华酒店召开。届时,郑耀威将带来「低成本、高收益的自进化 Agent 闭环构建实践:从 LlamaFactory 到 PenguinHarness 的技术演进」的主题分享。

从模型微调,到 Agent 自进化。

这一次,他想讨论的已经不只是“怎么把 Agent 搭出来”,而是:

怎样让一个 Agent 在真实业务中越用越强?

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

从大模型微调走向 Agent 自进化

郑耀威是北京航空航天大学计算机学院博士研究生,也是 PrismShadow(千影光流)联合创始人兼 CTO。

他在 ACL、CVPR、AAAI 等顶级会议和期刊发表论文 10 余篇,担任 AAAI、EMNLP 等会议审稿人,曾获北航榜样、昇腾生态开源卓越贡献奖等荣誉,也曾多次受邀在人工智能计算大会、阿里云栖大会等行业峰会分享。

但如果一定要从这些经历中挑一个开发者最熟悉的标签,大概还是:LlamaFactory 作者

几年前,大模型微调还是一件门槛不低的事情。

环境配置、训练参数、数据处理、显存管理、模型适配……任意一个环节都可能让开发者花费大量时间。

LlamaFactory 把复杂的大模型微调流程尽可能封装进统一框架,并提供 CLI、Web UI 等方式,显著降低大模型微调和实验的使用门槛。

如今,这个项目已经获得超过 7 万 GitHub Star。

而完成这一切时,郑耀威还是一名博士研究生。

Agent 搭起来容易,变强难。

LlamaFactory 解决的是:模型怎么通过训练和微调变得更好?

但到了 Agent 时代,问题开始发生变化。LangChain、LangGraph 等框架已经显著降低了 Agent 原型开发的门槛。

接模型、接工具、配 Prompt、做 Workflow、写 Skill。一个“能跑起来”的 Agent,已经越来越容易实现。

但真正的问题往往发生在上线以后。

它会自己成长吗?对很多 Agent 系统而言,上线并不意味着能力会自然增长。

如果缺少数据沉淀、自动评估和持续优化机制,一个 Agent 运行三个月之后,它的核心能力可能和上线第一天并没有本质区别。

甚至还可能出现另一种情况:

  • 业务不断增加,Prompt 越写越长,临时规则越堆越多,Token 成本持续上涨,但 Agent 并没有真正学会什么。

如果你也正在做 Agent,可以问自己三个问题:

  • Agent 上周犯过的错误,这周还会不会再犯?

  • 新业务接进来以后,需要工程师重新修改 Prompt 和流程,还是 Agent 能利用已有经验进行适应?

  • 你能不能明确说出,它比一个月之前“强了多少”?

如果这些问题很难回答,那么这个 Agent 可能还停留在:“能用”。

距离真正的:“越用越强”,还有一段距离。

打开网易新闻 查看精彩图片

PenguinHarness:让 Agent 从“自动构建”走向“自动优化”

这正是郑耀威此次演讲准备重点讨论的问题。

过去半年,团队围绕智能体自进化打造了 PenguinHarness。

如果说传统 Agent 框架更关注:Build Agent。

那么 PenguinHarness 希望继续往前走一步:Optimize Agent。

它的核心包括一套面向 Agent 的 SDK、尽可能精简的工具体系和 System Prompt 设计,并支持大量模型统一接入,让开发者可以根据不同业务、成本和数据安全要求灵活选择模型。

更关键的是:

  • 它试图让“优化 Agent”这件事本身也形成自动化闭环。

过去的方式可能是:

  • Agent 出错 → 人工看日志 → 找问题 → 改 Prompt → 再测试

而在自进化体系中,这个流程开始变成:

  • 任务数据 → 自动评估 → 问题定位 → Harness 迭代 → 新版本验证

也就是说:

  • Agent 不仅在执行任务,“如何改进 Agent”本身,也开始成为系统的一项能力。

一个 Agent 的“进化闭环”,到底怎么搭?自进化最容易产生的误解,是把它简单理解成:“让模型反思一下,然后重新回答。”

但真正进入工程环境后,自进化远比“Reflection”复杂。一个 Agent 的能力来自很多部分:

  • 模型、Prompt、Tool、Skill、Memory、Workflow、上下文以及 Harness。

因此,真正的自进化首先要解决两个问题:

第一,怎样稳定地让 Agent 变强

第二,怎样证明它真的变强了?

郑耀威团队给出的方案,是建立一条完整的 Evolution Loop:

打开网易新闻 查看精彩图片

在这一过程中,真实任务产生的数据可以转化为评估和优化依据。

评估系统判断:这次任务到底哪里做得不好?

  • 是 Prompt 的问题?

  • Skill 的问题?

  • 工具选择的问题?

  • 还是执行策略的问题?

然后再根据结果进行下一轮迭代。最终形成一个不断循环的:Agent Evolution Loop。

比“让 Agent 进化”更难的是:如何证明它真的进化了?这是整个 Agent 自进化问题里非常关键、却经常被忽略的一环。

今天已经有很多 Agent Benchmark。但大部分 Benchmark 回答的是:

  • 这个 Agent 现在有多强?

而真正做自进化时,需要回答的问题是:

  • 给它经验、数据和反馈之后,它究竟提升了多少?

为此,郑耀威团队进一步推出:GDPevo Benchmark——它专门面向具有经济价值的实际业务任务,用于评估 Agent 的自进化能力。

GDPevo Benchmark 通过 120 个任务、12 个业务场景等方式,尝试系统度量 Agent 在经历数据、反馈和迭代之后究竟提升了多少。

在团队目前公布的 PenguinHarness 自进化实践中,部分实验实现了:

  • 平均准确率提升 18.8%

  • Token 成本降低 7.5%

同时,在相关演示中,团队还展示了使用一句自然语言生成完整 AI 应用、Token 成本约 0.2 元的案例。

这背后真正值得关注的,并不是某一个具体数字,而是一个正在发生的变化:

  • Agent 的竞争,可能正在从“第一次谁做得更好”,走向“运行一千次之后,谁学得更多”。

而这也是郑耀威此次现场分享最值得期待的部分。

打开网易新闻 查看精彩图片

从一个 Agent,看见整个 AI 技术栈正在变化

郑耀威的这场分享,只是 2026 奇点智能技术大会众多技术议题中的一个切面。

2026 奇点智能技术大会将于 11 月 20-21 日在北京万达文华酒店举行。

大会将聚焦大模型、Agent、AI 原生软件研发、AI Infra、多模态、世界模型、具身智能、AI Coding 与企业级 AI 应用等方向,规划 18 大前沿专题,从模型能力一路讨论到工程体系与真实业务落地。

目前已经确认的嘉宾阵容,也覆盖了 AI 技术演进的多个关键方向。

其中包括:

  • Łukasz Kaiser OpenAI 资深研究科学家、Transformer 八子之一

  • 段楠 京东集团副总裁、京东探索研究院副院长

  • 李宇轩 面壁智能技术合伙人、智能进化首席科学家

  • 张俊林 新浪微博首席科学家及 AI 研发部负责人

  • 成宇 昆仑万维集团首席科学家、南洋理工大学讲席副教授

  • 董汉德 腾讯 WorkBuddy 模型研发负责人

  • 张铂 上海人工智能实验室青年科学家、智能体中心负责人

  • 俞扬 南京大学人工智能学院副院长、教授

  • 郎玉川 昆仑行机器人具身算法负责人、前理想汽车资深算法专家

  • 李宇轩 面壁智能技术合伙人、智能进化首席科学家

更多专家及议题,欢迎访问「2026 奇点智能技术大会」官网:https://ml-summit.org/

当 AI 从模型走向系统、从 Demo 走向生产,我们到底需要怎样的新技术栈?

对于正在做 Agent、AI Coding、企业级 AI 应用的开发者来说,郑耀威这场演讲尤其值得关注。

你将现场看到:

  • Agent 自进化闭环怎么搭

  • GDPevo 如何度量 Agent 进化能力

  • 怎样通过数据、评估和 Harness 实现自动迭代

  • 如何兼顾效果、Token 成本与企业数据安全

以及 PenguinHarness 如何让 Agent 从“自动构建”进一步走向“自动优化”。

最后,我们整理了一套大会资料包,Łukasz Kaiser 历届演讲视频与 PPT、Agent 实战训练营。

Agent 实战训练营录播课包含Agent 设计模式、微信 AI 搜索实战、Agentic AI Infra,六章内容,讲的全是"Agent 怎么从 Demo 跑上产线"

打开网易新闻 查看精彩图片

「立即领取」

购票热线:400-821-5876

购票咨询:service@boolan.com

企业合作:partner@boolan.com

演讲申请:hemiao@csdn.net

媒体联系:media@boolan.com