打开网易新闻 查看精彩图片

  • 20 种循环设计模式:从提示词操作者到系统设计者的AI工程师进阶手册

  • Loop Engineering 全景:五大类 20 种生产级循环设计模式完整拆解

  • 从单次调用到持续进化:AI 循环工程的核心范式与落地方法论

  • 生成 - 评估 - 学习 - 改进:循环工程时代 AI 系统的底层设计逻辑

2026 年 AI 领域正在发生一场静悄悄的范式跃迁:竞争焦点正在从模型参数、提示词技巧,转向系统层面的循环工程设计。

吴恩达公开表示,其 100% 的任务已由 AI 智能体完成,而 “自我改进的循环” 将是下一阶段核心,3 到 6 个月内提示词时代就将走向终结。

Anthropic Claude Code 负责人 Boris Cherny 也坦言,工作重心早已从直接编写提示,转向设计协调模型行为的外部执行循环。

这场转变的核心逻辑非常清晰:智能体只是执行的工人,循环才是让系统持续进步的机制。

单次提示词的质量天花板越来越近,而一套设计精良的循环架构,能让系统在生成、评估、学习、改进的迭代中不断自我进化,这正是生产级 AI 与玩具级 Demo 的核心分野。

本文翻译整理了 AI 工程师 Rahul 总结的 20 种循环设计模式,覆盖质量改进、记忆迭代、动态规划、分支探索、系统自优化五大类别。

每一种都对应真实生产环境中的高频场景,是 AI 工程师从提示词使用者进阶为系统设计者的必备参考。

以下是正文。

20 种每个AI工程师都应该了解的循环设计模式

20 Loop Design Patterns Every AI Engineer Should Know

大多数 AI 工程师知道如何构建一个智能体,但很少有人知道如何构建一个在首次尝试后能够持续优化的系统。这一差距,价值不止六位数。

区别在于:智能体是一名工人,循环才是让工人不断进步的机制。

当今生产环境中能力最强的 AI 系统,并非单次模型调用即可完成的系统,它们本质上是由循环机制驱动的系统。

生成 → 评估 → 学习 → 改进。周而复始,直到输出质量达到可接受水平。

以下是 20 种在生产环境 AI 系统中反复出现的循环设计模式。建议保留这些模式,后续构建 AI 系统时会反复使用。

智能体 vs 循环 Agents vs Loops

旧方式:提示词 → 响应 → 完成。

新方式:生成 → 批判性评审 → 重写 → 评分 → 重试 → 记忆 → 改进。

前者是一名只把活干一遍的流水线工人;后者则是研究每一次失误、更新执行手册,并在每一次轮班中提升 3% 的流水线工人。

打开网易新闻 查看精彩图片

当前正在交付生产级 AI 系统的团队,并不是在编写更好的提示词,而是在构建更好的循环。

第一类:质量改进循环(在输出离开系统之前提升其质量) QUALITY IMPROVEMENT (Make the output better before it leaves the system) 1. 生成 → 批判性评审 → 重写 Generate → Critique → Rewrite

AI 工程领域最重要的循环。

生成输出。评审器对其进行批判性审查。生成器根据反馈进行重写。重复此过程,直至质量达到阈值。

不是一个模型,而是两个角色、一条流水线。

[生成器] → 草稿
[评审器] → "第 3 段表述模糊,缺乏论据,语气有偏差。"
[生成器] → 根据评审意见重写
[评审器] → "有所改善,但结论部分仍然薄弱。"
[生成器] → 最终重写

适用场景:写作、代码审查、报告、战略文档、销售邮件。

核心洞见:负责生成的模型,并不是评判自身输出的最佳裁判。独立的评审器每次都能发现生成器遗漏的问题。

打开网易新闻 查看精彩图片

2. 评分重试循环 Score-and-Retry Loop

生成。评分。低于阈值则重试。

简洁、有效、使用率偏低。

score = evaluate(output)


while score < threshold:
output = generate(prompt)
score = evaluate(output)
attempts += 1
if attempts > max_retries:
return best_so_far

最适用于质量可量化的场景——提取准确率、格式合规性、事实准确性、线索评分。

生成器不知道自己正在被评分,评估器知道。这种分离,正是该模式的精髓。

3. 多评审器循环 Multi-Critic Loop

单一评审器存在盲点。使用四个。

准确性评审器:事实是否准确?
风格评审器:表达是否清晰流畅?
安全评审器:内容是否恰当、安全?
领域评审器:是否符合专业标准?

各评审器独立进行评估。输出必须满足全部四项标准,方可流出系统。

适用场景:医疗 AI、法律文档审查、金融分析、受监管内容。

打开网易新闻 查看精彩图片

4. 对抗性批判评审循环 Adversarial Critique Loop

评审器的唯一任务,是推翻答案。不是改进它,而是推翻它。

对抗性评审器提出的问题:

→ 这里存在哪些失效假设?
→ 缺少哪些证据?
→ 怀疑论者会如何反驳?
→ 哪些地方看似自信,实则有误?

生成器随后进行辩护或重写。能经受住攻击的答案,才是更优答案。

适用场景:研究综合、投资论点审查、战略规划、风险分析。

5. 评判器集成循环 Judge Ensemble Loop

单个评判器给出的评分往往包含噪声。多个评判器的综合评分可以平滑单点评估中的噪声。

对同一输出运行多个评估器,汇总评分,只有获得高度一致评价的输出才能进入下一阶段。

适用场景:单一模型评估不可靠、风险较高、边界案例至关重要时。

打开网易新闻 查看精彩图片

第二类: 记忆循环(从已发生的事件中学习,使下一次更智能) MEMORY LOOPS(Learn from what happened so next time is smarter) 6. 反思循环 Reflexion Loop

目前最重要的自我改进模式。

智能体失败 → 分析失败原因 → 存储教训 → 携带教训重试。每次迭代都比上一次更智能。

第 1 次尝试:失败
反思:"我假设了 X,但 X 是错误的。下次先验证 X。"
第 2 次尝试:融入教训 → 部分成功
反思:"有所改善,但跳过了 Y。增加 Y 的检查。"
第 3 次尝试:成功

这就是"会反复失败的系统"和"同类错误只犯一次的系统"之间的本质差异。

7. 记忆更新循环 Memory Update Loop

每次任务完成后,存储三件事:

→ 做出了什么决策
→ 结果如何
→ 下次会如何改进

后续执行会继承并复用这些知识。第 6 个月的系统,已不同于第 1 个月的系统——它已读取了自身 6 个月的历史记录。

8. 错误库循环 Error Library Loop

存储所有失败。

错误答案、低质量输出、执行失败、边界案例。

在处理新任务之前:先检索错误库。若存在相似的失败案例,则在开始前即应用已知的修复方案。

系统不再重复相同的错误。这是生产环境 AI 中使用率最低的模式。

9. 成功模式循环 Success Pattern Loop

大多数工程师只存储失败,成功同样值得存储。

任务顺利完成时:

→ 保存所采用的方法
→ 保存当时的上下文
→ 保存使其奏效的关键因素

面对相似任务时,检索成功模式。从胜利中学习,而不仅仅从错误中学习。

10. 记忆压缩循环 Memory Compression Loop

记忆会无限增长,而无限的记忆等同于无法使用的记忆。

当记忆条目累积到 N 条时,对其进行压缩:将大量具体的记忆压缩为更少的高层抽象。

压缩前:
"任务 A 因 X 失败"
"任务 B 因 X 失败"
"任务 C 因 X 失败"


压缩后:
"规律:X 会导致失败,始终优先检查 X。"

这样可以保持上下文规模可控、模式易于检索,并确保系统运行高效。

打开网易新闻 查看精彩图片

第三类: 规划循环(当现实发生变化时动态调整计划) PLANNING LOOPS(Adapt the plan when reality changes) 11. 规划 → 执行 → 重新规划 Plan → Execute → Replan

AI 智能体设计中最常见的错误:将计划视为一成不变。计划一旦接触现实便会瓦解。

该模式的流程:

制定计划 → 执行步骤 → 观察结果 → 更新计划 → 继续执行

不是瀑布式流程,而是螺旋式推进。每一圈都使方案更加精准。

适用场景:环境存在变化、任务存在依赖关系、长程目标。

打开网易新闻 查看精彩图片

12. 动态工作流循环 Dynamic Workflow Loop

大多数流水线是固定的:步骤 1 → 步骤 2 → 步骤 3,始终如此。动态工作流则根据结果动态调整。

若输出 A → 执行分支 X
若输出 B → 执行分支 Y
若输出 C → 直接跳至步骤 5

流水线在运行时动态决定自身结构和执行路径。

适用场景:多文档研究、客户支持路由、自适应内容流水线。

13. 目标分解循环 Goal Decomposition Loop

系统接收一个大型目标,将其分解为子目标;每个子目标再分解为任务;每个任务再进一步分解为步骤。持续分解,直到每个最小单元可在单次调用中执行完毕。

目标:"撰写一份完整的竞争分析报告"

子目标 1:"识别排名前 5 的竞争对手"
子目标 2:"分析每个竞争对手的产品"
子目标 3:"比较定价模型"
子目标 4:"识别竞争缺口"

每个子目标 → 任务 → 独立的模型调用

循环持续分解,直至系统可以执行。

14. 进度评估循环 Progress Evaluation Loop

每执行 N 个步骤后,暂停并评估:

"当前进展是否真的在向目标靠近?"

若是:继续当前策略。
若否:调整策略、工具或计划。

系统对自身进度进行监控,而不只是盲目执行。

适用场景:长周期研究智能体、多日自主任务、调试智能体。

15. 约束满足循环 Constraint Satisfaction Loop

持续运行,直至所有约束条件均被满足。

while not all_constraints_satisfied(output):
output = improve(output, unsatisfied_constraints)


constraints = [
budget_under_limit, # 预算未超限
quality_above_threshold, # 质量高于阈值
latency_under_200ms, # 延迟低于 200 ms
tone_matches_brand, # 语气符合品牌调性
no_hallucinations # 无幻觉
]

在生产系统中极为常见。输出在通过所有业务规则验证之前,均视为未完成。

打开网易新闻 查看精彩图片

第四类: 探索循环(通过尝试多条路径寻找最优答案) EXPLORATION LOOPS(Find the best answer by trying multiple paths)

16. 分支探索循环 Branch-and-Explore Loop

不要局限于单一路径,同时探索多条路径。

paths = [
generate(approach="保守"),
generate(approach="激进"),
generate(approach="创意")
]


scores = [evaluate(p) for p in paths]
best = paths[scores.index(max(scores))]

比较各路径结果,选择最优分支,舍弃其余。

适用场景:内容多版本生成、架构决策、多假设调试、A/B 版本生成。

打开网易新闻 查看精彩图片

17. 树搜索循环 Tree Search Loop

分支探索循环只深入一层,树搜索循环可以深入任意层级。

扩展最有潜力的节点,剪除最弱的节点,持续探索直至找到解决方案。

根节点 → [A, B, C]
A → [A1, A2] # A 看起来有潜力,继续扩展
B → 剪枝 # B 较弱,停止此处
A1 → [A1a, A1b]
A1a → 找到解决方案 ✓

计算成本较高,但能找到一次性模型调用无法发现的解决方案。

适用场景:复杂推理链、多步骤规划、代码调试、研究综合。

18. 辩论循环 Debate Loop

两个智能体,一个主题,立场相反。

智能体 A 支持该答案,智能体 B 反对该答案。每一轮都在挑战假设、要求证据、暴露逻辑漏洞。

最终答案在分歧中涌现,而非在共识中产生。对抗性压力能够揭示单智能体自信答案中遗漏的内容。

适用场景:投资决策、战略规划、风险评估、研究评议。

打开网易新闻 查看精彩图片

第五类:系统优化循环(用循环来优化循环本身) SYSTEM OPTIMIZATION LOOPS(The loop improves the loop) 19. 提示词优化循环 Prompt Optimization Loop

大多数工程师只写一次提示词,此后再不修改。提示词优化循环改变了这种状况。

系统的运作方式:

→ 在测试集上运行提示词
→ 对每条输出进行评分
→ 识别提示词的失效点
→ 重写提示词以修复这些失效
→ 重新运行并重新评分

提示词自动得到优化,无需人工介入。

current_prompt = "总结这份文档。"

for iteration in range(max_iterations):
outputs = [run(current_prompt, doc) for doc in test_set]
scores = [evaluate(o) for o in outputs]
avg_score = mean(scores)

if avg_score >= target:
break

failures = [o for o, s in zip(outputs, scores) if s < threshold]
current_prompt = improve_prompt(current_prompt, failures)
# 提示词根据失效案例自动重写

适用场景:生产流水线、自动化内容系统、分类任务。

生产环境 AI 中最优秀的提示词,并非由人类编写,而是经由演化迭代而来。

打开网易新闻 查看精彩图片

20. 工作流优化循环 Workflow Optimization Loop

更关键的是,循环还可以优化循环本身。

系统对自身性能进行度量:

延迟:每个步骤耗时多久?
成本:每次调用消耗多少 token?
质量:每个阶段的输出评分如何?

随后,系统对自身工作流进行修改。

速度过慢?将两个步骤并行化。成本过高?在质量可维持的步骤中,用更小的模型替换 GPT-4 调用。质量下降?在最终输出步骤前增加一个评审器。

metrics = measure_workflow(outputs, latency, cost)

if metrics.latency > target_latency:
workflow = parallelize(slow_steps)

if metrics.cost > budget:
workflow = replace_with_cheaper_model(high_cost_steps)

if metrics.quality < threshold:
workflow = add_critic_before(final_output_step)

这正是真正意义上的自我改进系统的起点——不只是输出在改进,而是能够自我重构工作流的系统。

打开网易新闻 查看精彩图片

所有模式背后的共同结构 The pattern behind all 20 patterns

以上 20 种循环,均共享同一底层结构:

行动 → 观察 → 评估 → 调整

这就是全部的秘诀。

输出在第一次尝试时永远不是最终结果,而只是起点。循环才是将起点转化为生产可用输出的关键机制。

打开网易新闻 查看精彩图片

全景概览

第一类:质量循环(在输出离开系统前提升质量) Quality Loops(Make output better before it leaves)

→ 1. 生成 → 批判性评审 → 重写
→ 2. 评分重试
→ 3. 多评审器
→ 4. 对抗性批判评审
→ 5. 评判器集成

第二类:记忆循环(从已发生的事件中学习) Memory Loops(Learn from what happened)

→ 6. 反思
→ 7. 记忆更新
→ 8. 错误库
→ 9. 成功模式
→ 10. 记忆压缩

第三类:规划循环(当现实变化时动态调整) Planning Loops(Adapt when reality changes)

→ 11. 规划 → 执行 → 重新规划
→ 12. 动态工作流
→ 13. 目标分解
→ 14. 进度评估
→ 15. 约束满足

第四类 — 探索循环(通过尝试多条路径寻找最优答案) Exploration Loops(Find best answer by trying many paths)

→ 16. 分支探索
→ 17. 树搜索
→ 18. 辩论

第五类 — 系统优化循环(用循环优化循环本身) System Optimization Loops(The loop improves the loop)

→ 19. 提示词优化
→ 20. 工作流优化

大多数工程师认为智能体代表着未来。

然而,智能体不过是工人,循环才是让工人不断进步的机制。

当前 AI 领域正在发生的最重大转变,并非来自更强大的模型,而是从:

提示词 → 响应

转变为:

生成 → 评估 → 学习 → 改进

掌握循环设计的团队,将不只是编写出更好的提示词,他们将构建出在部署后每天都在自我优化的系统——无需任何人为干预。

从"提示词工程"到"循环工程"的转变,本质上是从"工具使用"到"系统设计"的思维升级。

提示词工程师问的是:如何让模型一次给出更好的答案?

循环工程师问的是:如何设计一套机制,使系统在每次运行后都比上一次更好?

这两个问题,代表了截然不同的工程哲学。

文中所描述的 20 种循环模式,其底层逻辑与人类的学习机制高度同构:行动、观察、反思、改进。

但这并非偶然,因为最有效的 AI 系统架构,往往正是对人类认知过程的显式工程化。我们为 AI 设计"错误库循环"时,实际上是在工程化人类的"经验积累";当我们构建"反思循环"时,实则是在工程化"元认知"能力。

从提示词工程到循环工程,这个趋势还揭示了一个更深层的竞争逻辑:随着大模型能力日趋同质化,拥有更强基础模型的优势正在递减,而拥有更精良循环架构的优势则在持续递增。

未来 AI 领域真正的护城河,不再是参数规模,是那些能让系统在部署后持续自我优化的工程积累:错误记忆库、成功模式库、自适应提示词与自重构工作流。

这些资产无法被一个更大的模型直接复制,却可以随着系统运行时间的积累而不断增值。

这意味着,真正的 AI 工程能力正在从"会用模型"向"会设计系统"迁移。

你目前的 AI 系统里已经落地了哪几种循环?是评审重写、反思记忆,还是更复杂的工作流自优化?落地过程中最头疼的是效果评估、成本控制,还是架构设计?

欢迎在评论区留言交流。

设计模式 工程化

看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,也可以给个星标,你的支持就是我的动力。

全文完

王吉伟频道图书《一本书讲透Agentic AI》已出版,完整构建Agentic AI在企业应用中的全景式知识体系,内容跨越 “基础认知-技术原理-业务应用-组织战略-实操指南” 五大板块,为读者提供从认知共识、技术解构、业务对接到组织变革的端到端路线图,欢迎大家关注。

赠书福利进行中

感谢大家的长期关注与支持。欢迎小伙伴们在文末留言与转发,王吉伟频道会随机选取读者,《一本书讲透Agentic AI》包邮到家。

【 文末福利1 】:后台发消息研报2026,获取15篇 2026年 AI Agent研报 。

打开网易新闻 查看精彩图片

【文末福利2】: 后台发消息Workflow,获取 Agentic Workflow 相关25篇论文。

打开网易新闻 查看精彩图片

【文末福利3】:后 台发消息agentic,获取Agentic AI相关资源 。

打开网易新闻 查看精彩图片

【文末福利4】:后台发消息RPA Agent,获取 相关论文和研报。

打开网易新闻 查看精彩图片

1、

2、

3、

4、

5、

6、

7、

8、

8、

10、