把 LLM 接进 EDA 工具,最容易做出的演示,是让它生成一段 Tcl:用户说目标,模型查手册,脚本一次写完,工具从头跑到尾。问题也藏在这里。脚本生成完,模型的决策随即结束;后续网表怎样变化、关键路径转移到哪里、上一条命令有没有效果,都不会改变下一条动作。

中国香港中文大学团队在 2026 年 8 月 13 日提交的预印本 SynAct,尝试让 LLM 留在商业综合工具的会话里。每执行一轮命令,它都读取新的综合报告,再决定下一轮做什么。作者把它称为自适应推理—行动闭环智能体。

论文在 AltiSyn 商业逻辑综合工具、ASAP7 标准单元库和 14 个 OpenCores RTL 设计上报告:以 WNS 为主目标时,SynAct 把剩余 WNS 违例幅度的平均比值降到初始综合结果的 27.03%。作者复现的 ChatLS 为 71.73%,适配后的 CBTune 为 66.67%。

这组数字值得看,但边界必须先钉牢:它来自论文作者的特定实验,尚无独立复现,也没有证明布局布线收敛、时序 sign-off、客户部署或流片。

打开网易新闻 查看精彩图片

综合调优需要“看一步,再走一步”

逻辑综合把 RTL 转成门级网表。命令、参数和顺序都可能改变时序、面积和功耗。传统自动调优通常先规定动作空间,再用强化学习、贝叶斯优化或 bandit(多臂老虎机方法)寻找序列。

LLM 拓宽了动作来源。它能读自然语言目标和工具文档,也能生成预设列表里没有的命令。ChatEDA、ChipNeMo、ChatLS 等工作已经展示了脚本生成、知识检索和工具调用。不过,一次性脚本有个结构性短板:第 5 条命令看不到前 4 条命令实际改变了什么。

而综合调优的状态一直在变。某条命令改善了当前最差路径,另一组路径可能随即浮到前面;时序收益也可能伴随面积或功耗变化。下一步做尺寸调整、retiming、缓冲优化还是局部重构,取决于更新后的网表和报告。静态脚本切断了这条反馈链。

SynAct 把 LLM 的角色改成了“受反馈约束的命令决策者”。模型每轮只提交下一步,决策发生在工具返回新状态之后。

四层闭环怎样运转

第一层是观察。SynAct 先跑初始综合:配置工艺库、读入并展开 RTL、施加时序约束、执行默认优化,得到各方法共享的初始状态。分析 Agent 随后读取时序、面积和功耗报告。信息不够时,它会生成analyze_*探针,查询时钟域、时序约束、实例或缓冲链,再用返回结果完成诊断。

第二层是生成。优化 Agent 同时从两条线寻找候选命令。GraphRAG(图增强检索)把工具文档整理成“场景—命令—变量”三层图;贝叶斯优化和 GrammarVAE(语法约束的变分自编码器)把历史命令编码到连续潜在空间,按奖励值寻找邻域,再交给 LLM 结合文档修正。

第三层是实跑。主实验每轮生成 10 个候选,从同一父检查点出发分别执行。候选效果由综合结果判断,不由模型自评。

第四层是过滤与回滚。候选若让 WNS 越过预设恶化阈值,或奖励值低于初始综合的 0.2 倍,就会被过滤。剩余候选按奖励值、探索价值和近期重复惩罚打分;没有候选通过时,系统保留上一检查点。主实验最多运行 5 轮。

这四层构成了一条责任链:报告提供状态,LLM 诊断并提出动作,综合工具给出结果,过滤和检查点控制单轮风险。SynAct 更重要的变化发生在决策时点上。

27.03% 到底说明了什么

论文先把 WNS 和 TNS 转成违例幅度max(0, -slack),再计算每个设计相对初始综合的比值并取平均。27.03% 的准确含义是:在这 14 个设计、这套工具和约束下,SynAct 最终保留的 WNS 违例幅度平均为初始综合的 27.03%。

把它直接写成“WNS 普遍提升 72.97%”会越过证据。各设计的初始 WNS、约束难度和优化空间不同;WNS 变为非负后,论文把违例幅度计为零。作者报告 picorv32 为 0.06 ps、wb_conmax 为 0.01 ps。这只能说明综合阶段在当前约束下没有负 WNS。经过布局布线、时钟树、寄生参数提取和 sign-off STA 后是否仍满足时序,论文没有回答。

次要指标补上了 PPA 代价。SynAct 的 TNS 平均比值为 17.86%,面积、动态功耗和静态功耗分别为初始综合的 99.28%、98.92% 和 98.64%。GPT-5.2 全量复测把 WNS 平均比值进一步降到 20.37%,说明框架表现也受底层模型能力影响。

消融实验拆开了收益来源。去掉 BO,WNS 平均比值从 27.0% 变为 37.5%;把 GraphRAG 换成普通 RAG 后为 28.6%;直接提供完整文档则为 38.3%。历史反馈帮助了搜索,结构化检索也降低了信息噪声。

闭环的账单,大头在反复跑工具

三种方法都提交 5 个动作,但工具查询次数没有对齐。论文明确提示,已提交动作预算相同,候选评估预算不同。

SynAct 的端到端耗时平均为初始综合的 988.62%,约 9.89 倍;ChatLS 为 289.83%,CBTune 为 2174.18%。SynAct 比作者适配的 CBTune 快一半以上,仍明显慢于一次性脚本。

时间都花在了哪里?候选评估占 84.85%,初始综合占 10.4%;分析 Agent 和优化 Agent 只占 2.56% 和 1.67%。每个设计还平均消耗约 13.9 万 token,其中 69% 来自优化 Agent。

这份账单很有代表性。Agentic EDA(智能体式 EDA)的主成本未必是模型推理,反复调用工程工具才可能是瓶颈。评价闭环 Agent,除了问 PPA 好了多少,还要问工具次数、许可证与机器资源、并行能力和提前停止条件。进入分钟甚至小时级流程后,搜索质量与调用预算会直接决定产品能不能用。

走进企业流程,还缺三类证据

第一,跨工具和工业设计。论文只覆盖 AltiSyn、ASAP7 和开源 RTL。换一套命令体系、工艺库、约束风格和企业 RTL,知识库、适配器、奖励函数与安全阈值都可能需要重做。

第二,后端保真度。物理实现还会改变延迟、拥塞、缓冲和路径分布。下一步要看综合收益经过布局布线后能保留多少,是否减少时序 ECO 和总周转时间,以及在 sign-off 多工况下能否复现。

第三,工程治理。论文的安全过滤主要防 PPA 退化,企业环境还需要命令白名单、权限边界、资源配额、日志留痕、版本固定、异常恢复和人工审批。当 Agent 能直接控制商业 EDA 会话,谁批准动作、谁验收结果、错误怎样复盘,都会进入落地清单。研发流程编排平台也要把报告、工具调用、权限和回滚接进同一条可审计链路,Flow Builder 等能力的价值就在这里。

一套可迁移的验收方法由此形成:先看 Agent 观察到了什么,再看它能执行哪些动作;接着检查过滤、回滚与人工接管;最后把 PPA 收益和工具成本、后端保真度、跨版本稳定性放在一起评估。

SynAct 把“LLM 写 Tcl”推进到了连续决策。最新综合报告约束每条命令,历史尝试也会影响下一轮选择。就这篇论文的结果看,闭环调优比一次性脚本表现出更强的 WNS 优化能力。

代价同样清楚:更可靠的决策依赖更多真实工具反馈,反馈会消耗运行时间、许可证、算力和验证责任。下一阶段应当关注闭环能否在工业 RTL、不同综合工具和后端流程中,以可审计、可预算、可复现的方式保住收益。

跨工具验证、物理实现结果和真实项目周期,才会给出最终答案。在此之前,SynAct 是一个有说服力的研究原型,还不是可以直接交给研发团队验收的自动综合调优系统。

作者:麒芯

声明:本文基于公开论文与公开资料整理,仅作技术与产业讨论,不构成投资建议。论文结果为作者实验,不代表独立复现、生产部署或时序 sign-off。

参考资料:

1. Liu 等:《SynAct: A Reasoning-Acting Large Language Model Agent for Adaptive Synthesis Optimization》

2. ZeniSyn Design Systems:AltiSyn 与企业公开介绍