现代芯片设计越来越受限于工程师的时间成本。寄存器传输级(RTL)开发与验证需要专业的硬件知识、精确的逻辑推理,以及与电子设计自动化(EDA)工具的反复交互。大语言模型已经在加速代码生成方面发挥了重要作用,而AI智能体则通过利用验证反馈对错误进行迭代修正,进一步放大了这一价值。
这对RTL开发尤为关键——RTL的正确性依赖于精确的时序行为,而许多缺陷只有在工具验证阶段才会暴露出来。
本文将介绍智能体上下文演化(ACE)-RTL智能体与NVIDIA Nemotron 3 Ultra如何协同工作,在智能体RTL任务中实现精度与效率的双重领先。ACE-RTL提供了一套"生成—测试—反思"的迭代工作流,而Nemotron 3 Ultra则贡献了长上下文推理能力,以及与RTL生成、编辑和调试任务高度对齐的训练基础。
综合Verilog设计问题(CVDP)基准测试对大语言模型在真实RTL生成、修改、调试和验证任务上的表现进行评估。与早期基于简短独立Verilog提示构建的基准不同,CVDP更真实地反映了实际硬件设计问题。
RTL编码并不等同于"根据提示写Verilog"。一个实用的AI助手需要能够读取规格说明、理解现有模块、复用并修改代码、解读仿真失败信息、调试信号不匹配问题,并提出针对性的修复方案。这些本质上都是智能体工作流的范畴。工程师们很少能一次性解决复杂的RTL任务,他们需要借助编译器、仿真器、静态分析工具、波形检查以及验证反馈不断迭代。
为了在真实的智能体RTL工作流中评估Nemotron 3 Ultra,研究团队采用了论文《ACE-RTL:当智能体上下文演化遇上RTL专用大语言模型》中提出的ACE-RTL智能体。ACE-RTL代表了RTL编码智能体的标准范式:生成RTL,运行仿真或工具检查,分析失败原因,并迭代优化设计。该智能体由三个协同组件构成:生成器、反思器和协调器。生成器负责产生或更新RTL代码;反思器分析仿真反馈、识别可能的根本原因,并提供高层次的修复指导;协调器则在多次迭代间维护一个动态演化的调试上下文,决定哪些历史信息和反馈应当指导下一次生成尝试。这使智能体能够从之前的失败中积累经验,而非反复犯同样的错误。
测试结果显示,ACE-RTL智能体显著提升了所有评测模型的通过率。GLM 5.2从独立模型的44.0%提升至94.3%,Kimi K2.6从68.6%提升至97.1%,Nemotron 3 Ultra则从65.7%跃升至100.0%。这些结果充分体现了迭代工具反馈和上下文演化对解决真实RTL任务的重要价值。
在对比实验中,研究团队将ACE-RTL流程固定,分别以GLM 5.2、Kimi K2.6或Nemotron 3 Ultra作为智能体循环中唯一的大语言模型,从而隔离模型本身的影响。在CVDP的九个任务类别中,搭载Nemotron 3 Ultra的ACE-RTL取得了最强的综合表现,平均通过率达97.1%,高于Kimi K2.6的95.2%和GLM 5.2的92.1%。其优势广泛体现在RTL补全、规格到RTL生成、RTL修改、模块复用、静态检查与质量优化、测试激励与检查器生成、断言生成以及RTL调试等多个维度,并在多个类别中达到100%通过率。
尤为值得关注的是,Nemotron 3 Ultra在实现更高精度的同时,Token消耗量也显著更低。其平均每次迭代仅使用6,629个Token,而GLM 5.2为9,156个,Kimi K2.6高达22,579个。这意味着与GLM 5.2相比节省约28%的Token,与Kimi K2.6相比节省约71%,且仍能取得最高的平均通过率。
更高精度与更低Token成本的结合,对智能体编码场景极具价值。更高的通过率意味着智能体能解决更多独特的硬件问题,更低的Token消耗则降低了每个优化步骤的推理开销。实际意义在于:相同的算力预算可以尝试更多RTL任务,工程师也能更快获得结果。
Nemotron 3 Ultra是一款拥有5500亿总参数、550亿活跃参数的混合专家(MoE)Mamba-Attention混合架构模型,专为长时间运行的智能体场景而设计。该模型在20万亿文本Token上完成预训练,上下文长度扩展至100万Token。在同类开源模型中,Nemotron 3 Ultra在关键智能体基准上表现领先,以更小的体量超越了更大规模的开源模型。
混合Mamba-Attention架构通过降低注意力计算开销和KV缓存占用来提升吞吐效率,而MoE设计则在每个活跃参数上实现更高精度,与其他开源模型相比可提供高达5倍的吞吐量提升和30%的成本降低。
在RTL工作流中,效率尤为关键,因为智能体的上下文会快速膨胀。单次调试迭代可能包含规格说明、模块代码、生成的RTL、仿真输出、断言失败信息以及此前的修复尝试。高效的长上下文推理能力直接决定了此类智能体对实际工程师是否具有实用价值。
Nemotron 3 Ultra的RTL能力得益于ACE-RTL论文中提出的合成数据生成(SDG)流程。该流程旨在创建高质量的RTL训练数据,真实反映硬件工程师和RTL智能体的实际工作方式:不仅从规格说明生成代码,还包括修改现有实现和调试失败设计。
SDG流程从公开代码库筛选出的高质量RTL种子设计出发,由开源大语言模型将这些种子转化为指令式训练样本,并以少量上下文示例为引导,定义期望的格式、细节层次和硬件特定任务风格。对于规格到RTL的生成任务,模型会合成自然语言规格说明,并与从种子设计中提取的黄金RTL实现配对。
该流程的关键创新在于任务多样性。除规格到RTL生成之外,流程还创建了RTL代码编辑和调试任务,更贴近模型在智能体工作流中的实际运作方式。在编辑任务中,原始种子RTL作为黄金实现,简化版本作为输入,配套规格说明描述了恢复黄金RTL所需的功能扩展或边界情况处理。
在调试任务中,流程向种子设计中注入真实的RTL错误,例如有限状态机转换错误、握手或时序违规以及其他常见硬件设计错误。对应的规格说明包含诊断信息(如观察到的失败行为或信号不匹配),使模型能够结合代码上下文和反馈信息学习修复故障RTL。
所有生成的样本在用于训练前都会经过数据过滤环节,包括语法检查、基准测试去污,以及基于大语言模型评判的评分标准打分,以评估规格说明与RTL实现在语义上的一致性。这一过滤步骤有助于确保最终合成数据在结构上有效且对训练有实际价值。
这一区别对于智能体RTL工作流至关重要。在迭代优化过程中,模型必须对之前的代码、失败的测试和工具反馈进行推理,而不仅仅是从干净的规格说明生成RTL。通过在代码编辑和调试任务上进行训练,Nemotron 3 Ultra得以接触到与RTL编码智能体内部所需解决的相同类型的修复与优化问题。
Nemotron 3 Ultra是一款开源模型,工程团队可以直接在现有工具中使用。开发者可以用它生成RTL并迭代设计,然后将输出接入现有的验证和签核流程,支持的合作伙伴包括:
Cadence:ChipStack AI超级智能体与Nemotron 3 Ultra结合,通过协调RTL生成、测试台创建、回归编排和调试等专项AI智能体,为前端设计和验证带来智能体编排能力。此外,Cadence还将Nemotron 3 Ultra开源模型扩展至其整个工程超级智能体产品线:面向数字实现与签核的InnoStack AI超级智能体、面向定制化与模拟设计的ViraStack AI超级智能体,以及面向PCB和封装全多物理场驱动电子系统设计的AuraStack AI超级智能体。
Siemens:Nemotron 3 Ultra与Questa One智能体工具包结合,帮助团队更早发现问题、提升工程生产力、更快交付高质量设计。同时还与Fuse EDA AI智能体集成,为长时间运行的自验证EDA AI智能体提供支持,Token效率提升可达5至10倍。
Synopsys AgentEngineer:基于Nemotron 3 Ultra模型的技术方案,通过多智能体系统实现自主验证收敛,建立持续可追溯的反馈闭环,大幅减少人工验证工作量。其Openshell沙箱可将数周的人工验证工作压缩至数小时完成。
Q&A
Q1:ACE-RTL智能体是如何工作的?
A:ACE-RTL智能体由三个协同组件构成:生成器、反思器和协调器。生成器负责产生或更新RTL代码;反思器分析仿真反馈,识别根本原因并提供修复建议;协调器则在多次迭代间维护动态调试上下文,决定哪些历史信息应指导下一次生成。这种架构让智能体能从失败中积累经验,避免重复犯同样的错误,最终实现对复杂RTL任务的迭代优化。
Q2:Nemotron 3 Ultra在RTL任务中比其他模型强在哪里?
A:Nemotron 3 Ultra搭配ACE-RTL智能体后,在CVDP基准测试的九个任务类别中平均通过率达97.1%,高于Kimi K2.6的95.2%和GLM 5.2的92.1%,并在多个类别中达到100%。更重要的是,它每次迭代平均仅消耗6,629个Token,比GLM 5.2少约28%,比Kimi K2.6少约71%,在精度更高的同时推理成本更低。
Q3:Nemotron 3 Ultra的RTL能力是如何训练出来的?
A:Nemotron 3 Ultra的RTL能力来自专门设计的合成数据生成(SDG)流程。该流程从公开代码库筛选高质量RTL种子设计,生成涵盖规格到RTL生成、代码编辑和调试三类任务的训练样本。其中调试任务会向种子设计注入真实错误(如状态机转换错误、时序违规等),让模型学习结合代码上下文和反馈信息进行修复。所有样本还经过语法检查和语义一致性评分过滤,确保训练数据质量。
热门跟贴