与自动驾驶或工业机器人不同,医疗机器人无法依赖互联网级别的数据采集或无限制的真实世界实验。每一次演示都需要专业设备、临床专业知识以及接触患者或实验室环境的机会。这给开发者带来了三项根本性挑战。
第一是数据缺口。训练现代机器人策略需要跨越多种解剖结构和手术流程的演示数据。大多数团队仅有数百份演示数据,远未达到构建稳健系统所需的数万份规模。即便收集数百万份演示数据在实践中可行,最重要的案例仍会缺失。这是因为医疗领域由长尾效应主导——罕见解剖结构、复杂患者生理状况、并发症和故障模式发生频率过低,难以在真实世界数据集中得到充分呈现。然而,这些恰恰是临床安全中最关键的案例。
数据缺口直接导致第二项挑战:泛化能力不足。模仿学习在数据分布边缘不可避免地会遭遇瓶颈。强化学习(RL)提供了突破这一瓶颈的路径。强化学习能够探索数百万次交互、对策略进行压力测试并从失败中学习。要做到这一点,它需要足够逼真的仿真环境以产生有意义的策略,同时还需足够快速和可扩展以支持大规模训练。
第三项挑战是开发速度。医疗机器人开发依赖台式模型、尸体研究、动物模型和有限的临床评估。这些方法虽不可或缺,但本质上是序列化的、成本高昂且难以扩展。当前,设计和算法的迭代需要数月时间,导致整体开发周期长达4至7年。
这三项挑战共同指向同一缺失的基础设施:一个开放的、GPU原生的仿真框架,能够以机器人训练所需的保真度对设备与解剖结构的交互进行建模。
NVIDIA医学物理仿真框架正是为填补这一空白而构建的。这是NVIDIA Isaac for Healthcare中一项开源、GPU加速的能力。开发者可以在NVIDIA Isaac Sim和NVIDIA Isaac Lab中生成解剖数字孪生体、仿真设备与解剖结构的交互及医学成像,并在GPU规模上训练强化学习策略。
医学物理仿真框架同时提供经典物理求解器和生成式世界模型仿真器,用于设备与解剖结构交互的实时仿真,支持跨医疗机器人细分领域的强化学习策略训练。两个模块均提供模块化的研究与工程平台,适用于交互式手术与介入仿真、机器人学习、合成数据生成和手术流程开发。由于仿真与学习均在同一GPU上运行,避免了CPU与GPU之间反复内存传输的开销,因此非常适合机器人学习工作流程。
腔内仿真模块现已在Isaac for Healthcare中正式发布。该模块支持对长柔性手术器械在腔内腔道中导航的诊断和介入手术进行实时仿真,以独立软件包的形式实现,可独立集成到不同工作流程和环境中。此次初始版本展示了在荧光镜引导下导管穿越血管系统的导航过程。
该模块使用NVIDIA Warp和Newton Physics以Python实现。柔性器械被建模为Cosserat杆,为仿真材料的弯曲、扭转和拉伸变形提供了坚实的理论基础。为在GPU上高效捕捉这些一维杆的复杂非线性动力学,选用了扩展基于位置的动力学(XPBD)作为主要仿真方法。
XPBD通常依赖局部迭代约束投影。然而对于长器械而言,局部投影可能需要大量迭代才能将运动从受控的近端传播到远端。该模块改为将耦合杆约束组装成矩阵系统。每个杆段贡献六个约束方程——三个用于拉伸和剪切,三个用于弯曲和扭转——生成一个具有6×6块的块三对角XPBD系统。Thomas算法以相对于器械长度的线性时间求解该系统,而独立器械则在GPU的向量化环境中并发处理。
这种全局耦合求解器在每个仿真步骤内沿整个器械传播近端插入和旋转等输入,即使对于极长的器械也能实现,从而实现对远端用户操作的即时响应。
导管与血管交互仿真
导管与血管的交互也在GPU上并行评估。有符号最近点查询直接对患者特定三角网格进行评估,避免了单独预计算距离场。当器械样本穿透血管壁时,将其投影回腔内,同时保留切向滑动运动。当前版本支持刚性单向约束;与可形变血管壁的双向耦合计划在未来版本中实现。
控制输入通过杆的边界条件和静止状态直接表达。插入操作沿导管鞘轴推进受约束的近端,轮毂旋转设置其方向,远端转向修改最后几个杆段的静止曲率,而非施加外部人工力。弯曲和扭转约束随后将这些输入沿器械传播。
连接物理、成像与机器人学习
腔内仿真模块通过通用API与其他Newton求解器保持兼容性。通过wp.from_torch和wp.to_torch提供的Torch-Warp互操作性,使控制和强化学习接口实现零拷贝且完全驻留在GPU上。这支持与NVIDIA Isaac Lab的直接集成,后者是专为大规模机器人学习设计的框架。Isaac Lab负责环境编排和推演控制,而求解器则执行基于GPU的动力学计算,并返回设备端张量用于观测、奖励和控制循环。
物理与成像的协同设计支持高吞吐量策略训练,包括512个并行环境和1500次训练迭代的实验。报告性能约为:单环境物理仿真约1300 Hz,512个环境下物理仿真约60 Hz,256×256像素分辨率下完整仿真和渲染循环约63帧每秒。该平台还为未来直接基于荧光镜图像和其他基于像素的观测进行策略训练奠定了基础。
导管导航工作流程作为统一仿真循环运行,结合了两个耦合的患者特定组件:血管数字孪生包生成解剖衰减/几何体(mu_volume、血管掩模/网格和中心线),腔内仿真包在该解剖结构内以XPBD约束推进导管力学。每帧中,求解器状态被转换为可渲染的导管段,并由fluorosim合成到同一CT衍生成像域中。这使物理与荧光镜在一个端到端循环中保持同步,同时额外的探测器响应效果提升了荧光镜图像的逼真度。
手术仿真模块通过早期访问渠道提供,是一个实时GPU加速手术仿真框架,专为在统一仿真流水线中对软组织变形和手术交互进行建模而设计,并具备触觉反馈和渲染功能。
与腔内仿真模块类似,它也使用NVIDIA Warp和Newton Physics以Python实现。与单体物理引擎不同,它将功能组织为显式有序的仿真系统,每个手术流程通过变形、碰撞、抓取、切割、夹闭、电外科和渲染操作的序列进行配置,使物理GPU流水线可检查、可配置且易于扩展。
软组织使用四面体网格表示。变形采用基于位置的动力学求解,使用距离和体积保持约束,校正在GPU上累积并取平均,减少约束排序伪影,支持高效并行执行(Jacobi求解器)。
此外,仿真和可视化循环均驻留在GPU上,包括变形、碰撞查询、抓取、热扩散、拓扑更新和曲面重建。NVIDIA CUDA图捕获进一步降低了内核启动开销,而直接GPU到渲染器的数据传输(CUDA互操作)避免了不必要的CPU/GPU复制。这使得在一块消费级GPU上,以8个物理子步和8次内部变形约束迭代实现超过30帧每秒的实时仿真成为可能。
该模块的初始版本支持完整的胆囊切除术流程(胆囊摘除)。仿真从机器人器械插入充气腹腔开始,可视化肝脏、胆囊和结缔脂肪组织等关键结构,涉及肝囊三角的解剖、胆囊管和动脉的夹闭与切断,以及胆囊与肝脏的分离。
医学物理仿真的生成式方法是物理求解器的补充技术。与其显式编程每一种交互,生成式世界模型从视频和其他数据中学习真实场景的外观及其随时间变化的方式。在训练阶段,模型学习视觉观测、运动与条件信号(如机器人动作)之间的关系;在推断阶段,它利用这些习得的世界知识预测下一个视频帧。
由于结果在摄像头和机器人策略所观察的视觉空间中生成,该模型能够再现难以手工构建的场景细节和外观,同时避免了为传统仿真器创建每个资产、材料和光照设置所需的大量手工工作。其代价是这些预测从数据中学习而来:它们在视觉上可以非常逼真,但无法提供数值求解器所具备的明确物理保证。
NVIDIA Cosmos为这一方法提供世界基础模型。Cosmos视频模型采用基于流的扩散Transformer架构,结合整流流公式。在生成过程中,模型在压缩视频表示中迭代地将噪声转化为从习得数据分布中采样的连贯样本。视频Token化器将像素空间帧压缩为这种潜在表示以实现高效建模,并将生成的潜在向量解码回视频。多模态条件控制使生成的未来内容具备可控性;对于医疗应用,在领域数据上进行后训练以适应该广泛视觉模型,使其应用于特定解剖结构、器械、手术流程和动力学。
Cosmos-H系列展示了生成式医学物理仿真的多种形式。Cosmos-H-Surgical-Predict从初始图像和文本预测合理的未来手术视频;Cosmos-H-Surgical-Transfer生成由深度、边缘、分割或模糊等控制信号引导的手术视频;Cosmos-H-Surgical-Simulator预测直接以手术机器人运动学为条件的未来帧。
这些模型共同支持从合成数据生成、受控域迁移到动作条件机器人训练和策略评估等多种应用场景。它们并非在所有场景中都能取代显式物理仿真,但能减少场景创作负担,并在完整第一性原理建模不切实际时提供逼真的观测级仿真。
Cosmos-H-Dreams将这一方法扩展至交互式仿真。它将从Cosmos-H-Surgical-Simulator微调的教师模型蒸馏为因果、少步骤的学生模型,以自回归方式响应机器人动作流式传输未来手术视频。通过FlashDreams推断引擎提供服务,它将高质量离线世界模型转变为帧生成速率超过30帧每秒的实时环境,可由人工操作员控制,或在单个工作站GPU上由习得的机器人策略闭环查询。
Isaac for Healthcare同时支持经典仿真和生成式仿真,以满足医疗机器人的互补需求。为提供用户信任度和定量质量评估(这是任何医疗解决方案的基础),经典仿真提供的物理一致性和确定性建模环境不可或缺;而生成式仿真则能大规模生成经典仿真无法实现的多样化且视觉逼真的环境,支持数据合成和实时临床工作流中的临床应用。
Isaac for Healthcare中的医学物理仿真为开发者提供了构建患者特定数字孪生体、仿真设备与解剖结构交互、生成合成体验以及训练智能医疗机器人系统的基础模块。
开发者可利用GPU加速物理仿真、解剖数字孪生体和仿真医学成像构建患者特定导管导航仿真,流程包括:生成血管数字孪生体、引入导管-血管交互求解器、使用X射线传感器仿真模拟X射线感知,以及构建端到端导管导航工作流程。
Cosmos-H Dreams支持使用世界基础模型大规模生成逼真的手术体验。开发者可使用预训练模型、运行交互式仿真,或将框架适配到新手术流程和机器人形态。可从GitHub仓库获取预训练检查点、示例和交互式仿真工作流,从Hugging Face下载预训练模型检查点,或通过微调Cosmos-H-Surgical-Simulator创建适用于自定义实施例的Cosmos-H Dreams模型。如从不同视频扩散架构或专有数据集训练的模型出发,可通过FlashDreams(驱动Cosmos-H Dreams的高性能推断运行时)进行集成。
Q&A
Q1:NVIDIA Isaac for Healthcare中的腔内仿真模块有什么功能?
A:腔内仿真模块支持对长柔性手术器械在腔内腔道中导航的诊断和介入手术进行实时GPU加速仿真。它基于Cosserat杆模型仿真器械的弯曲、扭转和拉伸,采用XPBD方法进行高效求解,支持512个并行环境,可实现约60 Hz的物理仿真频率,并能在荧光镜成像环境中完整呈现导管穿越血管系统的导航过程。
Q2:Cosmos-H系列模型与传统物理仿真有何区别?
A:传统物理仿真依赖显式编程的物理规则,能提供确定性和物理一致性保证,但构建资产和场景需要大量手工工作。Cosmos-H系列是生成式世界模型,从视频数据中学习场景外观和变化规律,能大规模生成多样化、视觉逼真的环境,减少手工创作负担。两者各有侧重,Isaac for Healthcare同时支持这两种方式以满足不同需求。
Q3:医疗机器人开发目前面临哪些主要挑战?
A:医疗机器人开发面临三大核心挑战:一是数据缺口,训练所需的大量多样化演示数据难以获取,尤其是罕见解剖结构和并发症等长尾案例;二是泛化能力不足,模仿学习在数据分布边缘容易遭遇瓶颈,强化学习虽能突破但需要高保真仿真支撑;三是开发速度慢,依赖台式模型、尸体研究等传统方法导致整体开发周期长达4至7年。
热门跟贴