用AI生成一个3D打印的马克杯,拿到手却发现它根本装不了咖啡。问题出在:AI模型懂一个东西该长什么样,却不懂它该怎么用。设计出来的物件看着像那么回事,实际用起来处处是坑。
更麻烦的是改。就算你想动手修,这些模型通常也很难编辑,对没碰过3D设计的新手尤其不友好。
麻省理工学院计算机科学与人工智能实验室(CSAIL)、谷歌和东北大学的研究人员给出了一个新方案,叫InstructMesh。这套设计软件可以按提示生成一副眼镜的3D设计,用户再圈出图纸上想细调的部分,然后送去3D打印。它是一个AI驱动的界面,既理解设计该长什么样,也理解专家和新手分别想改哪里。
它到底能做出什么
CSAIL的研究者用InstructMesh给普通物件加上了个性化的创意。比如它做出了一个被龙包裹的马克杯,龙尾就是杯柄;一个像贝壳的亮蓝色哨子;一副镜片上方展开蝴蝶翅膀的眼镜。再放飞一点,它做出了一个章鱼造型的分液器,液体从每条触手里流出,一次给好几个杯子倒饮料。
InstructMesh之所以能跟上这些古怪提示,靠的是把微软的TRELLIS系统和支撑ChatGPT的大语言模型GPT-4配在一起。前者能从文字和图像提示生成3D模型,后者提供推理能力——视觉知识和文本知识合流。
论文第一作者、麻省理工学院电气工程与计算机科学系毕业生Faraz Faruqi说:“我们想把3D生成器的才能和大语言模型的推理能力放进一个交互空间里,做出人们真正想要的物件。语言模型擅长文本和图像,而TRELLIS的本事在于它能造3D模型,因为它见过太多了。”
从护膝到机器人
这套工具在更意外的场景里也派得上用场。MIT的科学家用它做出了一个看起来像牛仔布的护膝,用来搭配患者穿的牛仔裤。InstructMesh甚至能帮忙造机器人——准确说,是容纳无线元件的巧妙外壳。研究者做了一个像彩色虾的“毛刷机器人”来演示:电机藏在里面,一开机就能在表面上滑行,有点像上发条的玩具。
Faruqi和同事发现,InstructMesh能轻松做出他们想要的物件。但一个从没做过3D建模的人会怎么看这套程序?他们真能在动手制作前发现设计缺陷吗?
为了找答案,团队让TRELLIS复刻Thingiverse上流行的3D模型——那是一个聚集了数百万可打印模型的平台。结果它生成的模型里,近80%在结构上存在某种缺陷。CSAIL的研究者随后请新手在InstructMesh里找出并修复这些问题,经专家复核,他们大约90%的情况下两件事都做到了。这些新人缺的是专业经验,补上的是直觉。
InstructMesh把原本需要3D建模工具领域专长的建模过程搭好了脚手架。Faruqi说:“操作发生在生成模型的潜空间里,InstructMesh支持用自然语言描述问题,并在几何上做出可解释的改动,交给用户评估和确认。”
用户随后做出了手机支架、花瓶这类东西,并反馈InstructMesh很好上手。他们还发现,这套工具能让他们表达各种各样的想法,而滑块给了他们更高的精度去做某些微调,比如放大或挤出模型的某个特定部位。
Faruqi补充说:“用户得到了他们提示的东西,也能在需要的地方轻松调整设计。他们看到的就是他们得到的,这些物件也确实如宣传的那样能用。”
用户用着开心,Faruqi对这个项目的设想更大。他现在在谷歌工作,可能很快会把InstructMesh整合进一个增强现实(AR)平台。思路是:结合你周围环境的上下文,用语言说明你需要什么,然后它快速3D打印出来——比如做一个和你钱包相配的手机壳。
InstructMesh还可能开始引入物理仿真,来模拟你的设计在特定使用场景下会怎样,比如碗掉在地上会不会碎,以及哪种材料最合适。软件也可能整合更新的TRELLIS.2,去打磨3D模型里更细小的特征。
麻省理工学院电气工程与计算机科学系及机械工程系副教授、CSAIL成员Stefanie Mueller是这篇论文的资深作者。Faruqi和Mueller与谷歌研究人员Ahmed Katary、Fabian Manhardt、Vrushank Phadnis、Ruofei Du和Federico Tombari共同撰写了论文。其他合著者包括东北大学助理教授Megan Hofmann,以及几位CSAIL同事:Demircan Tas、前访问研究员Theresa Hradilak、Ning Zhang、博士后Jiaji Li和Martin Nisser。
热门跟贴