AI直接操作PowerPoint,为什么行不通?

让AI像人一样去点击菜单、拖拽元素来制作幻灯片,这条路基本走不通。模型无法像人类那样对视觉布局形成全局理解,它更擅长通过生成指令来创建内容,而不是模拟一套完整的交互流程。操作与生成之间的差异,决定了直接操控PowerPoint的效率会非常低。

宝玉在推文中点出了这个问题的本质:模型对“操作”这件事缺乏足够的训练,也没有人类那种对页面整体结构的直觉。与其让它模拟点击,不如让它直接产出结构化的内容。

YAML格式的DSL,卡在表达力上

另一种常见做法是用YAML格式的领域特定语言来标准化命令。这个思路看似合理,但实际使用中暴露了两个明显短板。

  • 表达力有限:YAML很难描述复杂的视觉元素,比如不规则的排版、重叠的图形或精细的间距控制。
  • 文档负担重:为了让模型理解这种格式,需要大量额外说明。Kimi为了解释什么是PPTD,用了将近2000行文档,这本身就说明YAML的表达边界太窄。

最终生成的结果往往与预期不符,因为格式本身无法承载足够丰富的设计信息。

HTML为什么是更好的中间格式

HTML是一个通用且表达力强的格式,几乎任何AI模型都能轻松读取和生成。先让模型创建HTML页面,再把HTML转换成标准的PPTX文件,这条路径同时解决了两个问题:美观度和可编辑性。

原文给出的判断很直接:HTML可以保证大模型生成PPT的美观,可以人工二次编辑,又可以几乎无损地转成PPTX。这里的“几乎无损”也留了余地,说明转换过程并非绝对完美,但已经足够实用。

模型对HTML的理解优势是现成的,不需要额外训练,也不需要写几千行文档去解释一种新格式。

给规范,而不是给模板

在内容生成环节,一个详细的设计系统比固定模板更有效。模板会限制内容的排版方式,而规范允许模型在保持风格一致的前提下,自由组织信息。

这种思路对应了《苦涩的教训》里的原则:通用学习方法优于专家知识捷径。与其把每一种版式都固化成模板,不如让模型理解设计规则,再根据具体内容灵活布局。输出质量反而更高。

从HTML到PPTX的过渡,本质上是在用模型已经熟悉的格式,去承接一个它原本不擅长的任务。这个路径不追求一步到位,而是把问题拆成模型能解决的部分和工具能解决的部分。