同一个主题,让不同模型写研究报告,有的能给出7个关键事实点,有的只写出2个,剩下全是"深刻洞察"式的空话。Manus团队在评测实践中发现,这种差距可以被精确量化——他们构建了两个指标:「信息量」和「隐喻率」,用来衡量AI生成报告的质量。
这两个指标的设计思路很直接。信息量,就是让LLM逐篇抽取报告中的事实点和数据点数量,横向对比不同模型的信息密度。隐喻率,则是统计每百句话中出现比喻表达的次数,用来反映模型的写作风格和可读性。团队用这两个指标跑了9个主流模型,包括GPT-5.6、Claude Fable-5、Opus-5、Gemini-3.7-flash、Grok-4.6等,得出了几组有意思的对比数据。
信息量:GPT为什么"话多但料少"
在信息量测试中,同主题下模型A能写出7个事实点(比如iPod发布时间、硬盘规格、容量、接口等),模型B只写了2个事实点,其余全是评价修饰语。Manus团队发现,GPT模型倾向于写完整的总结笔记,导致信息损失更高。他们通过Prompt规范笔记写法后,GPT的信息量得到了有效改善。
更值得注意的是,GPT的Search工具调用平均次数甚至高于Claude模型。如果信息量低不是因为信息接触得少,那也许就是发生了某种信息的丢失——模型接触到了信息,但在生成过程中丢掉了。
隐喻率:文风背后的信息损耗
隐喻率这个指标,统计的是每百句话中的比喻次数。Manus团队把隐喻定义为一种"语言函数":把x词映射成y词,而y的信息量一定小于等于x。也就是说,隐喻本质上会带来信息损失——句子变得更抽象复杂,读者需要额外处理才能理解原意,报告的可读性随之下降。
实测数据里,各模型的文风差异很明显:
- Fable-5隐喻率最高,偏好身体/有机体表达
- GPT-5.6最克制,几乎不用比喻
- Gemini偏宏大词汇
- Grok偏商业竞争隐喻
不过团队也强调,低隐喻率不等于绝对更易读,但它是一个可操作的Signal——至少能帮你定位哪些模型在"用修辞掩盖信息密度不足"。
指标设计:有效且可靠,缺一不可
Manus团队指出,好的指标必须同时满足两个条件:有效性和可靠性。有效的指标能让Signal简洁直接地反映模型特点,分数高低能帮助定位产品问题;可靠的指标则要求可量化、自动化评测稳定。
实际操作中,隐喻率的标注并不简单。团队要求排除日常无感隐喻和术语比喻,并且每个标注都要输出字面替换作为反向校验——确保标注者真的理解了原句,而不是凭感觉打标签。
这套方法论背后有一个更本质的判断:研究报告的质量取决于两个维度——包含哪些信息(决定用户能否读到高质量内容),以及这些信息如何组织(决定用户能否低成本理解)。信息量和隐喻率只是从这两个维度出发构造的众多可量化指标中的两个。
团队自己也承认,这仅是海量可挖掘Signal中的一小部分。比如信息量这个指标,就还有未竟的话题:怎么防止一个模型提升信息量的同时也提升了废话的数量?如何把主观感受通过一个简洁优雅的切口量化出来,是最需花心思的部分,指标的有效性也需要长期的线上数据跟踪来验证。
对于做AI产品评测的人来说,这套思路的参考价值在于:别只盯着"好不好用"这种主观评价,把质量拆成可量化的维度,用数据说话,才能发现模型之间真正的差距。
热门跟贴