科技记者Dibakar Ghosh近日做了一项有趣的测试:把ChatGPT、Claude和Gemini这三款主流大语言模型(LLM)改造成项目管理系统。结果发现,其中一款表现远超另外两个——关键在于谁能真正记住你交给它的任务。
2024年,Ghosh曾尝试用ChatGPT的Memory(记忆)功能搭配系统提示词,创建了一个自定义项目管理模式。只需发送“Start PMS”这样的简短指令,它就能自动进入任务管理状态。他当时写道:“我可以告诉它把任务保存到记忆里,完成后自动移除。”
近日,他决定把Claude和Gemini也拉入这个测试。三个AI都收到了相同的初始提示词,用来生成一个带搜索栏、快速添加任务框、分类筛选和看板视图的HTML界面。测试项目是策划一场虚拟生日派对,包含制作嘉宾名单、购物、预订场地和发送邀请等任务。
第一轮,ChatGPT一到两分钟内就生成出了功能完整的界面。它的每个任务栏都有详细描述,添加任务也能根据上下文自动填写详情。切换标签时,页面会完全刷新以显示新内容——虽然每次都要重新加载,但任务状态始终保持正确。
Claude的输出速度最快,几秒钟就产出了一个界面。不过任务描述比ChatGPT简短,过滤功能也有些混乱:点击“未完成”标签时,本应只显示三个任务,却把所有任务都呈现了出来。Ghosh评价:“Claude更像是在做一个原型,而不是可以直接用的工具。”
Gemini的表现问题最大。它一开始拒绝了交互要求,提示“此HTML使用Blob URL,在当前环境下无法访问。请将HTML保存为文件后再用浏览器打开。”经过手动输入任务名称、截止日期和备注,勉强能添加任务,但刷新页面后所有数据立即消失。
在第二轮测试中,Ghosh给每个AI注入了一个“灵魂”创意——把项目管理界面变成一个角色扮演游戏(RPG)。完成三项以上任务就能获得奖杯,未完成的则会在看板视图中显示警示。ChatGPT成功在页面上方加入了经验值和奖杯系统,清单项也更密集。Claude生成了视觉华丽、带游戏通知的界面,但任务项中的文案存在重复问题。
第三轮测试聚焦于记忆和跨会话能力。Ghosh在项目里添加了“预订生日蛋糕”任务,记录下指定的日期和备注,随后关闭所有标签页重新开始。结果显示:ChatGPT凭借Memory功能,从过去的上下文里准确调出了任务详情,包括他之前说过的话、具体日期和备注。
Claude则没有任何跨对话记忆。再次打开时,一切归零。“这意味着你必须在每一次新对话里从头配置整个系统。”Ghosh写道。Gemini虽然提供了Save Info功能,可以在侧边栏查看用户长期偏好,但无法关联到特定的项目背景,加载界面时不会自动读取上次留下的任务信息。
“把LLM变成项目管理工具确实可行,而且创建专属自定义模式的速度,远比等待某个App上线新功能快得多。”Ghosh总结道。他同时警告:这些系统并不缓存界面。任何对HTML的修改都要手动导出保存,切勿完全依赖任何一个AI来管理关键任务。
最终,ChatGPT凭借可靠的Memory功能、丰富的任务描述和上下文感知的自动化能力,在这场对比中胜出。Claude适合做快速原型展示,而Gemini在需要会话间持久记忆的场景下,尚不具备实用条件。GitHub社区已出现大量类似的自制“微SaaS”工具,证明了一个趋势:用户越来越倾向于用最熟悉的AI,搭建完全写着自己名字和偏好的私人项目系统。
热门跟贴