如果你在用 AI 办公,这 10 个 Skill 很适合上班直接装。它们不是什么“未来科技”,而是已经能实际部署、当天就能改变你工作流的工具。

什么是 Skill? 简单说,Skill 是教 AI“怎么做事”的可复用知识包。跟一次性的提示词不同,Skill 会在需要时自动触发,跨对话持续生效。你不是在“问 AI”,而是在给 AI 装上一套工作方法论。

一、官方文档处理:把 Office 全家桶交给 AI 1. document-skills

Word / Excel / PPT / PDF,一句话处理办公文件

这套技能集包含 docx、pdf、pptx、xlsx 四个子技能,覆盖日常办公文件的读写编辑全流程。核心能力包括:PDF 的文本表格提取、表单填写、合并拆分、扫描件 OCR;Word 的创建编辑、修订追踪、批注分析;PPT 的幻灯片重排、文本替换、缩略图生成;Excel 的公式计算、格式处理、数据分析。

安装方式很直接,Anthropic 官方仓库一条命令即可:

/plugin marketplace add anthropics/skills/plugin install document-skills@anthropic-agent-skills

装完后 Skill 会自动激活,你不需要说“用 PDF 技能”,直接描述任务就行。比如把 PDF 拖进去说“帮我提取这份合同里所有涉及付款的条款”,它会自动识别并执行。

2. canvas-design

一句话生成培训海报、活动宣传图,没有设计功底也能用

canvas-design 是 Anthropic 官方示例 Skill 之一,专门处理视觉设计输出(PDF/PNG)。它的工作方式是根据一段“设计理念”渲染出成品,而不是套模板。

实际用法很直接:告诉它活动时间、主题、主讲人,它会生成一张完整的宣传海报。适合需要快速产出视觉物料但不想打开 PS 的场景。和 document-skills 里的 pptx 搭配,PPT 和海报可以一次性出。

二、信息获取与压缩:把“读”这件事自动化 3. summarize

PDF、网页、长文章、视频链接,直接提炼重点

好的摘要工具不是把长文压短,而是在压缩的同时保住关键细节。理想的 summarize Skill 采用两步法:先逐节提取所有要点,保留具体数据、方法名称和原文引用;再清理引用标记、添加概述、组织结构。输出的是一份带章节标题的编号列表,关键术语加粗,直接引语斜体,没有废话。

支持配置摘要深度——从一句话到 500 词的结构化摘要,以及针对不同受众(技术/管理/通用)调整侧重点。日常快速浏览用轻量模式,需要精读留存用完整模式。

4. tavily-search

查最新新闻、数据和资料,而且会附来源

Tavily 的搜索 Skill 专为 Agent 设计,返回的是 LLM 优化的结果,带内容片段和相关性评分。支持高级搜索参数:按时间范围过滤(比如查最近一周的 AI 新闻)、按域名限定(比如只搜 sec.gov 和 reuters.com 的备案文件)、调整搜索深度。

安装后 Agent 会自动在需要时调用它。跟通用搜索不同的是,它返回的结果结构对 AI 更友好,来源信息也保留得比较完整。做行业调研、竞品分析、数据核查时,这个 Skill 能省掉大量“打开网页→复制→粘贴→整理来源”的机械操作。

5. local-whisper

会议录音本地转文字,再直接生成纪要和待办

这个 Skill 把语音转文字从云端 API 切换到本地 whisper.cpp,完全在设备上运行,不需要 API key,没有网络传输,也没有按次计费。前提条件包括 macOS Apple Silicon 环境,以及通过 Homebrew 安装 whisper-cpp 和 ffmpeg,再下载一个 GGML 模型文件(base 版 148MB,小模型 466MB,medium 版 1.5GB)。

转成文字后,让 AI 接着生成会议纪要和待办列表就是顺理成章的事。对于经常需要处理会议记录、访谈录音、培训材料的职场人,这个 Skill 把“听录音→打字→整理”这条链路压缩成了一步。

三、自动化执行:让 AI 真的去“做事” 6. agent-browser

让 AI 自动打开网页、搜索、点击、填表

agent-browser 是一个浏览器自动化 CLI 工具,100% 原生 Rust 构建,专为 AI Agent 设计。它的 Skill 设计比较务实:安装一个轻量的“发现技能”后,Agent 就能根据需要加载具体的执行协议。

核心能力包括页面导航、表单填写、截图、数据提取、会话管理,甚至反向工程站点 API。它用“ref-based”快照机制替代传统选择器——snapshot 命令返回无障碍树,每个元素带唯一引用如 @e1、@e2,点击时直接引用,不再依赖容易失效的 CSS 选择器。输出用紧凑文本格式,token 消耗只有完整 DOM 的十分之一左右。

实际案例中,有团队用 agent-browser 配合“Copy as fetch”方案直接复用 SPA 页面的接口请求,避开了传统浏览器自动化在动态页面上“元素定位不稳、token 消耗高”的老问题。

四、记忆与知识库:让 AI 记住你 7. claude-mem

让 AI 记住你的项目背景,不用每次会话都从头解释

Claude Code 最大的痛点之一:每次新会话都要重新交代项目结构、代码风格、历史决策,之前聊过的上下文全部清零。claude-mem 专门解决这个问题,它给 Claude Code 装上跨会话的持久化长期记忆。

工作原理分三层:全量记录——监听 Claude Code 生命周期,自动捕获工具使用、文件修改、关键决策;AI 压缩——不是简单存文本,而是抽取关键信息,生成“高密度记忆片段”(原始 5000 tokens 的上下文压缩到 200 tokens 但保留核心);精准注入——新会话启动时,根据当前任务自动检索相关记忆并注入 prompt。

所有数据存储在本地 ~/.claude-mem/ 目录,不上传云端。常规场景下可以节省约 90% 的 token 消耗,因为不需要每次对话重复解释背景。

8. obsidian-skills

让 AI 真正理解你的本地知识库,而不是只会读写文件

如果你用 Obsidian 做笔记和知识管理,这套 Skill 值得认真考虑。它不是简单地把 Obsidian 当文件夹处理,而是帮助 Claude 理解 Markdown 结构、Canvas 画布、Frontmatter 元数据以及你的笔记组织规范。

装完之后,你可以让 AI 帮你整理散落的笔记、重构知识库结构、从零散记录中提取主题并建立链接。对于把 Obsidian 当作“第二大脑”的人来说,这相当于给知识库接上了一个能理解上下文的协作者。

五、协作与元技能:让工作流自己进化 9. doc-coauthoring

多阶段协作文档流程,专门治“写到一半就散架”

doc-coauthoring 是一个引导式多阶段工作流,用于技术文档和规格说明的协作撰写。它的流程结构是:先收集上下文,再结构化起草,最后做读者测试。

这个 Skill 的价值在于“强制流程”。很多人写技术方案或产品文档时容易东一榔头西一棒子,doc-coauthoring 会按阶段推着你走,确保每一部分都建立在上一部分的输出之上。如果你经常需要产出 PRD、技术设计文档、接口说明,这个 Skill 比单纯让 AI“帮我写个文档”靠谱得多。

10. skill-creator

把你每天重复的工作流程,直接封装成一个 Skill

这个 Skill 的定位很清晰:它是用来“造别的 Skill”的 Skill。手写一个 SKILL.md 文件确实不难,难的是写出来的 Skill 在该触发的时候不触发。skill-creator 解决的正是这个问题——它会像向导一样问你:这个 Skill 要干什么?什么情况下该用?用户会说什么话?输出格式是什么?

这几个问题恰恰是手写时最容易忽略的。description 字段写不好,Skill 就在角落里永远沉睡。skill-creator 会把“触发条件”这件事专门拎出来让你想清楚,还会提供测试用例验证它到底能不能被叫动。

说白了,它的价值不是帮你打字,是逼你把那些看不见的坑一个一个填上。

最后说一句

Skill 的本质是把“你会的”变成“AI 会的”。每一个重复性工作流程——不管是整理周报、分析工单、还是从一堆 PDF 里捞数据——都值得被固化下来,装一次,用一百次。

这 10 个 Skill 覆盖了办公场景里最常见的几类需求:处理文件(document-skills、canvas-design)、获取信息(summarize、tavily-search、local-whisper)、执行操作(agent-browser)、沉淀知识(claude-mem、obsidian-skills)、协作流程(doc-coauthoring),以及把重复流程固化下来(skill-creator)。

装 Skill 的原则不用贪多,先把高频场景覆盖住,剩下的按需补。巧用 Skill,让 AI 替你上班。