微软开源 Skill Recorder:录一遍操作,AI 就能替你干

你是不是也有这种经历:每周都要重复做一套操作——导出报表、整理格式、上传到某处、再发邮件通知。步骤你早就背下来了,但每次都不得不亲手点一遍,因为写自动化脚本的成本比手动做还高。

微软最近开源了一个工具,叫 Skill Recorder,想把这个问题从根上解决掉。

它的做法很直接:你正常操作一遍,它把屏幕和操作过程录下来,然后用 AI 帮你整理成一份步骤说明。这份说明可以变成 AI 代理能执行的技能,下次你说一句话,它就能照着做完。

它不是普通录屏软件,也不是传统 RPA 工具。它走的是另一条路——让 AI 理解你的意图,而不是记住你的鼠标轨迹


它跟录屏软件和 RPA 到底有什么不一样

先澄清一个容易搞混的点。

Skill Recorder 确实会录你的屏幕,但它不产出视频。你用 Loom 或 OBS 录完,得到的是一个 MP4 文件,别人看了能学会怎么操作,但机器看不懂。

Skill Recorder 产出的是一份结构化的操作说明,AI 能直接读取并执行。

那它跟 RPA(机器人流程自动化)工具的区别呢?传统 RPA 比如 UiPath,记录的是你点了哪个坐标、输入了什么文字、等待了多久。执行的时候,它复现这些动作。好处是精确,坏处是脆弱——按钮挪了个位置,脚本就断了。

Skill Recorder 不记录坐标。它记录的是你完成了什么,然后让 AI 自己决定用什么方式去完成。

举个例子。你录的是“在 GitHub 上提交一个 Issue”。你本人是通过浏览器点按钮、填表单来完成的。但 Skill Recorder 生成的技能,AI 执行时大概率会直接用 gh 命令行工具调用 GitHub API,而不是打开浏览器去模拟点击。

API 调用比界面操作稳定得多,不会因为页面改版就失效。而且 AI 的泛化能力比宏录制强——你录了一次“提交 Issue”,AI 学到的是“提交 Issue 的方法论”,下次你让它提交一个内容完全不同的 Issue,它也能独立完成,不需要你重新录一遍。

这就是 Skill Recorder 的核心判断:它要教给 AI 的是“怎么做这类事”,而不是“怎么做这件事”。

从按下录制到 AI 替你干活,一共就四步

Skill Recorder 的工作流很清晰,顺着走一遍就明白了。

第一步:录制

启动应用后,界面上有一个显眼的红色录制按钮。点一下,或者直接按键盘快捷键 ⌘⇧R(Mac)或 Ctrl+Shift+R(Windows),录制就开始了。

录制期间,屏幕上会一直显示一个小型控制条,始终浮在最上层。你可以随时:

  • 暂停或继续
  • 开关麦克风
  • 切换不同的麦克风输入源
  • 结束录制,或者放弃录制(会弹确认框,防止手滑)

这个阶段,Skill Recorder 在后台记录的信息比普通录屏丰富得多:

  • 你切换了哪些应用和窗口
  • 浏览器里打开了什么页面
  • 剪贴板里复制了什么内容(只保存简短预览,用来串联操作步骤)
  • 如果你开了麦克风,还有你的语音解说

所有数据都只存在本地。在你主动点击“分析”之前,什么都不会上传。

第二步:控制

录制过程中,那个浮在顶部的控制条虽然小,但该有的功能都有了。麦克风状态、录制时长一目了然。如果中途发现操作失误,可以直接放弃录制,系统会跟你确认一次,防止误操作把刚录好的内容丢了。

这个设计看起来不起眼,但实际用起来很顺手——你不用为了调整麦克风就跳回主界面,所有操作都在控制条上完成,不打断正在做的事。

第三步:分析

录制结束之后,点击 Analyze 按钮。Skill Recorder 会把刚才收集到的所有信息打包,发送给 GitHub Copilot 处理。

这是整个流程里唯一需要联网的环节,也是依赖 Copilot 能力的核心步骤。

Copilot 拿到数据后会做两件事:

  1. 用一句话概括你完成了什么任务——这叫意图
  2. 把整个操作过程拆解成有序的步骤列表——这叫步骤

分析完成后,你会看到类似这样的输出:

意图:在 GitHub 上创建一个新的 Issue 并填写模板。

步骤

  1. 打开项目仓库的 Issues 页面
  2. 点击“New Issue”
  3. 选择模板类型
  4. 填写标题和描述
  5. 提交

关键来了:Copilot 输出的步骤是描述性的,不是指令性的。它不会写成“点击坐标 (320, 480) 处的按钮”,而是写成“点击‘提交新 Issue’按钮”。这个抽象层次让步骤可以被理解、被修改、被复用。

分析结果出来后,你可以自由编辑。AI 的初稿通常能搭好 80% 的骨架,剩下 20% 需要你来调整——确保步骤描述准确、逻辑完整、没有遗漏。

第四步:创建

对分析结果满意之后,你可以生成两种东西:

Skill(技能):一份 SKILL.md 文件,里面写清楚了完成某类任务的意图和步骤。AI 代理可以随时读取并执行。

Automation(自动化):同样的操作描述,但额外配置了触发条件——定时执行,或者某个事件触发执行。

两者的区别在于调用方式——Skill 是“我说你做”,Automation 是“到点就做”。底层的东西是一样的。

第五步:执行

到了这一步,你之前的投入就开始产生回报了。

假设你生成了一份 Skill。下次你需要完成同样任务的时候,只需要对你的 AI 代理说一句“执行那个提交 Issue 的技能”,AI 就会按照 SKILL.md 里的步骤,一步步完成操作。

整个过程你不需要再动手。AI 会自己打开需要的工具、填写表单、提交确认。你只需要验收结果。

安装:三条命令,覆盖三大平台

Skill Recorder 目前以源码发布的形式提供。换句话说,你下载的不是一个编译好的安装包,而是一个安装脚本。脚本会自动拉取指定版本的源码,在你本地编译并配置好运行环境。

这样做的好处是透明——你可以审查源码,也可以自己修改。代价是第一次安装需要联网下载 Node.js 运行时和项目依赖,稍微需要一点耐心。

macOS / Ubuntu

打开终端,执行:

commit="<40-character-release-commit>"
curl -fsSL "https://raw.githubusercontent.com/microsoft/skill-recorder/$commit/install.sh" | SKILL_RECORDER_COMMIT="$commit" bash

注意替换 <40-character-release-commit> 为实际发布版本的 commit 哈希值。你可以在 GitHub Releases 页面找到最新版本对应的值。

安装完成后,macOS 上会在 ~/Applications 目录下添加一个名为 Skill Recorder (Source) 的应用。你可以通过 Spotlight、Launchpad 或 Dock 启动它。

如果你希望终端关闭后应用继续保持运行,可以加上环境变量:

commit="<40-character-release-commit>"
curl -fsSL "https://raw.githubusercontent.com/microsoft/skill-recorder/$commit/install.sh" | SKILL_RECORDER_COMMIT="$commit" SKILL_RECORDER_DETACHED=1 bash

Ubuntu 的安装方式相同,安装完成后会添加对应的应用条目。

Windows 11(PowerShell)

$commit="<40-character-release-commit>"
$env:SKILL_RECORDER_COMMIT=$commit
irm "https://raw.githubusercontent.com/microsoft/skill-recorder/$commit/install.ps1" | iex

安装完成后,桌面上和开始菜单里会出现 Skill Recorder (Source) 的快捷方式。

Windows 版本支持 x64 和 ARM64 架构。

首次启动:别忘了这一步

在 macOS 上第一次启动 Skill Recorder,系统会弹窗要求授予屏幕录制权限。这是因为底层的 Chromium 引擎需要这个权限才能录制画面。如果不授权,录制功能无法工作。

授权之后,你就可以正常使用了。

第一次点击 Analyze 时,如果还没有登录 GitHub,系统会引导你完成登录和 Copilot 授权。之后就不需要再管了。

数据隐私:什么上传、什么不上传

隐私问题是这类工具绕不开的关切。Skill Recorder 在数据边界上做了一个明确的分割。

录制和存储阶段(全部在本地)

  • 窗口追踪:记录你切换的应用和窗口标题
  • 浏览器 URL:记录你访问的页面地址(目前仅 macOS)
  • 屏幕视频:由 Chromium 底层录制,只在画面变化时保存低帧率快照
  • 剪贴板:记录复制内容的简短预览,用于串联步骤
  • 语音解说(可选):通过麦克风录制

所有这些数据都只保存在你的电脑上。

分析阶段(发送到云端)

当你点击 Analyze 时,以下数据会发送给 GitHub Copilot:

  • 事件时间线(窗口标题、文档标题、URL、剪贴板预览)
  • 提取的屏幕图像
  • 转录后的语音文字

注意一点:语音转录本身是在本地完成的。Skill Recorder 使用 Whisper 模型进行语音识别,首次使用时会下载一个大约 252MB 的模型文件,之后所有转录都在你的电脑上完成,音频数据不需要上传。

但分析阶段的数据传输是功能本身必需的,因为 Copilot 是云端服务。

红线:不要录秘密

启动录制时,应用界面会给出清晰的提醒:不要录制、输入、粘贴或口述任何密码、访问令牌、API 密钥、凭证或其他机密信息。

这不是套话。Skill Recorder 会记录你屏幕上的内容,包括你打开的页面、输入的文字。如果你的操作过程涉及敏感信息,那就不要在这个操作中使用 Skill Recorder

如果确实需要录制包含敏感操作的任务,最安全的做法是:用测试环境或模拟数据完成录制,然后再在分析结果中手动补充说明。

源头发行的逻辑:为什么要这样安装

Skill Recorder 选择源码发布方式,而不是提供预编译安装包,主要有三个考量:

  1. 完整性:你运行的代码和开源仓库里的代码完全一致,没有“黑盒”二进制文件。
  2. 可审计性:你可以随时检视源码,确认应用的行为符合预期。
  3. 可修改性:如果你想定制功能,可以 fork 仓库,修改后自建版本。

每次发布版本时,Releases 页面会标注一个具体的 commit 哈希值。安装脚本精确拉取这个 commit 对应的源码,然后构建。这个过程保证了可复现性——你今天安装的版本,和三个月后安装的同一个版本,代码完全一致。

第一次安装时,脚本会自动下载一个固定版本的 Node.js 运行时(基于 Node.js 24),并执行 npm ci 安装依赖,然后构建应用。这一切都在本地完成,不会影响你系统上已有的 Node.js 环境。

给开发者:从源码跑起来

如果你想修改 Skill Recorder 的源码或者跑通测试,项目提供了完整的开发环境配置。

签出代码后(确保处于某个发布版本的 revision 上),执行:

npm ci
npm run compliance:licenses
npm run dev

npm run dev 会启动 Vite 开发服务器并拉起 Electron 应用,支持热重载。录制快捷键在开发模式下同样生效。

评估测试

Skill Recorder 还有一个独立的评估测试套件,主要用于测试 Copilot“描述器”和“构建器”的准确性:

npm run eval         # 测试描述器在合成录制数据上的表现
npm run eval:builder # 测试 Skill 和 Automation 的泛化生成质量

评估套件基于固定测试集,不依赖外部环境,适合在修改逻辑后验证效果。

什么场景适合用,什么场景不适合

Skill Recorder 不是万能工具,它有自己的适用边界。

适合的场景

重复操作的沉淀:团队里有人每周都要做一次数据导出、格式转换、上传报表的操作。录一遍生成 Skill,以后交给 AI 做。

流程文档化:与其写长篇大论的操作手册,不如录一遍实际操作,生成结构化的步骤描述,再稍作修改就是一份高质量文档。

个人效率提升:把自己日常工作中的高频操作录成 Skill,每次只需要一句话触发,省去重复劳动。

自动化脚本的前期准备:如果你正在从手动操作向自动化迁移,Skill Recorder 可以帮助你快速梳理出现有流程的步骤逻辑,为后续编写脚本提供清晰的参考。

不适合的场景

每次都不一样的任务:如果你的工作流程没有重复性,每次操作差异很大,那录制一次的价值有限。

涉及敏感数据的操作:录制过程中会暴露屏幕内容,如果涉及密码、密钥、个人信息,风险较高,不建议使用。

需要复杂决策的任务:Skill Recorder 适合流程明确的操作,不适合需要频繁判断和灵活应对的任务。

一点实操建议

如果你打算上手试一试,有这么几个小建议可以帮你少踩坑:

第一次录,选一个简单的任务。 比如“打开某个网页并截图保存”这类只有三四步的操作。先跑通整个流程——录制、分析、生成 Skill、让 AI 执行——对每一步的输出有个预期之后,再去录复杂任务。

录制之前,先把屏幕清理一下。 关闭无关的窗口和通知,避免 Copilot 把无关信息当成步骤的一部分。你操作得越干净,分析结果就越精准。

分析结果出来后,认真改一遍。 AI 的初稿能搭好骨架,但细节需要你补充。比如某些步骤的判定条件、异常情况的处理方式,这些是 AI 从一次录制里看不出来的,只有你才知道。

测试 Skill 的时候,用测试环境。 第一次让 AI 执行 Skill,最好在一个可以随意操作的环境里跑,确认步骤正确之后,再挪到正式环境。

常见问题

Skill Recorder 和普通录屏软件有什么区别?

录屏软件产出视频,给人看;Skill Recorder 产出结构化操作说明,给 AI 读和执行。

分析数据一定会传到云端吗?

是的。点击“分析”后,事件时间线和截取的屏幕图像会发送给 GitHub Copilot 处理。这是功能本身所必需的。

语音转录是在本地还是云端?

本地。Skill Recorder 使用 Whisper 模型,首次使用下载约 252MB 模型文件后,所有转录在电脑上完成。

生成的 Skill 只能在 GitHub Copilot 上用吗?

SKILL.md 是标准的 Markdown 格式,理论上任何支持该格式的 AI 代理都可以读取。但目前的设计主要针对 Copilot 生态。

Windows 和 macOS 的功能一致吗?

核心功能一致。浏览器 URL 追踪目前仅支持 macOS,Windows 版本在持续跟进中。

录制的视频存在哪里?

录制数据存储在本地,直到你点击“分析”或手动删除。具体存储位置可以查阅项目文档。

如果我没有 Copilot 账号,能用吗?

不能。分析功能依赖 GitHub Copilot,你需要有一个启用了 Copilot 的 GitHub 账号。


Skill Recorder 做的事情其实很简单:把你的一次操作,变成 AI 可以重复执行的技能。它不追求录下你的每一次点击,而是追求让 AI 理解你每一次点击背后的目的。

如果你手头有重复性的操作任务,恰好又有 Copilot 账号,不妨花半小时试一下。录一个小任务,生成一份 Skill,看看 AI 执行出来的结果是不是你想要的。从我自己的体验来看,第一次看到 AI 按照你教的方式把活干完,那种感觉确实挺有意思的。