Codex 不是 ChatGPT 桌面版:非技术人员的 AI Agent 实战指南

「本段核心问题:」 Codex 到底是什么?它跟 ChatGPT 有什么不一样?

很多人一听说 OpenAI 出了桌面版 Codex,直觉反应是“ChatGPT 终于有桌面客户端了”。打开软件,输入文字,等它回答——然后就没了。就像有人调侃的那样:「把 Codex 当 ChatGPT 用,就像买了特斯拉只拿来听广播。」

Codex 不是 ChatGPT 的桌面版皮肤。它们是两种完全不同的东西。

ChatGPT 是一个装在浏览器里的对话机器人。你问它问题,它给你答案,但动手做事的人始终是你——上传文件的是你,下载结果的是你,复制粘贴、整理归档的还是你。因为 ChatGPT 根本碰不到你的电脑。

Codex 则不同。它是一个桌面 AI Agent,能够在你授权的范围内「直接读你的文件、修改文件、执行工具、产出成品」。你不用一次次上传下载、复制粘贴,Codex 可以自己钻进你的电脑去干活。

桌面 AI Agent 大致有两种形态:一种是像 Codex 这样对非技术人员友善的桌面 App;另一种是像 Claude Code 那样在终端机里操作的 CLI 工具。Codex 的优势在于——它有免费版,只要有 ChatGPT 帐号就能用,而且操作界面直观,不需要敲指令。

所以,在使用 Codex 之前,最需要做的事情不是安装,而是「心智转换」:从“问一个问题”转变为“交代一个任务”。你要把它当成一个可以直接动手的实习生,而不是一个只能动口的顾问。

「反思:」 我第一次打开 Codex 的时候,下意识地跟它说“帮我写一个 Python 脚本”——它写了,但我发现它其实能做得更多。真正让我意识到它不一样的地方是,当我跟它说“把桌面上的那个 Excel 打开,把第二列的空格去掉,然后存回去”,它真的照做了。那一刻我才明白,这不是一个聊天窗口,这是一个能操作电脑的入口。

界面导览:三栏式设计,5 分钟上手

「本段核心问题:」 Codex 的界面长什么样,最关键的几个功能在哪里?

Codex 采用直观的三栏式设计,不需要学习成本就能开始用:

  • 「左栏:」 历史对话、任务列表、专案资料夹、外挂程式和设定
  • 「中间栏:」 主要输入区,支援打字和语音输入
  • 「右栏:」 即时预览区,显示文件结构、网页渲染或 HTML 报表

有两个快速键必须记住:

  • 输入 @ 可以附加专案里的特定档案传送给 Codex
  • 输入 / 可以查看当前状态或指定要使用的 Skill

Fork 功能:平行宇宙的存档点

每一个对话回复下方都有一个「分支」按钮(Fork)。它的作用是:从该时间点复制出一条一模一样的新对话,让你可以分别尝试不同的方向。比如 Codex 给你两个解决问题的方案,你可以 Fork 两条分支,各走各的路,看看哪个结果更好——就像打电玩时存了一个进度,然后回头尝试另一种玩法。

视觉化注解:点画面就能改设计

在预览网页时,打开右上角的注解功能,你可以直接点击画面上的任何元素,然后说“这个标题放大”、“这张图换掉”,Codex 就会自动去修改底层代码并更新预览。整个过程不需要写程式,也不需要用抽象的语言描述位置——你指哪里,它就改哪里。

「反思:」 我教过一个完全不会写程式的朋友用 Codex 做活动网页。他看到注解功能的时候说了一句让我印象很深的话:“所以我不用跟它说‘上面那个区块的第二段文字’这种我自己都搞不清楚的话?”没错,视觉注解就是解决这个问题的——直接点画面,比任何描述都精确。

四个基本功:任何桌面 AI Agent 的核心能力

「本段核心问题:」 要驾驭 Codex,需要掌握哪四个核心概念?

不管用哪一款桌面 AI Agent,这四个概念都是核心。掌握它们,你就掌握了跟这类工具协作的基本方法论。

1. 专案(Project):先圈出工作范围

Codex 的工作范围取决于你在哪个资料夹里开启它。那个资料夹就是它的工作区——它只会在这个范围内读档、改档、新增或删除。

「操作要点:」 与其只丢一个关键字让 Codex 自己找文件,不如直接把整个资料夹拖进去,或者贴完整路径,或者用 @ 功能指定档案。这本质上是在做「上下文工程」——把档案归好类、名字取清楚,让任何人(或 AI)光看资料夹名称就知道里面有什么。

「反思:」 我有一次把 Codex 直接开在“下载”资料夹里,结果它面对一堆“final_v2_真的最终版.xlsx”和“新增资料夹(3)”完全傻眼。后来我才意识到:「自己都没整理清楚的东西,AI 也帮不上忙。」 整理资料夹不是为了 AI,是为了你自己——AI 只是把你没做好的功课暴露出来了。

2. 权限(Permissions):决定它能玩多大

Codex 有三种权限模式:

模式 说明 适用场景
保守(要求合作) 只能读档案跟你讨论,要动任何东西都得先问过你 新手入门、处理重要资料
中等(带我合作) 在工作资料夹内可自主读改档,想碰外面或联网时会停下问你 大多数日常任务
完整存取(Full Access) 完全放行,连整台电脑都能碰 熟悉后追求效率

「建议做法:」 从保守模式开始。被它问烦了再在当前视窗切到更高权限,或直接告诉它“这个工作阶段不要再问我”。等熟悉后可以开完整存取,但建议用 Agent’s Markdown 锁死不可逆操作(例如明确写“不要删除原始档”)。

3. 上下文(Context):不是越多越好

上下文是 AI 的“视野范围”——能读到的所有资料,包括你的对话、提供的文件等。

「一个重要观念:」 上下文不是越多越好。因为 AI 要读的东西越多,能用来思考的空间就越被压缩,焦点也容易分散。

「实战技巧:」

  • 一个阶段做完后,让 Codex 先总结当前状态,然后输入 /compact 压缩上下文
  • 界面上的上下文用量小圈圈到 80% 就手动压缩一次,不要等它满了自动压缩
  • 这样可以避免任务做到一半被迫压缩而漏掉重要资讯

4. Agent’s Markdown:专案的规则书

这可以理解成专案的「员工手册」。在专案资料夹里放一份 Markdown 文件,里面写明:

请用繁体中文输出
不要删除原始档
修改文件前先说明你要改哪里
所有报名名单一律输出成 Excel
做完附上处理摘要

每次在这个专案下开启新 Session,Codex 都会先读这份文件,把它当成最高指导原则。

「新手容易踩的坑:」 写得越长越好,把所有 SOP 通通塞进去。实际上,规则越肥,AI 真正用来思考任务的空间就越少。比较好的做法是只放每次一定要知道的最低限度规则,较长的操作流程做成 Skill,要用再叫出来。

「如果不知道怎么开始:」 正常用一阵子,等专案有了点样子,再叫 Codex 根据合作经验帮你生成这份文件。

Agent’s Markdown 和 Memory 的区别

  • 「Agent’s Markdown:」 你亲手写的员工手册,是专案的规定,跟着资料夹走
  • 「Memory:」 AI 私底下对你的观察笔记——它觉得你有这个偏好就自己写下来

好处是它会越来越懂你,坏处是可能过度解读。所以 Memory 要定期清理,最简单的方法就是直接问 Codex:

你现在记了我哪些东西?

然后告诉它哪些可以删掉。

「总结原则:」 个人长期偏好给 Memory,专案规则与底线写进 Agent’s Markdown。

实战:从混乱资料夹到完整活动网页

「本段核心问题:」 用 Codex 做一个活动筹备的实际流程是怎样的?

下面用一个完整的讲座筹备案例,展示 Codex 如何把一个乱七八糟的资料夹变成有序的交付物。

第一步:扫描与整理资料夹

「操作:」 让 Codex 先扫描资料夹,告诉你里面有哪些文件、每个大概是做什么的,然后帮你重新命名。

例如把「Final 真的最终版.xlsx」改成「2026-06 讲座活动说明.xlsx」。

「为什么要做这一步:」 档名看不懂往往是工作开始乱掉的第一步。整理干净后,不管后面是自己做还是让 AI 接手,都会轻松很多。

第二步:整理表格

「关键技巧:」 跟 Codex 讲清楚目的,结果会差很多。

不要说:

帮我整理名单

要说:

帮我整理一份等一下要拿来记缺席的名单

这样它就会把信箱、是否出席等资讯摆前面,把不相关的栏位收起来。

「处理日志很重要:」 整理完后,请 Codex 产出一份处理日志,告诉你它改了什么、有哪些资料缺漏、哪些人需要补信箱。因为 Codex 不是魔法——你得知道它做了什么,才有办法验收。

有了干净的 Excel,还能继续往下串:叫 Codex 针对每个人写一封确认信,甚至去读报名者填的备注,客制化回应特殊需求。

第三步:制作简报与活动网页

根据活动说明和讲者介绍,先让 Codex 列出简报架构:第一页活动背景、第二页流程、第三页讲者介绍……而不是直接叫它“做一个简报”。

「做活动网页时,使用 Plan Mode(计划模式):」

不要一上来就说:

帮我做一个活动网站

而是:

请你扮演一个 PM,针对我没讲清楚的地方反过来问我,问到规格被定义清楚为止。

等需求被厘清、计划看起来合理,再让 Codex 动手。

「视觉化修改:」 网页做出来不满意也没关系。利用右栏预览区的注解功能,直接点画面,然后像跟同事交代需求一样说:

  • “最上面那条横条放大”
  • “标题的字删掉”
  • “按钮往上弄一点”

做到这里,其实你已经在 Vibe Coding 了——不需要写一行程式码,却做出了一个完整的活动网页。

「反思:」 我以前做活动网页的习惯是打开 Wix 或 WordPress,从模板开始一点点改,一个下午就没了。用 Codex 配合 Plan Mode 的做法,我先让它把计划列出来——这个阶段大概 10 分钟——确认无误后再让它动手。整个流程下来,从原始资料到上线,不到一小时。真正省时间的不是“写代码变快了”,而是“不用来回确认需求”了。

Skill、外挂与自动化:从执行助理到自动化系统

「本段核心问题:」 怎么让 Codex 从每次都要重新交代变成自动运行的体系?

Skill:封装你的 SOP

一套你已经跑通、也满意的 SOP,可以存成 Skill,下次不用重讲一遍。

「举例:」 「讲座筹备 Skill」可以包含:

  1. 读取报名资料
  2. 整理名单与填补栏位
  3. 产生邀请信草稿
  4. 产出活动筹备状态报告
  5. 活动结束后产出复盘摘要

下次办类似活动,直接叫出这个 Skill,Codex 就会按流程一步一步执行。

外挂程式:串接第三方服务

点左侧栏的「外挂程式」,可以搜寻你想要的应用程式功能并一键连接:

  • 「Gmail:」 Codex 能帮你搜寻信件、撰写草稿
  • 「Google Drive:」 读取云端文件,按你的要求修改

自动化排程:解放你的脑子

把你每天固定要跑的任务交给 Codex,让它定时帮你做。

「举例:」 每天早上 9 点自动检查报名表单 → 有新报名就更新到 Excel → 捞未回信的人 → 写客制化 Follow-up

「一个容易被忽视的成本:」 一件琐事可能只花五分钟,但你要记得去做这件事的心智成本绝对不只五分钟。每天被这些琐事磨掉的时间,远比你以为的要多。自动化排程不是炫技,它在解放你的脑子。

「反思:」 我以前觉得“这种小事不用自动化,我自己做还比较快”。但我后来发现,真正消耗我的不是做那件事的 5 分钟,而是“记得要做”这个念头在脑子里盘旋的几小时。把这些固定琐事交给自动化之后,我脑子里少了很多“待办清单”的杂音。

把 Codex 当家教:边做边学的最高境界

「本段核心问题:」 Codex 除了干活,还能教人做事?怎么用它来学习?

Codex 除了是助理,其实也是随叫随到的家教。

「场景一:理解并定制 Skill」

拿到一个别人写好的 Skill,不知道怎么用?直接丢给 Codex,问它是做什么的、什么情况会触发。然后告诉它你平常的工作内容,问它这份 Skill 该怎么改才更适合你。

「场景二:安装并学会用新工具」

以前要去 GitHub 的 README 看一堆手把手教学,中间有一个画面长得不一样就卡住了。

现在可以直接跟 Codex 说:

你先帮我装好 [工具名称],然后一步一步教我怎么用,顺便给我一张表,整理出我要注意的地方跟一些小技巧。

「场景三:给反馈,持续改进」

你是 Agent 的管理者,不能把任务丢给它就预设它会产出你脑子里那个完美的版本。要像带一个新来的同事一样:

  • 先给它背景
  • 讲清楚目标
  • 看一下它的计划
  • 验收它的成果

它做错的时候,不要只丢一句“我不喜欢”。要告诉它哪里不对、为什么不对、下次遇到类似情况该怎么判断。

你越是这样带它,它就越像一个真的懂你做事方式的伙伴,而不是每次都从零开始乱猜。

「反思:」 有一件事让我印象很深。我跟 Codex 说“这个报告的语调太生硬了”,然后它改了一版,还是不太对。后来我意识到问题不在“语调”,在于我没有告诉它“我的读者是谁”。当我补充了“这些报告是给非技术的主管看的”之后,它调整出来的版本就对了。这件事情教会我:「AI 不会读心,你对它越坦诚,它给你的东西越有用。」

风险与适用边界

「本段核心问题:」 Codex 有哪些风险?什么情况下不该用它?

Codex 能直接操作你的电脑档案,这意味着它也有能力造成破坏:

「档案遗失风险:」
在 Full Access 模式下,如果 Agent’s Markdown 没有明确写“不要删除原始档”,Codex 可能直接覆盖或删除你的文件。建议先备份重要资料。

「隐私与安全:」
Codex 需要读取你的档案才能工作,敏感资料(如密码、个资)不应放在专案资料夹中。串接外挂程式时注意授权范围。

「上下文限制:」
Codex 的上下文有上限,处理大型专案时需要手动压缩或拆分任务。不要指望它能记住整个专案的所有细节。

「不是万能:」
Codex 无法处理需要人类判断的复杂决策——创意方向、人际沟通、需要领域专家知识的深度分析。它擅长的是执行明确指令和处理结构化资料。

「免费版限制:」
免费版有使用额度限制,大量使用时需要升级付费方案。

「最安全的做法:」
先用保守模式,在一个专门的测试资料夹中练习,熟悉后再逐步提升权限。每次让 Codex 做重要操作前,先问它“你打算怎么做”,确认计划合理再放行。

「反思:」 我见过有人第一次用 Codex 就直接开 Full Access 跑一个重命名脚本,结果把整个专案资料夹的结构弄乱了。这不是 Codex 的错——是人没有设定边界。就像你不会让一个新来的实习生直接动生产环境的资料一样,AI 也需要你先把规则讲清楚。

核心原则:并行开发,而不是傻等

「本段核心问题:」 怎么同时利用多个 AI 代理干活,而不是干等一个跑完?

不要一个任务一个任务地喂给 AI 代理,然后盯着进度条发呆。真正的效率不是让代理跑得更快,而是让你能够同时调度多个任务。

Codex 支援这种并行工作流:

  1. 发完一个提示就切到下一个
  2. 让 AI 们各自干活
  3. 你负责调度和验收

你可以同时跑:iOS App 开发、Web Landing 页面、投资人简报、发布视频、社交媒体自动发布、App 图标设计——全部并行。

「Fork 分支功能」在并行场景下特别好用:用不同的分支测试不同的方向,然后选出最好的结果。

实用摘要 / 操作清单

如果你打算今天就开始用 Codex,这里是一份可以直接照着做的清单:

  1. 「下载并安装 Codex」(搭配 Ollama 使用本地模型更佳)
  2. 「选择一个专案资料夹」,把相关档案整理好,取好名字
  3. 「从保守权限模式开始」,在一个测试资料夹里练习
  4. 「第一个任务」:请 Codex 扫描并整理你的资料夹结构
  5. 「建立 Agent’s Markdown」:写入基本规则(语言、命名规范、安全边界)
  6. 「试用注解功能」:如果做网页,直接点画面修改
  7. 「定期检查上下文用量」,到 80% 就压缩
  8. 「把一个跑通的流程存成 Skill」
  9. 「设一个自动化排程」——哪怕是最简单的那一种

一页速览(One-page Summary)

概念 一句话解释 新手该怎么做
专案(Project) Codex 的工作范围 开一个专属资料夹,别开在桌面
权限(Permissions) 它能做什么、不能做什么 从保守模式开始,熟了再升级
上下文(Context) AI 的视野范围 到 80% 就压缩,别等它满
Agent’s Markdown 你写的员工手册 先简单写 5 条,别写太多
Skill 封装好的 SOP 跑通一个流程后就存起来
外挂 串接第三方服务 先连 Gmail 或 Drive 试试
自动化 定时执行任务 从每天早上一个固定任务开始
Fork 平行宇宙存档点 有两个方案时各走一条
注解 点画面改设计 做网页时一定要试

常见问答(FAQ)

「Q1:Codex 和 ChatGPT 桌面版有什么区别?」
Codex 能直接操作你电脑里的档案和工具,在你授权的范围内自主读档、改档、产出成品;ChatGPT 只能回答问题,动手的人还是你。

「Q2:Codex 免费吗?」
Codex 有免费版,只要有 ChatGPT 帐号就能使用。免费版有使用额度限制,大量使用时需要升级付费方案。

「Q3:我不是工程师,能用 Codex 吗?」
可以。Codex 的界面是三栏式设计,不需要写指令或代码。注解功能让你直接点画面就能改设计,语音输入也支援。

「Q4:Codex 会不会把我的资料删掉?」
在保守和中等权限模式下不会。只有在完整存取模式下,且你没有在 Agent’s Markdown 里写明安全规则时才有风险。建议从保守模式开始,重要资料先备份。

「Q5:Agent’s Markdown 要写多长?」
越短越好。只放每次一定要知道的最低限度规则(语言、命名规则、安全边界),详细的 SOP 做成 Skill 单独调用。

「Q6:什么是 Fork 功能?」
Fork 可以从任何一个对话时间点复制出一条一模一样的新对话,让你分别尝试不同方向,对比结果。

「Q7:Codex 能处理大型专案吗?」
可以,但要注意上下文限制。建议定期压缩上下文(/compact),并把大任务拆分成多个 Session 分段完成。

「Q8:自动化排程能做什么?」
可以定时执行固定任务,比如每天早上检查报名表单、更新 Excel、捞未回信的人、写 Follow-up 邮件等。


本文内容基于 OpenAI Codex 桌面版的实际使用体验整理而成。所有案例和技巧均来自真实应用场景。