Codex 不是 ChatGPT 桌面版:非技术人员的 AI Agent 实战指南
❝
「本段核心问题:」 Codex 到底是什么?它跟 ChatGPT 有什么不一样?
❞
很多人一听说 OpenAI 出了桌面版 Codex,直觉反应是“ChatGPT 终于有桌面客户端了”。打开软件,输入文字,等它回答——然后就没了。就像有人调侃的那样:「把 Codex 当 ChatGPT 用,就像买了特斯拉只拿来听广播。」
Codex 不是 ChatGPT 的桌面版皮肤。它们是两种完全不同的东西。
ChatGPT 是一个装在浏览器里的对话机器人。你问它问题,它给你答案,但动手做事的人始终是你——上传文件的是你,下载结果的是你,复制粘贴、整理归档的还是你。因为 ChatGPT 根本碰不到你的电脑。
Codex 则不同。它是一个桌面 AI Agent,能够在你授权的范围内「直接读你的文件、修改文件、执行工具、产出成品」。你不用一次次上传下载、复制粘贴,Codex 可以自己钻进你的电脑去干活。
桌面 AI Agent 大致有两种形态:一种是像 Codex 这样对非技术人员友善的桌面 App;另一种是像 Claude Code 那样在终端机里操作的 CLI 工具。Codex 的优势在于——它有免费版,只要有 ChatGPT 帐号就能用,而且操作界面直观,不需要敲指令。
所以,在使用 Codex 之前,最需要做的事情不是安装,而是「心智转换」:从“问一个问题”转变为“交代一个任务”。你要把它当成一个可以直接动手的实习生,而不是一个只能动口的顾问。
「反思:」 我第一次打开 Codex 的时候,下意识地跟它说“帮我写一个 Python 脚本”——它写了,但我发现它其实能做得更多。真正让我意识到它不一样的地方是,当我跟它说“把桌面上的那个 Excel 打开,把第二列的空格去掉,然后存回去”,它真的照做了。那一刻我才明白,这不是一个聊天窗口,这是一个能操作电脑的入口。
界面导览:三栏式设计,5 分钟上手
❝
「本段核心问题:」 Codex 的界面长什么样,最关键的几个功能在哪里?
❞
Codex 采用直观的三栏式设计,不需要学习成本就能开始用:
-
「左栏:」 历史对话、任务列表、专案资料夹、外挂程式和设定 -
「中间栏:」 主要输入区,支援打字和语音输入 -
「右栏:」 即时预览区,显示文件结构、网页渲染或 HTML 报表
有两个快速键必须记住:
-
输入 @可以附加专案里的特定档案传送给 Codex -
输入 /可以查看当前状态或指定要使用的 Skill
Fork 功能:平行宇宙的存档点
每一个对话回复下方都有一个「分支」按钮(Fork)。它的作用是:从该时间点复制出一条一模一样的新对话,让你可以分别尝试不同的方向。比如 Codex 给你两个解决问题的方案,你可以 Fork 两条分支,各走各的路,看看哪个结果更好——就像打电玩时存了一个进度,然后回头尝试另一种玩法。
视觉化注解:点画面就能改设计
在预览网页时,打开右上角的注解功能,你可以直接点击画面上的任何元素,然后说“这个标题放大”、“这张图换掉”,Codex 就会自动去修改底层代码并更新预览。整个过程不需要写程式,也不需要用抽象的语言描述位置——你指哪里,它就改哪里。
「反思:」 我教过一个完全不会写程式的朋友用 Codex 做活动网页。他看到注解功能的时候说了一句让我印象很深的话:“所以我不用跟它说‘上面那个区块的第二段文字’这种我自己都搞不清楚的话?”没错,视觉注解就是解决这个问题的——直接点画面,比任何描述都精确。
四个基本功:任何桌面 AI Agent 的核心能力
❝
「本段核心问题:」 要驾驭 Codex,需要掌握哪四个核心概念?
❞
不管用哪一款桌面 AI Agent,这四个概念都是核心。掌握它们,你就掌握了跟这类工具协作的基本方法论。
1. 专案(Project):先圈出工作范围
Codex 的工作范围取决于你在哪个资料夹里开启它。那个资料夹就是它的工作区——它只会在这个范围内读档、改档、新增或删除。
「操作要点:」 与其只丢一个关键字让 Codex 自己找文件,不如直接把整个资料夹拖进去,或者贴完整路径,或者用 @ 功能指定档案。这本质上是在做「上下文工程」——把档案归好类、名字取清楚,让任何人(或 AI)光看资料夹名称就知道里面有什么。
「反思:」 我有一次把 Codex 直接开在“下载”资料夹里,结果它面对一堆“final_v2_真的最终版.xlsx”和“新增资料夹(3)”完全傻眼。后来我才意识到:「自己都没整理清楚的东西,AI 也帮不上忙。」 整理资料夹不是为了 AI,是为了你自己——AI 只是把你没做好的功课暴露出来了。
2. 权限(Permissions):决定它能玩多大
Codex 有三种权限模式:
| 模式 | 说明 | 适用场景 |
|---|---|---|
| 保守(要求合作) | 只能读档案跟你讨论,要动任何东西都得先问过你 | 新手入门、处理重要资料 |
| 中等(带我合作) | 在工作资料夹内可自主读改档,想碰外面或联网时会停下问你 | 大多数日常任务 |
| 完整存取(Full Access) | 完全放行,连整台电脑都能碰 | 熟悉后追求效率 |
「建议做法:」 从保守模式开始。被它问烦了再在当前视窗切到更高权限,或直接告诉它“这个工作阶段不要再问我”。等熟悉后可以开完整存取,但建议用 Agent’s Markdown 锁死不可逆操作(例如明确写“不要删除原始档”)。
3. 上下文(Context):不是越多越好
上下文是 AI 的“视野范围”——能读到的所有资料,包括你的对话、提供的文件等。
「一个重要观念:」 上下文不是越多越好。因为 AI 要读的东西越多,能用来思考的空间就越被压缩,焦点也容易分散。
「实战技巧:」
-
一个阶段做完后,让 Codex 先总结当前状态,然后输入 /compact压缩上下文 -
界面上的上下文用量小圈圈到 80% 就手动压缩一次,不要等它满了自动压缩 -
这样可以避免任务做到一半被迫压缩而漏掉重要资讯
4. Agent’s Markdown:专案的规则书
这可以理解成专案的「员工手册」。在专案资料夹里放一份 Markdown 文件,里面写明:
请用繁体中文输出
不要删除原始档
修改文件前先说明你要改哪里
所有报名名单一律输出成 Excel
做完附上处理摘要
每次在这个专案下开启新 Session,Codex 都会先读这份文件,把它当成最高指导原则。
「新手容易踩的坑:」 写得越长越好,把所有 SOP 通通塞进去。实际上,规则越肥,AI 真正用来思考任务的空间就越少。比较好的做法是只放每次一定要知道的最低限度规则,较长的操作流程做成 Skill,要用再叫出来。
「如果不知道怎么开始:」 正常用一阵子,等专案有了点样子,再叫 Codex 根据合作经验帮你生成这份文件。
Agent’s Markdown 和 Memory 的区别
-
「Agent’s Markdown:」 你亲手写的员工手册,是专案的规定,跟着资料夹走 -
「Memory:」 AI 私底下对你的观察笔记——它觉得你有这个偏好就自己写下来
好处是它会越来越懂你,坏处是可能过度解读。所以 Memory 要定期清理,最简单的方法就是直接问 Codex:
你现在记了我哪些东西?
然后告诉它哪些可以删掉。
「总结原则:」 个人长期偏好给 Memory,专案规则与底线写进 Agent’s Markdown。
实战:从混乱资料夹到完整活动网页
❝
「本段核心问题:」 用 Codex 做一个活动筹备的实际流程是怎样的?
❞
下面用一个完整的讲座筹备案例,展示 Codex 如何把一个乱七八糟的资料夹变成有序的交付物。
第一步:扫描与整理资料夹
「操作:」 让 Codex 先扫描资料夹,告诉你里面有哪些文件、每个大概是做什么的,然后帮你重新命名。
例如把「Final 真的最终版.xlsx」改成「2026-06 讲座活动说明.xlsx」。
「为什么要做这一步:」 档名看不懂往往是工作开始乱掉的第一步。整理干净后,不管后面是自己做还是让 AI 接手,都会轻松很多。
第二步:整理表格
「关键技巧:」 跟 Codex 讲清楚目的,结果会差很多。
不要说:
帮我整理名单
要说:
帮我整理一份等一下要拿来记缺席的名单
这样它就会把信箱、是否出席等资讯摆前面,把不相关的栏位收起来。
「处理日志很重要:」 整理完后,请 Codex 产出一份处理日志,告诉你它改了什么、有哪些资料缺漏、哪些人需要补信箱。因为 Codex 不是魔法——你得知道它做了什么,才有办法验收。
有了干净的 Excel,还能继续往下串:叫 Codex 针对每个人写一封确认信,甚至去读报名者填的备注,客制化回应特殊需求。
第三步:制作简报与活动网页
根据活动说明和讲者介绍,先让 Codex 列出简报架构:第一页活动背景、第二页流程、第三页讲者介绍……而不是直接叫它“做一个简报”。
「做活动网页时,使用 Plan Mode(计划模式):」
不要一上来就说:
帮我做一个活动网站
而是:
请你扮演一个 PM,针对我没讲清楚的地方反过来问我,问到规格被定义清楚为止。
等需求被厘清、计划看起来合理,再让 Codex 动手。
「视觉化修改:」 网页做出来不满意也没关系。利用右栏预览区的注解功能,直接点画面,然后像跟同事交代需求一样说:
-
“最上面那条横条放大” -
“标题的字删掉” -
“按钮往上弄一点”
做到这里,其实你已经在 Vibe Coding 了——不需要写一行程式码,却做出了一个完整的活动网页。
「反思:」 我以前做活动网页的习惯是打开 Wix 或 WordPress,从模板开始一点点改,一个下午就没了。用 Codex 配合 Plan Mode 的做法,我先让它把计划列出来——这个阶段大概 10 分钟——确认无误后再让它动手。整个流程下来,从原始资料到上线,不到一小时。真正省时间的不是“写代码变快了”,而是“不用来回确认需求”了。
Skill、外挂与自动化:从执行助理到自动化系统
❝
「本段核心问题:」 怎么让 Codex 从每次都要重新交代变成自动运行的体系?
❞
Skill:封装你的 SOP
一套你已经跑通、也满意的 SOP,可以存成 Skill,下次不用重讲一遍。
「举例:」 「讲座筹备 Skill」可以包含:
-
读取报名资料 -
整理名单与填补栏位 -
产生邀请信草稿 -
产出活动筹备状态报告 -
活动结束后产出复盘摘要
下次办类似活动,直接叫出这个 Skill,Codex 就会按流程一步一步执行。
外挂程式:串接第三方服务
点左侧栏的「外挂程式」,可以搜寻你想要的应用程式功能并一键连接:
-
「Gmail:」 Codex 能帮你搜寻信件、撰写草稿 -
「Google Drive:」 读取云端文件,按你的要求修改
自动化排程:解放你的脑子
把你每天固定要跑的任务交给 Codex,让它定时帮你做。
「举例:」 每天早上 9 点自动检查报名表单 → 有新报名就更新到 Excel → 捞未回信的人 → 写客制化 Follow-up
「一个容易被忽视的成本:」 一件琐事可能只花五分钟,但你要记得去做这件事的心智成本绝对不只五分钟。每天被这些琐事磨掉的时间,远比你以为的要多。自动化排程不是炫技,它在解放你的脑子。
「反思:」 我以前觉得“这种小事不用自动化,我自己做还比较快”。但我后来发现,真正消耗我的不是做那件事的 5 分钟,而是“记得要做”这个念头在脑子里盘旋的几小时。把这些固定琐事交给自动化之后,我脑子里少了很多“待办清单”的杂音。
把 Codex 当家教:边做边学的最高境界
❝
「本段核心问题:」 Codex 除了干活,还能教人做事?怎么用它来学习?
❞
Codex 除了是助理,其实也是随叫随到的家教。
「场景一:理解并定制 Skill」
拿到一个别人写好的 Skill,不知道怎么用?直接丢给 Codex,问它是做什么的、什么情况会触发。然后告诉它你平常的工作内容,问它这份 Skill 该怎么改才更适合你。
「场景二:安装并学会用新工具」
以前要去 GitHub 的 README 看一堆手把手教学,中间有一个画面长得不一样就卡住了。
现在可以直接跟 Codex 说:
你先帮我装好 [工具名称],然后一步一步教我怎么用,顺便给我一张表,整理出我要注意的地方跟一些小技巧。
「场景三:给反馈,持续改进」
你是 Agent 的管理者,不能把任务丢给它就预设它会产出你脑子里那个完美的版本。要像带一个新来的同事一样:
-
先给它背景 -
讲清楚目标 -
看一下它的计划 -
验收它的成果
它做错的时候,不要只丢一句“我不喜欢”。要告诉它哪里不对、为什么不对、下次遇到类似情况该怎么判断。
你越是这样带它,它就越像一个真的懂你做事方式的伙伴,而不是每次都从零开始乱猜。
「反思:」 有一件事让我印象很深。我跟 Codex 说“这个报告的语调太生硬了”,然后它改了一版,还是不太对。后来我意识到问题不在“语调”,在于我没有告诉它“我的读者是谁”。当我补充了“这些报告是给非技术的主管看的”之后,它调整出来的版本就对了。这件事情教会我:「AI 不会读心,你对它越坦诚,它给你的东西越有用。」
风险与适用边界
❝
「本段核心问题:」 Codex 有哪些风险?什么情况下不该用它?
❞
Codex 能直接操作你的电脑档案,这意味着它也有能力造成破坏:
「档案遗失风险:」
在 Full Access 模式下,如果 Agent’s Markdown 没有明确写“不要删除原始档”,Codex 可能直接覆盖或删除你的文件。建议先备份重要资料。
「隐私与安全:」
Codex 需要读取你的档案才能工作,敏感资料(如密码、个资)不应放在专案资料夹中。串接外挂程式时注意授权范围。
「上下文限制:」
Codex 的上下文有上限,处理大型专案时需要手动压缩或拆分任务。不要指望它能记住整个专案的所有细节。
「不是万能:」
Codex 无法处理需要人类判断的复杂决策——创意方向、人际沟通、需要领域专家知识的深度分析。它擅长的是执行明确指令和处理结构化资料。
「免费版限制:」
免费版有使用额度限制,大量使用时需要升级付费方案。
「最安全的做法:」
先用保守模式,在一个专门的测试资料夹中练习,熟悉后再逐步提升权限。每次让 Codex 做重要操作前,先问它“你打算怎么做”,确认计划合理再放行。
「反思:」 我见过有人第一次用 Codex 就直接开 Full Access 跑一个重命名脚本,结果把整个专案资料夹的结构弄乱了。这不是 Codex 的错——是人没有设定边界。就像你不会让一个新来的实习生直接动生产环境的资料一样,AI 也需要你先把规则讲清楚。
核心原则:并行开发,而不是傻等
❝
「本段核心问题:」 怎么同时利用多个 AI 代理干活,而不是干等一个跑完?
❞
不要一个任务一个任务地喂给 AI 代理,然后盯着进度条发呆。真正的效率不是让代理跑得更快,而是让你能够同时调度多个任务。
Codex 支援这种并行工作流:
-
发完一个提示就切到下一个 -
让 AI 们各自干活 -
你负责调度和验收
你可以同时跑:iOS App 开发、Web Landing 页面、投资人简报、发布视频、社交媒体自动发布、App 图标设计——全部并行。
「Fork 分支功能」在并行场景下特别好用:用不同的分支测试不同的方向,然后选出最好的结果。
实用摘要 / 操作清单
如果你打算今天就开始用 Codex,这里是一份可以直接照着做的清单:
-
「下载并安装 Codex」(搭配 Ollama 使用本地模型更佳) -
「选择一个专案资料夹」,把相关档案整理好,取好名字 -
「从保守权限模式开始」,在一个测试资料夹里练习 -
「第一个任务」:请 Codex 扫描并整理你的资料夹结构 -
「建立 Agent’s Markdown」:写入基本规则(语言、命名规范、安全边界) -
「试用注解功能」:如果做网页,直接点画面修改 -
「定期检查上下文用量」,到 80% 就压缩 -
「把一个跑通的流程存成 Skill」 -
「设一个自动化排程」——哪怕是最简单的那一种
一页速览(One-page Summary)
| 概念 | 一句话解释 | 新手该怎么做 |
|---|---|---|
| 专案(Project) | Codex 的工作范围 | 开一个专属资料夹,别开在桌面 |
| 权限(Permissions) | 它能做什么、不能做什么 | 从保守模式开始,熟了再升级 |
| 上下文(Context) | AI 的视野范围 | 到 80% 就压缩,别等它满 |
| Agent’s Markdown | 你写的员工手册 | 先简单写 5 条,别写太多 |
| Skill | 封装好的 SOP | 跑通一个流程后就存起来 |
| 外挂 | 串接第三方服务 | 先连 Gmail 或 Drive 试试 |
| 自动化 | 定时执行任务 | 从每天早上一个固定任务开始 |
| Fork | 平行宇宙存档点 | 有两个方案时各走一条 |
| 注解 | 点画面改设计 | 做网页时一定要试 |
常见问答(FAQ)
「Q1:Codex 和 ChatGPT 桌面版有什么区别?」
Codex 能直接操作你电脑里的档案和工具,在你授权的范围内自主读档、改档、产出成品;ChatGPT 只能回答问题,动手的人还是你。
「Q2:Codex 免费吗?」
Codex 有免费版,只要有 ChatGPT 帐号就能使用。免费版有使用额度限制,大量使用时需要升级付费方案。
「Q3:我不是工程师,能用 Codex 吗?」
可以。Codex 的界面是三栏式设计,不需要写指令或代码。注解功能让你直接点画面就能改设计,语音输入也支援。
「Q4:Codex 会不会把我的资料删掉?」
在保守和中等权限模式下不会。只有在完整存取模式下,且你没有在 Agent’s Markdown 里写明安全规则时才有风险。建议从保守模式开始,重要资料先备份。
「Q5:Agent’s Markdown 要写多长?」
越短越好。只放每次一定要知道的最低限度规则(语言、命名规则、安全边界),详细的 SOP 做成 Skill 单独调用。
「Q6:什么是 Fork 功能?」
Fork 可以从任何一个对话时间点复制出一条一模一样的新对话,让你分别尝试不同方向,对比结果。
「Q7:Codex 能处理大型专案吗?」
可以,但要注意上下文限制。建议定期压缩上下文(/compact),并把大任务拆分成多个 Session 分段完成。
「Q8:自动化排程能做什么?」
可以定时执行固定任务,比如每天早上检查报名表单、更新 Excel、捞未回信的人、写 Follow-up 邮件等。
本文内容基于 OpenAI Codex 桌面版的实际使用体验整理而成。所有案例和技巧均来自真实应用场景。

