GPT-5.5 发布,让我重新认识了 Codex

GPT-5.5 发布后,作者实测 Codex 的后台任务执行、电脑操控、浏览器操作等能力,发现它早已不只是写代码的工具,而是能独立完成复杂任务的通用助手。

艾康2026-04-242,648 字 · 7 分钟AI应用效率工具行业观察

今天凌晨两点 GPT-5.5 发布了,现已在 ChatGPT 和 Codex 中上线。

早上起来之后,第一时间同步翻了 OpenAI 的发布关于 GPT‑5.5 的博客。

翻完之后,发现一件事有点意思:这篇博客里,Codex 出现的频率远比我预想的高。

博客里有一句话,直接说明了两者的关系:「GPT-5.5 的编码优势在 Codex 中体现得尤为明显」。

博客地址:https://openai.com/index/introducing-gpt-5-5/

我用 Codex 也有一段时间了。但基本上是通过 Openclaw 调用,一直把它当作工作流里的一个模块。

Codex 的桌面应用,之前一直没怎么认真用过。

这次重新看完发布内容,才意识到:我把它用窄了。

GPT-5.5:不是「更聪明」,是工作方式变了

每次新模型发布,大家最关心的通常是跑分。

GPT-5.5 的跑分确实很强——Terminal-Bench 82.7%,SWE-Bench Pro 58.6%,行业最高。

但说实话,这些数字对大多数人来说,几天就忘了,日常使用中也感受不到什么明显差异。

OpenAI 在博客里有一句话,我觉得比跑分重要得多:

「给它一个混乱的多步骤任务,然后信任它去计划、使用工具、检查结果、在模糊中继续推进。」

这句话说的不是「更聪明」,是工作方式变了。

之前我们用 AI,本质上是一问一答。

你提问,它回答,你再提问,它再回答。整个过程你得全程盯着。

GPT-5.5 + Codex 的定位不是这样。你把一个完整的任务交给它,然后走开,去干别的事。等它做完了,回来拿结果。

Codex 不只是程序员的工具

Codex 这个名字本来是「Code(代码)」的衍生词,一开始确实是主打编程场景。很多人对它的印象还停留在「AI 帮你写代码的地方」,觉得跟自己关系不大。

但在 OpenAI 的博客里,我发现了一个数字,目前 OpenAI 超过 85% 的员工每周都在使用 Codex,涵盖财务、传播、市场、数据科学等部门。

85% 是什么概念?

这意味着在 OpenAI 内部,Codex 不只是工程师在用,各种职能的人都在用它处理日常工作。

他们具体在做什么:

传播团队用 Codex 分析了 6 个月的演讲邀请数据,搭建了一套自动分类流程——低风险的邀请自动处理,需要人工判断的才推送给团队。

财务团队用它处理了 71637 页 K-1 税务表单,整个任务比上一年提前了两周完成。

还有员工用它自动生成每周业务报告,每周节省了 5 到 10 个小时。

这些都不是写代码。

这让我想起之前写过的一篇文章,说的是「AI 时代,软件正在长出第二套界面」。

现在看来,Codex 也在成为那个界面更完整的入口,不只是给程序员用,更是给所有需要处理复杂任务的人用。

实际案例测试

下面用三个真实案例,来测试一下 GPT-5.5 ➕ Codex 具体都有哪些不一样的地方。

1、异步任务执行

Codex 现在支持长任务、后台运行,并行 agent / worktree 流程。

例如,可以把一个完整的复杂任务交给 Codex,它会在后台自主运行,搜索信息、阅读内容、生成文件、检查结果,整个过程不需要自己参与。

举一个实际场景。

我把一个不熟悉的项目仓库丢给 Codex:

帮我读完这个仓库:https://github.com/jarrodwatts/claude-hud,不要只复述 README。

我比较关心: 这个项目到底能实现哪些功能、解决什么问题,各种配置应该如何切换,可能会有什么坑

然后我就可以切换窗口去做其他事情了,我不需要关心 Codex 如何请求 Github,如何阅读仓库。

它会自己搜索、自己整理、自己生成文档。

回来之后,看到的就是一份关于这个项目的完整介绍。

为什么我会有这个需求呢?

是因为我自己实际在使用这个插件时,感觉 README.md 写得不是很清晰,有些功能上的细节不清楚,不知道怎么切换。

所以,以后有这种长任务、复杂任务,就可以直接丢给 Codex 在后台运行。

这样自己就可以去做其他事情,而不是使用 Chatbot 窗口,需要反复多次一轮一轮确认。

2、Computer Use——AI 直接操作电脑

Codex 需要借助插件,才能拥有操作电脑、浏览器的能力,默认没有安装 Computer Use,因此需要点击安装一下。

插件是 OpenAI 官方提供的,可以放心安装。

我的电脑上有一个名为 Rectangle Pro 的窗口管理工具,工具本身很好用,但是是英文版且功能很多,经常记不住各种快捷键的位置。

于是,我想试试能否让 Codex 帮我去操纵我电脑上的 Rectangle Pro,同时把相关的功能模块写成一个手册,方便我日后随时进行查阅。

点击插件,添加 Computer Use 这个插件。

然后把需求告诉 Codex,如果需要进一步申请权限,点击「允许」或「始终允许」就可以了

首次启动的话,还需要额外给 Codex 一些电脑的辅助权限。

这个任务的完成度很高。在 Codex 操作我电脑的期间,它并没有出现鼠标乱点的情况,整个操作都是集中在这个软件本身。

灰色三角的光标就是 Codex 自己在操作我的电脑。

整个过程持续了几分钟,把各个模块逐一点击完成之后,Codex 就输出了一份核心功能手册。

完整内容很长,这里截图只放了一部分。

有了这个功能之后,我觉得以后跟 AI 交互的方式真的会发生很大的变化。

除了一些创新的工作,可以让 AI 直接用自己的本地电脑去完成。

甚至当自己需要安装某个工具,做一些复杂的配置,自己搞不定的话,可以尝试让 Codex 帮自己去安装,帮自己去配置。

3、Browser Use:AI 直接操控浏览器

Codex 不只能操作本地电脑,还可以接手我们日常使用频率极高的工具——浏览器。

为了更直观地测试这一点,我没有给它一个很复杂的任务,而是交给它一件非常生活化的事:帮我在京东和淘宝里筛选一款适合我的显示器支架。

如果只是查「显示器支架推荐」,普通搜索早就能做到。

真正麻烦的地方在于,用户往往需要自己,反复浏览商品页面,查看参数、对比价格、筛选安装方式和承重范围,最后才能从一堆商品里收敛到少数几个候选。

而这一次,这整段流程几乎都是由 Codex 自己完成的(我完成了扫码的步骤)。

这个任务一共执行了大约 6 分钟。

在完成之后,Codex 整理出了最值得买的 3 个产品,并附上了它当时看到的价格、关键参数以及最后的判断依据。

从这个角度看,浏览器操作的意义并不只是会打开网页,还能够代替用户完成一部分真实的决策过程。

对于购物这种场景来说,这种价值非常直观:你不再需要自己去一页页翻、一项项比,它已经先帮你把信息走过一遍,并把结果收敛成几个真正值得看的选项。

4、自动化任务

我分别让 Codex 基于 OpenAI 的这篇博客(https://openai.com/index/introducing-gpt-5-5/),帮我将其中的核心内容在 WPS 里创建为对应的 PPT 和 Excel 数据表格。

下面是 PPT 的完成情况👇

整个过程虽然用时不短,一共花了 17 分钟,但是任务的完成度非常高。

没有调用任何 Skill 的情况下,PPT 能做到这个程度,我真是有点惊讶的。

而且在这个过程中,Codex 会自己去检查任务的完成情况。例如它会发现 PPT 在创建的过程中,有一些主标题把副标题压住的情况,它会自己进行修改。

所以最终这个任务的完成度很高,不需要我再去检查哪里是否有一点瑕疵。

下面是 Excel 数据表格的完成情况👇

这个任务完成的时间也不短,总共花了 11 分钟,但它的完成度同样很高。

可以看到 Excel 表格有好几个 sheet 页面,每个页面都对应不同的关键数据格式。表格的样式虽然不是特别美观,但整体并没有出现乱码的情况。

这是因为 Codex 自己会在任务完成的过程中去检查,例如预览是否有问题、是否会遮住部分字体。

如果发现了这些细节问题,它都会直接解决掉。

除了以上几个应用场景,Codex 还支持丰富的插件列表和技能列表。

在这里能看到各种常用的工具都能进行添加和管理,添加之后 Codex 都能进行接管。

怎么开始用

ChatGPT Plus(月费 20 美元)已经可以直接访问 Codex,不需要额外付费。

Codex 桌面版也已单独发布。

建议搭配 Codex 进行使用,功能更完整,效果更好。

写在最后

GPT-5.5 的发布,某种程度上是给 Codex 配上了一个更能干活的大脑。

我之前一直把 Codex 当成一个写代码的辅助工具。用了挺久,但一直用得很窄。

这次 GPT-5.5 发布后,重新审视了一遍 Codex 的能力,

能在后台自主完成整个任务,能直接操控浏览器,能像人一样操作你的电脑。

这些能力叠加在这一起,让我觉得以后跟 AI 交互的方式还会发生更大的变化。

不知道那一天还有多久会到来,已经很期待了。