首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >CodeX为什么这么火

CodeX为什么这么火

作者头像
靖扬
发布2026-07-21 13:23:47
发布2026-07-21 13:23:47
70
举报

过去一个月,我高强度使用Codex,却没让它写过一行代码。

我用它最多的地方,反而是选题、审查文章和生产内容。

过去,这些工作的方法都装在我的脑子里。每次重新开始,我都要再解释一遍。哪些步骤不能漏,什么地方需要检查,做到什么程度才算完成。

现在,我开始把它们沉淀成一套套可以重复使用的工作流和Skill。下一次遇到类似任务,Codex不需要等我一步步指挥,而是可以沿着这些方法继续工作。

你可以把Skill理解成一份交给AI的工作说明书。它记录的不只是任务,还有完成任务的步骤、标准和检查方法。

我开始重新理解Codex

它表面上是一个编程工具,真正进入的却可能是每个人的工作方式。

而且,这种变化不只发生在我身上。

到7月中旬,Codex每周活跃用户已经超过700万。两个多月里,官方更新了150多项能力。越来越多用户,也开始把它用于代码之外的工作。

这就出现了一个很有意思的反差。

Codex明明是OpenAI最垂直的产品之一,为什么反而比许多什么都能做的Agent跑得更快?

如果你以前没听过Agent,可以先把它理解成一个能动手办事的AI。普通的聊天AI更像顾问,给你建议和答案。Agent则会调用工具,把任务继续往下做。

接下来,我想拆三层:

  1. 为什么Codex要从编程这个窄入口开始?
  2. 为什么Agent真正交付的不是内容,而是工作结果?
  3. 为什么用户对Agent的信任,是一点点交出来的?

换成产品语言,就是三件事:

入口能不能迁移。 结果能不能直接用。 信任能不能逐步变大。

这三个问题,可能比“模型能力强不强”更接近Agent产品真正的胜负手。

01 起点可以很窄,但能力不能太窄

为什么Codex偏偏从编程开始?

一个很直观的答案,是编程容易证明价值。

程序员的时间成本高,AI如果能缩短开发时间,节省的成本很容易被感知。代码写完后还可以直接运行和测试。能不能工作、哪里报错,用户很快就能判断。

产品经理把这种任务叫作高价值、可验收。用户容易看见效果,产品也更容易站稳。

但这可能还不是编程最有价值的地方。

你想想看,我们今天的大部分工作,其实都装在软件里。

数据放在表格和数据库里,客户信息放在销售系统里,内容发布在网站上,财务也有自己的业务系统。互联网里的一个个产品和服务,说到底都是由程序连接起来的。

所以,编程不只是一项职业技能。

它更像一种操作数字世界的通用方式。

编程看起来是Codex最窄的入口,却可能是它进入数字世界最宽的一扇门。 它从程序员的工作开始,积累的却是一种可以迁移到更多数字任务中的能力。

一个AI如果只会写文章,它解决的主要是内容问题。一个AI如果能够写代码、调用工具和操作软件,它就有机会进入这些系统,把原来分散在不同工具里的工作连接起来。

这也是为什么Codex后来可以进入数据分析、财务、销售和内容生产。它不是突然学会了所有职业,而是把操作代码和软件的能力,用到了更多数字工作里。

产品经理把这种现象叫作能力迁移

说得简单一点,就是在一个任务上练出来的本事,能不能继续用到其他任务。

当然,编程不能解决一切。AI还会受到数据、权限、接口、组织流程和现实世界操作的限制。但在数字世界里,它确实给了Codex一把可以打开许多扇门的钥匙。

所以,Codex选中的不只是一个容易验收的垂直场景。它选的这把钥匙,本身就能打开很多扇门。

这给Agent产品经理留下了一个更重要的问题。

选择第一个任务时,不只要看眼前有没有用户、价值是否容易证明,还要看为了完成这个任务积累下来的能力,未来能把产品带到哪里。

产品判断: 一个Agent产品的第一个场景,不只要看它能不能赚钱、能不能验收,还要看它在这个场景里练出来的能力,未来能不能迁移到更多任务。

02 AI生成了什么不重要,用户拿到了什么才重要

选对任务只是拿到入场券。用户第一次使用后,能不能迅速感到「它真的替我完成了工作」,决定了他会不会继续使用。

普通聊天AI的工作方式,通常是用户问一步,AI回答一步。用户看完以后,再决定下一步让它做什么。整个过程仍然需要人不断往前推。

Codex更接近另一种工作方式。用户先说明目标,AI自己寻找资料、开始执行、检查结果,发现问题后继续修改,最后把可以检查的结果交回来。

两者的区别,不只是AI多做了几个步骤。

前者交付一段内容。

后者尽量交付一项完成的工作。

例如,AI生成了一份财务分析,看起来很完整,不代表它真的有用。如果用户还要重新核对数据、修改格式、补充引用,再调整成公司的模板,AI只是完成了「生成文字」,大量工作仍然留给用户。

Codex面向财务团队时,会读取已有的结算表格、看板和历史报告,计算数据变化,标出无法解释的异常,并列出需要负责人确认的问题。用户拿到的不是一段孤立的分析,而是一份接近可以开会使用的材料。

所以,判断Agent有没有创造价值,可以先看两件很具体的事。

AI到底完成了多少?

用户为了让结果真正可用,还要返工多少?

真正的产品进步,应该让AI完成的范围越来越大,让用户核对、修改和整理的工作越来越少。只增加AI能生成的内容,却没有减少用户的返工,能力看起来变强了,用户得到的价值未必增加。

这些指标其实都在回答同一个问题:用户还要花多少时间,才能把AI给出的东西变成真正能用的结果?

沿着这个问题,还可以继续观察一个指标。

从用户提出目标,到拿到第一个可以使用的结果,中间需要多长时间?

这叫第一次价值时间

名字听起来有点专业,其实问的就是,用户要等多久,才能第一次真切地感觉到这个产品有用。

时间越短,用户越容易出现「原来它真的能干活」的哇时刻。

但让AI多做一点,不等于什么都交给AI。

财务报告一旦算错,后果很严重。AI应该先标出异常,再由负责人做最后确认。内部头脑风暴即使出现偏差,修改成本也不高,就可以让AI先放手去做。

要不要保留人工确认,不该只看AI能自动做到哪一步,而要看出错之后需要付出多大代价。

产品判断: 判断Agent有没有价值,不是看它生成了多少内容,而是看它让用户少返工了多少。用户越快拿到可用结果,产品的价值感越强。

生成内容,不等于完成工作

03 用户不是一次相信Agent,而是一次多交一点工作

用户不会第一次见到一个AI,就把整个项目交给它。

这个过程更像带一个新同事。

先交一件小事,确认结果可靠,再逐渐增加任务难度和自己做主的空间。

信任不是产品在宣传页上写一句「安全可靠」就会产生,而是用户在一次次具体结果中积累出来的。

Codex身上可以看到这种变化。OpenAI公布过一组数据,使用「记住我的固定做法」功能的用户比例,从3月初的5.4%升到6月中旬的26.6%。在OpenAI公司内部,这一比例达到96.2%。

这个功能做的事很好理解。用户把自己反复使用的工作方法交给Codex保存,下次就不用再从头解释。

手机端也允许用户查看任务进展、批准具体动作,并在需要时接管或调整。用户可以同时让多个任务在后台运行,自己只在关键节点检查,不必一直推着AI往前走,也没有完全失去控制。

这说明Agent产品不能要求用户一步从「不信任」跨到「完全托付」。

用户第一次使用时,可以先让AI完成一个容易检查的小任务。结果可靠,他才愿意交出更长的任务。

任务变长以后,过程就必须让人看得见。

等AI准备执行关键动作时,再把确认权交还给用户。

真出了问题,还要允许用户随时接管。

如果一开始就要求用户完全放手,他感受到的可能不是效率,而是失控。

人不是因为AI永远不会犯错才信任它,而是因为AI犯错时,自己看得见、拦得住、接得回来。

产品经理通常会用留存来判断用户会不会回来。但对Agent来说,只看用户下次有没有打开还不够。

更值得观察的是另一件事。

用户下一次,是否愿意交出一个更长、更难或者更重要的任务?

产品判断: 对Agent来说,真正值得看的不只是留存,而是用户下一次愿不愿意交出更重要的任务。信任不是一次建立的,是一次次任务交付出来的。

写在最后

一个月前,我还把Codex看成一个编程工具。现在,我更愿意把它看成一个能够逐渐承接我工作方式的Agent。

当然,Codex背靠ChatGPT的用户入口,也拥有领先的模型和巨大的投入。这些条件无法通过产品设计复制。

研究Codex,不是为了照抄一份成功公式。

我用Codex这一个月真正改变的,不是我完成了多少任务,而是我开始把自己的工作方式,一点点交给它来承接。

下一代Agent真正要争夺的,不只是用户会不会再次打开,而是用户下一次,愿不愿意交给它一件更重要的事。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-18,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 靖扬 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档