2026 年的 Codex 有一個麻煩:如果把二月、四月和七月的文章放在一起看,很多做法會互相衝突。
二月的 Codex App 還是一個以軟體開發為中心的多 Agent 工作區;四月加入 Computer Use、Browser、Chats 與 Memory 之後,它開始碰到更多電腦上的工作;到了六月,OpenAI 公開的使用資料已經顯示,非開發者正在把 Codex 用在研究、資料分析、試算表、簡報、合約與工作流程自動化。七月之後,Chat、Work、Codex 又被放進更接近同一套桌面工作面的產品架構裡。[1][5][6][7]
所以這篇文章不拿今天的介面去解釋年初,也不把現在的功能倒灌回舊文章。每個節點只回答兩件事:當時多了什麼,以及它讓 Codex 的工作方式改了哪一部分。
本文用 Agent Work OS 當作這條演進線的整理名稱。這不是 OpenAI 的正式產品名稱,也不是說 Codex 已經等同傳統作業系統。這裡的意思比較窄:模型之外,Codex 開始同時管理 Agent、Workspace、Tools、長任務、權限、可重用工作流程與跨裝置執行,使用者面對的逐漸是一套「工作怎麼被交付、持續、監督與完成」的執行環境。
研究核對至:2026-08-18。本文會持續更新。2026-08-31 仍是未來日期,因此文末提到的 GPT-5.4 / GPT-5.4 mini 退役目前只能寫成已公告、尚未生效。
February|Agent command center
2026-02-02|Codex App 把多個 Agent 放進同一個控制面
2 月 2 日,OpenAI 發布 macOS 版 Codex App,官方定位直接用了「agent command center」這個概念。App 可以同時管理多個 Agent thread,用 worktree 隔離平行工作,並把 Skills 與 Automations 放到同一個桌面工作區。[1]
這裡的變化不需要靠抽象名詞包裝。以前一個常見工作單位是「開一個 Agent,交給它一個 coding task」。Codex App 把畫面往上拉了一層:同一個人可以同時看多條工作線,Agent 可以各自在隔離環境裡處理任務,人則在上方分配、查看與收斂結果。
這還不是後來的 Work。二月的產品敘事仍然明顯以 software lifecycle 為中心。但從這天開始,「怎麼管理 Agent」已經和「Agent 能不能寫 code」一樣成為產品問題。
工作單位的變化: 單一 coding task → 可同時監督的多 Agent 工作線。
2026-02-05|Mid-turn steering 讓執行中的 Agent 可以被改方向
三天後,GPT-5.3-Codex 上線。除了長任務、研究與工具使用能力提升,Codex App 同一天加入 mid-turn steering:Agent 還在工作時,使用者可以再送訊息調整方向,不必等整個 turn 結束。[2][3]
這讓互動從 prompt → 等待 → 結果 多出一個很實際的控制點。長任務不必在開始前把所有條件一次猜完;進度出現新資訊時,可以在不中斷既有 context 的情況下修正。
二月還有兩個小節點。2 月 10 日,App 加入更清楚的 Plan mode guidance 與 parallel approvals;2 月 12 日,GPT-5.3-Codex-Spark 以 research preview 推出,主打低延遲 coding,首發為 text-only、128k context,並使用獨立 limits。[2] 這兩件事放在一起看,比單獨記型號有用:一邊是更明確的 planning / approval control,一邊是開始依任務需求區分不同速度與能力的模型路線。
March–April|Agent 開始走進完整工作環境
2026-03-05|GPT-5.4 把 Computer Use 與 Tool Search 拉進主線
3 月 5 日的 GPT-5.4 對這條時間線比 benchmark 更重要。OpenAI 把它描述成第一個在 Codex 與 API 中提供原生 computer-use 能力的 general-purpose model,Codex 端同時提供 experimental 1M context,並加強 tool use 與 tool search。[4]
這讓模型處理的環境開始變寬。它不只在 repository 裡讀 code、改 code,也可以在較長 context 和更大的工具集合中規劃、執行與驗證工作。後來 Browser、Computer Use 與更大的 plugin / MCP catalog 能成立,模型層至少需要先有這種能力。
3 月 12 日的 Automations 更新讓排程工作可以選 local 或 worktree、指定 model 與 reasoning level;3 月 17 日的 GPT-5.4 mini 則明確被放到 lighter coding tasks 與 subagents 的位置,而且只消耗 GPT-5.4 約 30% 的 included limits。[2] 這已經出現後來常見的分工思路:高推理工作不必和大量支援型工作全部用同一個模型。
2026-03-25|Plugins 把能力從設定變成可安裝的 bundle
3 月 25 日,Codex 正式支援 Plugins。官方定義很具體:一個 plugin 可以包 Skills、app integrations 與 MCP server configuration,並在 App、CLI、IDE extension 使用。[2]
這個改動的價值在可搬移性。以前把 Agent 調成「會做某件事」,很容易散落在 prompt、個人設定、MCP config 和一些本機檔案裡。Plugin 至少提供了一個較完整的封裝邊界,讓能力可以被安裝、分享與在不同 Codex surface 重複使用。
2026-04-16|Codex 的 Workspace 不再只圍著 codebase 打轉
4 月 16 日是上半年最容易被寫錯的一個日期,因為這天同時出現很多功能,而且其中一些後來又繼續演進。
OpenAI 當天把 Codex 描述成更廣的 AI work workspace。更新包含 Computer Use、early in-app Browser、可以不先選 project folder 的 Chats、thread automations,以及 Memory preview;軟體開發面也加入更完整的 PR workflow、多終端與 SSH remote connection alpha。[2][5]
要特別切清楚 Browser 的歷史。4 月 16 日的 early in-app Browser 可以開 local / public page、直接在 rendered page 留 comment,再叫 Codex 處理頁面 feedback;Codex 自己操作 in-app browser 去點 UI、重現 visual bug、驗證 local fix,官方 changelog 是 4 月 23 日才明確寫出來。[2]
Computer Use 則已經讓 Codex 可以看、點、輸入 macOS app。對讀者來說,這比「多了一個工具」更容易理解:Agent 的可操作環境開始從 repository 和 terminal,延伸到 GUI app 與 rendered interface。
工作單位的變化: codebase 內的任務 → 可以跨 terminal、browser、GUI 與一般 workspace context 的任務。
2026-04-23|Browser Use 把前端驗證迴路縮短了一截
4 月 23 日,Codex App 的 Browser Use 可以讓 Codex 操作 in-app browser,針對 local development server 或 file-backed page 點擊 UI、重現視覺問題,再檢查修正結果。同一天也加入 Automatic approval reviews,把符合條件的 approval prompt 先交給 reviewer agent 評估。[2]
這兩件事其實回答不同問題。Browser Use 提供更多外部回饋,讓「改完 code」與「頁面真的照預期運作」之間少一次人工搬運;Auto-review 處理的是權限邊界上的審查流程。Reviewer agent 可以代為審查符合條件的 request,但它沒有因此取得超出既有 sandbox / approval policy 的額外權限。
6 月 11 日,Browser 又多了 Developer mode,給 Codex 受控的 Chrome DevTools Protocol 存取,用來看 network traffic、console output、runtime error 與 page state。[2] 因此 Browser 比較適合寫成三段:4/16 有瀏覽與 annotation surface,4/23 開始由 Codex 操作 UI,6/11 再進到 CDP debugging。
May–June|工作的單位變長了
2026-05-21|Goal Mode 把「做一個 task」拉成「朝 objective 持續工作」
5 月 21 日,Goal mode 脫離 experimental,進入 Codex App、IDE extension 與 CLI。OpenAI 的說法很直接:可以讓 Codex 朝一個 specific objective 工作數小時,甚至數天。[2]
Goal 沒有讓驗證、checkpoint 或人工 supervision 自動消失。它改的是產品允許的工作時間尺度。當任務可能跨過多個 turn、需要中途遇到問題再調整,系統就必須保存更多狀態,也要有更清楚的 resume、notification、approval 與失敗處理。
同一次更新還有 Appshots,以及 Mac 鎖定後仍能在受限條件下繼續 Remote Computer Use。[2] 這些功能一起出現很合理:任務一旦開始跑得更久,「現在不在同一個 app、甚至不在電腦前」就會變成正常狀態,而不是例外。
5 月 14 日其實已經先鋪了一層 Remote:ChatGPT mobile 可以連到一台正在跑 Codex App 的 Mac,沿用同一台 host 上的 projects、files、credentials、plugins、skills 與 configuration。[2] 5 月 26 日則提醒了另一件歷史閱讀很重要的事:GPT-5.3-Codex 對 ChatGPT 登入的 Codex 使用者停止作為可選模型,但 API-key workflow 的生命週期不同。[2]
2026-06-02|「Codex 只給工程師」已經不符合實際使用資料
6 月 2 日,OpenAI 公布一份 knowledge-work 報告。當時 Codex 每週活躍使用者已超過 500 萬,自二月桌面 App 發布後成長超過六倍;knowledge workers 約佔 20%,而且成長速度超過 developers 三倍。[6]
他們主要拿 Codex 做 reports、spreadsheets、presentations、contracts,也用在 research、data analysis、workflow automation,以及一些過去需要工程支援的 lightweight tools。[6]
這個節點的重要性在證據類型。四月可以從產品功能推論「可做的事情變多了」,六月則已經有官方使用資料證明產品真的被帶進軟體開發以外的工作。這也是標題使用 Agent Work OS 這個整理框架的原因之一:它描述的是工作範圍與控制面的擴張,不是單一模型突然換了名字。
工作單位的變化: software deliverable → 包含研究、資料與文件產出的更廣泛工作成果。
2026-06-18|Record & Replay 把一次人類示範變成可重用 Skill
6 月 18 日,macOS 版 Record & Replay 上線。使用者示範一次 workflow,Codex 可以把這段操作轉成 reusable Skill;首發需要啟用 Computer Use,且 EEA、UK、Switzerland 當時不在 initial availability。[2]
這跟「寫一段更長的 prompt」不同。示範裡包含的是操作順序和環境互動,產物則進到 Skill 這個可重用能力層。對重複性工作而言,人的 SOP 開始有一條更直接的路徑被轉成 Agent 可以再次執行的 workflow。
2026-06-25|Remote GA 讓 Workspace 可以跟著工作移動
6 月 25 日,Codex Remote 進入 general availability。手機可以在連線的 Mac 或 Windows host 上 start / continue work、看進度、review,並 approve actions。[2]
Remote 的意義不在「手機也能按 Codex」。執行環境仍在 host,手機比較像另一個控制面。當 projects、credentials、local files 與工具留在既有機器上,使用者可以離開桌面後繼續管理任務,而不用重新建立一套縮水版環境。
同月 6 月 9 日,Codex 也開始提供從 Claude Code / Claude Cowork 匯入 supported setup 的流程;7 月 21 日 /import 再擴大到 Cursor 與 Claude Code 的 settings、MCP servers、plugins、sessions、commands 與 project-scoped memories。[2] 這條線到八月還會繼續長。
July–August|多 Agent、模型與能力被放進同一個工作面
2026-07-09|Codex 併入 ChatGPT desktop,Work 與 GPT-5.6 同一天上線
7 月 9 日,Codex 成為 ChatGPT desktop app 的一部分,既有 Codex App 使用者可以保留 projects、settings 與 workflows;同一天 OpenAI 發布 ChatGPT Work,以及 GPT-5.6 Sol、Terra、Luna。[2][7][8]
這個組合比任何單一功能都更能說明產品方向。ChatGPT Work 被設計成可以跨 apps 與 files 行動、把 goal 拆成步驟並持續工作數小時;官方也明確說其中內建 Codex technology。[7] GPT-5.6 則把模型分成 Sol、Terra、Luna 三個 tier,並允許 Codex 使用者依方案選模型與 effort level;ultra 的官方說明還包含協調多個 Agent 平行處理工作流。[8]
這裡要避免一個常見誤讀:Sol / Terra / Luna 的存在,不等於 Codex 已經會自動把每一類任務 route 到某一個固定型號。比較安全的說法是,產品開始提供更明確的 intelligence、latency、cost 與 reasoning 分層,讓不同 Agent / workload 可以用不同配置。
到了這個時間點,二月散落在 Codex App 裡的多 Agent、Skills、Automations,和後來的 Computer Use、Goal、Remote、Plugins,正在被收進更大的桌面工作環境。
工作單位的變化: 一個 Codex App 裡的 Agent 工作 → 跨 Chat、Work、Codex 與不同模型 tier 的工作執行面。
2026-07-21|Multi-Agent V2 讓「多 Agent」有了更可配置的形狀
7 月 21 日的 Codex CLI 0.145.0 穩定化 opt-in Multi-Agent V2,可以設定 sub-agent model、reasoning level、concurrency,恢復 roles,並改善 agent navigation。[2]
二月的 App 已經能平行跑多條 Agent thread;七月這個更新處理的是更細的 orchestration。當不同 subagent 可以有不同模型與 reasoning 設定,架構上才更接近「某個 Agent 做 coordination,其他 Agent 負責 bounded work」這種可配置拓撲,而不是單純同時開很多視窗。
同一版 /import 也擴大到 Cursor 與 Claude Code,能搬 settings、MCP servers、plugins、sessions、commands 與 project-scoped memories。[2] 7 月 23 日桌面 App 再加入跨 Chat / Work / Codex 的 Voice coordination 與 multi-folder project;7 月 30 日 Review 可以在同一個 multi-folder project 裡看多個 repository 的 diff。[2] Workspace 本身也開始變得比「一個 repo」更寬。
2026-08-07|Agent Plugins 開始像一個可攜式能力分發層
截至目前,A00 最後一個主節點放在 8 月 7 日。Codex CLI 0.147.0 加入 portable Agent Plugins,可以搜尋 local、personal、workspace 與 remote plugin catalogs;同版也加入 --approve-for-me、Cursor-managed skills import,以及 imported Claude / Cursor conversations 的同步能力。[2]
這比三月的 plugin bundle 再往前一步。三月先回答「如何把 Skills、integration、MCP config 包起來」;八月的 Agent Plugins 更接近「這些能力要從哪裡被找到、安裝、帶到另一個 scope」。對一套長期工作的 Agent 環境來說,能力如果只能黏在一台機器或一個人身上,很快就會變成新的設定債。Catalog 和 portable install 處理的就是這個問題。
7 月 31 日,OpenAI 也已公告 GPT-5.4 與 GPT-5.4 mini 將在 8 月 31 日從 ChatGPT 登入的 Codex 退役,建議分別改用 GPT-5.6 Terra 與 Luna;API 與 API-key authenticated Codex 的生命週期不同。[2] 這件事在今天(2026-08-18)還沒有生效,所以本文不把它寫成已完成事件。
Agent Work OS 在這篇文章裡到底指什麼?
把這半年拆開看,很容易得到一張功能清單;放回時間順序之後,幾條比較穩定的變化才會浮出來。
模型層開始提供不同能力與成本的 tier;Agent 層從單一 thread 走到平行執行與可配置 subagent;Workspace 從 repository 擴到 terminal、browser、desktop app、remote host 與 multi-folder project;能力層有 Skills、Plugins、MCP 與 Record & Replay;控制層則逐步補上 steering、Goals、Automations、approvals、review 與跨裝置 continuation。
本文把這個組合稱作 Agent Work OS。它不是要取代 macOS 或 Windows 的「OS」,也不是 OpenAI 宣布的新產品類別。它只是一個閱讀 2026 Codex 的方法:不要只問「今年哪個模型比較強」,而是看 工作如何被交出去、在什麼環境裡持續、誰能改方向、哪些能力可以重用,以及結果怎麼回到人面前被檢查。
這也解釋了為什麼這個系列需要保留歷史 cutoff。二月的正確做法,不必和八月完全一樣;四月的 Browser 文章,也不能偷偷使用六月才有的 Developer mode。後面的教學與方法文會各自深入某個 feature 或 workflow,A00 只負責留下這條時間軸。
下次更新這篇文章的條件也很簡單:**只有當新事件改變了 Codex 的工作模型,才升成主節點。**一般 UI polish、patch release 或單一小功能留在 changelog,不讓這篇文章長成另一份 changelog。
References
- OpenAI, Introducing the Codex app, 2 February 2026.
- OpenAI, ChatGPT & Codex changelog, verified 18 August 2026.
- OpenAI, Introducing GPT-5.3-Codex, 5 February 2026.
- OpenAI, Introducing GPT-5.4, 5 March 2026.
- OpenAI, Codex for (almost) everything, 16 April 2026.
- OpenAI, Codex is becoming a productivity tool for everyone, 2 June 2026.
- OpenAI, ChatGPT is now a partner for your most ambitious work, 9 July 2026.
- OpenAI, GPT-5.6: Frontier intelligence that scales with your ambition, 9 July 2026.