Codex
OpenAIOpenAI 的代理式程式開發系統。由 GPT‑5 Codex 系列模型驅動,能在終端、IDE、雲端沙箱與 GitHub 中讀懂整個專案、規劃、修改多個檔案、執行測試並提出 Pull Request。
- CLI、雲端、IDE、桌面 App 四種型態
- 雲端沙箱可平行跑多個任務
- 內含於 ChatGPT 付費方案
總覽
Codex 與 Claude 是「會做事的 AI」,GitHub 是「程式碼與協作的基地」。三者不是互斥的選項,而是經常一起使用的組合。
OpenAI 的代理式程式開發系統。由 GPT‑5 Codex 系列模型驅動,能在終端、IDE、雲端沙箱與 GitHub 中讀懂整個專案、規劃、修改多個檔案、執行測試並提出 Pull Request。
Anthropic 的 AI 模型家族與產品線:Claude 5 系列模型(Fable 5.1、Opus 5、Sonnet 5)、代理式程式工具 Claude Code、以及開發者用的 Claude API 與 Agent SDK。
全球最大的程式碼託管與協作平台。以 Git 儲存庫為核心,加上 Pull Request、Issues、Actions CI/CD、Codespaces,以及 AI 助手 Copilot 與讓各家代理進駐的 Agent HQ。
Codex 是 OpenAI 於 2025 年重新推出的代理式程式開發系統(agentic coding system)。它不是單純的自動補全,而是一個能接下完整任務、在沙箱裡工作、最後交出可審查成果的「AI 工程師」。
開源(Rust 實作)的命令列代理,直接在本機工作目錄讀寫檔案、執行指令與測試。codex exec 提供非互動模式,可用於腳本與 CI。
在 ChatGPT 網頁側欄啟動。每個任務在獨立雲端沙箱中執行,預先載入你的 GitHub 儲存庫,可同時平行處理多個任務並直接開 PR。
支援 VS Code、Cursor、Windsurf 與 JetBrains。側欄代理可把目前開啟的檔案當作上下文;本機任務與雲端任務可以互相接手。
macOS 與 Windows 桌面應用,專為同時管理多個代理設計:平行執行、追蹤長時間任務,並以 git worktree 把每個任務隔離開來。
在 PR 留言 @codex review 觸發自動審查,也可設定每個新 PR 自動審查。Codex GitHub Action 可在 CI 流程中執行代理任務。
在 ChatGPT iOS App 中啟動與追蹤雲端任務;在 Slack 頻道 @Codex 直接派工,成果回到 Codex cloud。
| 模型 | 說明 |
|---|---|
| GPT‑5‑Codex | 2025 年 9 月推出,是 GPT‑5 針對代理式程式開發進一步最佳化的版本。能依任務難易動態調整思考時間,簡單問題秒回,複雜重構可持續數小時。 |
| GPT‑5.1‑Codex‑Max、GPT‑5.2 / 5.3‑Codex | 後續版本,強化長時間任務、原生上下文壓縮、工具使用與 Windows 環境支援。 |
| GPT‑5.x 通用模型 | Codex 也可切換到最新的通用 GPT‑5 系列模型,並選擇推理強度(low / medium / high / xhigh)。 |
Plus、Pro、Business、Enterprise 與 Edu 方案都可使用 Codex,各方案用量額度不同,Pro 額度最高。
也可用 OpenAI API 金鑰登入 Codex CLI,依 tokens 用量計費,適合 CI 與自動化場景。
Codex CLI 以 Apache‑2.0 授權開源,可自行檢視原始碼或貢獻功能。
Claude 是 Anthropic 推出的 AI 模型家族,也是一整套產品:一般使用者的 Claude.ai、工程師用的 Claude Code、開發者用的 Claude API 與 Agent SDK。Anthropic 以安全與可控性為核心,Claude 在長上下文、程式開發與代理任務上尤其突出。
| 模型 | 定位 | 上下文 | 價格(每百萬 tokens,輸入 / 輸出) |
|---|---|---|---|
| Claude Fable 5.1 | 最強大的公開模型,適合最困難的推理與長程代理任務;思考永遠開啟,以 effort 控制深度。 | 1M | $10 / $50 |
| Claude Opus 5 | 旗艦等級,程式開發與代理任務的主力,也是 API 的預設推薦模型。 | 1M | $5 / $25 |
| Claude Sonnet 5 | 速度、成本與能力的平衡點,適合大量互動與產品內嵌。 | 1M | $2 / $10 |
| Claude Haiku 4.5 | 最快、最省,適合子代理、分類與簡單任務。 | 200K | $1 / $5 |
網頁、桌面(Mac / Windows)與 iOS / Android。支援 Projects、Artifacts 互動式產物、記憶、檔案分析、連接 Google Drive / Slack / GitHub 等連接器,以及處理一般工作的 Cowork 代理模式。
代理式程式開發工具:終端 CLI、桌面 App、VS Code / JetBrains 擴充,以及網頁版 claude.ai/code。可在本機或雲端直接讀寫檔案、執行指令、開 PR。
開發者透過 Messages API 直接呼叫模型,支援工具使用、結構化輸出、串流、批次、檔案上傳與提示快取。提供 Python、TypeScript、Java、Go、Ruby、C#、PHP 官方 SDK。
把 Claude Code 的整套 harness(工具、迴圈、權限、Hooks、子代理、MCP)包成 Python / TypeScript 函式庫,用來打造自己的代理,不限於寫程式。
瀏覽器內的代理可代為操作網頁;Slack 中可直接 @Claude;GitHub 上可透過 claude-code-action 在 Actions 中審查與修改程式碼。
除了 Anthropic 官方 API,也可透過 Amazon Bedrock、Google Vertex AI 與 Microsoft Foundry 使用 Claude,方便企業沿用既有雲端合約與資安規範。
/commit、/code-review 這類可自訂、可分享的工作流程,一個指令就能觸發完整步驟。/code-review 依效能等級審查目前的差異,ultra 模式會在雲端啟動多個代理做深度審查。定義自己的工具,SDK 自動跑「呼叫 → 執行 → 回傳」的代理迴圈,並提供每輪的審核與攔截點。
網路搜尋、網頁擷取與程式碼執行都在 Anthropic 端完成,不需要自己架設執行環境。
以 JSON Schema 保證回傳格式,方便程式直接解析,不必再做字串清理。
重複出現的系統提示、文件與工具定義快取起來,後續請求大幅降低成本與延遲。
非即時任務以批次處理享半價;檔案 API 讓 PDF、圖片上傳一次即可重複引用,並支援引用(citations)。
Skills 讓模型產生 PDF、簡報等檔案;Managed Agents(beta)由 Anthropic 代管代理迴圈與沙箱,並支援排程與多代理。
Claude Free、Pro 與 Max。Pro 即可使用 Claude Code,Max 提供更高的 Claude Code 用量與優先存取。
Team 與 Enterprise 方案提供集中管理、SSO、更高額度與資料保護選項。
依 tokens 用量計費(見上方模型表),快取讀取與批次處理可再大幅降低成本。
GitHub 是全球最大的程式碼託管與協作平台,以 Git 為核心,加上 Issues、Pull Request、CI/CD 與 AI 助手 Copilot。它是 Codex 與 Claude 之類代理「工作的地方」:讀取儲存庫、提出變更、接受審查、觸發自動化都在這裡發生。
公開或私有的 Git 儲存庫,含分支、標籤、README、授權、Fork 與 Star,是所有工作的起點。
提交變更、逐行評論、指定必要審查者、Merge queue 與自動合併,是團隊品質把關的核心。
追蹤工作項目、看板或表格式專案管理、社群討論與 Wiki 文件。
以 YAML 定義 CI/CD 與自動化工作流程;Marketplace 上有數千個現成 action 可直接套用。
瀏覽器或 VS Code 中一鍵啟動的雲端開發環境,環境設定隨儲存庫版本控制。
Dependabot 相依更新、CodeQL 程式碼掃描、Secret scanning 與 Push protection,屬 GitHub Advanced Security。
套件註冊表、版本發佈與資產、靜態網站託管,發佈流程一站完成。
gh 命令列工具、REST / GraphQL API、Webhooks、GitHub Apps 與 GitHub Mobile。
.github/copilot-instructions.md 或 AGENTS.md 給代理專案規則。| 方案 | 適合對象與內容 |
|---|---|
| GitHub Free | 個人與開源專案。無限公開與私有儲存庫,含 Actions 與 Codespaces 的每月免費額度。 |
| GitHub Team | 小型團隊。進階協作功能、分支保護規則、更多 Actions 額度。 |
| GitHub Enterprise | 企業。SSO / SAML、稽核紀錄、GitHub Advanced Security 與合規支援。 |
| Copilot Free / Pro / Pro+ / Business / Enterprise | 從免費有限額度到企業級。Pro+ 提供最多的 premium requests 與最新模型;Business / Enterprise 加上組織管理與政策控制。 |
Codex cloud 與 Claude Code 都能讀取儲存庫、建立分支、開 PR 與審查 PR;GitHub 是它們交付成果的地方。
Copilot coding agent、Codex GitHub Action 與 claude-code-action 都可在 GitHub Actions 中運行,與既有 CI 串在一起。
在 GitHub 介面中直接選擇由 Codex、Claude 或 Copilot 執行任務,並在 Mission Control 追蹤所有代理的進度。
比較
同一個面向下,三個工具分別扮演什麼角色。
| 面向 | Codex | Claude | GitHub |
|---|---|---|---|
| 本質 | AI 程式代理(agent) | AI 模型家族 + 代理工具 + API | 程式碼託管與協作平台 |
| 開發商 | OpenAI | Anthropic | GitHub(Microsoft 旗下) |
| 主要介面 | CLI、雲端、IDE 擴充、桌面 App、GitHub、Slack、ChatGPT App | Claude.ai、Claude Code(CLI / 桌面 / IDE / 網頁)、API、Agent SDK | 網站、gh CLI、Codespaces、Mobile、REST / GraphQL API |
| 底層模型 | GPT‑5 Codex 系列與 GPT‑5.x | Claude Fable 5.1、Opus 5、Sonnet 5、Haiku 4.5 | Copilot 可選 OpenAI、Anthropic、Google 模型 |
| 運行位置 | 本機沙箱或 OpenAI 雲端沙箱 | 本機、Anthropic 雲端(網頁版、Managed Agents) | GitHub Actions 雲端執行環境 |
| 專案指引檔 | AGENTS.md | CLAUDE.md | copilot-instructions.md、AGENTS.md |
| 擴充機制 | MCP、Skills、外掛整合 | MCP、Skills、Hooks、子代理、Plugins | Actions Marketplace、GitHub Apps、GitHub MCP Server |
| 審查與 PR | @codex review、自動開 PR | /code-review、claude-code-action | Copilot code review、PR 機制本身 |
| 計費方式 | ChatGPT 方案內含,或 API 用量計費 | Claude 方案內含,或 API 用量計費 | GitHub 方案 + Copilot 方案 |
搭配流程
一個典型的 AI 輔助開發流程:GitHub 當中樞,Codex 或 Claude 當執行者,人類負責決策與最後把關。
在 GitHub 上描述需求、驗收條件與限制,這就是給代理的任務規格。
指派給 Codex cloud、Claude Code 或 Copilot coding agent;透過 Agent HQ 也能在同一處選擇。
代理在沙箱中讀 repo、規劃、修改檔案、執行測試,遇到重大決策時回頭詢問。
代理建立分支並提出 PR,附上變更說明與測試結果。
GitHub Actions 跑測試;@codex review、Copilot 或 Claude 進行第一輪程式碼審查。
工程師檢視結果、要求修改或直接合併,人在迴圈中確保品質。
AI 名詞介紹
從基礎概念到代理框架,每個名詞都附上與 Codex、Claude、GitHub 相關的實例。輸入關鍵字或點選分類即可篩選。
以海量文本訓練、能理解與生成語言的神經網路。它是所有 AI 助手與代理的核心引擎。
例:GPT‑5 與 Claude 5 都是 LLM;Codex 與 Claude Code 則是包在 LLM 外面的代理工具。
模型處理文字的最小單位,約等於 0.75 個英文單字或 1 到 2 個中文字。API 計費、用量額度與上下文長度都以 token 計算。
例:Claude Opus 5 每百萬輸入 tokens 收費 5 美元,一份 10 萬字的文件大約需要 15 萬個 tokens。
模型一次能「看到」的 token 上限,包含你的輸入、對話歷史、工具回傳結果與它自己的輸出。超過上限就必須壓縮或截斷。
例:Claude 5 系列為 1M tokens,足以一次讀入整個中型程式庫。
你給模型的輸入,包含指令、背景資訊、範例與問題。好的 prompt 會明確說明目標、限制條件、可用資源與期望的輸出格式,而不是只丟一句話。
例:「用 TypeScript 改寫這個函式,保持 API 不變,並補上單元測試」比「幫我改一下」有效得多。
由開發者或工具(而非使用者)設定的最高層級指令,定義模型的角色、規則、語氣與可用工具。使用者的訊息會在這個框架內被解讀。
例:Claude Code 與 Codex 都有內建的系統提示,規定如何使用工具、何時要詢問使用者。
模型根據輸入產生輸出的過程。訓練(training)是學習,推論是實際使用;你每次送出的請求都是一次推論。
例:API 價格表上的輸入 / 輸出費用就是推論的成本。
控制輸出隨機性的參數:數值低則穩定一致,高則多樣有創意。新一代推理模型多半已不開放調整,改由模型自行決定。
例:Claude 5 系列不再接受 temperature 參數,改以 effort 控制行為。
模型自信地產生錯誤或虛構的內容,例如不存在的函式或錯誤的 API 參數。
例:代理工具靠實際讀檔、執行測試與查文件來驗證,而非憑記憶作答,藉此降低幻覺。
模型在給出答案前先進行的內部推演。推理模型會為困難問題花更多時間思考,簡單問題則快速作答。
例:Claude 的 adaptive thinking 與 GPT‑5 的 reasoning effort 都屬此類,可設定「想多久」。
模型能處理文字以外的輸入或輸出,例如圖片、PDF、語音。
例:把 UI 截圖貼給 Codex 或 Claude Code 要求「做成一樣的」就是多模態應用。
設計與優化 prompt 的技巧:給明確角色與目標、拆解步驟、提供範例、指定輸出格式、說明限制與驗收條件。
例:CLAUDE.md 與 AGENTS.md 其實就是「寫給代理的長期 prompt」。
不給範例直接要求模型完成任務叫 zero‑shot;先給幾個輸入輸出範例再要求叫 few‑shot,通常能顯著提升格式與品質的一致性。
例:給代理兩個「好的 commit message」範例,它之後寫的就會跟著那個風格。
要求或引導模型逐步推理再作答,而非直接跳到結論,能提高複雜問題的正確率。現代推理模型已將此內建為「思考」階段。
例:Claude Code 的 Plan mode 就是先把思考過程攤開、確認後再執行。
把重複出現的前綴(系統提示、大型文件、工具定義)快取起來,之後的請求只需付少量費用並更快回應。
例:Claude API 的快取讀取價格遠低於一般輸入,代理工具每一輪都重送整段歷史時特別受益。
攻擊者把「指令」藏在網頁、文件、Issue 或工具回傳內容中,誘使代理執行非使用者本意的動作,例如外洩資料或刪除檔案。
例:成熟的代理會把外部內容視為資料而非指令,遇到可疑指令會先向使用者確認。
要求模型以符合 JSON Schema 的格式回覆,讓程式可以直接解析,不必再處理自由文字。
例:Claude API 的 output_config 可保證回傳符合你定義的 schema。
模型邊生成邊回傳,使用者不必等整段完成才看到內容;長輸出時也能避免請求逾時。
例:Claude Code 與 Codex CLI 都是串流顯示,你會看到文字一字字出現。
能自主規劃、使用工具、觀察結果並持續行動直到完成目標的 AI 系統。與單純「一問一答」的聊天機器人最大的差別,是它會主動做事並根據結果調整。
例:Codex、Claude Code、Copilot coding agent 都是代理。
代理運作的核心循環:模型思考 → 決定呼叫某個工具 → harness 執行並回傳結果 → 模型再思考 → … 直到它判斷任務完成。每跑一圈稱為一個 turn。「loop」也常指讓代理反覆執行同一任務的機制。
例:Claude Code 修 bug 時會「讀檔 → 改檔 → 跑測試 → 看錯誤 → 再改」跑好幾圈;/loop 則可每隔幾分鐘重跑一次指令。
包在模型外面的整套程式:負責跑代理迴圈、管理上下文與記憶、提供工具、處理權限與安全、記錄與重試。模型是「大腦」,harness 是「身體與神經系統」;同一個模型換不同 harness,表現可以差很多。「Harness engineering」指的就是設計這一層的工程。
例:Claude Code 與 Codex CLI 都是 harness;Claude Agent SDK 就是把 Claude Code 的 harness 開放給開發者自己用。
模型輸出一段結構化的「請呼叫某工具、參數如下」,由 harness 實際執行後把結果回傳給模型。讀檔、執行指令、搜尋網路、查資料庫都是工具。
例:Claude API 的 Tool Runner 會自動處理「呼叫 → 執行 → 回傳」,你只要定義工具函式。
由 Anthropic 提出、業界共同採用的開放標準,讓 AI 應用以統一方式連接外部工具與資料來源,不必為每個工具各寫一套整合。
例:Codex、Claude Code、Copilot 都支援 MCP;GitHub 也提供官方 GitHub MCP Server。
隔離的執行環境,限制代理能碰的檔案、程序與網路。即使代理出錯或被注入惡意指令,也不會破壞你的系統。
例:Codex cloud 的每個任務、Anthropic 的 Managed Agents 都在獨立沙箱中執行。
決定代理哪些動作需要人類批准:從「每一步都問」、「編輯自動、執行要問」到「完全自動」。風險越高的任務越該保守。
例:Codex 的 Read‑only / Auto / Full access;Claude Code 的 permission mode。
在代理流程的關鍵節點加入人類確認或審查,兼顧自動化效率與可控性。
例:代理可以開 PR,但合併前一定由工程師審查,就是典型的人在迴圈中。
主代理派出的專用代理,擁有自己的上下文,處理搜尋、規劃、審查等子任務後只回報結論,避免主上下文被大量細節塞滿。
例:Claude Code 內建 Explore(找檔案)與 Plan(規劃)子代理。
多個代理平行或接力協作完成大型任務,例如一個負責審查、一個負責修正、一個負責驗證。
例:Claude Code 的 agent teams 與 Workflows、Codex App 的平行代理、GitHub 的 Mission Control。
可重用的指令與資源包,告訴代理「遇到某類任務該怎麼做」,例如產生 PDF、審查程式碼、部署流程。可以自己寫,也可以安裝別人分享的。
例:Claude Code 的 /code-review 就是一個 skill;Codex 也採用相同概念。
在代理生命週期的特定時機(工具呼叫前後、任務結束、需要確認時)自動觸發的腳本,用來強制格式化、跑測試、擋下危險指令或送通知。
例:設定「每次 Claude Code 寫檔後自動執行 prettier」。
對話接近上下文上限時,自動把舊內容摘要成較短的版本,保留重點、丟掉細節,讓代理可以連續工作數小時。
例:Codex 與 Claude 都內建 compaction,Claude API 也提供伺服器端版本。
跨工作階段保存的資訊,例如專案慣例、使用者偏好、上次的結論。可能是人寫的指引檔,也可能是代理自動寫入的記憶檔。
例:CLAUDE.md、AGENTS.md,以及 Claude Code 的持久記憶目錄。
不需要人在旁邊互動,以一條指令或 API 觸發代理跑完整任務並輸出結果,常用於 CI、排程與批次處理。
例:codex exec、claude -p,以及 GitHub Actions 裡的代理任務。
預訓練是用大規模資料學會通用語言與知識;微調是用特定資料再訓練,強化某類任務的表現。
例:GPT‑5‑Codex 是 GPT‑5 針對真實軟體工程任務再訓練的版本。
以人類偏好資料訓練模型「更符合期望」的方法,是讓模型有幫助、誠實且無害的關鍵技術之一。
例:Anthropic 與 OpenAI 都用 RLHF 及其後續方法對齊模型行為。
回答前先從外部資料庫檢索相關文件並放進 prompt,讓模型根據真實資料作答,減少幻覺並取得最新資訊。
例:企業知識庫問答、Copilot Spaces 把相關文件帶入上下文,都是 RAG 的應用。
把文字轉成一串數字向量,語意相近的內容向量也相近,用來做語意搜尋與相似度比對,是 RAG 的基礎。
例:搜尋「登入失敗」也能找到寫著「authentication error」的文件。
衡量模型或代理能力的標準化測驗。Benchmark 是公開的通用測驗,eval 通常指針對自己產品場景設計的評測。
例:SWE‑bench 讓模型修真實 GitHub issue;Terminal‑Bench 測終端操作能力。
讓模型行為符合人類價值與規範的技術與限制,包括拒絕有害請求、安全分類器、輸出過濾與使用政策。
例:Claude 對高風險請求會回傳 refusal;代理工具會禁止未經確認的破壞性操作。
控制模型思考深度與 token 用量的參數,通常分為 low / medium / high / xhigh / max,用來在品質、速度與成本之間取捨。
例:簡單任務用 low 省錢又快;困難的重構用 xhigh 或 max。