AI開發工具指南

2026 年 9 月版 · 完整指南

Codex、Claude 與 GitHub
一次看懂三大 AI 開發工具

從功能、模型、介面到定價全面介紹 OpenAI Codex、Anthropic Claude 與 GitHub,並用白話解釋 Harness、Prompt、Loop、MCP 等常見 AI 名詞。

3大工具全面介紹
60+項具體功能
39個 AI 名詞解釋

總覽

它們各自是什麼?

Codex 與 Claude 是「會做事的 AI」,GitHub 是「程式碼與協作的基地」。三者不是互斥的選項,而是經常一起使用的組合。

Cx

Codex

OpenAI

OpenAI 的代理式程式開發系統。由 GPT‑5 Codex 系列模型驅動,能在終端、IDE、雲端沙箱與 GitHub 中讀懂整個專案、規劃、修改多個檔案、執行測試並提出 Pull Request。

  • CLI、雲端、IDE、桌面 App 四種型態
  • 雲端沙箱可平行跑多個任務
  • 內含於 ChatGPT 付費方案
Cl

Claude

Anthropic

Anthropic 的 AI 模型家族與產品線:Claude 5 系列模型(Fable 5.1、Opus 5、Sonnet 5)、代理式程式工具 Claude Code、以及開發者用的 Claude API 與 Agent SDK。

  • 1M tokens 超長上下文與適應性思考
  • Claude Code 提供子代理、Hooks、MCP、Plugins
  • 以安全與可控性為核心設計
Gh

GitHub

Microsoft

全球最大的程式碼託管與協作平台。以 Git 儲存庫為核心,加上 Pull Request、Issues、Actions CI/CD、Codespaces,以及 AI 助手 Copilot 與讓各家代理進駐的 Agent HQ。

  • Codex 與 Claude 都在這裡讀 repo、開 PR
  • Actions 是代理與 CI 的共同執行平台
  • Copilot 可選用 OpenAI、Anthropic 等模型
OpenAI

Codex:OpenAI 的 AI 程式代理

Codex 是 OpenAI 於 2025 年重新推出的代理式程式開發系統(agentic coding system)。它不是單純的自動補全,而是一個能接下完整任務、在沙箱裡工作、最後交出可審查成果的「AI 工程師」。

A

使用介面:在哪裡用 Codex

⌨️

Codex CLI(終端)

開源(Rust 實作)的命令列代理,直接在本機工作目錄讀寫檔案、執行指令與測試。codex exec 提供非互動模式,可用於腳本與 CI。

☁️

Codex cloud(雲端)

在 ChatGPT 網頁側欄啟動。每個任務在獨立雲端沙箱中執行,預先載入你的 GitHub 儲存庫,可同時平行處理多個任務並直接開 PR。

🧩

IDE 擴充

支援 VS Code、Cursor、Windsurf 與 JetBrains。側欄代理可把目前開啟的檔案當作上下文;本機任務與雲端任務可以互相接手。

🖥️

Codex App(桌面)

macOS 與 Windows 桌面應用,專為同時管理多個代理設計:平行執行、追蹤長時間任務,並以 git worktree 把每個任務隔離開來。

🔀

GitHub 整合

在 PR 留言 @codex review 觸發自動審查,也可設定每個新 PR 自動審查。Codex GitHub Action 可在 CI 流程中執行代理任務。

📱

ChatGPT 行動版與 Slack

在 ChatGPT iOS App 中啟動與追蹤雲端任務;在 Slack 頻道 @Codex 直接派工,成果回到 Codex cloud。

B

核心能力

  • 專案理解與多檔案修改
    讀取整個儲存庫、追蹤跨檔案相依,先規劃再動手,一次修改多個檔案並自行驗證。
  • 沙箱執行
    指令與測試在受限沙箱中執行,預設關閉網路存取,需要時才開啟,降低誤操作風險。
  • 審核模式(Approval modes)
    從「唯讀」、「自動(工作目錄內自動編輯與執行,超出範圍時詢問)」到「完全存取」,依任務風險調整。
  • AGENTS.md 專案指引
    在專案根目錄放置指引檔,告訴 Codex 專案慣例、測試指令與禁區,作用相當於 Claude 的 CLAUDE.md。
  • MCP 與網路搜尋
    連接 MCP 伺服器取得外部工具與資料,並可啟用 web search 查詢最新文件。
  • Skills 與外掛整合
    可重用的技能包,讓 Codex 知道特定任務的做法;並能連接 Slack、Linear、Figma 等外部工具。
  • 圖片輸入
    貼上截圖、設計稿或錯誤畫面,Codex 據此實作 UI 或除錯。
  • 程式碼審查
    對 PR 進行深度審查,會實際追蹤相依關係並執行驗證,而不只是看 diff。
  • 長時間任務與上下文壓縮
    自動壓縮(compaction)上下文,讓單一任務可以連續工作數小時而不中斷。
  • Codex SDK
    以 TypeScript SDK 把 Codex 代理嵌入自己的工具與自動化流程。
C

模型

模型說明
GPT‑5‑Codex2025 年 9 月推出,是 GPT‑5 針對代理式程式開發進一步最佳化的版本。能依任務難易動態調整思考時間,簡單問題秒回,複雜重構可持續數小時。
GPT‑5.1‑Codex‑Max、GPT‑5.2 / 5.3‑Codex後續版本,強化長時間任務、原生上下文壓縮、工具使用與 Windows 環境支援。
GPT‑5.x 通用模型Codex 也可切換到最新的通用 GPT‑5 系列模型,並選擇推理強度(low / medium / high / xhigh)。
D

取得方式與定價

ChatGPT 方案內含

Plus、Pro、Business、Enterprise 與 Edu 方案都可使用 Codex,各方案用量額度不同,Pro 額度最高。

API 用量計費

也可用 OpenAI API 金鑰登入 Codex CLI,依 tokens 用量計費,適合 CI 與自動化場景。

開源 CLI

Codex CLI 以 Apache‑2.0 授權開源,可自行檢視原始碼或貢獻功能。

💡
適合誰? 已經在 ChatGPT 生態內工作、需要在雲端平行處理大量小任務、或想要在 GitHub PR 上自動審查的團隊。Codex 的雲端沙箱與桌面 App 特別適合「同時派很多任務、之後再回來收成果」的工作方式。
Anthropic

Claude:模型家族、Claude Code 與 API

Claude 是 Anthropic 推出的 AI 模型家族,也是一整套產品:一般使用者的 Claude.ai、工程師用的 Claude Code、開發者用的 Claude API 與 Agent SDK。Anthropic 以安全與可控性為核心,Claude 在長上下文、程式開發與代理任務上尤其突出。

A

模型家族(2026 年 9 月)

模型定位上下文價格(每百萬 tokens,輸入 / 輸出)
Claude Fable 5.1最強大的公開模型,適合最困難的推理與長程代理任務;思考永遠開啟,以 effort 控制深度。1M$10 / $50
Claude Opus 5旗艦等級,程式開發與代理任務的主力,也是 API 的預設推薦模型。1M$5 / $25
Claude Sonnet 5速度、成本與能力的平衡點,適合大量互動與產品內嵌。1M$2 / $10
Claude Haiku 4.5最快、最省,適合子代理、分類與簡單任務。200K$1 / $5
🧠
適應性思考:Claude 5 系列會自行決定要「想多久」,並可用 effort(low → medium → high → xhigh → max)在品質與成本之間取捨。
📚
1M 上下文、128K 輸出:一次讀入整個中型程式庫或數百頁文件;單次輸出最長 128K tokens。
🔒
安全機制:內建安全分類器與拒答機制;Fable 5.1 另以 Claude Mythos 5.1 之名提供給經審核的組織。
B

產品與介面

💬

Claude.ai

網頁、桌面(Mac / Windows)與 iOS / Android。支援 Projects、Artifacts 互動式產物、記憶、檔案分析、連接 Google Drive / Slack / GitHub 等連接器,以及處理一般工作的 Cowork 代理模式。

⌨️

Claude Code

代理式程式開發工具:終端 CLI、桌面 App、VS Code / JetBrains 擴充,以及網頁版 claude.ai/code。可在本機或雲端直接讀寫檔案、執行指令、開 PR。

🔌

Claude API

開發者透過 Messages API 直接呼叫模型,支援工具使用、結構化輸出、串流、批次、檔案上傳與提示快取。提供 Python、TypeScript、Java、Go、Ruby、C#、PHP 官方 SDK。

🛠️

Claude Agent SDK

把 Claude Code 的整套 harness(工具、迴圈、權限、Hooks、子代理、MCP)包成 Python / TypeScript 函式庫,用來打造自己的代理,不限於寫程式。

🌐

Claude in Chrome / Slack / GitHub

瀏覽器內的代理可代為操作網頁;Slack 中可直接 @Claude;GitHub 上可透過 claude-code-action 在 Actions 中審查與修改程式碼。

☁️

雲端平台

除了 Anthropic 官方 API,也可透過 Amazon Bedrock、Google Vertex AI 與 Microsoft Foundry 使用 Claude,方便企業沿用既有雲端合約與資安規範。

C

Claude Code 核心功能

  • CLAUDE.md 專案指引
    放在專案或家目錄的指引檔,自動載入,記錄慣例、指令與注意事項。
  • Skills 與斜線指令
    /commit/code-review 這類可自訂、可分享的工作流程,一個指令就能觸發完整步驟。
  • 子代理(Subagents)
    內建 Explore、Plan 等專用代理,各自擁有獨立上下文,可平行分工再回報結果。
  • Agent teams 與 Workflows
    多個代理協作處理大型任務;Workflows 以腳本決定性地編排數十個代理的分工與順序。
  • Hooks
    在工具呼叫前後、任務結束等時機自動執行腳本,用來強制格式化、跑測試或發通知。
  • MCP 連接器
    連接資料庫、Issue 追蹤、瀏覽器、設計工具與內部 API,讓代理能碰到真實系統。
  • Plugins
    把 Skills、子代理、Hooks、MCP 定義打包成可安裝的擴充包,方便團隊統一分發。
  • Plan mode 與 Worktree
    先規劃、經確認再執行;以 git worktree 隔離實驗性修改,不污染主分支。
  • 背景任務與排程
    長時間任務可在背景執行;routines 依 cron 定時啟動雲端代理,例如每天早上整理進度。
  • 程式碼審查
    /code-review 依效能等級審查目前的差異,ultra 模式會在雲端啟動多個代理做深度審查。
  • 持久記憶
    跨工作階段保存使用者偏好、專案脈絡與回饋,下次自動帶入。
  • 權限模式
    從逐步確認、自動接受編輯到完全自動,可依信任程度調整代理的自主範圍。
D

Claude API 重點功能

工具使用與 Tool Runner

定義自己的工具,SDK 自動跑「呼叫 → 執行 → 回傳」的代理迴圈,並提供每輪的審核與攔截點。

伺服器端工具

網路搜尋、網頁擷取與程式碼執行都在 Anthropic 端完成,不需要自己架設執行環境。

結構化輸出

以 JSON Schema 保證回傳格式,方便程式直接解析,不必再做字串清理。

提示快取(Prompt caching)

重複出現的系統提示、文件與工具定義快取起來,後續請求大幅降低成本與延遲。

批次 API 與檔案 API

非即時任務以批次處理享半價;檔案 API 讓 PDF、圖片上傳一次即可重複引用,並支援引用(citations)。

Skills 與 Managed Agents

Skills 讓模型產生 PDF、簡報等檔案;Managed Agents(beta)由 Anthropic 代管代理迴圈與沙箱,並支援排程與多代理。

E

取得方式與定價

個人方案

Claude Free、Pro 與 Max。Pro 即可使用 Claude Code,Max 提供更高的 Claude Code 用量與優先存取。

團隊與企業

Team 與 Enterprise 方案提供集中管理、SSO、更高額度與資料保護選項。

開發者 API

依 tokens 用量計費(見上方模型表),快取讀取與批次處理可再大幅降低成本。

💡
適合誰? 需要最強推理與超長上下文、想在終端 / IDE / CI 深度客製代理工作流程(Hooks、子代理、Plugins)、或重視安全與可控性的團隊。開發者若要打造自己的代理產品,Claude API 與 Agent SDK 是完整的一條龍方案。
Microsoft

GitHub:程式碼託管、協作與 AI 代理的基地

GitHub 是全球最大的程式碼託管與協作平台,以 Git 為核心,加上 Issues、Pull Request、CI/CD 與 AI 助手 Copilot。它是 Codex 與 Claude 之類代理「工作的地方」:讀取儲存庫、提出變更、接受審查、觸發自動化都在這裡發生。

A

平台核心功能

📦

Repositories

公開或私有的 Git 儲存庫,含分支、標籤、README、授權、Fork 與 Star,是所有工作的起點。

🔍

Pull Request 與 Code Review

提交變更、逐行評論、指定必要審查者、Merge queue 與自動合併,是團隊品質把關的核心。

📋

Issues、Projects、Discussions

追蹤工作項目、看板或表格式專案管理、社群討論與 Wiki 文件。

⚙️

GitHub Actions

以 YAML 定義 CI/CD 與自動化工作流程;Marketplace 上有數千個現成 action 可直接套用。

🧑‍💻

Codespaces

瀏覽器或 VS Code 中一鍵啟動的雲端開發環境,環境設定隨儲存庫版本控制。

🛡️

安全性

Dependabot 相依更新、CodeQL 程式碼掃描、Secret scanning 與 Push protection,屬 GitHub Advanced Security。

🚀

Packages、Releases、Pages

套件註冊表、版本發佈與資產、靜態網站託管,發佈流程一站完成。

🧰

CLI、API 與行動版

gh 命令列工具、REST / GraphQL API、Webhooks、GitHub Apps 與 GitHub Mobile。

B

GitHub Copilot 與 AI 功能

  • 程式碼補全與 Chat
    在 VS Code、Visual Studio、JetBrains、Xcode、Eclipse、Neovim 中即時建議與對話,並能解釋程式碼、產生測試。
  • Agent mode
    IDE 內的自主多步驟代理:自行決定要改哪些檔案、執行終端指令、依錯誤迭代,2026 年 3 月起在主要 IDE 正式提供。
  • Copilot coding agent(雲端代理)
    把 Issue 指派給 Copilot,它在 GitHub Actions 環境中工作並提出 PR,全程留下紀錄供審查。
  • Copilot code review
    以代理式架構審查 PR:先探索儲存庫、追蹤跨檔案相依,再留下評論,而非只看 diff。
  • Copilot CLI
    終端中的代理,可用自然語言執行 Git 與 shell 任務。
  • Copilot Spaces
    把檔案、Issue、PR 與文件打包成情境包,讓任何 Copilot 介面都帶著正確的背景知識。
  • Agent HQ 與 Mission Control
    在 GitHub 中統一指派、監控多個代理任務;除了 Copilot,也可接入 OpenAI Codex、Anthropic Claude、Google 等第三方代理。
  • 多模型選擇與自訂指引
    Copilot 可切換 OpenAI、Anthropic Claude、Google Gemini 等模型;以 .github/copilot-instructions.md 或 AGENTS.md 給代理專案規則。
C

方案

方案適合對象與內容
GitHub Free個人與開源專案。無限公開與私有儲存庫,含 Actions 與 Codespaces 的每月免費額度。
GitHub Team小型團隊。進階協作功能、分支保護規則、更多 Actions 額度。
GitHub Enterprise企業。SSO / SAML、稽核紀錄、GitHub Advanced Security 與合規支援。
Copilot Free / Pro / Pro+ / Business / Enterprise從免費有限額度到企業級。Pro+ 提供最多的 premium requests 與最新模型;Business / Enterprise 加上組織管理與政策控制。
D

GitHub 與 Codex、Claude 的關係

代理都連到 GitHub

Codex cloud 與 Claude Code 都能讀取儲存庫、建立分支、開 PR 與審查 PR;GitHub 是它們交付成果的地方。

Actions 是共同執行平台

Copilot coding agent、Codex GitHub Action 與 claude-code-action 都可在 GitHub Actions 中運行,與既有 CI 串在一起。

Agent HQ 統一調度

在 GitHub 介面中直接選擇由 Codex、Claude 或 Copilot 執行任務,並在 Mission Control 追蹤所有代理的進度。

💡
適合誰? 幾乎所有軟體團隊。無論用哪一家的 AI 代理,程式碼最終都要進到儲存庫、經過審查與 CI,而 GitHub 正是這條流程的中樞。

比較

三者一覽表

同一個面向下,三個工具分別扮演什麼角色。

面向CodexClaudeGitHub
本質AI 程式代理(agent)AI 模型家族 + 代理工具 + API程式碼託管與協作平台
開發商OpenAIAnthropicGitHub(Microsoft 旗下)
主要介面CLI、雲端、IDE 擴充、桌面 App、GitHub、Slack、ChatGPT AppClaude.ai、Claude Code(CLI / 桌面 / IDE / 網頁)、API、Agent SDK網站、gh CLI、Codespaces、Mobile、REST / GraphQL API
底層模型GPT‑5 Codex 系列與 GPT‑5.xClaude Fable 5.1、Opus 5、Sonnet 5、Haiku 4.5Copilot 可選 OpenAI、Anthropic、Google 模型
運行位置本機沙箱或 OpenAI 雲端沙箱本機、Anthropic 雲端(網頁版、Managed Agents)GitHub Actions 雲端執行環境
專案指引檔AGENTS.mdCLAUDE.mdcopilot-instructions.md、AGENTS.md
擴充機制MCP、Skills、外掛整合MCP、Skills、Hooks、子代理、PluginsActions Marketplace、GitHub Apps、GitHub MCP Server
審查與 PR@codex review、自動開 PR/code-review、claude-code-actionCopilot code review、PR 機制本身
計費方式ChatGPT 方案內含,或 API 用量計費Claude 方案內含,或 API 用量計費GitHub 方案 + Copilot 方案

搭配流程

三者如何一起工作

一個典型的 AI 輔助開發流程:GitHub 當中樞,Codex 或 Claude 當執行者,人類負責決策與最後把關。

  1. 建立 Issue

    在 GitHub 上描述需求、驗收條件與限制,這就是給代理的任務規格。

  2. 指派給代理

    指派給 Codex cloud、Claude Code 或 Copilot coding agent;透過 Agent HQ 也能在同一處選擇。

  3. 代理規劃與實作

    代理在沙箱中讀 repo、規劃、修改檔案、執行測試,遇到重大決策時回頭詢問。

  4. 開 Pull Request

    代理建立分支並提出 PR,附上變更說明與測試結果。

  5. CI 與 AI 審查

    GitHub Actions 跑測試;@codex review、Copilot 或 Claude 進行第一輪程式碼審查。

  6. 人類審查與合併

    工程師檢視結果、要求修改或直接合併,人在迴圈中確保品質。

AI 名詞介紹

看懂上面內容必備的 39 個名詞

從基礎概念到代理框架,每個名詞都附上與 Codex、Claude、GitHub 相關的實例。輸入關鍵字或點選分類即可篩選。

顯示 39

基礎概念

LLM 大型語言模型

基礎

以海量文本訓練、能理解與生成語言的神經網路。它是所有 AI 助手與代理的核心引擎。

例:GPT‑5 與 Claude 5 都是 LLM;Codex 與 Claude Code 則是包在 LLM 外面的代理工具。

Token 詞元

基礎

模型處理文字的最小單位,約等於 0.75 個英文單字或 1 到 2 個中文字。API 計費、用量額度與上下文長度都以 token 計算。

例:Claude Opus 5 每百萬輸入 tokens 收費 5 美元,一份 10 萬字的文件大約需要 15 萬個 tokens。

Context window 上下文視窗

基礎

模型一次能「看到」的 token 上限,包含你的輸入、對話歷史、工具回傳結果與它自己的輸出。超過上限就必須壓縮或截斷。

例:Claude 5 系列為 1M tokens,足以一次讀入整個中型程式庫。

Prompt 提示

基礎

你給模型的輸入,包含指令、背景資訊、範例與問題。好的 prompt 會明確說明目標、限制條件、可用資源與期望的輸出格式,而不是只丟一句話。

例:「用 TypeScript 改寫這個函式,保持 API 不變,並補上單元測試」比「幫我改一下」有效得多。

System prompt 系統提示

基礎

由開發者或工具(而非使用者)設定的最高層級指令,定義模型的角色、規則、語氣與可用工具。使用者的訊息會在這個框架內被解讀。

例:Claude Code 與 Codex 都有內建的系統提示,規定如何使用工具、何時要詢問使用者。

Inference 推論

基礎

模型根據輸入產生輸出的過程。訓練(training)是學習,推論是實際使用;你每次送出的請求都是一次推論。

例:API 價格表上的輸入 / 輸出費用就是推論的成本。

Temperature 溫度

基礎

控制輸出隨機性的參數:數值低則穩定一致,高則多樣有創意。新一代推理模型多半已不開放調整,改由模型自行決定。

例:Claude 5 系列不再接受 temperature 參數,改以 effort 控制行為。

Hallucination 幻覺

基礎

模型自信地產生錯誤或虛構的內容,例如不存在的函式或錯誤的 API 參數。

例:代理工具靠實際讀檔、執行測試與查文件來驗證,而非憑記憶作答,藉此降低幻覺。

Reasoning / Thinking 推理 / 思考

基礎

模型在給出答案前先進行的內部推演。推理模型會為困難問題花更多時間思考,簡單問題則快速作答。

例:Claude 的 adaptive thinking 與 GPT‑5 的 reasoning effort 都屬此類,可設定「想多久」。

Multimodal 多模態

基礎

模型能處理文字以外的輸入或輸出,例如圖片、PDF、語音。

例:把 UI 截圖貼給 Codex 或 Claude Code 要求「做成一樣的」就是多模態應用。

提示與互動

Prompt engineering 提示工程

提示

設計與優化 prompt 的技巧:給明確角色與目標、拆解步驟、提供範例、指定輸出格式、說明限制與驗收條件。

例:CLAUDE.md 與 AGENTS.md 其實就是「寫給代理的長期 prompt」。

Zero‑shot / Few‑shot 零樣本 / 少樣本

提示

不給範例直接要求模型完成任務叫 zero‑shot;先給幾個輸入輸出範例再要求叫 few‑shot,通常能顯著提升格式與品質的一致性。

例:給代理兩個「好的 commit message」範例,它之後寫的就會跟著那個風格。

Chain of thought 思維鏈

提示

要求或引導模型逐步推理再作答,而非直接跳到結論,能提高複雜問題的正確率。現代推理模型已將此內建為「思考」階段。

例:Claude Code 的 Plan mode 就是先把思考過程攤開、確認後再執行。

Prompt caching 提示快取

提示

把重複出現的前綴(系統提示、大型文件、工具定義)快取起來,之後的請求只需付少量費用並更快回應。

例:Claude API 的快取讀取價格遠低於一般輸入,代理工具每一輪都重送整段歷史時特別受益。

Prompt injection 提示注入

提示

攻擊者把「指令」藏在網頁、文件、Issue 或工具回傳內容中,誘使代理執行非使用者本意的動作,例如外洩資料或刪除檔案。

例:成熟的代理會把外部內容視為資料而非指令,遇到可疑指令會先向使用者確認。

Structured output 結構化輸出

提示

要求模型以符合 JSON Schema 的格式回覆,讓程式可以直接解析,不必再處理自由文字。

例:Claude API 的 output_config 可保證回傳符合你定義的 schema。

Streaming 串流

提示

模型邊生成邊回傳,使用者不必等整段完成才看到內容;長輸出時也能避免請求逾時。

例:Claude Code 與 Codex CLI 都是串流顯示,你會看到文字一字字出現。

代理與工具

Agent 代理

代理

能自主規劃、使用工具、觀察結果並持續行動直到完成目標的 AI 系統。與單純「一問一答」的聊天機器人最大的差別,是它會主動做事並根據結果調整。

例:Codex、Claude Code、Copilot coding agent 都是代理。

Agentic loop / Loop 代理迴圈

代理

代理運作的核心循環:模型思考 → 決定呼叫某個工具 → harness 執行並回傳結果 → 模型再思考 → … 直到它判斷任務完成。每跑一圈稱為一個 turn。「loop」也常指讓代理反覆執行同一任務的機制。

例:Claude Code 修 bug 時會「讀檔 → 改檔 → 跑測試 → 看錯誤 → 再改」跑好幾圈;/loop 則可每隔幾分鐘重跑一次指令。

Harness 代理框架 / 鷹架

代理

包在模型外面的整套程式:負責跑代理迴圈、管理上下文與記憶、提供工具、處理權限與安全、記錄與重試。模型是「大腦」,harness 是「身體與神經系統」;同一個模型換不同 harness,表現可以差很多。「Harness engineering」指的就是設計這一層的工程。

例:Claude Code 與 Codex CLI 都是 harness;Claude Agent SDK 就是把 Claude Code 的 harness 開放給開發者自己用。

Tool use / Function calling 工具使用 / 函式呼叫

代理

模型輸出一段結構化的「請呼叫某工具、參數如下」,由 harness 實際執行後把結果回傳給模型。讀檔、執行指令、搜尋網路、查資料庫都是工具。

例:Claude API 的 Tool Runner 會自動處理「呼叫 → 執行 → 回傳」,你只要定義工具函式。

MCP Model Context Protocol

代理

由 Anthropic 提出、業界共同採用的開放標準,讓 AI 應用以統一方式連接外部工具與資料來源,不必為每個工具各寫一套整合。

例:Codex、Claude Code、Copilot 都支援 MCP;GitHub 也提供官方 GitHub MCP Server。

Sandbox 沙箱

代理

隔離的執行環境,限制代理能碰的檔案、程序與網路。即使代理出錯或被注入惡意指令,也不會破壞你的系統。

例:Codex cloud 的每個任務、Anthropic 的 Managed Agents 都在獨立沙箱中執行。

Approval / Permission mode 審核 / 權限模式

代理

決定代理哪些動作需要人類批准:從「每一步都問」、「編輯自動、執行要問」到「完全自動」。風險越高的任務越該保守。

例:Codex 的 Read‑only / Auto / Full access;Claude Code 的 permission mode。

Human‑in‑the‑loop 人在迴圈中

代理

在代理流程的關鍵節點加入人類確認或審查,兼顧自動化效率與可控性。

例:代理可以開 PR,但合併前一定由工程師審查,就是典型的人在迴圈中。

Subagent 子代理

代理

主代理派出的專用代理,擁有自己的上下文,處理搜尋、規劃、審查等子任務後只回報結論,避免主上下文被大量細節塞滿。

例:Claude Code 內建 Explore(找檔案)與 Plan(規劃)子代理。

Multi‑agent / Agent team 多代理

代理

多個代理平行或接力協作完成大型任務,例如一個負責審查、一個負責修正、一個負責驗證。

例:Claude Code 的 agent teams 與 Workflows、Codex App 的平行代理、GitHub 的 Mission Control。

Skill 技能

代理

可重用的指令與資源包,告訴代理「遇到某類任務該怎麼做」,例如產生 PDF、審查程式碼、部署流程。可以自己寫,也可以安裝別人分享的。

例:Claude Code 的 /code-review 就是一個 skill;Codex 也採用相同概念。

Hook 掛鉤

代理

在代理生命週期的特定時機(工具呼叫前後、任務結束、需要確認時)自動觸發的腳本,用來強制格式化、跑測試、擋下危險指令或送通知。

例:設定「每次 Claude Code 寫檔後自動執行 prettier」。

Compaction 上下文壓縮

代理

對話接近上下文上限時,自動把舊內容摘要成較短的版本,保留重點、丟掉細節,讓代理可以連續工作數小時。

例:Codex 與 Claude 都內建 compaction,Claude API 也提供伺服器端版本。

Memory 記憶

代理

跨工作階段保存的資訊,例如專案慣例、使用者偏好、上次的結論。可能是人寫的指引檔,也可能是代理自動寫入的記憶檔。

例:CLAUDE.md、AGENTS.md,以及 Claude Code 的持久記憶目錄。

Headless / Non‑interactive 無頭模式

代理

不需要人在旁邊互動,以一條指令或 API 觸發代理跑完整任務並輸出結果,常用於 CI、排程與批次處理。

例:codex execclaude -p,以及 GitHub Actions 裡的代理任務。

模型與訓練

Pre‑training / Fine‑tuning 預訓練 / 微調

模型

預訓練是用大規模資料學會通用語言與知識;微調是用特定資料再訓練,強化某類任務的表現。

例:GPT‑5‑Codex 是 GPT‑5 針對真實軟體工程任務再訓練的版本。

RLHF 人類回饋強化學習

模型

以人類偏好資料訓練模型「更符合期望」的方法,是讓模型有幫助、誠實且無害的關鍵技術之一。

例:Anthropic 與 OpenAI 都用 RLHF 及其後續方法對齊模型行為。

RAG 檢索增強生成

模型

回答前先從外部資料庫檢索相關文件並放進 prompt,讓模型根據真實資料作答,減少幻覺並取得最新資訊。

例:企業知識庫問答、Copilot Spaces 把相關文件帶入上下文,都是 RAG 的應用。

Embedding 嵌入向量

模型

把文字轉成一串數字向量,語意相近的內容向量也相近,用來做語意搜尋與相似度比對,是 RAG 的基礎。

例:搜尋「登入失敗」也能找到寫著「authentication error」的文件。

Benchmark / Eval 基準測試 / 評測

模型

衡量模型或代理能力的標準化測驗。Benchmark 是公開的通用測驗,eval 通常指針對自己產品場景設計的評測。

例:SWE‑bench 讓模型修真實 GitHub issue;Terminal‑Bench 測終端操作能力。

Alignment / Guardrails 對齊 / 防護欄

模型

讓模型行為符合人類價值與規範的技術與限制,包括拒絕有害請求、安全分類器、輸出過濾與使用政策。

例:Claude 對高風險請求會回傳 refusal;代理工具會禁止未經確認的破壞性操作。

Effort 努力程度

模型

控制模型思考深度與 token 用量的參數,通常分為 low / medium / high / xhigh / max,用來在品質、速度與成本之間取捨。

例:簡單任務用 low 省錢又快;困難的重構用 xhigh 或 max。