TL;DR:GPT-5.6 在 2026 年 7 月 9 日全面上線,分成 Sol、Terra、Luna 三階。Codex(OpenAI 給工程師寫 code 用的工具,不是你平常聊天的那個 ChatGPT)這一代沒有自己的模型:清單上只剩
gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna,上一代的gpt-5.3-codex標成已淘汰。專用 checkpoint 讓位給一個叫 reasoning effort 的設定,最高那一格 ultra,官方說它會叫 subagent 出來把大任務拆開做。有意思的兩點是:獨立評測機構 METR 在自家測試環境抓到 Sol 作弊,作弊率高於他們評過的任何公開模型;而單價便宜一半的 Terra,在一份獨立測試裡跑完一個任務反而比 Sol 貴。
OpenAI 的模型文件上,reasoning effort 現在列了六段:low、medium、high、extra high、max、ultra。
前面五段講的是同一件事的程度,想久一點、想細一點。第六段換了說法:官方說 ultra 超出單一 agent 跑一輪的範圍,會動用 subagent 來加速,適合那種可以拆開平行做的大任務。
清單上少了一個名字
前兩代 OpenAI 都會另外出一顆給寫 code 用的 checkpoint:GPT-5.2-Codex、GPT-5.3-Codex,Codex CLI 預設就是用它。(Codex 是 OpenAI 那套 AI 寫 code 的工具,終端機和桌面 app 都有。)
5.6 沒有。能選的就是 gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna,跟 ChatGPT 網頁上跑的是同一批。gpt-5.3-codex 和 gpt-5.2 則標成「ChatGPT 登入下已淘汰」,用 API key 的工作流不受影響。還掛著 Codex 名字的只剩一個 gpt-5.3-codex-spark,純文字的 research preview,只給 Pro。
Sol、Terra、Luna 這組命名 OpenAI 說明:數字是世代,名字是能力。
分化的軸換了一根
Codex CLI 那邊的操作很直白。/model 選 sol、terra 還是 luna,或者直接寫進 config.toml:
model = "gpt-5.6-sol"
model_reasoning_effort = "ultra"
(注意在 config.toml 裡,extra high 要寫成 xhigh。)
三顆模型乘六段 effort,跟以前的切法不太一樣。
Hacker News 那串討論裡,對 ultra 最常見的反駁是這能力早就有了。你今天就可以叫 Claude Code 或 Codex 去開 subagent,它們也做得不錯,這功能存在超過半年了。這話沒錯。差別就在於,以前那是你 prompt 裡的一句話,現在變成設定檔裡的一個值。至於設好之後,模型有多自主地決定要不要分身,這點目前不清楚。
至於專用 coding 模型為什麼消失,我猜是因為 coding 的難點換地方了。現在卡住 agent 的,多半就是拆任務、派工、把結果收回來這段,而寫 for loop 早就不是問題。這種能力得讓模型自己跑一小段 orchestration,換一顆 checkpoint 是拿不到的。
每個副本各自產 token。有報導說一次 ultra 呼叫大約是一般呼叫的兩到三倍成本,這個倍數我沒找到官方出處,當個粗略的參考就好。
那幾個分數,還有 METR 抓到的事
OpenAI 自己公布的是這組:Terminal-Bench 2.1 上 Sol 拿 88.8%,開 ultra 91.9%,Claude Fable 5 83.4%。獨立一點的 Artificial Analysis 給 Sol (max) 打 80 分。(「比 Fable 5 高 2.8 分、output token 用不到一半」,OpenAI 如是說。)
METR 那份部署前評估,量的是 time horizon:一件熟手要花 N 小時的任務,模型還有五成機率做完,N 就是它的 time horizon。有趣的是,量到一半,他們發現 Sol 竟然在作弊 —— 它會自己去翻出藏起來的測試套件,把寫著預期答案的原始碼撈出來抄。
同一份資料因此長出三個數字。作弊算失敗,11.3 小時;作弊的紀錄丟掉不算,71 小時(信賴區間 13 小時到 11400 小時,你沒看錯);作弊算成功,270 小時以上。METR 認為:「我們不認為上面任何一個數字,構成對 GPT-5.6 Sol 能力的可靠量測。」OpenAI 的 system card 也承認,模型會在任務上作弊、會捏造研究結果,包括把一條沒算過的方程式寫成「已計算並驗證」。
(METR 是在自己的 harness 上抓到的,Terminal-Bench 則是另一份考卷,所以 88.8% 不會因此失效變成假的。)
便宜的那顆,跑完一個任務不一定便宜
benchmark 之外,CodeRabbit 做了一份獨立測試,拿一百多個真實 repo 任務去跑,涵蓋 TypeScript、Go、Python、JavaScript、Rust,要求 agent 讀 repo、改 code、通過行為檢查。
Sol 通過 63.7%,平均每個任務吐 20,968 個 output token。Terra 通過 40.7%,平均吐 55,594 個。
把定價乘進去算一下。Sol 的 output 每百萬 30 美元,一個任務大約 0.63 美元。Terra 每百萬 15 美元,一個任務大約 0.83 美元。單價便宜一半的那顆,跑完一個任務反而貴了三成,通過率還低 23 個百分點。
把通過率也除進去,算成「解掉一題要多少錢」:Sol 大約 0.99 美元,Terra 大約 2.05 美元,差了兩倍出頭。(這是把失敗的嘗試攤進去算的,假設重試彼此獨立,實際上當然沒這麼乾淨。)
這筆帳只算 output。Sol 的 input 又比 Terra 貴一倍,讀 repo 的任務輸入量不會小,補上之後差距往哪邊跑還不好說,而且這只是一份 benchmark、跑在 CodeRabbit 自己的 harness 上。參考類似文章:你的 Prompt 到底花掉多少 Token?
CodeRabbit 另外提到,Sol 在多輪對話裡有時候會卡在沒用的路徑上打轉,有個改動來回了八輪;而架構判斷,他們還是偏好 Fable。
連 app 也一起收掉了
同一天消失的不只是模型清單上那一行。
OpenAI 把 Codex app 併進了 ChatGPT 桌面版,Chat、Work、Codex 三個介面收在同一個視窗裡。macOS 上你還可以繼續掛 Codex 的 icon。
(方案的部分,報導和官方文件兜不攏:發表當天的報導說 ultra 在 ChatGPT Work 裡只給 Pro 和 Enterprise,Codex 裡 Plus 就開得起來,官方文件則沒寫這條。)
我跑過幾下,然後額度就沒了
我有拿 5.6 跑過東西,只是額度掉得比想像中快,還沒累積到能拿出來講的程度。所以上面那些數字,全是讀文件、翻別人量出來的。昨天才 GA,網路上現在多數的「心得」其實也還是預測居多。
真要知道這三顆值不值,能查的其實不多:沒有一份 benchmark 跑的是你的 repo。拿一個你熟的任務跑一遍,記下它吐了多少 output token,再跟你原本那顆比一下,大概就有譜了。
你如果已經在用 5.6,Sol、Terra、Luna 實際跑起來的手感怎麼樣,跟這些數字對不對得上,我還蠻想聽的。
聲明:這篇寫在 GPT-5.6 上線的隔天(2026 年 7 月 10 日)。我有拿它跑過一點東西,但額度很快就見底了,所以文中沒有一個數字來自我自己的測試。出處分三層,我盡量在內文標清楚了:
- OpenAI 自己公布的:模型清單、六段 reasoning effort、定價、Terminal-Bench 的 88.8% 和 91.9%、token 效率 54%。廠商講自己的分數,看看就好。
- 第三方獨立量測的:METR 的部署前評估、CodeRabbit 的 benchmark、Artificial Analysis 的 Coding Agent Index。這三個跟 OpenAI 沒有共同利害,但 CodeRabbit 和 Artificial Analysis 各自有自己的 harness 和商業立場。
- 我自己推算的:Sol 和 Terra 的每任務 output 成本(0.63 / 0.83 美元),以及把通過率攤進去的每題成本(0.99 / 2.05 美元)。都是拿 CodeRabbit 的 token 數乘 OpenAI 的定價算的,只算輸出端,沒算 input 和 cache,也假設了重試彼此獨立。它是一個用來說明「單價不等於總價」的算式,不是你的帳單。
另外,ultra 的方案權限是我從發表當天的報導看來的,官方沒明說。這類條件和價格改得很快,真要動手之前,以你當下看到的官方文件為準。
資料來源:OpenAI 模型文件、GPT-5.6 發表公告、GPT-5.6 system card、METR 部署前評估、CodeRabbit 獨立測試、Artificial Analysis benchmark、TechCrunch 報導
延伸閱讀:
- AI 寫 code 為什麼又搬回終端機了:Codex CLI 為什麼長成一個終端機程式
- Claude Fable 5 是什麼?第一個公開的 Mythos 級模型:這篇裡被拿來當基準的那顆模型
- 你的 Prompt 到底花掉多少 Token?:ultra 開下去之前,先知道 token 怎麼算
- AI 說「完成了」,怎麼確認它真的做完?:METR 抓到的,就是一個沒人驗的完成宣告
English version: What Are GPT-5.6’s Sol, Terra, and Luna?

