GPT-5.6 這一代拆成三個版本:Sol(旗艦)、Terra(中階)、Luna(輕量)。名字換了,真正該問的是——在什麼任務、什麼預算下,哪一個才划算?

這篇用 DeepSWE 的權威數據來拆解。

先搞懂幾個名詞

怕看不懂?先花 30 秒認識這幾個詞,後面就順了:

  • DeepSWE:一個測 AI 寫程式能力的評測榜。它出的是「真實、需要多步驟的軟體工程題」(跨 91 個程式庫、5 種語言),而且題目全新、AI 沒背過答案,所以能拉開頂尖模型的差距。
  • PASS@1(通過率):模型一次就把題目做對的比例。越高越強,73% 就是 100 題對 73 題。
  • 平均成本/任務:完成一題平均要付多少 API 費用(美元)。越低越省。
  • harness(代理框架):讓模型能讀檔、改碼、跑測試的「工具外殼」。各家用自己的原生框架(GPT 用 Codex、Claude 用 Claude Code),比較才公平。
  • 檔位 low → max:同一個模型可以設定思考的力氣。想得越久(越靠 max)通常越聰明,但也越慢、越貴。
  • Sol / Terra / Luna:GPT-5.6 的三個等級——Sol 旗艦、Terra 中階、Luna 輕量

一、DeepSWE 排行榜:Terra 才是性價比之王

直接看通過率(PASS@1)與每題平均成本(2026/07/09,113 題,各家用原生 harness):

DeepSWE 排行榜:PASS@1 與平均成本

模型 PASS@1 平均成本/任務
gpt-5.6-sol (max) 73% $8.39
claude-fable-5 (max) 70% $21.63
gpt-5.6-terra (max) 70% $4.95
gpt-5.6-luna (max) 67% $3.03
gpt-5.5 (xhigh) 67% $7.23
claude-opus-4.8 (max) 59% $13.22
glm-5.2 (max) 44% $3.92

關鍵:Terra 和 Fable 5 同樣 70%,但成本只要 $4.95 vs $21.63——便宜約 4.4 倍!

  • Sol 最強(73%),適合不計成本要最高通過率。
  • Terra 是性價比王:與 Fable 5 同分(70%),成本卻不到四分之一。
  • Luna 最省($3.03)還能拿 67%,預算敏感時很划算。
  • Claude Opus 4.8 只有 59%,成本卻要 $13.22——被 GPT-5.6 全系列壓制。

二、分數 vs 成本定位圖:越靠左上越好

把每個模型(含各檔位 low→max)畫在「分數 × 成本」座標上,一眼看出誰划算——越靠左上(高分、低成本)越理想

DeepSWE 分數 vs 平均成本定位圖

  • 綠色的 GPT-5.6 系列(sol / terra / luna) 整條曲線都盤據左上方,性價比明顯優於橘色的 Claude 系列。
  • Claude Fable 5 雖然分數高,但位置偏右(成本高);同樣的分數區間,GPT-5.6 都用更低的成本達成。
  • 曲線顯示:從 Luna 往 Sol 加碼,分數提升但成本陡增——中間的 Terra 正好卡在「高分又不貴」的甜蜜點

結論:先問「什麼任務」,再選檔位

你的情境 推薦 理由
要最高通過率、不計成本 Sol (max) 73% 全場最高
大型 Coding、要性價比 Terra (max) 同分 Fable 5,成本只要 ~1/4
預算敏感 Luna $3.03 就有 67%
開源自架 glm-5.2 便宜($3.92)且可自主部署,惟本榜分數較低

一句話:大型 Coding 想省錢又要品質,Terra 是目前最甜的一檔。 Sol 留給「要最強」的場景,Luna 留給「極省」的場景。

參考來源

註:模型版本、分數與成本會隨時間變動,實際採用前請以官方最新資料為準。