GPT-5.6 三兄弟怎麼選?Sol / Terra / Luna 的成本效益甜蜜點分析
GPT-5.6 這一代拆成三個版本:Sol(旗艦)、Terra(中階)、Luna(輕量)。名字換了,真正該問的是——在什麼任務、什麼預算下,哪一個才划算?
這篇用 DeepSWE 的權威數據來拆解。
先搞懂幾個名詞
怕看不懂?先花 30 秒認識這幾個詞,後面就順了:
- DeepSWE:一個測 AI 寫程式能力的評測榜。它出的是「真實、需要多步驟的軟體工程題」(跨 91 個程式庫、5 種語言),而且題目全新、AI 沒背過答案,所以能拉開頂尖模型的差距。
- PASS@1(通過率):模型一次就把題目做對的比例。越高越強,73% 就是 100 題對 73 題。
- 平均成本/任務:完成一題平均要付多少 API 費用(美元)。越低越省。
- harness(代理框架):讓模型能讀檔、改碼、跑測試的「工具外殼」。各家用自己的原生框架(GPT 用 Codex、Claude 用 Claude Code),比較才公平。
- 檔位 low → max:同一個模型可以設定思考的力氣。想得越久(越靠 max)通常越聰明,但也越慢、越貴。
- Sol / Terra / Luna:GPT-5.6 的三個等級——Sol 旗艦、Terra 中階、Luna 輕量。
一、DeepSWE 排行榜:Terra 才是性價比之王
直接看通過率(PASS@1)與每題平均成本(2026/07/09,113 題,各家用原生 harness):

| 模型 | PASS@1 | 平均成本/任務 |
|---|---|---|
| gpt-5.6-sol (max) | 73% | $8.39 |
| claude-fable-5 (max) | 70% | $21.63 |
| gpt-5.6-terra (max) | 70% | $4.95 |
| gpt-5.6-luna (max) | 67% | $3.03 |
| gpt-5.5 (xhigh) | 67% | $7.23 |
| claude-opus-4.8 (max) | 59% | $13.22 |
| glm-5.2 (max) | 44% | $3.92 |
關鍵:Terra 和 Fable 5 同樣 70%,但成本只要 $4.95 vs $21.63——便宜約 4.4 倍!
- Sol 最強(73%),適合不計成本要最高通過率。
- Terra 是性價比王:與 Fable 5 同分(70%),成本卻不到四分之一。
- Luna 最省($3.03)還能拿 67%,預算敏感時很划算。
- Claude Opus 4.8 只有 59%,成本卻要 $13.22——被 GPT-5.6 全系列壓制。
二、分數 vs 成本定位圖:越靠左上越好
把每個模型(含各檔位 low→max)畫在「分數 × 成本」座標上,一眼看出誰划算——越靠左上(高分、低成本)越理想:

- 綠色的 GPT-5.6 系列(sol / terra / luna) 整條曲線都盤據左上方,性價比明顯優於橘色的 Claude 系列。
- Claude Fable 5 雖然分數高,但位置偏右(成本高);同樣的分數區間,GPT-5.6 都用更低的成本達成。
- 曲線顯示:從 Luna 往 Sol 加碼,分數提升但成本陡增——中間的 Terra 正好卡在「高分又不貴」的甜蜜點。
結論:先問「什麼任務」,再選檔位
| 你的情境 | 推薦 | 理由 |
|---|---|---|
| 要最高通過率、不計成本 | Sol (max) | 73% 全場最高 |
| 大型 Coding、要性價比 | Terra (max) | 同分 Fable 5,成本只要 ~1/4 |
| 預算敏感 | Luna | $3.03 就有 67% |
| 開源自架 | glm-5.2 | 便宜($3.92)且可自主部署,惟本榜分數較低 |
一句話:大型 Coding 想省錢又要品質,Terra 是目前最甜的一檔。 Sol 留給「要最強」的場景,Luna 留給「極省」的場景。
參考來源
- DeepSWE(Datacurve)長時程軟體工程榜:https://deepswe.datacurve.ai/(上方截圖為 2026/07/09 榜單)
註:模型版本、分數與成本會隨時間變動,實際採用前請以官方最新資料為準。