AIREITER

GPT-6.1 Sol API 定價評測:這次改了什麼

最近更新: 2026-09-30 00:25:14

GPT-6.1 Sol 已透過 API、Codex 與 ChatGPT Work 上線,但它真正的優勢,其實沒有發布時的宣傳口號那麼全面。API 標準價格為每百萬輸入 token $2、每百萬輸出 token $10;相較 GPT-6 Sol,真正有感的變化是快取輸入降至每百萬 token $0.10。OpenAI 公布的基準測試讓 Sol 6.1 成為程式撰寫與電腦操作試點的有力候選,但目前證據仍高度受供應商控制,還不足以支持所有團隊直接切換到正式環境。

GPT-6.1 Sol 到底改了什麼

GPT-6.1 Sol 是 OpenAI 於 2026 年 9 月 29 日推出的模型,API 識別名稱為 gpt-6.1-sol。OpenAI 將它定位為處理代理式程式開發、電腦操作、文件作業,以及其他多步驟專業任務的模型。官方模型文件列出 105 萬 token 的上下文視窗、推理能力、工具支援與圖片輸入。

可用範圍是理解這次發布的關鍵。模型目前列於 API、Codex 與 ChatGPT Work,但發布時並未提供給一般 ChatGPT 對話。換句話說,這主要是面向開發者與工作代理的版本,而不是 ChatGPT 的全面升級。

早期使用者回報不一,不能取代針對固定任務進行的測試。在一則r/OpenAI 討論中,u/Foreign_Helicopter24 分享了低成本且成功的結果;u/shuwatto 則表示,在 PCB 任務上 Opus 5.5 的表現勝過 Astra。這些都只是個別經驗,不是受控測試。

GPT-6.1 Sol API 定價:真正有變化的地方

以下標準費率列於OpenAI 定價文件,發布當天的相關報導也一致採用這組數字。這些價格適用於短上下文定價級距內的請求。

計費項目GPT-6.1 SolGPT-6 SolGPT-6 Astra
輸入/每 1M token$2.00$2.00$10.00
快取輸入/每 1M token$0.10$0.20$1.00
快取寫入/每 1M token$2.50$2.50$12.50
輸出/每 1M token$10.00$10.00$50.00

真正值得比較的,不是「Sol 6.1 的整張帳單都比 Sol 6 便宜」。一般輸入與輸出價格完全沒變,例外只有快取輸入:GPT-6.1 Sol 將 GPT-6 Sol 的 $0.20 費率砍半,且比自身的標準輸入費率低 95%。

舉例來說,一次請求若包含 100,000 個快取輸入 token、10,000 個一般輸入 token,以及 5,000 個輸出 token,在不計快取寫入、工具、重試或人工審核的情況下,成本約為 $0.08:

  1. 快取輸入:100,000 × $0.10 / 1,000,000 = $0.01。
  2. 一般輸入:10,000 × $2 / 1,000,000 = $0.02。
  3. 輸出:5,000 × $10 / 1,000,000 = $0.05。

同樣的示範組合,使用 GPT-6 Sol 約為 $0.09,使用 GPT-6 Astra 則約為 $0.45。這只是依照價目表計算的範例,不是實際生產環境的測量結果。

長提示詞會改變計算方式。OpenAI 定價頁面指出,輸入 token 超過 272,000 後,費率會提高至每百萬輸入 token $4、每百萬快取輸入 token $0.20,以及每百萬輸出 token $15。較高費率適用於整個請求,因此面對 300,000 token 的提示詞時,不能只用 $2/$10 的標準數字編列預算。

快取只有在可重用的前綴確實符合供應商規則時才有幫助。穩定不變的系統指令、工具定義與重複使用的政策文字,都適合做成快取;如果每次提示詞開頭都被改寫,預期中的節省可能就會消失。

已公布的證據能證明什麼,又不能證明什麼

把供應商公布的基準測試當成挑選試點的依據,而不是宣稱模型在所有場景都更強。

評測GPT-6.1 Sol 結果真正值得看的比較
DeepSWE v1.1高推理力度下 75.2%與 GPT-6 Astra 大致同級;在公布的表格中比 GPT-6 Sol 高 6.4 個百分點
OSWorld 2.0 offline最大推理力度下 71.4%比 Astra 約低 2.1 個百分點,但公布的單項任務成本低得多
AutomationBench最大推理力度 36.1%;中等推理力度 35.4%低於 Astra 的 41.4% 峰值,也低於部分 Claude 在更高推理力度下的結果
Terminal-Bench Science 0.1最大推理力度下 57.0%落後 Astra 的 68.1%,但仍是公布的 GPT-6 Sol 結果兩倍以上

最有說服力的案例在程式開發。BitsMinds 報導,GPT-6.1 Sol 每個 DeepSWE 任務的成本為 $0.65,Astra 則是 $4.43;在其選定的比較中,兩者得分分別為 75.2% 與 74.1%。這是相當有吸引力的成本效能訊號,但分數與成本都來自發布材料,而非獨立重測。

電腦操作也是類似的高性價比故事,但不能算是乾淨俐落的勝利:發布數據顯示,GPT-6.1 Sol 在 OSWorld 2.0 的成績為 71.4%,Astra 為 73.5%,公布的任務成本則分別是 $1.27 與 $9.44。商業自動化反而是一個警訊:模型可能在某種推理力度下勝過競品,換一種設定卻輸掉,因此「接近 Astra」不能解讀成「適合每一種工作流程」。

OpenAI 表示,在低推理力度下,GPT-6.1 Sol 的事實錯誤率由 GPT-6 Sol 的 11.4% 降至 7.7%。這代表降低了 3.7 個百分點,但光憑這個來源,仍無法判斷模型在你的文件、工具或審批規則上會有什麼表現。

API 整合需要注意什麼

即使端點接受新的識別名稱,單純替換模型名稱也可能導致整合失敗。

  • 模型 ID: gpt-6.1-sol。
  • 推理力度: OpenAI 模型文件列出 low、medium、high、xhigh 與 max;不支援 none 與 minimal。
  • 工具呼叫: OpenAI 模型文件指出,工具呼叫需要使用 Responses API。不使用工具的請求仍可採用 Chat Completions。
  • 上下文定價:272K token 的門檻會改變價目表。
  • 輸出上限: 開發者文件列出的最高輸出量為 128,000 token。
  • 輸入模態:同一份規格列出文字與圖片輸入;未列出原生音訊或影片輸入。

在更改正式環境的預設模型前,先用相同的工具、權限、驗收標準與推理力度,重播一組固定任務。記錄結果通過率、重試次數、總 token 成本、耗時,以及審核所需的人力分鐘數。每 token 便宜 80% 的模型,如果帶來更多修復工作,單一驗收結果的實際成本仍可能更高。

哪些團隊應該優先切換

正在使用 GPT-6 Sol 的團隊,應該先跑 Canary 測試。 基本輸入與輸出價格沒有上漲,快取輸入反而更便宜,而且公布的程式開發與電腦操作結果都有改善。當應用程式會重複使用長前綴,且已支援 Responses API 時,遷移理由最充分。

正在支付 Astra 費用的團隊,應該把例行工作分流到 Sol 6.1,而不是直接移除 Astra。 有測試可驗證的程式開發工單、具備明確驗證流程的文件擷取,以及可重複執行的瀏覽器任務,都適合成為第一批候選。科學研究、例外情況繁多的工作流程,或難以驗證的決策,仍應保留 Astra。

沒有可靠驗收測試的團隊,建議先等等。 基準測試接近,不代表可以取代品質關卡。如果沒有人能判斷代理是否正確完成任務,降低 token 價格就不是足以切換模型的安全理由。

GPT-6.1 Sol 常見問題

GPT-6.1 Sol 比 GPT-6 Sol 便宜嗎?

只有部分項目更便宜。標準輸入與輸出仍是每百萬 token $2 與 $10。快取輸入則從 $0.20 降至 $0.10,因此大量使用快取的代理能獲得最直接的節省。

GPT-6.1 Sol 的能力和 GPT-6 Astra 一樣嗎?

根據發布時公布的基準測試,它在程式開發與電腦操作方面接近 Astra,但在部分商業自動化與科學結果上仍落後。把「接近 Astra」視為需要實測的工作負載假設,而不是全面替代的結論。

GPT-6.1 Sol 的 API 模型名稱是什麼?

在 API 請求中使用 gpt-6.1-sol。

一般 ChatGPT 使用者可以選擇 GPT-6.1 Sol 嗎?

本文檢視的發布範圍包括 API、Codex 與 ChatGPT Work。發布時並未列入一般 ChatGPT 對話。

GPT-6.1 Sol 支援工具呼叫嗎?

發布文件指出,工具呼叫需要使用 Responses API。在切換既有整合前,先於 staging 環境測試端點與工具 schema。

實際的分流原則很簡單:任務若可重複、快取比例高,而且能驗證結果,就優先使用 GPT-6.1 Sol;若漏掉一個邊界案例的代價高於一次模型呼叫,就保留 Astra。