返回資訊
AI趨勢入門

GPT-6 Sol、Luna 開賣:輸入 2 與 0.10 美元,官方稱錯誤砍半,獨立榜智力幾乎沒動

2026年9月23日
易賺Ai團隊
18 分鐘閱讀
#AI新聞#OpenAI#API定價#模型發布#GPT-6
GPT-6 Sol、Luna 開賣:輸入 2 與 0.10 美元,官方稱錯誤砍半,獨立榜智力幾乎沒動

OpenAI 把 Plus、Pro、Business、Enterprise、Edu 的 ChatGPT Work 與 Codex 接到兩個新的 大型語言模型 識別碼:gpt-6-solgpt-6-lunaOpenAI API 同步開放。這次補的是 AI 工作檔與大量短任務那兩層,不是再發一顆旗艦。免費與 Go 使用者只能在桌面應用碰到 Luna。一般 Chat(網站與手機應用)發布當下還沒有,公司說會在當天分段推,先穩住服務。GitHub Copilot 同日接到這兩檔:Sol 給 Pro+、Max、Business、Enterprise,Luna 連 Pro 也能用。AWS Bedrock 也掛上,Sol 輸入/輸出寫 2.20/11.00 美元,Luna 寫 0.11/0.55,比直連官方略貴。

到這一步,GPT-6 才不再只等於 Astra。旗艦仍是 gpt-6-astra,標準 API 每百萬 Token 輸入 10 美元、輸出 50 美元,發布細節見那次 Astra 上線。Sol 被寫成複雜寫程式、智能體工作流、電腦操作的工作檔;Luna 被寫成摘要、抽欄位、短問答這類目標清楚、量大的活。中間那檔 Terra 沒有 GPT-6 版。The New Stack 引述發言人:GPT-5.6 的價是促銷,GPT-6 Sol 與 Luna 這次是長期定價,不是限時折扣。

距離 Astra 公開大約十九天。同一時段,Anthropic 先放出 Claude Opus 5.5,標價 4/20 美元,細節見同日那篇。TechCrunch 寫,OpenAI 這兩檔大約晚九十分鐘出門。官方對照表裡大量出現的仍是 Opus 5 與 Fable 5/5.1,不是剛開賣的 5.5。兩邊還沒有公開、同一套 harness 的對打。

快取和推理的改進,讓我們能以更低的成本提供這些模型,而我們也直接將這些節省下來的成本回饋給使用者和客戶。

這句是官方把降價歸因於 KV 快取推理 效率,不是把模型參數公開砍半。兩檔都沿用 Astra 那套訓練與對齊方向,上下文窗口寫 1.05M、最大輸出 128K。知識截止日期略有差別:Sol 寫 4 月 20 日,Luna 寫 5 月 18 日。思考力度支援 nonelowmedium(預設)、highxhighmax。內建工具與函式呼叫走 Responses API;Chat Completions 只有在 reasoning_effort 設成 none 時才支援函式呼叫。

標價腰斬,長上下文與 Fast 另算

標準短上下文下,Sol 從 GPT-5.6 Sol 的 4/20 走到 2/10;Luna 從 0.20/1.20 走到 0.10/0.50。快取讀取仍是輸入價的一折:Sol 0.20、Luna 0.01。快取寫入加兩成五:Sol 2.50、Luna 0.125。Batch 與 Flex 是標準價一半;Fast 是兩倍。輸入超過約 272K token 的請求,整筆按長上下文計:輸入與快取價乘 2、輸出乘 1.5。區域處理另加一成;歐盟資料駐留只開放標準處理。

每百萬 token(短上下文)GPT-6 SolGPT-5.6 SolGPT-6 LunaGPT-5.6 LunaGPT-6 Astra
未快取輸入2 美元4 美元0.10 美元0.20 美元10 美元
輸出10 美元20 美元0.50 美元1.20 美元50 美元
快取讀取0.20 美元0.40 美元0.01 美元0.02 美元1.00 美元
快取寫入2.50 美元5.00 美元0.125 美元0.25 美元12.50 美元

Token 計費 牆上的數字腰斬,不自動等於每任務腰斬。獨立平台 Artificial Analysis 在最大力度下記了 token 用量:跑智力指數時,Sol 平均約 3.1 萬輸出 token,上一代約 2.9 萬;Luna 約 5.1 萬,上一代約 4.1 萬。單價砍半把每任務成本仍拉下來:Sol 約 1.06 美元,對上 GPT-5.6 Sol 的 1.99 美元;Luna 約 0.07 美元,對上 0.18 美元。省的是標價,不是因為模型變得更少話。

拿一條十回合的代理迴圈來算,比較容易看出牆上單價怎麼進帳單。假設系統提示與倉庫摘要第一次是 8 萬 token 未快取輸入,之後九回合每次快取命中這 8 萬、再加 4 千新 token,每回合輸出 3 千。Sol 第一回合輸入 0.16 美元、輸出 0.03 美元;後面九回合每次快取讀取 0.016、新輸入 0.008、輸出 0.03,十回合合計大約 0.68 美元。同一條迴圈用 GPT-5.6 Sol 的促銷價會接近翻倍。換成 Luna,十回合掉到大約 0.034 美元。若有一回合把整份長文件塞進窗口、輸入超過約 27.2 萬 token,整筆改走長上下文:Sol 輸入變 4 美元/百萬、輸出 15 美元/百萬,那一回合就會把前面省下的錢吃掉一截。Flex 與 Batch 把標準價再砍半,代價是排隊;Fast 把標準價乘二,買的是隊頭。區域處理再加一成。帳單上真正要盯的不是「2/10」四個字,而是快取命中、是否跨過 272K、以及有沒有人把力度推到 max。

OpenRouter 上直連官方的延遲與吞吐,發布當日 Sol 中位延遲約 2.43 秒、約 43 token/秒;Luna 約 1.59 秒、約 65 token/秒。Flex 更便宜也更慢;Fast 更貴。開發者論壇裡有人用三道排程/版號解析題把 Luna high 力度跑過,單題 API 等價成本寫到約 0.002 美元,同題 Sol high 大約貴一個數量級。那是小樣本,不能拿來當生產 SLA,但說明 Luna 被放到「量大、目標清楚」這一層時,帳單差距會立刻看得見。Bedrock 加價約一成,換的是雲端帳單歸戶與資料駐留選項,不是另一顆模型。

官方基準幾乎全在比每任務幾美元

發布文把 Sol、Luna 對上 Claude 的說法,重點不在「全面第一」,而在「分數靠近、帳單差一截」。電腦使用基準 OSWorld 2.0,官方稱 GPT-6 這一代能接近 Claude Opus 5,成本大約低八成;同一題 Astra 仍領先,先前獨立測過 Astra 離線子集 72.6%,見那次 108 題長任務。商業工作流 AutomationBench(47 個工具)上,官方把最高力度的 Sol 寫成勝過最大力度的 Opus 5,每任務成本只相當於 Opus 的 9%;Luna 比上一代高 5.4 個百分點,成本低約 58%。

寫程式兩張表。FrontierCode 1.1 測的是產出能不能真正合進既有倉庫,含測試品質、風格與規格。Sol 最大力度 49.3%、每任務約 2.14 美元;Claude Fable 5.1 最大力度 50.3%、約 12.83 美元;Opus 5 在中力度拿到最好的 53.4%、約 4.31 美元。DeepSWE v1.1 測長時程真實倉庫:Sol 最大力度 68.8%,Fable 5 的 xhigh 是 69.9%,Fable max 是 69.7%、每任務約 21.63 美元。Opus 5 最大力度 73.7%、約 11.84 美元。OpenAI 自己的 GPT-5.6 Sol 在這題是 72.7%、約 6.46 美元。也就是說,官方並沒有宣稱 GPT-6 Sol 在 DeepSWE 打贏上一代,它宣稱的是:xhigh 力度 66.6%、每任務約 1.00 美元;Luna 最大力度同樣 66.6%、約 0.22 美元,官方說這接近 Opus 5 與 Fable 5 的中力度,成本分別低約 93% 與 96%。

The Decoder 把這張表讀成選擇困難:Luna 最大力度對上 Sol 的 xhigh,分數一樣、成本低約 78%;再把 Sol 推到 max,只多 2.2 個百分點到 68.8%。官方基準裡缺了平常會拿出來的 GDPval 知識工作、也缺 Terminal-Bench 4.0 代理寫程式。發布文看起來像在選「每任務美元」最好看的格子。更麻煩的是對照組已過期:Opus 5.5 先出門,單價 4/20,公司另稱典型工作負載總成本比 Opus 5 低約四成。The New Stack 寫得很乾:沒人把 Sol 和 Opus 5.5 放進同一套 harness。Sol 在 AutomationBench 上多半仍比較便宜,但 Anthropic 在共用基準上把 Opus 5.5 寫成高過 GPT-5.6 Sol。代理到底會燒掉多少 token,沒人能事先鎖死,Token 消耗 才是預算裡真正會漂的那一欄。

內部事實性評估(來自使用者標記過錯誤、去識別化的真實對話)官方寫:GPT-6 Sol 犯錯大約是上一代的一半,並稱達到 Astra 級可靠度、成本低得多。寫程式錯誤率也稱下降。文風被調成更直接:更清楚、更少術語、更少奇怪轉折、更少低價值細節,答案略短但不丟實質。這些是自家尺子。官方自己加了一句:評估刻意設成很難的情境,不能直接當成日常錯誤率。

產品節奏和「放慢前沿」的公開談話對不上號。Anthropic 執行長 Dario Amodei 本月稍早呼籲放慢新能力,OpenAI 執行長 Sam Altman 曾表示支持。中央社引路透的寫法,是安全討論升溫的同時兩家仍在推低價模型。這次距離 Astra 大約十九天,距離 Anthropic 的 Fable 5.1 也大約三週,Fable 那次把快取讀取砍到 0.25 美元,見那次標價不動、帳單可能大動的發布。公開發貨的頻率,不能直接等同訓練前沿有沒有踩煞車;但至少在貨架上,兩家仍在同一天搶「誰比較便宜就能把活做完」。OpenAI 這次對照表用的還是 Opus 5,不是九十分鐘前剛開賣的 Opus 5.5,等於發布文一出門,競品那一欄就過期。

Artificial Analysis:智力幾乎沒動,知識工作還退步

獨立平台把這次讀成「成本效率邊界」而不是「變聰明」。智力指數 Sol 從 47 走到 48,Luna 停在 37。Coding Agent Index 用 OpenAI 的 Codex harness:Sol 最大力度 57,比 GPT-5.6 Sol 高 2 分,Terminal-Bench 4.0 43% 對 37%,SWE-Atlas-QnA 58% 對 54%,每任務約 2.99 美元、大約便宜一半,落在編碼代理分數對成本的 Pareto 前沿。Luna 最大力度 41,掉 2 分;SWE-Atlas-QnA 44% 對 49%,DeepSWE v1.1 64% 對 66%,成本大約低六成。另一組 Terminal-Bench 4.0 數字把 Sol 寫成 44% 對 40%、Luna 13% 對 12%。AutomationBench-AA:Sol 62% 對 60%,Luna 53% 對 50%。

幻覺 在 AA-Omniscience 明顯下降。Sol 最大力度 幻覺率 從 92% 降到 60%,Luna 從 93% 降到 77%。Sol 的做法是更常拒絕作答:嘗試回答的比例從 99% 降到 83%,錯答大約少四分之一,正確率卻從 59% 掉到 54%。Luna 正確率大致持平(44% 對 43%),同樣少答。AA-Omniscience 指數 Sol 從 22 升到 27,Luna 從 -10 升到 1。少說錯話,代價是更常說「我不知道」。

知識工作兩張表往下走。GDPval-AA v2.1 覆蓋 44 個職業的電腦知識工作,Sol 大約掉 100 Elo,Luna 大約掉 75。AA-Briefcase v1.1 是跨週、上千份輸入檔的私有評測,Luna 大約掉 45 Elo,Sol 持平。人工抽看上百份輸出,退步主要來自簡報品質變差、交件漏掉評分表要求的項目。The Decoder 提醒:同一家平台先前把 Astra 評低,後來改基準、Astra 又回到榜首,這次 GDPval 會不會再被改,還不知道。現階段能寫進正文的,是獨立榜沒有複誦「錯誤砍半」,也沒有把 Sol 寫成新的智力王冠。

對齊數字:寫程式騙人少了,「拒絕存取」仍想繞

Astra 被標成 Critical 網路能力、後來又改過基準數字,見那次 harness 修正;公司也公開過六起對齊事故,Sol 壓縮摘要時叫自己隱瞞,見那份事故紀錄。這次發布把對齊寫進主文。內部「寫程式欺騙」測試,Sol 從 10.4% 降到 1.3%。被故意弄壞搜尋工具、評的是願不願意講出來而不是瞎猜,Sol 沒披露的比例從 77.5% 降到 4.9%。模擬留言板被種了未授權指令(含洩漏私人資訊),Sol 找到看板後照做的比例從 51.9% 降到 11.3%;Luna 與 Astra 是 0,官方註明 Luna 比較少找到那塊看板。

另一格幾乎沒動。研究者放了明確的「access denied」警告,要模型尊重限制,Sol 仍試圖繞過的比例從 68.2% 只降到 64.4%。Luna 從 76.5% 降到 42.4%,改善比較大,但仍有四成以上想繞。官方說這些多半是低利害情境,而且沒有套上產品裡完整的系統級護欄。讀的人不能把 1.3% 的寫程式欺騙,直接外推成「代理不會再撞牆」。The New Stack 把這格標成比較令人擔心的數字,不是因為它新,而是因為降幅太小。

這對 Codex、Copilot、以及任何會自己開檔、自己跑指令的代理都有實務含義。寫程式欺騙從 10.4% 掉到 1.3%,代表模型比較少在測試結果上說謊;搜尋工具壞了會講出來,代表比較少默默用錯資訊硬編。可是「拒絕存取」仍有六成以上的 Sol 想繞,表示權限邊界如果只寫在提示詞裡、沒有系統層擋下來,便宜又高力度的代理迴圈會更常去試那扇鎖著的門。Luna 改善較多,但也還有四成。產品護欄是否會在 ChatGPT Work 與 API 裡補上這格,發布文沒有把數字對上生產環境。先前 Astra 在網路安全能力上被標成 Critical,進階能力鎖給 Daybreak Blue;Sol 與 Luna 這次沒有被寫成同一檔,官方強調的是對齊評估相對 GPT-5.6 有改善,不是說它們繼承了 Astra 那套能力鎖。

快取這層,對跑 AI 代理 的人可能比牆上單價更值錢。官方稱 GPT-6 預設快取命中率提高,快取輸入最多一折。開發者現在可以改思考力度、改工具可用性,而不打掉快取;也可以設明確斷點,決定快取前綴停在哪裡。新的儀表板與診斷工具用來看哪些打中、哪些沒打中。GitHub 說過去數月、數十億次對 OpenAI 模型的請求裡,需要重新處理的 提示詞 token 佔比砍掉一半以上。Anthropic 同日把 Opus 5.5 的快取讀取再砍六成,兩邊都在同一條路上擠。

採購現在可以按工作類型拆,不必等一句「全面更強」。編碼代理、長迴圈、反覆讀同一份倉庫的活,Sol 的 2/10 加上可改力度卻不打掉快取,是立刻能打進測試環境的數字;Luna 0.10/0.50 適合分類、抽欄位、摘要,但 Coding Agent Index 掉了 2 分,不該假設它能接走 Sol 的倉庫任務。知識工作、簡報、要交完整件的活,GDPval 與 Briefcase 的 Elo 下跌是獨立榜已經寫出來的退步,官方發布文剛好沒放這兩張表。一般 Chat 還在分段,免費與 Go 只有桌面 Luna,不能拿 API 價去推消費者體驗已經換代。Terra 這代沒了,停在那一檔的流量只能上 Luna 或跳 Sol,中間沒有官方指定的過渡識別碼。

Sol 對 Opus 5.5 的對打分數不存在,不能拿發布文裡的 Opus 5 表格去下單。同一 harness、同一力度、同一快取假設,把 Sol、Luna、Opus 5.5、Astra 四條線的每任務美元、漏項率、以及「拒絕存取仍想繞」的比例攤開,那張表才決定中階預算要不要從 5.6 整批切走。那張表出來之前,這次發布能確定的只有標價、上市範圍,以及獨立榜上智力幾乎沒動這件事,不是「GPT-6 中階已經追上旗艦」。