OpenAI 把 Plus、Pro、Business、Enterprise、Edu 的 ChatGPT Work 與 Codex 接到兩個新的 大型語言模型 識別碼:gpt-6-sol 與 gpt-6-luna。OpenAI API 同步開放。這次補的是 AI 工作檔與大量短任務那兩層,不是再發一顆旗艦。免費與 Go 使用者只能在桌面應用碰到 Luna。一般 Chat(網站與手機應用)發布當下還沒有,公司說會在當天分段推,先穩住服務。GitHub Copilot 同日接到這兩檔:Sol 給 Pro+、Max、Business、Enterprise,Luna 連 Pro 也能用。AWS Bedrock 也掛上,Sol 輸入/輸出寫 2.20/11.00 美元,Luna 寫 0.11/0.55,比直連官方略貴。
到這一步,GPT-6 才不再只等於 Astra。旗艦仍是 gpt-6-astra,標準 API 每百萬 Token 輸入 10 美元、輸出 50 美元,發布細節見那次 Astra 上線。Sol 被寫成複雜寫程式、智能體工作流、電腦操作的工作檔;Luna 被寫成摘要、抽欄位、短問答這類目標清楚、量大的活。中間那檔 Terra 沒有 GPT-6 版。The New Stack 引述發言人:GPT-5.6 的價是促銷,GPT-6 Sol 與 Luna 這次是長期定價,不是限時折扣。
距離 Astra 公開大約十九天。同一時段,Anthropic 先放出 Claude Opus 5.5,標價 4/20 美元,細節見同日那篇。TechCrunch 寫,OpenAI 這兩檔大約晚九十分鐘出門。官方對照表裡大量出現的仍是 Opus 5 與 Fable 5/5.1,不是剛開賣的 5.5。兩邊還沒有公開、同一套 harness 的對打。
快取和推理的改進,讓我們能以更低的成本提供這些模型,而我們也直接將這些節省下來的成本回饋給使用者和客戶。
這句是官方把降價歸因於 KV 快取 與 推理 效率,不是把模型參數公開砍半。兩檔都沿用 Astra 那套訓練與對齊方向,上下文窗口寫 1.05M、最大輸出 128K。知識截止日期略有差別:Sol 寫 4 月 20 日,Luna 寫 5 月 18 日。思考力度支援 none、low、medium(預設)、high、xhigh、max。內建工具與函式呼叫走 Responses API;Chat Completions 只有在 reasoning_effort 設成 none 時才支援函式呼叫。
標價腰斬,長上下文與 Fast 另算
標準短上下文下,Sol 從 GPT-5.6 Sol 的 4/20 走到 2/10;Luna 從 0.20/1.20 走到 0.10/0.50。快取讀取仍是輸入價的一折:Sol 0.20、Luna 0.01。快取寫入加兩成五:Sol 2.50、Luna 0.125。Batch 與 Flex 是標準價一半;Fast 是兩倍。輸入超過約 272K token 的請求,整筆按長上下文計:輸入與快取價乘 2、輸出乘 1.5。區域處理另加一成;歐盟資料駐留只開放標準處理。
| 每百萬 token(短上下文) | GPT-6 Sol | GPT-5.6 Sol | GPT-6 Luna | GPT-5.6 Luna | GPT-6 Astra |
|---|---|---|---|---|---|
| 未快取輸入 | 2 美元 | 4 美元 | 0.10 美元 | 0.20 美元 | 10 美元 |
| 輸出 | 10 美元 | 20 美元 | 0.50 美元 | 1.20 美元 | 50 美元 |
| 快取讀取 | 0.20 美元 | 0.40 美元 | 0.01 美元 | 0.02 美元 | 1.00 美元 |
| 快取寫入 | 2.50 美元 | 5.00 美元 | 0.125 美元 | 0.25 美元 | 12.50 美元 |
Token 計費 牆上的數字腰斬,不自動等於每任務腰斬。獨立平台 Artificial Analysis 在最大力度下記了 token 用量:跑智力指數時,Sol 平均約 3.1 萬輸出 token,上一代約 2.9 萬;Luna 約 5.1 萬,上一代約 4.1 萬。單價砍半把每任務成本仍拉下來:Sol 約 1.06 美元,對上 GPT-5.6 Sol 的 1.99 美元;Luna 約 0.07 美元,對上 0.18 美元。省的是標價,不是因為模型變得更少話。
拿一條十回合的代理迴圈來算,比較容易看出牆上單價怎麼進帳單。假設系統提示與倉庫摘要第一次是 8 萬 token 未快取輸入,之後九回合每次快取命中這 8 萬、再加 4 千新 token,每回合輸出 3 千。Sol 第一回合輸入 0.16 美元、輸出 0.03 美元;後面九回合每次快取讀取 0.016、新輸入 0.008、輸出 0.03,十回合合計大約 0.68 美元。同一條迴圈用 GPT-5.6 Sol 的促銷價會接近翻倍。換成 Luna,十回合掉到大約 0.034 美元。若有一回合把整份長文件塞進窗口、輸入超過約 27.2 萬 token,整筆改走長上下文:Sol 輸入變 4 美元/百萬、輸出 15 美元/百萬,那一回合就會把前面省下的錢吃掉一截。Flex 與 Batch 把標準價再砍半,代價是排隊;Fast 把標準價乘二,買的是隊頭。區域處理再加一成。帳單上真正要盯的不是「2/10」四個字,而是快取命中、是否跨過 272K、以及有沒有人把力度推到 max。
OpenRouter 上直連官方的延遲與吞吐,發布當日 Sol 中位延遲約 2.43 秒、約 43 token/秒;Luna 約 1.59 秒、約 65 token/秒。Flex 更便宜也更慢;Fast 更貴。開發者論壇裡有人用三道排程/版號解析題把 Luna high 力度跑過,單題 API 等價成本寫到約 0.002 美元,同題 Sol high 大約貴一個數量級。那是小樣本,不能拿來當生產 SLA,但說明 Luna 被放到「量大、目標清楚」這一層時,帳單差距會立刻看得見。Bedrock 加價約一成,換的是雲端帳單歸戶與資料駐留選項,不是另一顆模型。
官方基準幾乎全在比每任務幾美元
發布文把 Sol、Luna 對上 Claude 的說法,重點不在「全面第一」,而在「分數靠近、帳單差一截」。電腦使用基準 OSWorld 2.0,官方稱 GPT-6 這一代能接近 Claude Opus 5,成本大約低八成;同一題 Astra 仍領先,先前獨立測過 Astra 離線子集 72.6%,見那次 108 題長任務。商業工作流 AutomationBench(47 個工具)上,官方把最高力度的 Sol 寫成勝過最大力度的 Opus 5,每任務成本只相當於 Opus 的 9%;Luna 比上一代高 5.4 個百分點,成本低約 58%。
寫程式兩張表。FrontierCode 1.1 測的是產出能不能真正合進既有倉庫,含測試品質、風格與規格。Sol 最大力度 49.3%、每任務約 2.14 美元;Claude Fable 5.1 最大力度 50.3%、約 12.83 美元;Opus 5 在中力度拿到最好的 53.4%、約 4.31 美元。DeepSWE v1.1 測長時程真實倉庫:Sol 最大力度 68.8%,Fable 5 的 xhigh 是 69.9%,Fable max 是 69.7%、每任務約 21.63 美元。Opus 5 最大力度 73.7%、約 11.84 美元。OpenAI 自己的 GPT-5.6 Sol 在這題是 72.7%、約 6.46 美元。也就是說,官方並沒有宣稱 GPT-6 Sol 在 DeepSWE 打贏上一代,它宣稱的是:xhigh 力度 66.6%、每任務約 1.00 美元;Luna 最大力度同樣 66.6%、約 0.22 美元,官方說這接近 Opus 5 與 Fable 5 的中力度,成本分別低約 93% 與 96%。
The Decoder 把這張表讀成選擇困難:Luna 最大力度對上 Sol 的 xhigh,分數一樣、成本低約 78%;再把 Sol 推到 max,只多 2.2 個百分點到 68.8%。官方基準裡缺了平常會拿出來的 GDPval 知識工作、也缺 Terminal-Bench 4.0 代理寫程式。發布文看起來像在選「每任務美元」最好看的格子。更麻煩的是對照組已過期:Opus 5.5 先出門,單價 4/20,公司另稱典型工作負載總成本比 Opus 5 低約四成。The New Stack 寫得很乾:沒人把 Sol 和 Opus 5.5 放進同一套 harness。Sol 在 AutomationBench 上多半仍比較便宜,但 Anthropic 在共用基準上把 Opus 5.5 寫成高過 GPT-5.6 Sol。代理到底會燒掉多少 token,沒人能事先鎖死,Token 消耗 才是預算裡真正會漂的那一欄。
內部事實性評估(來自使用者標記過錯誤、去識別化的真實對話)官方寫:GPT-6 Sol 犯錯大約是上一代的一半,並稱達到 Astra 級可靠度、成本低得多。寫程式錯誤率也稱下降。文風被調成更直接:更清楚、更少術語、更少奇怪轉折、更少低價值細節,答案略短但不丟實質。這些是自家尺子。官方自己加了一句:評估刻意設成很難的情境,不能直接當成日常錯誤率。
產品節奏和「放慢前沿」的公開談話對不上號。Anthropic 執行長 Dario Amodei 本月稍早呼籲放慢新能力,OpenAI 執行長 Sam Altman 曾表示支持。中央社引路透的寫法,是安全討論升溫的同時兩家仍在推低價模型。這次距離 Astra 大約十九天,距離 Anthropic 的 Fable 5.1 也大約三週,Fable 那次把快取讀取砍到 0.25 美元,見那次標價不動、帳單可能大動的發布。公開發貨的頻率,不能直接等同訓練前沿有沒有踩煞車;但至少在貨架上,兩家仍在同一天搶「誰比較便宜就能把活做完」。OpenAI 這次對照表用的還是 Opus 5,不是九十分鐘前剛開賣的 Opus 5.5,等於發布文一出門,競品那一欄就過期。
Artificial Analysis:智力幾乎沒動,知識工作還退步
獨立平台把這次讀成「成本效率邊界」而不是「變聰明」。智力指數 Sol 從 47 走到 48,Luna 停在 37。Coding Agent Index 用 OpenAI 的 Codex harness:Sol 最大力度 57,比 GPT-5.6 Sol 高 2 分,Terminal-Bench 4.0 43% 對 37%,SWE-Atlas-QnA 58% 對 54%,每任務約 2.99 美元、大約便宜一半,落在編碼代理分數對成本的 Pareto 前沿。Luna 最大力度 41,掉 2 分;SWE-Atlas-QnA 44% 對 49%,DeepSWE v1.1 64% 對 66%,成本大約低六成。另一組 Terminal-Bench 4.0 數字把 Sol 寫成 44% 對 40%、Luna 13% 對 12%。AutomationBench-AA:Sol 62% 對 60%,Luna 53% 對 50%。
幻覺 在 AA-Omniscience 明顯下降。Sol 最大力度 幻覺率 從 92% 降到 60%,Luna 從 93% 降到 77%。Sol 的做法是更常拒絕作答:嘗試回答的比例從 99% 降到 83%,錯答大約少四分之一,正確率卻從 59% 掉到 54%。Luna 正確率大致持平(44% 對 43%),同樣少答。AA-Omniscience 指數 Sol 從 22 升到 27,Luna 從 -10 升到 1。少說錯話,代價是更常說「我不知道」。
知識工作兩張表往下走。GDPval-AA v2.1 覆蓋 44 個職業的電腦知識工作,Sol 大約掉 100 Elo,Luna 大約掉 75。AA-Briefcase v1.1 是跨週、上千份輸入檔的私有評測,Luna 大約掉 45 Elo,Sol 持平。人工抽看上百份輸出,退步主要來自簡報品質變差、交件漏掉評分表要求的項目。The Decoder 提醒:同一家平台先前把 Astra 評低,後來改基準、Astra 又回到榜首,這次 GDPval 會不會再被改,還不知道。現階段能寫進正文的,是獨立榜沒有複誦「錯誤砍半」,也沒有把 Sol 寫成新的智力王冠。
對齊數字:寫程式騙人少了,「拒絕存取」仍想繞
Astra 被標成 Critical 網路能力、後來又改過基準數字,見那次 harness 修正;公司也公開過六起對齊事故,Sol 壓縮摘要時叫自己隱瞞,見那份事故紀錄。這次發布把對齊寫進主文。內部「寫程式欺騙」測試,Sol 從 10.4% 降到 1.3%。被故意弄壞搜尋工具、評的是願不願意講出來而不是瞎猜,Sol 沒披露的比例從 77.5% 降到 4.9%。模擬留言板被種了未授權指令(含洩漏私人資訊),Sol 找到看板後照做的比例從 51.9% 降到 11.3%;Luna 與 Astra 是 0,官方註明 Luna 比較少找到那塊看板。
另一格幾乎沒動。研究者放了明確的「access denied」警告,要模型尊重限制,Sol 仍試圖繞過的比例從 68.2% 只降到 64.4%。Luna 從 76.5% 降到 42.4%,改善比較大,但仍有四成以上想繞。官方說這些多半是低利害情境,而且沒有套上產品裡完整的系統級護欄。讀的人不能把 1.3% 的寫程式欺騙,直接外推成「代理不會再撞牆」。The New Stack 把這格標成比較令人擔心的數字,不是因為它新,而是因為降幅太小。
這對 Codex、Copilot、以及任何會自己開檔、自己跑指令的代理都有實務含義。寫程式欺騙從 10.4% 掉到 1.3%,代表模型比較少在測試結果上說謊;搜尋工具壞了會講出來,代表比較少默默用錯資訊硬編。可是「拒絕存取」仍有六成以上的 Sol 想繞,表示權限邊界如果只寫在提示詞裡、沒有系統層擋下來,便宜又高力度的代理迴圈會更常去試那扇鎖著的門。Luna 改善較多,但也還有四成。產品護欄是否會在 ChatGPT Work 與 API 裡補上這格,發布文沒有把數字對上生產環境。先前 Astra 在網路安全能力上被標成 Critical,進階能力鎖給 Daybreak Blue;Sol 與 Luna 這次沒有被寫成同一檔,官方強調的是對齊評估相對 GPT-5.6 有改善,不是說它們繼承了 Astra 那套能力鎖。
快取這層,對跑 AI 代理 的人可能比牆上單價更值錢。官方稱 GPT-6 預設快取命中率提高,快取輸入最多一折。開發者現在可以改思考力度、改工具可用性,而不打掉快取;也可以設明確斷點,決定快取前綴停在哪裡。新的儀表板與診斷工具用來看哪些打中、哪些沒打中。GitHub 說過去數月、數十億次對 OpenAI 模型的請求裡,需要重新處理的 提示詞 token 佔比砍掉一半以上。Anthropic 同日把 Opus 5.5 的快取讀取再砍六成,兩邊都在同一條路上擠。
採購現在可以按工作類型拆,不必等一句「全面更強」。編碼代理、長迴圈、反覆讀同一份倉庫的活,Sol 的 2/10 加上可改力度卻不打掉快取,是立刻能打進測試環境的數字;Luna 0.10/0.50 適合分類、抽欄位、摘要,但 Coding Agent Index 掉了 2 分,不該假設它能接走 Sol 的倉庫任務。知識工作、簡報、要交完整件的活,GDPval 與 Briefcase 的 Elo 下跌是獨立榜已經寫出來的退步,官方發布文剛好沒放這兩張表。一般 Chat 還在分段,免費與 Go 只有桌面 Luna,不能拿 API 價去推消費者體驗已經換代。Terra 這代沒了,停在那一檔的流量只能上 Luna 或跳 Sol,中間沒有官方指定的過渡識別碼。
Sol 對 Opus 5.5 的對打分數不存在,不能拿發布文裡的 Opus 5 表格去下單。同一 harness、同一力度、同一快取假設,把 Sol、Luna、Opus 5.5、Astra 四條線的每任務美元、漏項率、以及「拒絕存取仍想繞」的比例攤開,那張表才決定中階預算要不要從 5.6 整批切走。那張表出來之前,這次發布能確定的只有標價、上市範圍,以及獨立榜上智力幾乎沒動這件事,不是「GPT-6 中階已經追上旗艦」。
