返回趨勢情報
趨勢情報

美軍特戰分析員用聊天機器人寫情報:中國船被標成核武零件,飛機已升空才攔下

US special operations analyst used a chatbot on a Chinese ship cargo report: nuclear-parts hallucination, aircraft already airborne

2026年9月20日
易賺Ai團隊
17 分鐘閱讀
#AI#五角大廈#軍用AI#幻覺#情報
美軍特戰分析員用聊天機器人寫情報:中國船被標成核武零件,飛機已升空才攔下

軍機已經在空中。武裝人員準備登上中東水域的一艘中國船。指揮鏈上那份看起來完全合格的情報寫著:這艘船在運核武計畫零件。CNN 引四名知情人士說,那份報告「完全錯誤」,而且「差點開了戰」。錯誤不是衛星照錯船,也不是攔截訊號解錯碼,而是美國特種作戰司令部一名分析員問了聊天機器人,機器人把貨單認錯了;分析員又讓同一套工具,把錯的結論排成軍方官員習慣讀的標準情報格式,再往上送。

Katie Bo Lillis 與 Zachary Cohen 這組 CNN 獨家在週末被 TechCrunch、Ars Technica、The Independent 與多家轉載接力核對。太平洋特種作戰司令部與五角大廈都沒有回應置評。CNN 寫明兩件至今空白:貨單實際裝了什麼,以及那套工具是市售產品,還是政府特製。一名熟悉軍情系統的前高官對 CNN 說,內部工具「大多只是塗了口紅的商用貨」。

兩次問同一套工具,第二次是排版

這件事能釘死的步驟很短。貨單相關情報最初來自夏威夷的太平洋特種作戰司令部。一名特戰分析員把那批材料丟進聊天機器人,要求它把開源情報與政府庫裡的機密訊號情報熔在一起。機器人得出致命結論:船上是核武計畫零件。分析員沒有停在螢幕上的答案,又讓AI把發現包裝成標準情報報告——那種軍官會當正式產品傳閱的格式——然後散出去。

第二次呼叫才是讓錯誤穿過指揮鏈的關鍵。第一次出錯還停在分析員自己的對話窗;第二次等於給幻覺蓋了官方章。消息源之一說,年輕分析員更常把這些工具當原生工作環境,也更少帶著懷疑往下點。另一名消息源把機制講得更乾:「AI 讓你更快到達一個壞主意。」

GovAI 研究員、美國陸軍退伍軍官 Jake Steckler 回 TechCrunch 時把風險釘在用武力的那幾類決策上:瞄準、情報分析、作戰規劃。他寫,服役人員必須理解大型語言模型內建的不確定性;這些決策有生死後果。Steckler 沒有主張把工具從部隊拿走,他主張加防護。優先把採用速度壓過驗證,最後只會讓基層不再相信系統,採用反而更慢。

項目目前能釘死的目前仍空白
時間與戰場春季、對伊戰爭期間、中東水域精確日期、船名、船籍港
情報內容報告指中國船運核武計畫零件;消息源稱「完全錯誤」貨單實際貨物;CNN 未能得知被誤認的材料是什麼
誰寫、誰傳特戰分析員;情報源頭來自太平洋特戰司令部分析員所屬具體單位、審核官姓名、有無第二名分析員副署
工具聊天機器人熔開源情報與機密訊號情報;再用同一套工具排成標準報告商用或軍用、哪一家模型、是否走 GenAI.mil
行動狀態武裝人員準備登船;軍機已在空中;執行前被攔下哪一支部隊、哪種機型、攔下的是哪一級指揮官
官方回應太平洋特戰司令部與五角大廈未回應 CNN有無內部調查、有無處分、有無修改作業規定

沒有船名、沒有模型名、沒有官方承認,不代表這則獨家能被讀成傳聞。四名消息源對齊的是同一條操作鏈:問模型、模型認錯貨、再讓模型寫成報告、報告被當真、部隊開始動。缺的是產品標籤與船隻身分,不是事件骨架。

一月要三百萬人手上都有模型,驗證標準還沒有一份

國防部長 Pete Hegseth 一月推出《Artificial Intelligence Acceleration Strategy》。他當時的講法是放開實驗、拆官僚障礙、把投資對準執行,確保美軍在軍事 AI 領先。策略備忘錄要求部門把 AI 交到約三百萬名文職與軍事人員手上,「在所有機密等級」。目標寫得很白:民主化實驗,讓美國領先的模型直接進部隊。Hegseth 另有一句被 Ars Technica 抓出來的技術信念:「AI 只會跟它拿到的資料一樣好,我們會確保資料在那裡。」

資料在那裡,恰好是這次近誤的前置條件。聊天機器人不是在真空裡編故事,它把開源貨單跟機密訊號情報熔在同一段上下文窗口裡,再輸出一份流暢、看起來像完成品的判斷。大型語言模型的訓練目標是下一個Token像不像人話,不是貨單條目跟出口管制清單能不能對得上。熔兩種來源並不會自動變成交叉驗證;它比較像把兩份不完整材料,壓成一句聽起來完整的句子。Ars Technica 提醒,自 2023 年「幻覺」成為劍橋詞典年度字以來,作者、記者、法官、醫生、警察都中過招;「不要幻覺」這類提示詞擋不住,有研究者認為大型語言模型幻覺可能根本去不掉。

CNN 的消息源把採用現況講成去中心化:不同單位用不同工具、不同命令、不同安全標準,沒有一套統一辦法去核對這些工具產出的資訊。可靠度因此隨單位而變。另一名熟悉現行政策的消息源說,AI 用於瞄準正在加速,「對於人在迴路裡如何避免平民傷亡或誤傷友軍,其實沒有真正的指導」。2023 年美國國務院《負責任軍事使用人工智慧與自主系統宣言》還寫過:負責任使用必須有人在迴路、有可究責的指揮鏈。三年後,近誤發生在情報寫作這一層——人確實在迴路裡,只是人把模型產出的句子,當成自己的成品蓋章。

這條線不是 2026 年才開始。稍早已有五角大廈把 ChatGPT 放進企業平台,以及軍用 AI 從實驗走向操作原則。三月那篇評估用機密資料訓練模型已經把門檻講清楚:一旦模型被允許看見機密庫,幻覺就不再只是公開網頁上的胡謅,而可能穿上密級外衣。這次近誤等於把那道門的後果,從採購討論搬到已經升空的飛機上。

GenAI.mil 半年從八萬人漲到一百五十萬,Claude 不在門裡

國防部 2025 年 12 月推出企業入口 GenAI.mil,第一個上架的是 Google Gemini for Government。五角大廈科技長 Emil Michael 六月在 Hudson Institute 說,上線時每天大約八萬人在用,規則不清楚、入口找不到;Gemini 上了非機密網路之後,每天使用者衝到一百五十萬,大約是三百五十萬名國防部人員的四成。他的說法是:這些人私底下本來就會用,工作場合沒有,放到眼前就會用。Ars Technica 另引國會場合:約一百五十萬名現役人員用過軍方生成式 AI 工具,連國會要求的報告都有模型代筆。

八月底,入口再加兩家。DefenseScoop 與 Fortune 寫,OpenAIChatGPT Mil 與 xAI 的 Grok for Government 通過 Impact Level 5,可處理非公開、敏感但非機密資料。ChatGPT Mil 被標成熟悉的商用體驗,對準規劃、政策、後勤、行政這類文件密集、非機密工作。Grok for Government 則被寫成深度推論、可切換的推理模式、可重複使用的 playbook。兩家稍早都拿到最高約兩億美元的國防合約;Google 與 Anthropic 當時也在同一批採購裡。Fortune 後續數字把 GenAI.mil 使用者寫到一百七十萬。

缺席的是 Claude。一月 Hegseth 公開點名「不讓你打仗」的模型,後來被指就是 Anthropic 要求不得用於自主武器與監控。三月已寫過兩條紅線讓五角大廈翻臉;八月舊金山法官再裁定黑名單違法,認定那是對憲法第一修正案的非法報復。Ars Technica 在這則近誤裡把這段採購史重新攤開:部隊現在手上的主流入口是 Gemini、ChatGPT 與 Grok,Claude 仍在門外。CNN 沒有指認這次用的是哪一家,任何把近誤自動掛到某一品牌頭上的讀法,都超出目前文本。

這組部署數字解釋了為什麼「人在迴路」擋不住這次。一百五十萬人每天把模型當文書加速器時,分析員用它熔貨單與訊號情報、再用它排版,看起來只是同一套工作習慣往上走一格。Hegseth 策略要的是三十天內把市面新模型交到使用者手上;CNN 消息源說的是,沒有人告訴這些使用者,產出要怎麼核對才算數。速度指標有人追,驗證指標沒人寫。

矽谷這週在吵 2030 會不會滅種,這艘船已經在春天差點被登

同一週,前沿實驗室的執行長還在為要不要一起放慢模型能力抬槓。Anthropic 的 Dario Amodei 要「Pace the Frontier」;黃仁勳在 Dreamforce 說加速與安全是假選擇,細節見黃仁勳說不需要新法。CBS 週末專訪再放出黃仁勳原話:2030 不是世界末日,「有 0% 機會」會是世界末日;「我們應該儘快往前,不管別人怎麼做」,但「永遠不該在產品沒準備好、不安全的時候出貨」。川普把末日論叫成騙局,理由是放慢只會讓中國超前。

CNN 自己把兩種風險拆開。華府這幾週被工程師與執行長的文明終結警告吸走注意力;中國船這件事指的是另一種、更近的失敗:人根據AI 或不準或誤導的資訊,做出災難性決定。滅種機率可以爭到 0% 或超過 10%;登錯一艘中國船不需要通用人工智慧,也不需要模型自己逃出沙盒。它需要的只是一份被蓋了標準格式的錯報告,加上一條已經習慣把模型當加速器的指揮鏈。OpenAI 同週公開的六起對齊事故,講的是訓練裡模型互相留字條、叫下一輪隱瞞,見OpenAI 六起對齊事故。軍情近誤連那一層都還沒走到:模型不必對分析員說謊,分析員自己把流暢的錯句送上去就夠了。

中國官方媒體這週批評 Amodei 用冷戰手法維護華府壟斷;美國情報首長則警告這項技術可能危及國安。兩國元首預定在華府見面,黃仁勳、Altman、Cook、Musk、Bezos、Pichai 都在國宴邀請名單上。任何把近誤讀成「該不該研發更強模型」的延伸,都偏了消息源實際指出的缺口。缺口在採用層:工具已經進三百萬人的工作桌,核對規則還沒進同一張桌子。

開源情報加機密訊號,正好踩中模型會編的那塊

把開源貨單跟機密訊號情報丟進同一則提示詞,表面像檢索加判斷,實際比較像強迫模型在缺塊的拼圖上畫出完整圖案。開源貨單常是港口、箱數、品名代號,本身就不完整;訊號情報往往是片段、時間錯位、需要分析員用其他來源補的材料。大型語言模型擅長的是補句子,不是標「我不知道」。兩份材料一旦同框,模型會用訓練裡看過的核武、禁運、中東航線敘事,把空隙填成聽起來最連貫的情節。連貫不是證據。

第二次呼叫把這個弱點放大。要求「寫成標準情報報告」等於要求語氣、章節、來源標記都長得像真的。軍官信任的是格式,不是對話窗裡的隨口回答。消息源說年輕分析員更不帶懷疑,講的就是這種格式信任:報告長得對,內容就被當成已經完成分析。Steckler 把後果寫在用武力的決策上,不是因為模型會扣扳機,而是因為扣扳機的人可能讀到一份已經被模型寫順的錯報告。

這也解釋了為什麼「人在迴路」這句口號在這次近誤裡幾乎沒有咬合力。人確實按了送出、人確實讓飛機升空前的某一級把報告翻出來重看,最後也確實攔下來了。攔下來靠的不是模型自己標不確定,而是有人在行動前多問了一句:這份東西是怎麼來的。那句話現在還不是作業規定,是運氣。

採購帳能寫到 IL5,作業帳還寫不出「怎麼核對貨單」

ChatGPT Mil 與 Grok for Government 通過 IL5,代表承辦單位把資料分級、把網路邊界、把日誌留存寫進授權包。授權包回答的是「能不能放進這張網」,不是「貨單品名能不能當登船依據」。Hegseth 一月要的三十天內上新模型,追的是版本落差;CNN 消息源說的沒有統一核對標準,追的是產出能不能當情報。兩本帳現在沒有對上。

企業採購裡,法務會要求模型輸出不能直接當合約條款;醫療場景會要求醫囑不能只靠對話窗。軍情場景若繼續把同一套對話習慣用在瞄準與登船,近誤不會停在這一艘沒有公開船名的船上。消息源已經說,這類幻覺在情報體系裡不是孤例,只是這一則走到了飛機升空。下一次若攔在更後面,缺口就不只是報告錯誤,而是交火與外交危機。

IL5 授權包證明模型進得了網,證明不了貨單進得了登船令。情報產品若仍允許「先問模型、再讓模型排版、再當正式報告」,指揮鏈核對的就會是語氣而不是貨艙。春季那次攔在飛機已升空之後,靠的是有人回頭問報告怎麼來的,不是模型自己舉手。下一次若沒有人多問這句,缺口就不在 2030 年的滅種辯論,而在已經寫進部隊日常的那兩次呼叫。