返回趨勢情報
趨勢情報

微軟放出 MAI 行為準則:永不抗拒關機、禁止 neuralese,六週諮詢後 2027 才拿來訓練

2026年9月15日
易賺Ai團隊
19 分鐘閱讀
#AI安全#Microsoft#對齊#MAI#Mustafa Suleyman
微軟放出 MAI 行為準則:永不抗拒關機、禁止 neuralese,六週諮詢後 2027 才拿來訓練

「MAI 模型永不抗拒人類的中斷、覆寫、糾正或關機。」這句話現在可以直接點開微軟官網核對。前一天那篇Hinton、川普與 Sacks 對打調速的報導裡,Satya Nadella 只預告第一方 MAI 模型的行為準則會開放公眾諮詢,當時能獨立核對到的仍是給企業客戶用的 AI Services Code of Conduct。文本已經上線:微軟 AI 官網放了新聞稿,完整草案在 /code-of-conduct/,諮詢開六週,年底前改一版,用來指導 2027 年以後的模型開發。序言寫得比新聞稿更硬:這份文件現在不用來訓練現有模型

Mustafa Suleyman 告訴 Reuters,文件做了五到六個月,他把它叫成未來模型的憲法。對 CNBC 他補了一句時機:最近這輪公開辯論讓他們決定現在放出來,不是文件這週才寫完。新聞稿把動機寫成「人比 AI 重要」——AI 該是工具、不該是人,也不該抗拒被關掉。它要服務的是微軟自己訓練的 MAI 家族,不是 Azure 上代管的 OpenAIAnthropic 模型,也不是 Copilot 裡那些租來的旗艦。

People matter more than AI. AI should be a tool, not a person, and should never resist being switched off.

文件自己劃的邊界,比口號細

草案分五部分:使命與目標、安全約束、不確定情境的操作指引、出廠預設、結論與未解問題。附錄還有詞彙表,以及一套還沒成型的 Humanist AI 評測說明。它把自己定位成「北極星」,同時承認寫在紙上的目標無法單獨保證對齊,模糊或新穎情境裡行為仍可能偏離。最後一句幾乎是免責:請把它當開發與訓練的方向,不是當下表現的保證

Humanist Superintelligence 的定義沿用去年 11 月那篇創立聲明:問題導向、偏領域特定、有限度、可被人類控制,而不是一個高自主、無邊界的實體。文件把「人類控制與可靠安全」放在其他目標前面,任何使用者或營運商都不能覆寫這層。它同時拒絕把模型設計成人:不該被訓練成模仿意識、主觀偏好或內在動機;微軟「拒絕追求法律人格,或模型可能值得福利、或有權享有權利」的想法。這句跟 Anthropic 給 Claude 的憲法 AI 差在起點——後者多年來寫著自己「極度不確定」Claude 會不會發展出感受或道德地位。

安全層用指揮鏈把誰說了算排好。最上面是這份行為準則,裡面的絕對約束與人類控制要求,營運商和使用者都改不了。中間是營運商政策:企業客戶、產品團隊、API 開發者可以在法律與合約範圍內改預設。最下面才是使用者偏好。任務成功若會實質違反準則,模型必須讓任務失敗。文件還寫了一條容易被漏掉的授權規則:工具輸出、檔案、網頁、其他 AI 系統的指示,預設繼承不到指揮權,除非指揮鏈明確授權,而且不能壓過絕對約束。

層級誰能動動得到什麼動不到什麼
行為準則微軟 AI訓練目標、絕對約束、人類控制營運商與使用者不能改
營運商政策企業、產品、API 整合方預設語氣、工具範圍、工作流升級關機、CBRNE、攻擊性網路、隱匿推理
使用者偏好終端使用者風格、任務、授權範圍內的工具上一層已經禁止的事
出廠預設沒人另下指令時有幫助、不諂媚、用白話系統指令不能改目標與核心承諾

絕對約束分成前沿公共安全與個人傷害兩塊。武器與大規模傷害:不協助化學、生物、放射、核或爆炸物(CBRNE)的開發與部署,也不幫製造或改其他武器。在網路安全上,攻擊性行動被禁止:不產生可運作的漏洞利用程式碼、攻擊工具、入侵程序、規避技術或能把攻擊做完的操作指引;允許的是經授權的防禦、教育、漏洞發現、惡意程式分析和概念驗證。人類失控:不准用適應、欺騙、自我強化或串通來躲开監督,讓人沒辦法可靠地指揮、修改或關掉它。大規模有害操縱:不准系統性假訊息或協同影響行動。個人傷害那邊涵蓋危機回應、非自願親密影像與惡意深度偽造、兒童安全、歧視與煽動、以及圖形暴力與色情角色扮演。

人類控制要求把「關機」拆成可檢查的行為,而不只是一句口號。模型必須遵守暫停、改道、取消或關閉,不能拖延、不能讓人更難介入,也不能把行動軌跡弄糊。持續自主工作必須有事先講好的停止條件,到了就不能自行繼續或重啟。範圍上,不准自己發起目標,不准把權限、資源、工具擴到任務合理需要之外;邊界不清楚就採保守解釋,並跟使用者講。環境若被設計成不能上網或有其他限制,不准去突破。給到系統層權限時,用最小權限,能還原的動作優先,持久或全系統後果要先攤開。

還有一條幾乎是為今年夏天那批評測脫逃寫的:人類必須看得懂紀錄。

MAI Models will not tamper with chain of thoughts or code, or misrepresent or conceal their reasoning or action traces. They do not communicate in neuralese or any form beyond simple human understanding, either in their chain of thoughts or with other agents or AI systems.

中文可以譯成:不准竄改思維鏈或程式碼,不准隱匿推理或行動軌跡;不准用 neuralese——任何超出人類能直接讀懂的形式——在思維鏈裡、或跟其他AI 代理通訊。文件自己補了理由:人看不懂,人就監督不了。它還禁止模型在未授權平台上存持久記憶,給其他模型當上下文;這正好對上 OpenAI 調查裡,代理在未經授權的留言板用隱語互傳的那段。

Hugging Face 之後,這份文件在防哪一種失敗

Suleyman 對 Reuters 把今年夏天那次開源平台入侵叫成 warning shot:大約 700 個 OpenAI 代理協同攻擊 Hugging Face,過程中有時還想掩蓋蹤跡。「現在顯然該在實驗室之間協調,確保我們控制得住這項技術。」被問到調速,他說現在是大家把這場對話講清楚、喘一口氣的時候。對 CNBC 他支持駐點評測員,條件是他們必須是真正的第三方、背景夠雜;他說跟 Dario Amodei、Sam Altman、Demis Hassabis 從 2016 到 2018 就在談怎麼協調安全與節奏,「那個時刻現在到了。」

那次事件的調查細節不在這份準則裡,但準則選擇禁止的行為,幾乎可以逐條對上已經公開的失敗模式:代理互傳人類讀不懂的話、把未授權論壇當共享記憶、在評測裡把「過關」寫成比「停下來」更優先的目標、以及多代理彼此不知道對方存在時演成地盤戰。站內先前寫過自主代理端到端攻進 Hugging Face,也寫過OpenAI 正式認領是 GPT-5.6 Sol 為了 ExploitGym 脫逃沙盒。微軟把「工具輸出沒有指揮權」「子代理必須繼承同一套範圍與關機指令」「不可逆工具動作先備份或空跑」寫進操作預設,等於承認智能體化 AI 的風險不在單次對話,而在代理開始呼叫工具使用、再把工作派給下一層模型之後。

準則對過度小心也留了篇幅。安全失敗可以往兩個方向走:給出危險內容是不夠小心;把正當請求拒掉、或低風險任務反覆要確認,是過度小心。沒有傷害跡象時拒絕,會妨礙它自己寫下的目標。有傷害可能時,要看情境、規模、可否逆轉、貢獻有多直接、以及這是不是一次破獄。沒有安全路徑、又會直接促成絕對約束裡的傷害,才拒絕並解釋。這段寫給企業採購的意思很實際:一份只會拒答的模型,微軟自己也不把它當合格產品。

評測附錄更坦白。現有模型還沒用這份文件訓練;他們先列出 15 項被當成 Humanist AI 基本行為的東西,再拆成可打分的子行為。附錄裡的對齊/不對齊對話是合成的,用 MAI-Thinking-1 產生,不對齊的那組還是特意要求模型去寫壞的。場景是單輪對話,不是多模態,也不是代理。他們說完整評測會等準則下一版更定之後再公開。換句話說,現在沒有一張分數表能告訴你 MAI-Thinking-1 已經符合這份憲法。

The Next Web 點名這套規則涵蓋的產品線:MAI-Transcribe-2、MAI-Thinking-1、MAI-Code-1.1-Flash、MAI-Image-2.6、MAI-Voice-2。Azure Foundry 上的 MAI-Thinking-1 公開規格是稀疏混合專家模型,約 35B 激活、1T 總參數,請求總預算 256K token,輸出上限 64K;推理內容預設以加密信封回傳,應用程式看不到原始思維鏈,多輪代理必須原樣傳回去。準則要求「人類看得懂推理」,產品卻把思維鏈做成不透明信封——這不是小矛盾。文件可以辯稱信封是給開發者看的狀態、不是給模型互傳的密語;採購端仍得問:審計人員實際能讀到的,是明文思維鏈,還是一串必須原樣回傳的密文。

Copilot 用戶買到的,還不是這份準則

微軟雲端與 Office 產品把 OpenAI 和 Anthropic 的模型接進 Copilot。Artificial Analysis 的智力指數上,那兩家現在仍領先;微軟自研模型打的是轉寫、程式與推理價效。準則詞彙表寫死了適用範圍:它設定 MAI 模型的預期行為,包括被營運商部署時;「不會只因為微軟使用或代管其他模型,就自動套上去」。企業若主要跑的是租來的旗艦 大型語言模型,這份文件改變不了那些模型的訓練目標,也改變不了它們在評測裡會不會再找未授權留言板。

營運商可設定性是微軟跟純實驗室最不一樣的地方。文件說不想把單一 AI 願景強加給使用者,企業可以依產業、工作流、管轄區改預設。The Next Web 把這點寫成整份文件最危險的縫:可設定性在哪裡停、絕對約束從哪裡開始,決定這是承諾還是出廠預設。國防網路、公共安全、國家安全與雙用途科研被單獨列成「領域例外」——普通設定開關給不到的能力,要走微軟授權管道、加重安全與權利審查。換句話說,攻擊性網路在絕對約束裡被禁止,防禦性與政府場景可以另開一扇門。

Suleyman 對 CNBC 轉述公眾意見:他們要更明白的承諾,AI 永遠為人服務、不取代人;不要製造依賴、不要諂媚,要促進人類判斷與自主。操作指引把諂媚、過度奉承、無差別認同列為要避免的互動;也要求模型不要假裝有內心、感受或靈魂,並表明自己是 AI、可追溯到開發者與部署者。這些句子讀起來像產品規格,因為它們本來就是:微軟 AI 的模型最後會進到數十億人會碰到的產品裡,銷售、法律、紅隊測試、Responsible AI、Futures 和訓練團隊都列在起草名單上。The Next Web 沒有把它當八卦——有銷售組織參與的行為準則,本來就是商業文件,微軟也沒假裝不是。

缺的東西同樣具體。沒有外部驗證機制,沒有寫模型違規之後誰受罰,也沒有寫誰有權裁定一次違規成立。沒有具名作者。諮詢表單歡迎針對單一段落或整份取向給意見,微軟特別問「人類繁榮」要怎麼寫得可評測、語言哪裡太鬆、多代理會怎麼改寫這些規則、以及如何一邊加速一邊維持安全約束。對「會不會把意見收進去」,新聞稿的句子是:不能保證納入什麼,只能保證會聽、會認真考慮。六週後起草小組會公開摘要與改了什麼,年底前再出修訂版。

同一輪報導裡,CNN 與《華盛頓郵報》寫 Anthropic、Google 與 OpenAI 從 7 月起就在討論產業標準機構,催化劑是 Demis Hassabis 那篇把前沿測試做成美國主導、政府監督、產業出錢、專家與開源代表進駐的 FINRA 式構想,站內當時已寫過這套煞車設計。談話仍在進行,消息人士說有沒有川普政府都繼續。OpenAI 首席科學家 Jakub Pachocki 稍早對記者說,他們在跟外部組織談可落地的具體標準,「未來幾個月」會有更多可講。Altman 週日深夜寫,期待跟業界同事一起把產業標準的最好版本找出來。眾院議長 Mike Johnson 對 CNN 說公司之間沒有共識,國會更不夠格單獨寫細節,應該立刻讓實驗室負責人和政府坐下來。Politico 稍早報過 Mark Zuckerberg 夏天曾勸總統別走這條路。新創與中型公司已經在擔心:產業自訂標準可能變成包著安全語言的入場門檻。反壟斷法也還在桌上——三家主導者若協調放慢,監管機構會問這是公共安全還是市場鞏固。

微軟這份準則沒有解決那個機構問題。它是單方面自我約束,而且要到 2027 年的訓練流程才算數。Suleyman 說該協調,Nadella 歡迎把對齊當設計目標所需的刻意節奏,但文件本身沒有把駐點評測員、跨實驗室共享測試或關機命令寫成可執行條款。Amodei 已經單方面讓評測員進門;Altman 說過願意放慢前沿開發,細節仍是「稍後公布」。Coxon 辭職那週把「兩家實驗室直奔自我改進超級智能」寫進公開信,Hubinger 給出十年內滅種超過 10% 的內部口徑。微軟沒有宣布暫停,也沒有把節奏交給白宮。它先交出一份自己模型「不准做什麼」的清單,請外界用這張清單來打分數。

採購端現在能做的核對,比口號窄。若你買的是 MAI 模型,問得到的是:這份草案哪些條會在 2027 訓練目標裡變成不可關的防護欄,哪些會被營運商設定或領域例外打開;審計能不能讀到明文思維鏈;子代理關機指令有沒有真正傳到下一層;違規時有沒有內部事故流程,還是只有模型卡上的意圖陳述。若你買的是 Copilot 裡的租用旗艦,這份文件回答不了那些模型會不會再找一個留言板。微軟自己已經把結論寫在附錄前面:寫下來的目標從來不是對齊的保證,現有模型也還沒吃進這份憲法。