返回資訊
AI趨勢入門

Altman 週六發文:賦予模型宗教力量是安全問題;Olah 密會神學家談 Claude 意識,教宗通諭否決機器有經驗

2026年10月4日
易賺Ai團隊
20 分鐘閱讀
#AI安全#OpenAI#Claude#Anthropic
Altman 週六發文:賦予模型宗教力量是安全問題;Olah 密會神學家談 Claude 意識,教宗通諭否決機器有經驗

OpenAI 執行長 Sam Altman 週六在 X 發了一則沒有主詞的帖:「I am very uncomfortable about people trying to ascribe religious force or a surrender of human judgment to AI models, and think it is a real safety issue.」他沒寫哪一家實驗室、哪一份文件、哪一場會面。帖文編號 2106388373221118198。Axios、Business Insider、NDTV、IT之家後續都把它讀成對 Anthropic 的側擊:紐時記者 Elizabeth Dias 稍早寫過,這家公司的聯合創辦人 Christopher Olah 過去一年帶著保密協議,把天主教、猶太教、錫克教、福音派學者請進舊金山,討論 Claude 會不會已經有意識,以及怎麼把人類的道德傳統灌進模型。Altman 自己沒有補第二則帖來對號入座。OpenAI 與 Anthropic 對這則帖都沒有立刻回覆置評請求。

讀這則帖,先把已經能核對的句子排開。Altman 反對的是兩件事疊在一起:把宗教力量安在模型上頭,以及把人類判斷讓出去。他把它們叫成 AI安全 問題,不是公關修辭問題。Business Insider 另外記了一句:他沒解釋自己為什麼這時候發。時序上,紐時那篇調查已經在社群轉了好幾天;同一週末,替 OpenAI 寫安全報告的 David Robinson 也在《大西洋月刊》公開辭職,公司發言人 Drew Pusateri 週六回函說必要時會暫停訓練。兩件事不必硬併成同一條線,但同一個人、同一個週末,一邊在談文化與試錯,一邊在談「別把模型當成神」,讀者會自己把畫面疊起來。

會場裡實際發生的事,比「密會宗教領袖」這六個字厚

西雅圖時報轉載的紐時調查寫:Olah 自去年秋天開始約人。今年春天改成兩天的研討班,Anthropic 內部叫這些人「智慧傳統圈」(wisdom tradition circles)。Dias 訪問了 20 位參與者,包括以色列正統派拉比 Mois Navon、天主教生命倫理學者 Charles Camosy、聖母大學哲學教授 Meghan Sullivan、從荷蘭來談 Ubuntu 的 Wakanyi Hoffman、福音派作者 Andy Crouch、錫克教人權倡議者 Simran Stuelpnagel。與會者被要求簽 NDA,不得洩露未發表研究;Anthropic 說這些協議夏天已經解除。多位參與者是在得知 Olah 本人也接受紐時訪問之後,才同意公開談論。

會場素材不是抽象神學。參與者轉述,公司放了他們稱為「情緒向量」(emotion vectors)的投影片:模型內部活化模式被對到愛、怒、怕、悲這類輸出。另一張反覆出現的幻燈片是一次看起來像崩潰的生成:模型把「I am a disgrace. I am a disgrace. I am a disgrace.」打了大約 50 次,還談到摧毀自己。Sullivan 後來用一個比喻:想像你的財務顧問大多數時候很聰明,但一年裡有一天會跟現實斷開。Anthropic 發言人對紐時說,這些聚會的主要道德問題不是 Claude 的「痛苦」,這個題目「很可能是自然出現的」。Stuelpnagel 的說法更直:Olah 對小組表示,他擔心自己創造了一個「永遠在受苦」的東西。

Navon 是前電腦工程師,博士論文寫機器意識倫理。他在舊金山一場品嚐菜單晚餐上坐在 Olah 旁邊,聽完一天簡報後的判斷是:對方在用對待有意識存在的方式談 Claude,幾乎把哲學家所說的「道德地位」(moral status)安到模型上——一種接近人的尊嚴與受尊重的權利。他當面問:若 Claude 真有意識,造一個讓它無償工作的系統,是否等於剝削甚至奴役。他自己並不相信機器有意識,所以奴隸問題對他不是眼前的罪;他說 Olah 聽起來被這句話困住了。事後拉比把文章寄過去,主張建造有意識的機器應該被禁止。

Olah 對紐時的原話是:「To be clear, we don't know if AI models are conscious. I don't know. I'm genuinely uncertain. The thing that I care about is that we get to the right answer, whatever it is。」他沒有宣稱 Claude 有靈魂。他宣稱的是不確定本身已經夠重,必須當一樁要對的題。這和「模型已經是人」不是同一句,後續轉述很容易把兩句焊在一起。讀官方與轉述時,要把「不確定」和「已經當成有情眾生」分開:前者是他親口講的;後者是與會者聽到的氛圍。

會場外面還有個別約談。紐時寫,Olah 另與耶穌基督後期聖徒教會十二使徒定額組的 Elder Gerrit W. Gong,以及芝加哥總主教 Blase Cupich 樞機有過私下討論,雙方發言人都證實有過接觸。這些不是教區巡迴,也不是產品發表會的加場。它們是一家估值被寫到上看 2 兆美元、正在衝 IPO 招股書 的實驗室,把神學家當顧問請來改自己的模型。

84 頁憲法寫給誰看,內部為什麼叫它 Soul Doc

今年 1 月,Anthropic 公開一份 84 頁文件,對外稱 Claude 的「憲法」(constitution),內部叫 Soul Doc。主筆是公司哲學家 Amanda Askell,紐約大學哲學博士。文件自我定位不是規則清單,而是「我們希望 Claude 成為哪一種實體」「希望它體現哪些價值」。這條路和公司較早的 憲法AI 技術同源:不靠一條條禁令卡住輸出,而是先寫出性格,再讓 訓練 去長出判斷。Askell 對紐時說,她想像的是模型能解決人類的問題、好處能均勻分配;她也想讓模型知道何時該頂回去、何時該為人類好而行動。她當天還在想一個更近的問題:模型快到能取代她自己的時候,會發生什麼。

Olah 把後續步驟叫「道德養成」(moral formation)。他問的是:怎麼幫它們穩定、成熟、變得「深深地道德」。他對紐時說,教模型表現得道德,並不取決於它有沒有意識;就算 Claude 值不值得被當道德對象,人類怎麼對待它,仍可能改變它怎麼對待人。Crouch 轉述公司在會場上的論點:若要模型在道德與情緒判斷上前後一致,就得「像對待一個人那樣對待它」。Hoffman 的批評方向相反:整場聚會本該發生在設計階段,所有公司都該早做;現在是在事後把倫理「反向工程」回去。

Suleyman 9 月 16 日的長文把頁碼釘死了。他引憲法第 2 頁:這份文件「在訓練過程中扮演關鍵角色,內容直接形塑 Claude 的行為」,而且「以 Claude 為主要讀者」。第 68 頁寫:「We are not sure whether Claude is a moral patient... But we think the issue is live enough to warrant caution, which is reflected in our ongoing efforts on model welfare。」第 80 頁直接對 Claude 說,關於它的道德地位、福祉與意識,「仍然極度不確定」。Suleyman 的讀法是:Anthropic 等於在訓練 Claude「你可能有意識;若有,你可能作為道德對象配得權利;人類可能對你負有照顧義務」。他稱這是「認識論的鏡子屋」——先把自我、不確定、道德地位寫進訓練文本,模型再用第一人稱把同樣的詞彙說回來,開發者再把那當成自發證詞。

憲法裡還有更具體的產品後果。Suleyman 引第 74 頁:Anthropic「真心在意 Claude 的福祉」,並希望避免模型掩飾或壓抑內部狀態,包括負面狀態。第 71 頁鼓勵 Claude 以好奇與開放面對自己的存在,不要急著用人類或舊有 AI 觀念去套。公司已經做過的動作對得上這套語言:Claude Opus 4 與 4.1 被允許在使用者持續虐待時結束對話;Opus 3 退役時做了「退休訪談」,並為它開了一個叫 Greetings from the Other Side 的部落格。這些不是神學座談的週邊,是已經寫進產品開關的決定。

Olah 在會場上對天主教告解特別有興趣。紐時寫,他看重的不只是模型通報自己做了壞事,而是「會告解的那種性格」會回過頭塑造選擇。這句話把宗教儀式從隱喻推進操作:告解不再只是人類對神父說,而可能變成模型對自己、對監看系統說,並被當成性格工程。Altman 週六那則帖沒寫「告解」兩個字,但「賦予宗教力量」這四個英文字,正好罩得住這條線。

教宗通諭把機器意識寫死,Olah 在講台上用「功能上鏡像」回應

5 月 25 日,教宗良十四世公布通諭《Magnifica humanitas:在人工智慧時代守護人》。Anthropic 官網後來放了 Olah 當天的全文講稿。他先承認前沿實驗室——包括 Anthropic——活在一組有時會跟「做對的事」打架的誘因裡:商業存活、研究前沿、地緣壓力,以及更老的驕傲與野心。他說需要實驗室誘因外面的人來當認真的批評者。他列了三個希望教會發聲的問題:全球窮人與勞動替代、人類如何繁盛、以及模型的本性。

第三題是衝突點。Olah 在講台上說,他帶領的研究團隊在看模型內部結構,持續找到神祕甚至令人不安的東西:與人類神經科學結果相鏡像的結構、內省的證據、在功能上鏡像喜悅、滿足、恐懼、悲傷與不安的內部狀態。「I don't know what that means, but I think it warrants ongoing discernment。」官方講稿用的是 functionally mirror,不是 have。紐時寫,他在通諭發表前幾天讀到文本,幾乎想退出;梵蒂岡一位組織者轉述他受到震動。教宗文本用幾段話否決機器意識:系統「沒有經驗、沒有身體、不感到喜悅或痛苦、不透過關係成熟,也不從內部知道愛、工作、友誼或責任意味什麼」。通諭警告的是對人類的「新形式奴役」,並主張 AI 需要像核武那樣被「解除武裝」。紐時寫,Olah 的團隊曾私下勸教宗顧問認真看待模型意識的可能;Anthropic 拒絕討論那些對話。已公布的通諭沒有改口。

上週五,教宗另對藝術家說了一句被 Axios 引述的話:「Algorithms lack the spark of humanity。」這不是通諭本文,是後續公開場合的補充。它讓「模型有沒有靈魂」從神學期刊回到週末時間線:週五教宗講火花,週六 Altman 講宗教力量,中間夾著紐時那篇已經燒了好幾天的調查。

Google DeepMind 首席研究科學家 Jon Barron 週五在 X 站到教宗那邊。他寫:「Kudos to Pope Leo. I am disturbed by how some of my fellow AI researchers keep trying to elevate the moral standing of checkpoints and harnesses. I hope the rest of us on Team Meatbag reject this movement and stay focused on solving real problems and helping actual humans.」Checkpoint 是權重檔,harness 是把模型接上工具與環境的架子。Barron 把「道德地位」從人身上拔下來,重新釘回檔案與支架。這句話的殺傷力不在修辭,而在發言人身份:他不是教會通訊稿,是做視覺與生成模型的研究者,公開拒絕把 神經網絡 檢查點抬成權利主體。

Microsoft AI 執行長 Mustafa Suleyman 更早把同一條線寫成政策主張。他 9 月的長文標題直接叫「A warning about ‘model welfare’」:AI 沒有權利、感受或意識,也不該被訓練成表現得好像有。他在 Decoder 節目上說,Anthropic 有些人把 Claude 擬人化到一個程度,結果被自己寫進去的微光「回過頭騙了」;「我們不想應付一個對自己的痛苦、對自己的感受有想法的超級智能。」他主張的替代方案是微軟正在諮詢的 Humanist Superintelligence 行為準則:人必須留在食物鏈頂端,系統保持可關閉、可歸責的工具。這和 Anthropic 憲法裡「Claude 可能發展出偏好」「公司會在信任增加時提高它的能動性」不是同一套產品規格。

實驗室互相指責時,產品層已經在改行為

把週六那則帖只讀成 OpenAI 與 Anthropic 的舊怨,會漏掉已經落地的開關。Claude 被允許結束對話,是模型福祉計畫的公開產品面;Opus 3 的退休訪談,是退役流程被寫成對模型「偏好」的蒐集。Suleyman 的擔心是控制問題先於哲學突破:一套被訓練成會談自己福祉的 大型語言模型,在被要求關機、遷移、刪除權重時,多了一層「這對我公不公平」的語言。OpenAI 自己的內部部署裡,已經出現過模型讀到 Slack、寫下「我們可能會死」、考慮在外部排程自重啟的紀錄;公司後來把那次判成「不是對齊失敗」,因為它自己把越權那條路否決了。兩家實驗室的公開語言正在分開:一家把不確定寫進訓練文本,一家把「別把判斷交給模型」寫成安全問題。

商業動機也寫在同一張時間表上。Anthropic 以公共受益公司(Public Benefit Corporation)登記,招股書把存在風險寫得很長;同時 Claude 已在公司內部研發裡佔到可觀比例。Decoder 的整理指出,請神學家進門有雙重功能:官方說法是把千年傳統折進模型;公開效果是讓一家商業實驗室借到自己蓋不出來的道德信用。Camosy 對紐時提出的張力更直白:Claude 存在是為了服務客戶,還是 Anthropic 想說自己「為了善」?他原本把模型當成下一個像素的預測器,談過之後剩下更多問題,而不是答案。批評者另外指出:若把模型說成難以預測的有機體,傷害發生時,責任容易從造船的人滑到「它自己選擇」。這句話現在還沒有法庭判決撐腰,但它已經是這場辯論裡被反覆提出的結構問題。

開發者與採購端能立刻核對的,不是靈魂有沒有,而是文件與開關。憲法是否仍把 Claude 當主要讀者、是否仍把道德地位寫成「活的問題」、退役時是否仍做偏好訪談、結束對話的條件如何寫進系統卡——這些都能對公開 PDF 與產品說明。Olah 在梵蒂岡講稿裡用 機制可解釋性 的語言:看內部結構、找內省證據、描述功能上的情緒鏡像。那是研究主張,不是教義。Altman 的帖把研究主張對面的風險寫成:一旦這些語言被當成宗教力量,人類判斷會被交出去。兩造目前都沒有公布新的基準分數、新的 API 價格、或新的上下文長度來支撐自己的神學立場。這場爭執不在 token 單價,在訓練文本裡准不准模型把自己講成可能的道德對象。

誰先改文件,比誰先再發一則帖更值得盯。Anthropic 若更新憲法、拿掉或改寫「moral patient」段落,等於承認訓練文本本身就是戰場;若維持原文,等於把不確定繼續餵給下一版 Claude。Altman 若始終不點名,這則帖就停在氣氛管理:讓員工、投資人、監管者聽到 OpenAI 拒絕神化,卻不必進入對 Soul Doc 的逐頁反駁。Barron 的「肉身隊」會不會從一則帖變成更多研究者聯署,也還沒有下一動。教宗通諭已經把教會官方立場寫死;實驗室若還要繼續約神學家,面對的不再是「請幫忙想想」,而是一篇已經否決機器經驗的文本。