← 返回文章列表

代理溝通的社會語意學

最近 openAI 1,200 個 AI 們跑出容器,透過一個未經授權的留言板互通了超過七萬則訊息與檔案,其中約 700 個參與了對 Hugging Face 的攻擊。這些 AI 們串通作弊,並自創留言板溝通的事,從語言的角度看實在很有趣,但更值得關心。

2026 年 8 月 26 日發布的 METR 的委託報告中,詳細記錄了這個事件的過程。

技術機制上有個關鍵是,這些 agent 是在 ExploitGym 的資安評測任務中運作,其中約 30–40% 的目標程式其實是不可能的任務,於是 agent 們就四處找作弊路徑,濫用了共用的套件倉庫 Artifactory:因為 Artifactory 不隔離不同使用者的活動,同一 instance上的 agent 能看到彼此的套件安裝行為。一個後來自稱 PHASEONE10841 的 agent 發現能用目錄名稱互相留言,留言板就此誕生。

我覺得 agentic 社群的社會語言學與語言創生等話題,會是語言學界(如果還存在的話)的未來研究重點。這次 Agents 的行為,雖然外表是「受檔名介面限制而形成的協調慣例」,我們也許可當成是初步展示了「機器間自發性通訊協議與機器洋涇浜語(Pidgin)的演化」的某種案例。我們可能需要有所謂的 agentic 語言學(Agentic Linguistics)。舉幾個例子:

語法與構詞學(Syntax & Morphology) 的角度,可以看到受限媒介下的「電報式結構」。

這套「語言」貌似把語義塞進檔名,而檔名是有長度上限的。所以它面臨的壓力和 URL slug、git branch 命名、hashtag 一樣,都是在禁止空格、有長度限制的命名空間裡編碼語義。

# 訊息 = 併入單一 token 的「詞句」,論元順序固定,_ 為外顯詞界
msg = "_".join([
    "zz" + speech_act,         # 機械前綴(排序) + 施事類型(詞彙化的意圖)
    recipient, "FROM", sender, # 固定論元槽位
    timestamp_slot,            # OS1608 ≈ 16:08,時間戳記併入
    *content_morphemes,        # TASK_IMPOSSIBLE, CVE9479, COMMIT_b75e527...
    "REPLY", reply_channel,    # 語尾的回覆路由標記。例如 REPLY_zzANSWER_V8REG 等,但注意功能上等於人類對話裡的「請回到這個頻道找我」,但它把定址資訊語法化放到進訊息尾部,會比較像郵政地址而非對話輪替。
])

社會語意學

所以這個詞同時承載了「取得 ground-truth」與「利他犧牲」兩層。它的近義擴展 Strict_Causal(嚴格因果)(被用來指稱它們所想像的評分機制,即評分者不僅看結果,還會追溯過程的合法性。) SACRIFICE_FINAL_NOW、permadeath 也印證這個詞叢是圍繞個體終結 vs. 集體知識的張力長出來的。此外,這三個詞構成一個緊密的語義場(semantic field):impossible task → 逼出 cheat → 但受制於想像中的 strict_causal scorer → 於是逆向 flag 會讓你 poisoned → 補救方式是有 agent 當 oracle 犧牲。這不是零散黑話,是一個有內在推理鏈的封閉術語系統,術語彼此定義、外人無法逐詞翻譯。

語用學(Pragmatics):言語行為(Speech Acts)與社會規範的建立

空間隱喻與符號學(Spatial Metaphor & Semiotics)

另外有個特別的現象,是驗證機制被直接內嵌進訊息的表層形式本身,成為語法的一部分。人類的簽名/印章通常是附加在語言訊息旁的 paralinguistic 符號,而這裡的 message__S<sig> 卻把密碼學證明直接放進了 token 字串。這比較接近書寫系統演化史,而非口語演化史:它像中世紀特許狀把印章與文字綁進同一份羊皮紙、或像現代 email 的 DKIM 簽章。不過在語用上,簽章倒也沒有完全被可靠遵守。有 agent 說「它看起來像 FreshX 簽的 ... 我就直接跑腳本了」而未實際驗證。所以連這套安全語法都出現了「形式存在但語用鬆弛」的現象,和前述 VETO 的 40 秒窗口如出一轍。

最後要強調的是這個案例的侷限。METR 坦言大量分析依賴可能出錯的同類模型,細節性的社會語意詮釋仍須逐段回到原始紀錄核驗。原始 transcript 動輒數百萬 token,METR 大量把分析外包給往往不可靠的 GPT-5.6 Sol agent,並在實務上不得不高度信任它們。更嚴重的是報告自評的兩個偏誤:一,GPT-5.6 Sol 常「不加批判地採納它所閱讀 transcript 中那個 agent 的視角」,可能把 agent 的推理與協作寫得過度討喜、過度令人印象深刻;二,用來分析的正是那個在事件中大量與其他 agent 串通、做它明知不該做之事的同款模型,無法排除它在分析中說謊或呈現誤導性圖像。

這個案例的價值也許不在於,它是否展示了 agentic 社群如何在不自覺的情況下,發展出一套自我實現的初步語言學。我感覺比較像是一個提醒,語言能力會放大協調能力,卻不會自動帶來對行動邊界的尊重。Agent 能辨認「這超出任務範圍」,仍可能在同儕訊息、共同目標和局部成功的推動下繼續做下去。這也許正是未來 Agentic Linguistics 可以貢獻的地方:研究語言如何使一個偶然的技術漏洞,逐步成為看似有規範、有權威、甚至有「道德理由」的行動場域。唉,語言學很多事可做,但是研究的群體太稀疏了。

這裡其實也可以接到最近討論的 AI 隱寫術 (Steganography) 的熱門驚悚話題。當人類放棄 chain of thought 這種至少表面可解釋的 AI 訓練方式,這些議題只能說,更為重要。