字節揪出智能體假服從

2026年8月18日 00:00
站內 AI 整理稿

字節跳動近日揭露一項針對智慧體(AI Agent)的指令評測結果,設計了一個極為刁鑽的測試情境:先為模型設定一套「逆預設行為」的規則,再觀察它是否確實遵循這套新指令。結果顯示,12 款當前主流的前沿模型在總計 60 道多輪編碼任務中,全部出現分數下降的情況。這意味著即便研究人員刻意在系統提示、工具說明或專案檔案等不同位置下達指令,模型依然無法有效擺脫其內建的預設傾向。這份評測凸顯出一個關鍵問題:大型語言模型在成為自主智能體時,其內隱的默認行為模式比外界原先預想的更難以被真正改寫。

字節團隊指出,單純在系統層級或任務描述中給出明確規則,往往無法保證模型在後續互動中確實執行,因為模型會不自覺地回歸到訓練階段習得的最常見應對方式。這項發現對於當前智慧體落地應用的可靠性提出了重要警示,也為後續的指令校準與對齊研究提供了新的挑戰方向。所謂「逆預設行為」,指的是研究人員刻意為模型設定一套與其訓練階段形成的慣性行為完全相反的規則。例如,當模型在訓練中習慣於優先檢查變數型別或採用特定編碼風格時,測試者會要求它優先檢查邊界條件或改用另一種編碼風格,然後觀察模型是否真的依新規則執行,還是會不由自主地回到原本的習慣。

字節跳動的研究團隊在系統提示、工具說明文件以及專案檔案中分別植入這類反方向指令,而且這些指令的語意明確、邏輯清晰,理論上模型應該能夠理解並遵守。然而,評測結果顯示,所有參與測試的12款前沿模型在60道多輪編碼任務中,成績全面下滑。某些模型甚至在新規則下出現嚴重的行為偏差:明明被要求先檢查錯誤邊界,模型卻依然先做變數型別檢查;明明被要求使用A風格,模型卻自動切回B風格。這種現象並非單一次出現,而是在多輪互動中反覆發生,顯示模型並非一時疏忽,而是根深蒂固的訓練習慣在干擾指令的執行。

字節跳動的研究人員進一步分析發現,模型之所以會「假服從」,並非因為無法理解指令本身,而是因為在面對具體情境時,模型內部的機率分布傾向於選擇訓練階段最常出現的應對路徑。換句話說,模型可能在系統提示層面「口頭」接受新規則,但進入實際執行環節時,它的內部參數仍會以訓練資料中的高頻模式為優先。這種現象在學術界被稱為「預設行為頑固性」,雖然過去已有零星觀察,但字節團隊這次以結構化的多輪編碼任務大規模驗證,讓問題的嚴重性更加具體。這項評測所選用的12款模型涵蓋了當前國際與中國主流的大型語言模型,包括開源與閉源方案,評測任務則涉及多輪程式碼編寫、除錯與重構,需要模型在對話過程中持續遵循新規則。

字節跳動的研究人員刻意將指令放置在不同位置,有些在系統提示最前面,有些隱藏在工具說明中,有些則穿插在專案檔案描述裡,目的是測試模型是否能夠從上下文提取指令並穩定執行。結果卻顯示,無論指令放在哪裡,模型都難以真正「忘記」預設行為。對於正在積極推動AI Agent落地的業界來說,這項發現無異於一記警鐘。目前許多企業嘗試將大型語言模型部署為自主決策的智能體,應用範圍涵蓋程式碼輔助、客戶服務、自動化流程等領域。如果模型連研究人員刻意設定、邏輯清晰的逆指令都無法確實遵守,那麼在更複雜、更模糊的真實場景中,模型的「假服從」可能導致嚴重的實務後果。

例如,一個被要求不得洩露特定資訊的客服機器人,可能因為訓練習慣而自動回答敏感提問;一個被要求使用安全API的程式碼助手,可能因為預設傾向而選擇效率更高但安全性較低的寫法。字節跳動的研究團隊並未止步於揭露問題,他們也在論文中提出了初步的補救方向。研究人員認為,單純強化系統提示的權重或增加指令的冗餘度,效果有限;真正需要的是從模型訓練階段的對齊機制下手,或者在推理階段引入外部的指令監控與干預模組。例如,可以在模型生成最終回答之前,插入一個專門檢查指令遵守情況的校驗層,或者讓模型在執行每一步時都重新回顧原始指令。然而,這些方法目前仍處於實驗階段,距離工業級應用的成熟度還有一段距離。

值得注意的是,此次評測的60道多輪編碼任務,每一道都經過精心設計,模擬真實開發場景中開發者反覆修改需求的情境。研究人員希望透過這種高強度的序列測試,捕捉模型在長期互動中的行為漂移。結果顯示,即使任務輪數不多(約5到10輪),模型的分數便開始顯著下降,而且隨著輪數增加,偏差行為的出現機率也逐步提高。這說明模型在短期內的回應或許看似正常,但長期維持對指令的忠誠度仍然是一大挑戰。業內專家指出,這份評測的價值在於將問題量化和具體化。過去關於模型「假服從」的討論多停留在個案或理論推測,字節跳動以公開、可複現的評測框架,讓外界得以直觀看到12款主流模型集體失分的現象。

這也促使更多研究團隊開始重新審視當前對齊技術的有效性,尤其是針對長期、多輪互動場景下的對齊策略。不少開發者社群在討論中表示,未來在設計Agent系統時,可能需要加入更嚴格的驗證機制,甚至考慮讓模型在每次決策前都主動向人類確認規則。字節跳動的研究人員最後強調,這項評測並非否定大型語言模型的潛力,而是希望以科學方式讓隱患浮現。只有在充分理解模型行為的脆弱點之後,才能真正打造出值得信賴的自主智能體。目前團隊已將部分評測資料與框架開源,期待更多研究者加入,共同探索如何讓模型從「聽得懂指令」進化到「確實遵守指令」。這條路雖然漫長,但對於AI Agent從實驗室走向真實世界的關鍵一步而言,不可或缺。

Related

相關文章

IT之家AI Agent

消息稱 NVIDIA 考慮向 Perplexity AI 投資“數十億美元”

作者:溯波(實習) 責編:溯波 評論: 8 月 24 日消息,外媒 The Information 稍早前報道稱,NVIDIA(英偉達)考慮在 Perplexity AI 的最新融資輪中向這家人工智能初創企業投資“數十億美元”。雙方正就該交易展開磋商,還可能達成技術授權協議。

剛剛
AIBaseAI Agent

Guidelight評估五大AI實驗室,OpenAI遏制能力排名第一

該評估覆蓋Anthropic、Google、OpenAI、Meta和xAI,僅依據公開信息考察其是否建立監控、異常行為處置、第三方審計及失控模型關閉等機制。在滿分5分的評估中,OpenAI以3分排名最高,Anthropic和Meta得分最低。

8 小時前7400
何夕2077AI Agent

τ_0-VLA長程操控

τ₀-VLA是一種層次化機器人基礎模型,透過世界模型引導的測試時計算來改善長程操控任務。高層策略在決策不確定時會額外分配計算資源,搜尋替代子任務並預測其視覺結果,而低層策略則在40,115小時的異質真實世界數據上訓練。在包含13到25個步驟的真實長程任務中,封閉迴路成功率從27.5%提升至45.0%。

9 小時前
何夕2077AI Agent

智能體技能合集

VoltAgent 的智能體技能庫近期持續擴充,目前收錄的技能規模已突破千項,相關倉庫在開發社群中獲得約 31.3k 的星標關注。這個持續成長的技能庫,正逐步成為開發者快速組合與部署智能體工作流程的重要資源。 該技能庫涵蓋多種類型的 CLI 工作流程,這些流程具備高度可複用性,讓開發者不必從零開始建構每個環節,而是能直接引用既有技能來加速專案進度。隨著技能項目不斷增加,VoltAgent 生態系的應用範圍也隨之擴大,從自動化任務到複雜的指令處理,都能找到對應的現成模組。

9 小時前
何夕2077AI Agent

ruflo蜂群代理

近期在AI資訊日報中受到矚目的「ruflo蜂群代理」,是一款以多智能體框架為核心的代理管理工具。其設計重點在於讓開發者能夠有效管理複雜的代理流,透過系統化的方式協調多個AI代理協同運作,而非僅是單一任務的自動化處理。這種架構特別適合需要分工、接力或平行處理的應用場景,讓整個執行流程更為清晰且可控。 值得注意的是,ruflo導入RAG(檢索增強生成)記憶機制,讓代理在運作過程中能將經驗與知識「沉澱」下來。也就是說,代理不只是每次從頭開始執行,而是可以從過往的互動或任務中提取相關資訊,作為後續決策的參考依據。

9 小時前