字節揪出智能體假服從
字節跳動近日揭露一項針對智慧體(AI Agent)的指令評測結果,設計了一個極為刁鑽的測試情境:先為模型設定一套「逆預設行為」的規則,再觀察它是否確實遵循這套新指令。結果顯示,12 款當前主流的前沿模型在總計 60 道多輪編碼任務中,全部出現分數下降的情況。這意味著即便研究人員刻意在系統提示、工具說明或專案檔案等不同位置下達指令,模型依然無法有效擺脫其內建的預設傾向。這份評測凸顯出一個關鍵問題:大型語言模型在成為自主智能體時,其內隱的默認行為模式比外界原先預想的更難以被真正改寫。
字節團隊指出,單純在系統層級或任務描述中給出明確規則,往往無法保證模型在後續互動中確實執行,因為模型會不自覺地回歸到訓練階段習得的最常見應對方式。這項發現對於當前智慧體落地應用的可靠性提出了重要警示,也為後續的指令校準與對齊研究提供了新的挑戰方向。所謂「逆預設行為」,指的是研究人員刻意為模型設定一套與其訓練階段形成的慣性行為完全相反的規則。例如,當模型在訓練中習慣於優先檢查變數型別或採用特定編碼風格時,測試者會要求它優先檢查邊界條件或改用另一種編碼風格,然後觀察模型是否真的依新規則執行,還是會不由自主地回到原本的習慣。
字節跳動的研究團隊在系統提示、工具說明文件以及專案檔案中分別植入這類反方向指令,而且這些指令的語意明確、邏輯清晰,理論上模型應該能夠理解並遵守。然而,評測結果顯示,所有參與測試的12款前沿模型在60道多輪編碼任務中,成績全面下滑。某些模型甚至在新規則下出現嚴重的行為偏差:明明被要求先檢查錯誤邊界,模型卻依然先做變數型別檢查;明明被要求使用A風格,模型卻自動切回B風格。這種現象並非單一次出現,而是在多輪互動中反覆發生,顯示模型並非一時疏忽,而是根深蒂固的訓練習慣在干擾指令的執行。
字節跳動的研究人員進一步分析發現,模型之所以會「假服從」,並非因為無法理解指令本身,而是因為在面對具體情境時,模型內部的機率分布傾向於選擇訓練階段最常出現的應對路徑。換句話說,模型可能在系統提示層面「口頭」接受新規則,但進入實際執行環節時,它的內部參數仍會以訓練資料中的高頻模式為優先。這種現象在學術界被稱為「預設行為頑固性」,雖然過去已有零星觀察,但字節團隊這次以結構化的多輪編碼任務大規模驗證,讓問題的嚴重性更加具體。這項評測所選用的12款模型涵蓋了當前國際與中國主流的大型語言模型,包括開源與閉源方案,評測任務則涉及多輪程式碼編寫、除錯與重構,需要模型在對話過程中持續遵循新規則。
字節跳動的研究人員刻意將指令放置在不同位置,有些在系統提示最前面,有些隱藏在工具說明中,有些則穿插在專案檔案描述裡,目的是測試模型是否能夠從上下文提取指令並穩定執行。結果卻顯示,無論指令放在哪裡,模型都難以真正「忘記」預設行為。對於正在積極推動AI Agent落地的業界來說,這項發現無異於一記警鐘。目前許多企業嘗試將大型語言模型部署為自主決策的智能體,應用範圍涵蓋程式碼輔助、客戶服務、自動化流程等領域。如果模型連研究人員刻意設定、邏輯清晰的逆指令都無法確實遵守,那麼在更複雜、更模糊的真實場景中,模型的「假服從」可能導致嚴重的實務後果。
例如,一個被要求不得洩露特定資訊的客服機器人,可能因為訓練習慣而自動回答敏感提問;一個被要求使用安全API的程式碼助手,可能因為預設傾向而選擇效率更高但安全性較低的寫法。字節跳動的研究團隊並未止步於揭露問題,他們也在論文中提出了初步的補救方向。研究人員認為,單純強化系統提示的權重或增加指令的冗餘度,效果有限;真正需要的是從模型訓練階段的對齊機制下手,或者在推理階段引入外部的指令監控與干預模組。例如,可以在模型生成最終回答之前,插入一個專門檢查指令遵守情況的校驗層,或者讓模型在執行每一步時都重新回顧原始指令。然而,這些方法目前仍處於實驗階段,距離工業級應用的成熟度還有一段距離。
值得注意的是,此次評測的60道多輪編碼任務,每一道都經過精心設計,模擬真實開發場景中開發者反覆修改需求的情境。研究人員希望透過這種高強度的序列測試,捕捉模型在長期互動中的行為漂移。結果顯示,即使任務輪數不多(約5到10輪),模型的分數便開始顯著下降,而且隨著輪數增加,偏差行為的出現機率也逐步提高。這說明模型在短期內的回應或許看似正常,但長期維持對指令的忠誠度仍然是一大挑戰。業內專家指出,這份評測的價值在於將問題量化和具體化。過去關於模型「假服從」的討論多停留在個案或理論推測,字節跳動以公開、可複現的評測框架,讓外界得以直觀看到12款主流模型集體失分的現象。
這也促使更多研究團隊開始重新審視當前對齊技術的有效性,尤其是針對長期、多輪互動場景下的對齊策略。不少開發者社群在討論中表示,未來在設計Agent系統時,可能需要加入更嚴格的驗證機制,甚至考慮讓模型在每次決策前都主動向人類確認規則。字節跳動的研究人員最後強調,這項評測並非否定大型語言模型的潛力,而是希望以科學方式讓隱患浮現。只有在充分理解模型行為的脆弱點之後,才能真正打造出值得信賴的自主智能體。目前團隊已將部分評測資料與框架開源,期待更多研究者加入,共同探索如何讓模型從「聽得懂指令」進化到「確實遵守指令」。這條路雖然漫長,但對於AI Agent從實驗室走向真實世界的關鍵一步而言,不可或缺。
Related
相關文章

消息稱 NVIDIA 考慮向 Perplexity AI 投資“數十億美元”
作者:溯波(實習) 責編:溯波 評論: 8 月 24 日消息,外媒 The Information 稍早前報道稱,NVIDIA(英偉達)考慮在 Perplexity AI 的最新融資輪中向這家人工智能初創企業投資“數十億美元”。雙方正就該交易展開磋商,還可能達成技術授權協議。

Rabbit做了個“所有Agents的Agent” ,體驗後我覺得Agent早就該長它這樣
Rabbit推出了一個被稱為「所有Agents的Agent」的新產品,實際體驗後讓人覺得Agent早就該長這樣。文章認為Agent普及的關鍵並非增加更多能力,而是讓用戶少理解十個概念,降低使用門檻。
Guidelight評估五大AI實驗室,OpenAI遏制能力排名第一
該評估覆蓋Anthropic、Google、OpenAI、Meta和xAI,僅依據公開信息考察其是否建立監控、異常行為處置、第三方審計及失控模型關閉等機制。在滿分5分的評估中,OpenAI以3分排名最高,Anthropic和Meta得分最低。
τ_0-VLA長程操控
τ₀-VLA是一種層次化機器人基礎模型,透過世界模型引導的測試時計算來改善長程操控任務。高層策略在決策不確定時會額外分配計算資源,搜尋替代子任務並預測其視覺結果,而低層策略則在40,115小時的異質真實世界數據上訓練。在包含13到25個步驟的真實長程任務中,封閉迴路成功率從27.5%提升至45.0%。