評測漂移被量化
AI 模型評測分數長期以來被視為衡量模型能力的重要依據,無論是學術研究單位還是一般開發者,多半以排行榜上的數字作為挑選模型的參考基準。然而近期「評測漂移」這個現象在 AI 社群中引發愈來愈多討論,許多人開始質疑:這些分數是否真的穩定可靠?如今,有一位 Reddit 使用者嘗試以更系統性的方式回答這個問題,將模型評測在時間維度上的變動具體量化,為這項爭論提供了寶貴的數據基礎。根據這位 Reddit 作者發布的模型波動統計,研究總計分析了 31,352 個小時的資料分布,涵蓋範圍相當廣泛。
這項分析並非僅針對單一模型或少數幾次測試,而是長期、連續地追蹤模型評測結果的變化,試圖從大量時間序列資料中找出規律。這樣的研究規模,使得觀察結果具有一定的代表性,也讓「評測漂移」不再只是零星個案的抱怨,而是能夠被統計數據支持的真實現象。從統計結果來看,模型評測分數並非固定不變,而是在不同時間尺度下呈現明顯起伏。若是將觀察區間設定在單日以內,模型評分的波動幅度大約為 2.8 分。這個數字乍看之下不算太大,卻已經足以讓某些排名接近的模型互換位置,也意味著即便是在同一天之內,不同時間點進行的評測也可能得到不盡相同的結果。更值得注意的是跨日層級的變化。
根據這份統計,當比較區間從單日拉長到跨日層級時,波動幅度進一步擴大至 8.4 分。相較於單日內的波動,跨日波動幾乎是三倍之多。這顯示時間因素對評測結果的影響並非線性增加,而是隨著比較區間拉長而顯著放大,模型評測的穩定性因此備受考驗。在所有觀察到的案例中,Gemini 3.1 Flash Lite 的評測分數變化特別引人注目。數據顯示,這款模型的評測分數一度下滑 32%,跌幅相當劇烈。這個案例具體說明了即使是同一款模型,在不同的時間點進行評測,也可能得到差異極大的結果。而這樣的大幅波動,過去往往被歸因於模型更新、測試環境改變或資料集調整,現在則被這份統計數據明確標示為「評測漂移」的一環。
這項量化的意義在於,過去關於模型評測不穩定的討論,多半停留在個別開發者的主觀經驗描述。有些使用者可能曾經發現,前一天還排名領先的模型,隔天再測分數就下滑不少,卻難以判斷這是正常變動還是異常狀況。如今有了長時間跨度的統計資料,至少可以明確知道:評測結果本來就會波動,而且波動的幅度會隨著比較時間拉長而擴大。進一步來看,這份數據也對現行的模型評測方式提出隱含的挑戰。目前市面上許多排行榜都是以單次評測或短期間的平均分數來排名,但若評測本身存在如此明顯的時間變異,那麼單憑一次分數就斷言哪個模型比較優秀,可能過於輕率。尤其在分數差距小於 8.4 分的情況下,排名先後恐怕缺乏統計上的顯著意義。
對於開發者而言,這項發現同樣具有實務參考價值。在選擇模型時,若只參考某一時間點的分數,可能會因為評測漂移而做出不夠準確的判斷。更穩妥的做法,或許是參考多次評測的分布範圍,或是將評測時間點納入考量,而非直接將單一分數視為模型能力的絕對指標。當然,這份統計資料並未進一步解釋評測漂移背後的根本成因。究竟波動來自模型本身的行為變化,還是測試環境、隨機種子、硬體差異等外部因素,仍有待後續研究釐清。但至少可以確定的是,評測結果隨時間變動已經是普遍存在的現象,並非特定模型或特定測試的偶然問題。隨著 AI 模型迭代速度愈來愈快,評測機制的可信度也愈來愈受到關注。
評測漂移的量化,某種程度上像是為這項爭議畫出了一條可供參考的基準線:從今以後,人們在看待模型評測分數時,或許應該將其視為一個會浮動的範圍,而非固定的定值。這位 Reddit 作者的統計雖然只是民間自發性的研究,卻為整個 AI 社群重新思考評測標準提供了具體的討論起點。
Related
相關文章
不到四百美元還能自己動手訓練!Hugging Face 推出微型開源雙足機器人Microduck
Hugging Face 推出微型開源雙足機器人Microduck發布於AI新閒資訊時間 :Aug 31, 2026閱讀 :1分鐘Hugging Face 旗下開源機器人公司 Pollen Robotics 近日正式開源了一臺迷你雙足機器人——Microduck(微鴨)。
LAION開放千萬小時視頻
LAION 近日發布了一個名為 BVD 的開放影片資料集,內含超過 8000 萬段影片片段,總時長達到 1000 萬小時。這項資源將提供給學術界與開發者使用,有助於進一步推動多模態 AI 模型的訓練與研究。 根據官方說明,BVD 資料集在訓練效果上表現突出,與先前的 InternVid 資料集相比,使用 BVD 訓練的模型在相關基準測試中最高可提升 2.1 個百分點。這意味著更大規模、更多元的開放影片數據,能夠有效強化模型對動態場景的理解能力。

Claude開始訓練Claude!4美元一小時,跑贏150美元人類研究員
! 時薪4美元,幹贏時薪150美元的人類研究員。 在Anthropic最新發布的研究中,Claude自己查論文、提方案、造數據、訓練模型,一口氣攻克了10類AI安全問題。 部分任務上,它交出的方案甚至比28名人類安全研究員更好。 更刺激的是,較弱的Claude已經開始反向參與訓練更強的Claude。
WikiSkill沉澱經驗
在大型語言模型快速演進的同時,如何有效累積與复用執行經驗,已成為提升模型能力的關鍵課題。近期一項名為「WikiSkill」的技術路線受到關注,其核心概念是將模型在實際任務中的執行經驗,以條列式、結構化的方式寫入維基格式的知識庫中,讓技能不再停留在一次性嘗試,而是能反覆更新、持續被後續任務引用。這種作法強調從「做中學」的動態回饋,而非僅依賴靜態的訓練資料,為模型在面對新任務時提供更具依據的決策支援。