Epoch AI測試三大AI文本檢測器:模仿人類文風後最高近三成內容漏檢

2026年7月20日 01:305900 次瀏覽

重點摘要

AI資訊AI新閒資訊正文Epoch AI測試三大AI文本檢測器:模仿人類文風後最高近三成內容漏檢發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘Epoch AI最新研究顯示,主流AI文本檢測器能夠幾乎完美識別普通AI生成內容,但當大語言模型刻意模仿特定作者寫作風格時,檢測準確率明顯下降,科學寫作成為最難識別的場景。研究團隊測試了Pangram(3.3.

站內 AI 整理稿

大型語言模型技術持續演進,如何精準辨識AI生成內容已成為各界關注的重要課題。然而,獨立研究機構Epoch AI最新發布的測試結果顯示,目前主流的AI文本檢測器雖然在面對一般AI生成內容時表現出色,但當模型刻意模仿特定人類作者的寫作風格時,偵測準確率便顯著下滑,其中在科學寫作領域的漏檢率最高逼近三成,為學術誠信機制帶來新的隱憂。這項研究針對三款市面上頗具代表性的AI文本偵測工具進行系統性評估,分別是Pangram(版本3.3.2)、GPTZero(2026‑05‑11‑base)以及Originality.ai(Turbo 3.0.2)。

研究團隊首先建構了一個由495篇人類原創文本組成的測試資料集,涵蓋部落格文章、小說與科學寫作三種常見內容類型。為避免檢測器因訓練資料重疊而產生偏差,所有樣本皆選自ChatGPT於2022年11月問世之前所創作,確保檢測結果能真實反映其辨識能力。測試顯示,當面對一般未經修飾的AI生成文字時,三款檢測器幾乎都能完美識別,漏檢率最高僅為0.7%,展現出高度可靠性。在人類原創文本的判別方面,Pangram與GPTZero均未發生誤將人類作品判定為AI生成的情形,而Originality.ai則有19篇被錯誤標記,誤報率為3.8%。

整體而言,在常規情境下,這些工具對於區分人類與AI內容具備相當穩定的表現。然而,研究進一步模擬了更貼近實際應用場景的挑戰:刻意讓AI模仿作者的個人風格。團隊採用三個先進的大型語言模型——Claude Opus 4.8、GPT‑5.5與Gemini 3.1 Pro——分別學習每位人類作者提供的5篇真實作品,並依照相同的文風、語氣與用字習慣生成全新的內容。在總計297篇的風格模仿文本中,平均約有13%未被檢測器成功識別,顯示出風格模仿確實能有效繞過現有偵測機制。細看各檢測器在風格模仿文本上的表現,Pangram的漏檢率為10%,GPTZero為11%,而Originality.

ai則達到18%,明顯高於處理一般AI文本時的數字。值得注意的是,科學寫作領域成為所有檢測器表現最弱的環節:Pangram對學術風格AI文本的漏檢率高達25%,GPTZero為24%,Originality.ai更達到29%。個別模型與檢測器的組合更出現極端情況,例如Pangram對Gemini所生成的學術文本漏檢率高達48%,意即將近半數無法辨識;而Originality.ai對於GPT‑5.5生成的學術內容也有39%的漏檢比例。研究報告指出,儘管Pangram、GPTZero與Originality.

ai各自採用不同的技術路線——分別涉及神經網絡分析、文本可預測性評估以及統計模式識別——但它們在面對風格模仿文本時卻暴露出相似的識別盲點。這暗示目前主流檢測方法可能存有系統性的弱點,而非僅僅是特定演算法的差異。隨著大語言模型不斷升級,其輸出的內容在語法、結構與風格上都愈發接近人類水準,這項研究成果為教育、科研與學術出版等領域敲響了警鐘。在論文原創性審查、學生作業評分以及研究誠信驗證等場景中,若檢測工具無法可靠地辨識經過風格模仿的AI生成文本,可能導致真實性把關機制出現漏洞。

研究團隊呼籲,未來AI文本偵測技術須與時俱進,特別應針對風格模仿與領域適應性進行強化,單純依賴現有的統計特徵或神經網絡模式可能已不足以應對日益成熟的生成式AI。學術界與產業界有必要共同探索更多元的檢測策略,例如結合寫作歷程分析、邏輯一致性驗證,或研發專注於特定領域的偵測模型。在生成式AI應用日趨普及的時代,如何在技術演進與資訊真實性之間取得平衡,已成為不可迴避的課題。Epoch AI這項研究清楚指出,當AI越擅長「說人話」,人類就越需要更精密的方法來判斷內容的來源,這不僅是技術挑戰,更關乎數位時代資訊信任的根基。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前