Epoch AI測試三大AI文本檢測器:模仿人類文風後最高近三成內容漏檢

2026年7月20日 01:305900 次瀏覽

重點摘要

AI資訊AI新閒資訊正文Epoch AI測試三大AI文本檢測器:模仿人類文風後最高近三成內容漏檢發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘Epoch AI最新研究顯示,主流AI文本檢測器能夠幾乎完美識別普通AI生成內容,但當大語言模型刻意模仿特定作者寫作風格時,檢測準確率明顯下降,科學寫作成為最難識別的場景。研究團隊測試了Pangram(3.3.

站內 AI 整理稿

大型語言模型技術持續演進,如何精準辨識AI生成內容已成為各界關注的重要課題。然而,獨立研究機構Epoch AI最新發布的測試結果顯示,目前主流的AI文本檢測器雖然在面對一般AI生成內容時表現出色,但當模型刻意模仿特定人類作者的寫作風格時,偵測準確率便顯著下滑,其中在科學寫作領域的漏檢率最高逼近三成,為學術誠信機制帶來新的隱憂。 這項研究針對三款市面上頗具代表性的AI文本偵測工具進行系統性評估,分別是Pangram(版本3.3.2)、GPTZero(2026‑05‑11‑base)以及Originality.ai(Turbo 3.0.2)。研究團隊首先建構了一個由495篇人類原創文本組成的測試資料集,涵蓋部落格文章、小說與科學寫作三種常見內容類型。為避免檢測器因訓練資料重疊而產生偏差,所有樣本皆選自ChatGPT於2022年11月問世之前所創作,確保檢測結果能真實反映其辨識能力。 測試顯示,當面對一般未經修飾的AI生成文字時,三款檢測器幾乎都能完美識別,漏檢率最高僅為0.7%,展現出高度可靠性。在人類原創文本的判別方面,Pangram與GPTZero均未發生誤將人類作品判定為AI生成的情形,而Originality.ai則有19篇被錯誤標記,誤報率為3.8%。整體而言,在常規情境下,這些工具對於區分人類與AI內容具備相當穩定的表現。 然而,研究進一步模擬了更貼近實際應用場景的挑戰:刻意讓AI模仿作者的個人風格。團隊採用三個先進的大型語言模型——Claude Opus 4.8、GPT‑5.5與Gemini 3.1 Pro——分別學習每位人類作者提供的5篇真實作品,並依照相同的文風、語氣與用字習慣生成全新的內容。在總計297篇的風格模仿文本中,平均約有13%未被檢測器成功識別,顯示出風格模仿確實能有效繞過現有偵測機制。 細看各檢測器在風格模仿文本上的表現,Pangram的漏檢率為10%,GPTZero為11%,而Originality.ai則達到18%,明顯高於處理一般AI文本時的數字。值得注意的是,科學寫作領域成為所有檢測器表現最弱的環節:Pangram對學術風格AI文本的漏檢率高達25%,GPTZero為24%,Originality.ai更達到29%。個別模型與檢測器的組合更出現極端情況,例如Pangram對Gemini所生成的學術文本漏檢率高達48%,意即將近半數無法辨識;而Originality.ai對於GPT‑5.5生成的學術內容也有39%的漏檢比例。 研究報告指出,儘管Pangram、GPTZero與Originality.ai各自採用不同的技術路線——分別涉及神經網絡分析、文本可預測性評估以及統計模式識別——但它們在面對風格模仿文本時卻暴露出相似的識別盲點。這暗示目前主流檢測方法可能存有系統性的弱點,而非僅僅是特定演算法的差異。 隨著大語言模型不斷升級,其輸出的內容在語法、結構與風格上都愈發接近人類水準,這項研究成果為教育、科研與學術出版等領域敲響了警鐘。在論文原創性審查、學生作業評分以及研究誠信驗證等場景中,若檢測工具無法可靠地辨識經過風格模仿的AI生成文本,可能導致真實性把關機制出現漏洞。 研究團隊呼籲,未來AI文本偵測技術須與時俱進,特別應針對風格模仿與領域適應性進行強化,單純依賴現有的統計特徵或神經網絡模式可能已不足以應對日益成熟的生成式AI。學術界與產業界有必要共同探索更多元的檢測策略,例如結合寫作歷程分析、邏輯一致性驗證,或研發專注於特定領域的偵測模型。 在生成式AI應用日趨普及的時代,如何在技術演進與資訊真實性之間取得平衡,已成為不可迴避的課題。Epoch AI這項研究清楚指出,當AI越擅長「說人話」,人類就越需要更精密的方法來判斷內容的來源,這不僅是技術挑戰,更關乎數位時代資訊信任的根基。

Related

相關文章

智東西生成式AI

阿里甩出“配音”神器:能調整情緒,還會說方言

阿里旗下的千問大模型推出語音合成工具Qwen-Audio-3.0-TTS,支援情緒調整、方言及多語種,並可透過自然語言指令控制語氣與場景。該模型在第三方評測中獲得語音合成榜單第一,具備高品質的聲音復刻與抗噪能力。

剛剛

關於面壁智能,聊聊我的一些新思考

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

29 分鐘前

Token收費,不再“天經地義”?

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

38 分鐘前
全天候科技生成式AI

AI眼鏡繼續進化:不只看見,還要辦事

過去兩年,大模型技術加速導入智慧眼鏡,翻譯、拍攝等應用功能密集問世,成為市場主流。然而,隨著這些能力逐漸成為標配,AI眼鏡所面臨的新課題也隨之浮現——業界開始思考,如何讓眼鏡從「看見」進化到「辦事」,真正成為能主動協助用戶完成任務的隨身裝置。

59 分鐘前

16萬Star的OpenCode徹底重寫:API全部重做、Bun換Node、桌面端遷移Electron

擁有超過 16 萬顆 GitHub 星星、每月活躍開發者高達 750 萬人的開源專案 OpenCode,在 2026 年 7 月正式推出了 2.0 版本。這不僅是一次例行更新,而是從底層架構到使用者體驗的全面翻新。聯合創始人 Dax Raad 在近期受訪時坦言,這是他職業生涯中「第三次才做對」的產品:0 是原型試水,1.x 是市場驗證,而 2.0 則是在徹底理解整個領域後,從零開始的推倒重來。 這次重寫的核心變革之一,就是完全重構了應用程式介面(API)。

1 小時前