三分之一arXiv淪陷,CS論文65%被判“AI味”,數學僅0.7%

2026年7月27日 16:16
三分之一arXiv淪陷,CS論文65%被判“AI味”,數學僅0.7%

重點摘要

一項針對arXiv論文的研究顯示,過去一年約三分之一的論文被檢測出帶有「AI味」,其中計算機科學領域高達65%被標記,而數學領域僅0.7%,學科差異懸殊。該研究由unslop團隊執行,發現自ChatGPT推出後,論文中的AI生成痕跡急遽攀升,引發學術界對誠信與審查品質的擔憂。

站內 AI 整理稿

一份針對全球知名學術論文預印本平台 arXiv 的研究報告近日引發學術界熱議。該研究顯示,過去一年間,平台上約三分之一的論文被判定帶有明顯的「AI 味」,其中計算機科學領域的論文高達 65% 被標記為可能由人工智慧工具輔助或直接生成,而數學領域的比例僅有 0.7%,學科之間的差異極為懸殊。這項研究由名為 unslop 的團隊執行,其檢測結果在學術社群中掀起波瀾,甚至有網友為此創造了「大泔水時代」一詞來形容當前論文產出充斥 AI 痕跡的現象。這項研究團隊掃描了 2023 年 1 月至 2026 年 7 月期間上傳至 arXiv 的 12,750 篇論文,時間跨度長達三年半。

研究鎖定十個不同學科,每個學科每月隨機抽取約 25 篇全文進行分析。為了建立基準,團隊將對照組設定在 2021 至 2022 年——也就是 ChatGPT 尚未問世的「純人類時代」。結果顯示,在 ChatGPT 出現之前,arXiv 論文被檢測工具標記為 AI 生成的比率長期穩定在極低水準,幾乎可以忽略不計。然而,自 2023 年起,標記率曲線出現了驚人變化。研究發現,在 ChatGPT 推出後不久,論文中的「AI 味」迅速攀升,尤其在計算機科學領域,過去一年內多達 65% 的新論文被 unslop 的檢測器標為紅燈。

這意味著每三篇新發表的計算機科學論文中,就有將近兩篇可能含有 AI 生成的內容。相比之下,數學領域的論文幾乎不受影響,僅有 0.7% 被判定為 AI 寫作,顯示出這門學科對 AI 工具的依賴度極低,或者說,數學論文的語言風格與表達方式更難被當前檢測工具誤判。研究團隊進一步指出,這項檢測結果並非單純反映論文是否由 AI 完整撰寫,而是針對論文中的語言模式、句式結構、用詞習慣等特徵進行判別。許多被標記的論文可能是作者利用 ChatGPT 等生成式 AI 協助潤飾、改寫部分段落,甚至直接生成初稿後再略作修改。

這種現象在投稿壓力較大的領域尤為明顯,因為研究者需要快速產出大量論文,AI 工具成為提升效率的捷徑。網友與學術界對此反應兩極。有人認為,AI 輔助寫作並非壞事,只要研究者仍對論文內容負最終責任,且不影響原創性與科學嚴謹性,適度使用 AI 工具可以減輕語言障礙與寫作負擔。但另一方面,大量論文被標記為「AI 味」,也引發了對學術誠信與論文審查品質的擔憂。部分學者擔心,如果審稿人無法辨別論文是否由 AI 生成,可能會導致低品質或虛假研究的氾濫,進一步侵蝕學術出版的公信力。值得注意的是,這項研究本身也引發了方法論的討論。unslop 使用的檢測器是否足夠準確?

是否存在誤判人類撰寫論文為 AI 生成的可能性?研究團隊並未在公開資料中詳細說明檢測器的準確率與誤判率,但他們強調,在 2021 至 2022 年的對照組中,標記率極低,顯示檢測工具對人類撰寫的論文具有較高的辨識力。換句話說,2023 年後標記率的急遽上升,並非檢測工具本身的偏差,而是論文內容特徵確實發生了顯著變化。從學科分布來看,計算機科學之所以成為重災區,可能與該領域研究者普遍熟悉 AI 工具、且論文產出速度要求極高有關。計算機科學論文往往需要大量實驗結果、程式碼與數據分析,AI 在撰寫方法論與結果描述時能提供相當流暢的敘述。

而數學論文則以嚴謹的符號推導與證明為主,AI 目前難以在這一領域生成可信的內容,因此被標記的比例極低。其他學科如物理、生物、醫學等領域的數據,研究團隊並未在本次報告中完整公布,但初步結果顯示,這些領域的 AI 標記率介於計算機科學與數學之間。這項研究也引發了 arXiv 平台本身是否應加強審查的討論。作為全球最大的學術論文預印本平台,arXiv 每天接收數百篇新論文,目前並未對論文是否使用 AI 輔助寫作進行強制揭露。部分學者呼籲,應該要求作者在投稿時聲明是否有使用生成式 AI,並在論文中標註其使用範圍,以維護學術透明度。

但也有反對意見認為,這樣的標註可能導致歧視性審查,反而對非英語母語研究者不利,因為他們更常依賴 AI 來改善語言表達。無論如何,這項研究清楚揭示了一個趨勢:生成式 AI 已經全面滲透學術論文寫作,且速度遠超多數人的預期。從 2023 年到 2026 年,短短三年間,arXiv 上三分之一論文被打上「AI 味」標籤,計算機科學領域更是高達三分之二。這不僅是科技新聞,更是整個學術生態系統必須正視的轉折點。未來,學術界如何定義「原創性」與「AI 輔助」的界線,審查機制如何與時俱進,將成為持續發酵的關鍵議題。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前