2.6萬中國學生30個月追蹤:AI把作業分抬高18%,把中考分打掉24%

2026年8月24日 09:37
2.6萬中國學生30個月追蹤:AI把作業分抬高18%,把中考分打掉24%
站內 AI 整理稿

AI唱反調2026.08.24 09:35 · 來自北京全文2386字00:00 / 07:09作業越漂亮考試越空心。文 | AI唱反調孩子用AI寫作業,分數漲了,速度也快了——兩年後,升學考試成績跌了24%。這不是焦慮營銷號的標題黨,是一篇正兒八經的經濟學論文。6月,歐洲經濟政策研究中心(CEPR)發佈討論論文DP21577,追蹤了26811名中國中學生整整30個月,結論冷得刺骨:生成式AI讓作業成績提高18%,卻讓閉卷月考成績在半年內下降20%。作業和考試的關係,被AI活生生掰反了。CEPR論文追蹤2.68萬中國中學生30個月:AI讓作業分漲18%、月考跌20%、中考跌24%。

八成學生在"認知外包",傷得最重的恰恰是尖子生。這篇論文到底研究了什麼先把論文的底子擺清楚,它的分量來自數據規格。論文題為《生成式AI的學習懲罰:來自中國中等教育的證據》,作者是斯德哥爾摩大學的David Strömberg和香港大學的Victor Lei、Yanhui Wu,6月2日以CEPR討論論文DP21577編號發佈。樣本是中國一個百萬人口縣的26811名七到十二年級學生,跨度30個月,覆蓋九門學科,數據包括每月閉卷月考、作業分數與完成時長、以及中考高考這類高利害考試。方法上用雙重差分:利用不同學生接觸AI的時間差構造自然實驗,把"用沒用AI"的因果效應從相關性裡剝離出來。

研究期間,學生自報的AI使用率從接近零一路漲到約80%,爆發節點正好卡在DeepSeek V2.5和R1發佈前後,最常用的工具是豆包、DeepSeek、ChatGLM、文心和通義。這份數據,基本就是中國中學生AI普及全過程的完整錄像。三組數字,一個悖論核心發現可以濃縮成三組數:作業端:用AI後,作業分數漲18%,完成時長從64分鐘壓到45分鐘,省了30%;月考端:六個月內,閉卷月考成績跌20%;升學考端:中考跌24%,高考跌18%,而且完整的懲罰要等約兩年才全部顯現。過去,作業成績基本能預測考試成績。AI出現之後,這個關係直接反轉——作業越"優秀"的學生,真實能力反而越可疑。

傷害在分佈上還極不均勻,幾個細節值得單獨拎出來:學科上,社科類跌最狠(政治、地理約-27%),STEM其次(-22%),英語-17%,語文最輕(-9%)。人群上,尖子生傷得比差生重:成績前三分之一的學生跌24%,後三分之一隻跌16%;初中生比高中生慘,男生比女生慘。最嚇人的是劑量效應:每週用AI不超過1小時,成績損失約5%;每週5小時以上,損失直接拉到30%。機制:八成學生在"認知外包"為什麼作業高分換不來考試分數?論文用行為模式把學生分成兩類。外包型:作業完成時間異常短、分數異常高——AI生成,複製提交,大腦全程沒參與。約80%的AI用戶落進這個坑,學習損失幾乎全部集中在他們身上。

用滿五個月AI的學生裡,81%寫作業比最快的非AI用戶還快。輔助型:用了AI,但作業時長沒明顯縮短——把AI當講解工具,思考過程還留在自己腦子裡。這批人的考試損失很小,接近零。研究者推測,尖子生損失最大,恰恰因為他們原本有更強的自學能力,AI的介入生硬打斷了他們自建知識心智模型的過程。那個著名的"教學機器"公案也被翻了出來。神經科學家霍瓦思在財富中文網的報道里說得很扎心:1924年俄亥俄州立大學的"教學機器"實驗就證明過,自動化會阻礙學習——"專家用來減負的認知卸載工具,不該被孩子用來學習成為專家。你學會的不是技能,只是依賴。為什麼這個發現現在才炸出來一個關鍵原因:懲罰是延時的。

月考損失半年顯現,升學考損失要等兩年。這意味著此前所有幾周、幾個月的短期研究,都系統性地低估了AI的傷害——等炸彈引爆,補救窗口已經關了。當前正在深度用AI的這一代學生,將在2027到2032年集中走進升學考場,第一次面對AI替不了他們考的試。政策端的反應已經開始。挪威首相宣佈對6到13歲學生幾乎全面禁用生成式AI,14到16歲也必須在教師督導下使用;英國教育部5月的指南更細——學校AI工具默認不給答案、要求學生先真實嘗試、並記錄誰在"卸載思考";世界銀行把這篇論文列入2026年人力資本博客,當作防範"AI學習懲罰"的警示彈。對比一下更有意思:世界銀行受控框架下的AI輔導,效果是+0.

31個標準差;CEPR這篇"野生使用"場景下,效果是-1.4個標準差。同一項技術,用法決定方向。冷水的部分當然,邊界也要說清楚。這是一篇討論論文(working paper),尚未經過正式同行評審。樣本來自單一縣,30個月正好是AI工具本身飛速迭代的窗口期——研究捕捉的是早期工具配合"野生用法"的效果,而今天的產品形態和使用規範都在變。而且論文自己給出的解藥也不是"禁用"。輔助型用戶的成績幾乎無損,說明問題從來不在AI,在於思考被誰做了。合理的推論是:學校真正該改的是評估結構——把評分權重向閉卷考試傾斜、監控作業時長異常、設計AI替不了的評估方式,比如口頭答辯和現場推導。

結語 馬克·吐溫式的諷刺在這裡完全成立:AI讓作業從未如此漂亮,讓學習從未如此空心。作業分數這個沿用了幾十年的"能力代理指標",在AI時代正式失效了。家長盯著作業本上的高分自我安慰的時候,真實的知識積累可能正在偷偷塌方——而且要等兩年後那張沒法帶AI進場的考卷,才肯亮出賬單。UCL教授Wayne Holmes那句話,值得印在每個教育產品的開機畫面上:"他們的成績更好,但實際上學得更差。"

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛