卡迪夫大學新研究:AI 尚無法像人類教師一樣可靠地批改作業

作者:清源 責編:清源 評論: 8 月 24 日消息,據外媒 Phys.org 今天(24 日)報道,卡迪夫大學和墨爾本大學的一項新研究發現,生成式人工智能(GenAI)目前還無法像人類教師一樣可靠地評判學生的書面作業。研究人員使用 ChatGPT 的兩個版本,對 50 篇生物科學專業本科生論文進行評分,以測試大模型評估學生作業的能力。ChatGPT 需要按照 7 項標準批改這些論文,研究人員還採用了 4 種不同的提示方式,隨後將大模型與人工評分的平均分和分數波動情況進行比較。
圖源:Pexels卡迪夫大學生物科學學院威廉 · 凱博士指出:“研究結果顯示,模型給出的分數波動很大,無法準確預測人工評分。生成式 AI 與人類批改同一批論文時存在明顯差異。只看論文總分,兩者給出的結果相對接近;一旦具體到每項評分標準和每一篇論文,大模型與人工評分之間的差距就相當明顯。”除一種情況外,AI 模型給出的平均分普遍高於人工評分。平均分方面,AI 模型與人工評分的最大差距達到 16.1 分;具體到單篇論文,最大差距達到 40 分。獲悉,威廉 · 凱還發現,AI 往往會壓低高分論文的成績,又把低分作業的成績抬高,最終使分數系統性地向中間集中。
研究結果說明,至少現階段,即使經過大量訓練,AI 仍無法可靠地對主觀性較強的書面作業給出與人類相當的分數。“我們測試的大模型目前並不適合取代教師,為學生預測作業成績。”研究人員指出,高等教育領域確實很關注大模型能否利用模式識別能力,讓學生作業評分更加客觀,同時提高批改效率、減輕教職人員壓力。但這項研究表明,目前並不適合這麼做。此外,未經學生明確同意便把作業提交給 AI 工具,本身還涉及倫理問題;大模型也不能、也不應該被依賴來給學生的長篇書面作業評分。“隨著大模型繼續發展,未來模仿人類判斷的能力可能會提高。但從這項研究來看,要讓 AI 給出的分數與人工評分真正保持一致,恐怕並不容易。
” 投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:生成式AI,人工智能,AI教育Netflix:今年有大約 300 部作品使用了生成式 AI美國教師聯合會呼籲:不要讓小學生在課堂上接觸 AI 軟硬件Panic 出手整治:Playdate 掌機遊戲不許用 AI 搞美術音樂,代碼輔助除外AI 讓英國學生“不會思考”,近 6000 名英格蘭中學教師表示擔憂創意界紛紛抵制生成式 AI:星雲獎、動漫展相繼封殺 AI 作品2030 年近七千億美元大市場,Counterpoint 預計消費者 GenAI 支出年均增長超 20%
Related
相關文章

路透社母公司湯森路透花 4000 萬美元研發 AI 模型,基於阿里千問
作者:潞源 責編:潞源 評論: 8 月 24 日消息,路透社母公司湯森路透集團近日正式公佈其首款大語言模型“Thomson”。該模型基於阿里千問構建,號稱擁有頂級表現。據介紹,該模型的研發成本大約是 4,000 萬美元(注:現匯率約合 2.

AI領域一週觀察:Codex 商業增速逆襲 Anthropic,具身智能迎來“GPT-2時刻”
產業 Mythos 2 不發,Astra 停訓,前沿模型的安全策略初現 8 月 18 日,OpenAI 披露,公司此前暫停了兩週針對擬部署模型的強化學習訓練。截至公告發布,最大規模的前沿 RL 訓練仍未恢復,較小規模的訓練和評測還在繼續。Anthropic同樣有一個新模型受阻,SemiAnalysis 主編 Dylan Patel 在 8 月 17 日的採訪中稱,據他獲悉,Anthropic 的下一代模型 Mythos 2 已經完成訓練,但不會發布。

菲爾茲獎得主都栽了,Claude終結78年懸案,或成最重要AI數學成果
Anthropic開發的AI模型Claude與頂尖數學家合作,在三天內構造出六維球面(S⁶)上的覆蓋結構,解決了自一九四七年懸宕至今的數學難題。過去包括菲爾茲獎得主在內的數學家都未能攻關,此次成果被譽為AI迄今最重要的數學貢獻,可能重新定義AI在數學研究中的角色。

值得買科技上半年營收增速回升,AI佈局成為新變量
王小娟 發表於 2026年08月24日 12:36 摘要:利潤同步改善 8月24日,值得買科技發佈2026年半年度報告。報告期內,公司實現營業收入約6.19億元,同比增長6.43%;利潤總額約1374萬元,同比增長53.45%;扣除股份支付影響後的淨利潤約1573萬元,同比增長9.

說好“多模態不是主線”的梁文鋒,怎麼轉頭就發了個Vision模型?
字母AI2026.08.24 20:17 · 來自北京全文7138字00:00 / 18:44多模態這事上,梁文鋒還是梁文鋒,但他學會了放低姿態。文 | 字母AI在多模態這個問題上,梁文鋒在那次投資人交流會上曾這麼說過:“多模態佈局,我們一直在做。對產品來講,它很重要;對C端用戶產品來講,它很重要。但是對智能的上限,它是一個組件,它不是主線本身。我們應該會上相關的模型,就是我們V4的後續版本會支持原生的多模態。”梁文鋒也的確做到了。

奧特曼最新訪談:AI還沒有到iPhone時刻,不缺技術缺交互
字母榜2026.08.24 20:17 · 來自河北全文8861字00:00 / 21:34奧特曼大談創業,我們為你總結了23條最有價值的信息。文 | 字母榜2026年8月24日,OpenAI創始人奧特曼做客主持人大衛·森拉(David Senra)的節目,聊了一個多小時。奧特曼在節目中袒露了很多心聲,包括產品、時間管理、創業的迷茫,以及他差點就不從事AI這個行業……信息量極大。奧特曼認為,技術跑得比人快,但人適應技術的速度要比想象中慢很多。