何夕2077模型更新

真實會計場景評測基準發佈

2026年8月1日 00:00

重點摘要

人工智慧模型能否勝任專業會計師的工作,一直是業界關注的焦點。近日,由 Mercor 與 Ramp 聯手打造的「APEX-Accounting」基準測試正式對外發布,這項評測基準旨在模擬真實會計場景,全面檢驗前沿語言模型在處理帳務時的實際能力。研究團隊將其成果以論文形式發表於 arXiv 預印本平台,並公開了開發集的資料。 APEX-Accounting 不同於傳統的問答或文本理解測試,它設計了一套高度擬真的會計工作環境。

站內 AI 整理稿

人工智慧模型能否勝任專業會計師的工作,一直是業界關注的焦點。近日,由 Mercor 與 Ramp 聯手打造的「APEX-Accounting」基準測試正式對外發布,這項評測基準旨在模擬真實會計場景,全面檢驗前沿語言模型在處理帳務時的實際能力。研究團隊將其成果以論文形式發表於 arXiv 預印本平台,並公開了開發集的資料。APEX-Accounting 不同於傳統的問答或文本理解測試,它設計了一套高度擬真的會計工作環境。整個評測基準由 160 項任務組成,這些任務被劃分為 10 個獨立的「世界」,每個世界都包含完整的會計系統、試算表、PDF 檔案以及其他常見的辦公文件。

研討會計與簿記專家親自撰寫每一項任務,並提供標準解答與詳細的評分標準,確保評估過程具備專業性與一致性。任務類型涵蓋會計師日常工作的核心環節,包括帳戶調節、費用預提、交易過帳以及財務報告的編製。研究團隊希望透過這些任務,測試模型是否能夠理解複雜的財務文件、正確執行多步驟的會計處理,並產出符合規範的結果。這項基準的推出,被視為 AI 在專業領域應用的一次重要壓力測試。在模型的評比結果方面,研究人員選用了 9 個目前最先進的語言模型進行測試。其中,Anthropic 旗下的 Claude-Fable-5(Max 版本)以 56.

4% 的「Mean Criteria@3」得分拔得頭籌,略勝過 Google 的 Muse-Spark-1.1(xHigh 版本)的 52.6%。這項指標衡量的是模型在前三次嘗試中,能達到任務關鍵要求的平均比例。然而,當評估標準轉向更嚴格的「完全正確率」時,所有模型的表現立即大幅下滑。在「Pass^8」指標上,表現最好的 GPT-5.6-Sol(Max+Pro 版本)也僅獲得 2.6% 的分數。而在「Pass@8」指標(允許模型嘗試八次,只要有一次完全正確即算通過)中,最高分仍只有 Muse-Spark-1.1(xHigh 版本的 21.5%)。

這顯示即使是目前最頂尖的 AI 模型,在需要一步不差、完全精準的會計作業中,與人類專家仍有極大差距。研究團隊還進行了一項有趣的實驗,探討 token 預算對模型表現的影響。他們將每次任務的 token 花費上限從 1 美元逐步提高到 50 美元,結果觀察到一個典型的辛普森悖論現象:在整體統計上,隨著 token 預算增加,模型的平均分數確實有所提升;但若將數據細分到同一預算限制下的每個任務,卻發現模型在花費較多 token 的任務上,得分反而更低。這意味著模型在遭遇困難任務時,雖然會消耗更多算力資源,卻未必能換來更好的結果,反映出目前模型在處理複雜會計邏輯時仍存在瓶頸。

APEX-Accounting 目前屬於封閉基準測試,研究團隊表示,任何前沿模型若要參與排行榜評估,都可以提出申請。這項機制確保了評比結果的可控性與一致性,也讓外界得以在統一的標準下比較不同模型的會計能力。這項基準的發布,為 AI 在專業領域的應用提供了一個具體且嚴謹的衡量尺規。會計工作不僅要求對文字的語義理解,更需要嚴格的邏輯推理、多步驟操作以及對法規與準則的遵循。從測試結果來看,雖然模型在部分任務上展現出一定潛力,但在需要最終結果完全正確的場景中,目前的技術仍難以取代人類會計師的專業判斷與細心。

業界分析認為,APEX-Accounting 的出現,將加速 AI 模型在財務與會計領域的迭代優化。未來,若能進一步提升模型在「完全正確率」上的表現,AI 將有機會成為會計師的得力助手,處理大量重複性高、規則明確的作業,讓人類專注於更需要策略思維與專業判斷的工作。然而,從現有數據來看,距離那一天仍有相當長的路要走。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

2 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

2 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前