何夕2077模型更新

真實會計場景評測基準發佈

2026年8月1日 00:00

重點摘要

人工智慧模型能否勝任專業會計師的工作,一直是業界關注的焦點。近日,由 Mercor 與 Ramp 聯手打造的「APEX-Accounting」基準測試正式對外發布,這項評測基準旨在模擬真實會計場景,全面檢驗前沿語言模型在處理帳務時的實際能力。研究團隊將其成果以論文形式發表於 arXiv 預印本平台,並公開了開發集的資料。 APEX-Accounting 不同於傳統的問答或文本理解測試,它設計了一套高度擬真的會計工作環境。

站內 AI 整理稿

人工智慧模型能否勝任專業會計師的工作,一直是業界關注的焦點。近日,由 Mercor 與 Ramp 聯手打造的「APEX-Accounting」基準測試正式對外發布,這項評測基準旨在模擬真實會計場景,全面檢驗前沿語言模型在處理帳務時的實際能力。研究團隊將其成果以論文形式發表於 arXiv 預印本平台,並公開了開發集的資料。 APEX-Accounting 不同於傳統的問答或文本理解測試,它設計了一套高度擬真的會計工作環境。整個評測基準由 160 項任務組成,這些任務被劃分為 10 個獨立的「世界」,每個世界都包含完整的會計系統、試算表、PDF 檔案以及其他常見的辦公文件。研討會計與簿記專家親自撰寫每一項任務,並提供標準解答與詳細的評分標準,確保評估過程具備專業性與一致性。 任務類型涵蓋會計師日常工作的核心環節,包括帳戶調節、費用預提、交易過帳以及財務報告的編製。研究團隊希望透過這些任務,測試模型是否能夠理解複雜的財務文件、正確執行多步驟的會計處理,並產出符合規範的結果。這項基準的推出,被視為 AI 在專業領域應用的一次重要壓力測試。 在模型的評比結果方面,研究人員選用了 9 個目前最先進的語言模型進行測試。其中,Anthropic 旗下的 Claude-Fable-5(Max 版本)以 56.4% 的「Mean Criteria@3」得分拔得頭籌,略勝過 Google 的 Muse-Spark-1.1(xHigh 版本)的 52.6%。這項指標衡量的是模型在前三次嘗試中,能達到任務關鍵要求的平均比例。 然而,當評估標準轉向更嚴格的「完全正確率」時,所有模型的表現立即大幅下滑。在「Pass^8」指標上,表現最好的 GPT-5.6-Sol(Max+Pro 版本)也僅獲得 2.6% 的分數。而在「Pass@8」指標(允許模型嘗試八次,只要有一次完全正確即算通過)中,最高分仍只有 Muse-Spark-1.1(xHigh 版本的 21.5%)。這顯示即使是目前最頂尖的 AI 模型,在需要一步不差、完全精準的會計作業中,與人類專家仍有極大差距。 研究團隊還進行了一項有趣的實驗,探討 token 預算對模型表現的影響。他們將每次任務的 token 花費上限從 1 美元逐步提高到 50 美元,結果觀察到一個典型的辛普森悖論現象:在整體統計上,隨著 token 預算增加,模型的平均分數確實有所提升;但若將數據細分到同一預算限制下的每個任務,卻發現模型在花費較多 token 的任務上,得分反而更低。這意味著模型在遭遇困難任務時,雖然會消耗更多算力資源,卻未必能換來更好的結果,反映出目前模型在處理複雜會計邏輯時仍存在瓶頸。 APEX-Accounting 目前屬於封閉基準測試,研究團隊表示,任何前沿模型若要參與排行榜評估,都可以提出申請。這項機制確保了評比結果的可控性與一致性,也讓外界得以在統一的標準下比較不同模型的會計能力。 這項基準的發布,為 AI 在專業領域的應用提供了一個具體且嚴謹的衡量尺規。會計工作不僅要求對文字的語義理解,更需要嚴格的邏輯推理、多步驟操作以及對法規與準則的遵循。從測試結果來看,雖然模型在部分任務上展現出一定潛力,但在需要最終結果完全正確的場景中,目前的技術仍難以取代人類會計師的專業判斷與細心。 業界分析認為,APEX-Accounting 的出現,將加速 AI 模型在財務與會計領域的迭代優化。未來,若能進一步提升模型在「完全正確率」上的表現,AI 將有機會成為會計師的得力助手,處理大量重複性高、規則明確的作業,讓人類專注於更需要策略思維與專業判斷的工作。然而,從現有數據來看,距離那一天仍有相當長的路要走。

Related

相關文章

MarkTechPost AI模型更新

DeepSeek 推出 DeepSeek-V4-Flash-0731 重大更新,強化代理與編碼能力

DeepSeek 於 Hugging Face 發布 DeepSeek-V4-Flash-0731,並於 2026 年 7 月 31 日將官方 V4-Flash API 轉為公開測試版。模型卡明確指出此為正式版本,取代先前的預覽版,且架構與參數量不變。效能提升來自重新訓練,而非全新設計。該檢查點附帶 DSpark 推測解碼模組,與 DeepSeek-V4-Flash-DSpark 結構一致。Hugging Face 顯示該儲存庫有 304B 參數,包含在 284B 基礎模型之上的草稿模組。API 方面,deepseek-v4-flash 現原生支援 Responses API 格式,並針對 Codex 進行調整。V4-Pro API 及應用程式與網頁模型則未更新。是否可部署?可以,有兩種截然不同的方式:透過 API 即可部署。

6 小時前
MarkTechPost AI模型更新

LingBot-Map 教學:GPU 感知推理與點雲匯出

本教學實作基於 LingBot-Map 的端到端串流 3D 重建流程。首先設定輸入來源、重建參數、檢查點選擇與輸出控制,接著偵測可用 GPU,並根據偵測到的 VRAM 自動調整幀數限制、相機迭代次數、尺度幀與 KV-cache 參數。安裝儲存庫及其相依套件,下載預訓練檢查點,預處理影像或影片幀,並建構具備串流注意力與長程軌跡記憶體的 GCTStream 模型。接著執行混合精度推理,解碼預測的相機姿態與內參數,將深度圖轉換為世界座標點雲,驗證恢復的幾何結構,並視覺化重建場景。

7 小時前
雷峰網模型更新

Kimi K3 已提前亮相?神秘模型「Kivine」現身,百萬上下文能力驚豔全球

如果傳聞屬實,Kimi K3 將成為國產模型的重要節點。 作者丨鄭佳美、樊天驕 編輯丨馬曉寧 7 月 15 日,一款名為 Kivine 的匿名模型突然出現在 LMArena。雷峰網按照正常流程,它本應該只是眾多匿名測試模型中的一個,等待用戶通過盲測判斷能力高低。但這一次情況有些不同,在上線之後短短幾個小時內,Kivine 就迅速成為全球 AI 社區關注的焦點。

16 小時前
智東西模型更新

騰訊科研智能體攻破50年未解數學難題,姚順雨喊話正在招人

騰訊混元科研智能體Hyra參與破解加法組合學領域一道50餘年未解的數學難題,透過提出可無限擴展的參數化構造方案,證明和集擴張指標C(A)可無限接近理論上界2,但無法真正達到。研究團隊已將論文與Lean 4形式化證明公開,首席AI科學家姚順雨也藉此公開招募AI for Science人才。

17 小時前

OpenAI 一口氣降價 80%,GPT-5.6 Luna 性價比反超 DeepSeek V4 Pro

OpenAI 公布 GPT-5.6 系列新定價,輕量級 Luna 模型輸入與輸出費用同步調降80%,每百萬輸入 Token 降至0.2美元,輸出降至1.2美元,性價比全面超越 DeepSeek V4 Pro。同系列 Terra 降價20%,旗艦 Sol 維持原價,外界認為此舉是因應中國大模型低價競爭,藉由分層定價搶攻市場。

1 天前7000