IT之家模型更新

AI 戰略和運營指數報告:Claude Fable 5 比 DeepSeek V4 Pro 高 12 分,每任務成本超 100 倍

2026年7月9日 14:46
AI 戰略和運營指數報告:Claude Fable 5 比 DeepSeek V4 Pro 高 12 分,每任務成本超 100 倍

重點摘要

首頁 > 智能時代>人工智能 AI 戰略和運營指數報告:Claude Fable 5 比 DeepSeek V4 Pro 高 12 分,每任務成本超 100 倍 2026/7/9 14:46:04 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 9 日消息,科技媒體 The Decoder 昨日(7 月 8 日)發佈博文,報道稱 Artif。

站內 AI 整理稿

國際科技媒體《The Decoder》於7月8日報導,獨立評測機構Artificial Analysis在7月7日發布最新AI模型能力指數報告。這份報告針對金融與會計、法律、醫療與醫學、戰略與運營、工程及經濟學六大行業,設計全新的能力評估指標。結果顯示,Anthropic旗下的Claude Fable 5模型在所有八項指標中均拿下第一名,展現壓倒性優勢。Artificial Analysis此次的評測方法與過往不同,他們參考美國勞工部職業資訊網絡(O*NET)的職業分類體系,根據各行業任務中所需技能的出現頻率來分配權重,進而建立八項行業能力指數。

這種設計旨在更精準地反映AI模型在真實職場場景中的應用價值,而非單純測驗學術基準。在所有八項指標中,Claude Fable 5(其備選模型為Opus 4.8)全部奪冠,表現最為亮眼。緊隨其後的是Claude Opus 4.8(max),在六項指數中排名第二;其餘兩項第二名則由OpenAI的GPT-5.2(max)拿下。值得注意的是,在六個行業指數中,GPT-5.2(max)有五項排名領先其他模型,但在工程基準指數中僅獲得53分,排名第五,落後於Claude Fable 5、Claude Sonnet 5(max)以及兩款其他模型。

在戰略與運營指數這項關鍵指標中,Claude Fable 5的得分比DeepSeek推出的V4 Pro模型高出12分,驗證了其在策略規劃與營運分析任務上的優異能力。然而,高表現也伴隨著高成本。根據報告,Claude Fable 5在該指數中每項任務的成本為3.48美元,相較之下DeepSeek V4 Pro max的成本極低,兩者差距超過一百倍,凸顯頂級模型與輕量模型在商業部署上的巨大成本差異。除了戰略與運營指數,其他行業的榜單同樣值得關注。在金融與會計領域,Claude Fable 5與Claude Opus 4.8(max)包辦前兩名,GPT-5.2(max)排名第三。

法律領域的排名類似,Claude Fable 5領先,但GPT-5.2(max)在法律推理相關任務上與Claude Opus 4.8(max)分數非常接近。醫療與醫學指數中,Claude系列模型同樣佔據主導地位,顯示其在專業知識問答與診斷建議方面的優勢。經濟學指數方面,Claude Fable 5與Claude Opus 4.8(max)位居前二,GPT-5.2(max)與Claude Sonnet 5(max)並列第三。工程基準則是唯一一個出現較多競爭的領域,Claude Fable 5雖然奪冠,但Claude Sonnet 5(max)與GPT-5.

2(max)的差距並不大,反映工程任務對模型推理與計算能力的要求更為均衡。這份報告同時也列出了各模型的成本對比。除了戰略與運營指數的顯著差距外,在其他指數中,Claude Fable 5的每任務成本普遍高於競爭對手數十倍甚至上百倍。例如在工程基準中,Claude Fable 5的成本同樣是DeepSeek V4 Pro max的數十倍,但得分差距卻不如戰略與運營指數明顯。這意味著企業在選擇AI模型時,必須在效能與成本之間權衡,針對不同任務需求挑選最適合的方案。Artificial Analysis指出,這些行業指數的誕生是因為傳統的學術評測難以反映真實工作場景。

透過O*NET的職業分類,他們可以將特定行業的常見任務(如財務分析、法律文件審閱、醫療診斷、策略規劃、工程設計、經濟預測)轉化為可量化的測試題目,並按照技能出現頻率加權,使評分更具實務參考價值。此舉也為企業採購AI服務時提供了更具體的比較依據。整體而言,Claude Fable 5在本次評測中無疑是最大贏家,但它的高成本也引發了討論。相較之下,DeepSeek V4 Pro系列以極低成本提供接近的表現,對於預算有限的團隊來說可能是更實惠的選擇。GPT-5.2(max)則在多個行業中展現競爭力,雖未奪冠但穩居前列。

隨著AI模型持續演進,這類行業導向的評測將成為企業決策的重要參考,也促使開發者更重視模型在專業領域的實際應用成效。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

53 分鐘前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

54 分鐘前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

1 小時前