AI 戰略和運營指數報告:Claude Fable 5 比 DeepSeek V4 Pro 高 12 分,每任務成本超 100 倍

重點摘要
首頁 > 智能時代>人工智能 AI 戰略和運營指數報告:Claude Fable 5 比 DeepSeek V4 Pro 高 12 分,每任務成本超 100 倍 2026/7/9 14:46:04 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 9 日消息,科技媒體 The Decoder 昨日(7 月 8 日)發佈博文,報道稱 Artif。
國際科技媒體《The Decoder》於7月8日報導,獨立評測機構Artificial Analysis在7月7日發布最新AI模型能力指數報告。這份報告針對金融與會計、法律、醫療與醫學、戰略與運營、工程及經濟學六大行業,設計全新的能力評估指標。結果顯示,Anthropic旗下的Claude Fable 5模型在所有八項指標中均拿下第一名,展現壓倒性優勢。Artificial Analysis此次的評測方法與過往不同,他們參考美國勞工部職業資訊網絡(O*NET)的職業分類體系,根據各行業任務中所需技能的出現頻率來分配權重,進而建立八項行業能力指數。
這種設計旨在更精準地反映AI模型在真實職場場景中的應用價值,而非單純測驗學術基準。在所有八項指標中,Claude Fable 5(其備選模型為Opus 4.8)全部奪冠,表現最為亮眼。緊隨其後的是Claude Opus 4.8(max),在六項指數中排名第二;其餘兩項第二名則由OpenAI的GPT-5.2(max)拿下。值得注意的是,在六個行業指數中,GPT-5.2(max)有五項排名領先其他模型,但在工程基準指數中僅獲得53分,排名第五,落後於Claude Fable 5、Claude Sonnet 5(max)以及兩款其他模型。
在戰略與運營指數這項關鍵指標中,Claude Fable 5的得分比DeepSeek推出的V4 Pro模型高出12分,驗證了其在策略規劃與營運分析任務上的優異能力。然而,高表現也伴隨著高成本。根據報告,Claude Fable 5在該指數中每項任務的成本為3.48美元,相較之下DeepSeek V4 Pro max的成本極低,兩者差距超過一百倍,凸顯頂級模型與輕量模型在商業部署上的巨大成本差異。除了戰略與運營指數,其他行業的榜單同樣值得關注。在金融與會計領域,Claude Fable 5與Claude Opus 4.8(max)包辦前兩名,GPT-5.2(max)排名第三。
法律領域的排名類似,Claude Fable 5領先,但GPT-5.2(max)在法律推理相關任務上與Claude Opus 4.8(max)分數非常接近。醫療與醫學指數中,Claude系列模型同樣佔據主導地位,顯示其在專業知識問答與診斷建議方面的優勢。經濟學指數方面,Claude Fable 5與Claude Opus 4.8(max)位居前二,GPT-5.2(max)與Claude Sonnet 5(max)並列第三。工程基準則是唯一一個出現較多競爭的領域,Claude Fable 5雖然奪冠,但Claude Sonnet 5(max)與GPT-5.
2(max)的差距並不大,反映工程任務對模型推理與計算能力的要求更為均衡。這份報告同時也列出了各模型的成本對比。除了戰略與運營指數的顯著差距外,在其他指數中,Claude Fable 5的每任務成本普遍高於競爭對手數十倍甚至上百倍。例如在工程基準中,Claude Fable 5的成本同樣是DeepSeek V4 Pro max的數十倍,但得分差距卻不如戰略與運營指數明顯。這意味著企業在選擇AI模型時,必須在效能與成本之間權衡,針對不同任務需求挑選最適合的方案。Artificial Analysis指出,這些行業指數的誕生是因為傳統的學術評測難以反映真實工作場景。
透過O*NET的職業分類,他們可以將特定行業的常見任務(如財務分析、法律文件審閱、醫療診斷、策略規劃、工程設計、經濟預測)轉化為可量化的測試題目,並按照技能出現頻率加權,使評分更具實務參考價值。此舉也為企業採購AI服務時提供了更具體的比較依據。整體而言,Claude Fable 5在本次評測中無疑是最大贏家,但它的高成本也引發了討論。相較之下,DeepSeek V4 Pro系列以極低成本提供接近的表現,對於預算有限的團隊來說可能是更實惠的選擇。GPT-5.2(max)則在多個行業中展現競爭力,雖未奪冠但穩居前列。
隨著AI模型持續演進,這類行業導向的評測將成為企業決策的重要參考,也促使開發者更重視模型在專業領域的實際應用成效。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。

內部賽馬暫停,騰訊、阿里、字節AI辦公產品“合兵”對陣
過去半年,騰訊、阿里巴巴、字節跳動等大廠在AI辦公產品領域經歷內部賽馬後,近期紛紛收攏資源,推出整合方案。騰訊將QClaw業務調整至雲產品六部,與WorkBuddy統一管理;阿里整合三款產品推出千問辦公;字節則將飛書團隊併入豆包。市場數據顯示,6月國內AI辦公智能體平臺月訪問量突破6000萬次,顯示此領域競爭日益激烈。