智東西生成式AI

新榜單出爐,單週處理量破8萬億Token:Agnes公佈大模型最新成績單

2026年7月27日 11:50

重點摘要

智東西 作者 | 程茜 編輯 | 漠影 AI的競爭主戰場,已經從淺層的對話交互,全面轉向實際生產力比拼。 基於這一行業趨勢,各大廠商在加速迭代自家大模型的同時,還瞄準了用戶付費意願場景更高、AI商業化落地確定性更強的多智能體協同、AI編程等場景。 當下正處搶佔AI應用生態佈局的關鍵窗口期,AI賽道的企業以分層基礎模型為核心,搭配自研的專屬開發工具,從而兼顧用戶日常和專業生產場景需求,壓低AI落地使用門檻。 恰逢行業變革的關鍵時點,Agnes AI今日正式官宣文本大模型與AI編程產品矩陣的最新升級,包括Agnes-2.5 Flash正式上線、旗艦文本模型Agnes-2.5 Pro Alpha即將開放體驗,以及AgnesCode功能優化升級。 此次升級進一步強化了Agnes在複雜推理、Agent任務執行、專業Coding以及智能開發場景中的能力,為開發者和企業用戶提供更高效、更智能的AI生產力工具。 Agnes 2.5 Flash:專為日常編程、Agent和高頻開發任務打造,目前API與AgnesCode已全面上線,並繼續不限期免費開放。 Agnes 2.5 Pro Alpha即將上線:首款付費模型,支持百萬token上下文,面向複雜智能體、專業編程和高難度工程任務場景優化,登錄AgnesCode即可領取積分免費體驗。 AgnesCode:優化開發體驗,首字生成時延(TTFT)進一步降低,模型響應更快;新增CLI命令行功能,支持開發者直接在終端環境中完成代碼理解、修改、調試和多步驟開發任務。 Agnes AI產品矩陣全方位升級的背後,是緊跟AI應用形態邁入新一輪升級週期的佈局,如今用戶普遍將大模型深度對接內部業務系統、內嵌至全流程工作鏈路,實現全天候高頻調用,直接推動批量Token消耗量呈現指數級攀升。在此背景下,行業的模型競爭已告別單點性能比拼,進入綜合實力的全方位角逐階段。

站內 AI 整理稿

智東西 作者 | 程茜 編輯 | 漠影 AI的競爭主戰場,已經從淺層的對話交互,全面轉向實際生產力比拼。基於這一行業趨勢,各大廠商在加速迭代自家大模型的同時,還瞄準了用戶付費意願場景更高、AI商業化落地確定性更強的多智能體協同、AI編程等場景。當下正處搶佔AI應用生態佈局的關鍵窗口期,AI賽道的企業以分層基礎模型為核心,搭配自研的專屬開發工具,從而兼顧用戶日常和專業生產場景需求,壓低AI落地使用門檻。恰逢行業變革的關鍵時點,Agnes AI今日正式官宣文本大模型與AI編程產品矩陣的最新升級,包括Agnes-2.5 Flash正式上線、旗艦文本模型Agnes-2.

5 Pro Alpha即將開放體驗,以及AgnesCode功能優化升級。此次升級進一步強化了Agnes在複雜推理、Agent任務執行、專業Coding以及智能開發場景中的能力,為開發者和企業用戶提供更高效、更智能的AI生產力工具。Agnes 2.5 Flash:專為日常編程、Agent和高頻開發任務打造,目前API與AgnesCode已全面上線,並繼續不限期免費開放。Agnes 2.5 Pro Alpha即將上線:首款付費模型,支持百萬token上下文,面向複雜智能體、專業編程和高難度工程任務場景優化,登錄AgnesCode即可領取積分免費體驗。

AgnesCode:優化開發體驗,首字生成時延(TTFT)進一步降低,模型響應更快;新增CLI命令行功能,支持開發者直接在終端環境中完成代碼理解、修改、調試和多步驟開發任務。Agnes AI產品矩陣全方位升級的背後,是緊跟AI應用形態邁入新一輪升級週期的佈局,如今用戶普遍將大模型深度對接內部業務系統、內嵌至全流程工作鏈路,實現全天候高頻調用,直接推動批量Token消耗量呈現指數級攀升。在此背景下,行業的模型競爭已告別單點性能比拼,進入綜合實力的全方位角逐階段。

一、兩大模型+AI工作臺全升級,Pro Alpha模型上榜Artificial Analysis 榜單分數,是體現模型水平高低的直觀證明。Agnes AI此次更新的Agnes 2.5 Pro Alpha在多個公開評測榜單中展現出較強的綜合能力。首先,在Artificial Analysis的Intelligence Index中,Agnes 2.5 Pro Alpha得分39,在其同類模型中位列第9。該指數由9項評測構成,覆蓋Agent任務、代碼執行、科學推理、知識可靠性和長上下文理解等能力,其中Agent和Coding相關評測合計佔據較高權重,更注重模型在真實任務中的綜合表現。

其次,Agnes 2.5 Pro Alpha在真實Linux終端智能體基準測試Terminal-Bench v2.1中得分為67%。這一榜單的含金量在於,其全程在隔離Docker沙箱環境運行,固定保留89項真實工程任務,修復了28項環境配置、指令匹配、資源配額的底層問題,因此分數反映的是模型在模擬終端環境中完成工程任務的能力。除了Agnes 2.5 Pro Alpha,Agnes AI還升級了Agnes 2.5 Flash,並配套完成其AI工作臺AgnesCode的使用優化。這兩款模型分別承接的是普通用戶日常需求和專業開發者的複雜需求。先來看下Agnes AI此次升級的AgnesCode平臺。

在用戶體驗方面,該平臺完成首字生成時延(TTFT)優化。用戶下發提示詞後整體響應效率提升,連續編碼、多輪智能體任務流轉更加順暢,保障Vibe Coding編寫的心流不被加載卡頓干擾,高頻改碼、執行指令時的交互體驗顯著改善。除了桌面端升級,AgnesCode將於7月28日上線CLI功能,用戶登錄部署後,可在本地項目文件夾用自然語言完成代碼解析、文件修改、故障排查、測試編譯等開發工作;授權後還可直接運行終端指令、安裝項目所需依賴。憑藉模型的全棧能力迭代、分層定價策略、免費體驗以及對AI工作臺升級的組合策略,Agnes AI已經打通了從技術研發、用戶沉澱到商業落地的完整鏈路。

二、一手實測編程難題,直出複雜項目管理平臺 智東西提前體驗了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。第一個輕量化模型是Agnes 2.5 Flash,其可以完成用戶日常編程、Agent和高頻開發任務,提升了代碼理解、Bug修復、項目重構、多文件修改、多步驟任務執行和複雜推理等能力。與Agnes AI此前的定價策略一脈相承,該模型全面上線後將不限期免費開放,開發者可以通過AgnesCode或API調用。智東西先用Agnes-2.5 Flash做了一輪測試,輸入提示詞:搭建一個macOS桌面界面,自帶文件管理、瀏覽器、筆記這類常用基礎功能。

可以看到,模型生成的界面整體視覺貼合原生macOS系統的經典UI風格,頂部菜單欄、桌面常駐圖標、底部Dock欄等元素齊全,同時配齊了文件管理器、瀏覽器、備忘錄、日曆、相機、音樂、黑屏終端、系統設置這些剛需程序,並且點擊日曆還能查看到對應的提醒事項,貼合真實系統的交互觀感。另一道題目是讓模型生成“一個完整響應式科幻風格個人博客網站”。整個網站的視覺風格統一,主標題設計了白色和紫色漸變的字體,符合科幻感,頁面佈局中自上而下采取了主標題、文章列表、博主個人介紹的排布,文章卡片使用半透明深色背景,主次分明。第二個是Agnes 2.

5 Pro Alpha,這一模型在Agnes AI的模型矩陣中定位較為特殊。該模型是全新旗艦文本模型Agnes-2.5 Pro的體驗先行版本,支持100萬Token超長上下文窗口,面向複雜問題理解與推理、長鏈路任務執行、大型項目協作、複雜代碼分析及工程開發等場景進行了優化。Agnes 2.5 Pro Alpha也是Agnes AI首款付費模型,當前API價格為每百萬輸入Token 0.45美元(約合人民幣3.05元)、每百萬輸出Token 0.90美元(約合人民幣6.09元)。

用戶可通過Agnes充值後調用API服務;同時,為降低專業用戶體驗門檻,模型上線後,用戶可登錄AgnesCode領取免費積分,體驗Pro Alpha模型能力。智東西提出了一個進階難題,要求Agnes 2.5 Pro Alpha“設計並實現一個企業級多租戶SaaS項目管理平臺”。首先在登錄頁,其完整設計了賬號、密碼、租戶標識(Tenant Slug)輸入框,精準對應多租戶體系的登錄鑑權邏輯。其次是後臺界面,其採用了左側導航欄、右側內容區的企業後臺佈局,匹配項目管理平臺的功能結構,並且組件化拆分、表單、篩選、卡片佈局都屬於成熟企業前端寫法,靜態頁面的還原質量合格。Agnes-2.

5 Pro Alpha作為先行體驗版本,已經在複雜平臺的構建方面展現出應用價值,再加上其Flash版本承接用戶日常的高頻業務調用,一普惠一旗艦的組合升級,適配當下AI應用的規模化落地。三、周token處理量超8萬億,調用數據印證模型商業化進展 評判一款全模態大模型的技術成熟度,紙面參數、各類權威評測榜單固然有參考價值,但真實線上Token消耗結構是更為硬核的落地檢驗標準。依託真實線上業務沉澱的數據能直觀反映用戶真實使用偏好與模型實用價值,根據Agnes AI披露的最新數據,其全模態模型的單週Token處理量已經達到8.16萬億,其中文本Token達到5.1萬億,佔總量的62.

5%,多模態Token為3.06萬億,佔總量的37.5%。這份Token配比數據釋放出清晰信號,Agnes全模態模型的整體調用規模走高,多模態佔比穩步提示,說明其圖像、視頻模塊具備獨立可用、穩定可靠的產品能力。用戶實際業務場景實現了全覆蓋,既包含文本對話、代碼編寫等傳統剛需場景,也落地了圖片處理、視頻解析等多元多模態業務需求。這與當下AI產業趨勢相關,如今頭部模型比拼的核心落點,轉向技術能力能否匹配用戶真實需求、收穫市場認可,並最終轉化為真實調用流量。根據全球AI模型聚合平臺OpenRouter的最新大模型周調用榜單,小米MiMo-V2.5以10.

2T tokens位列第一,DeepSeek V4 Flash以6.01T tokens位列第二。對比兩家行業頭部玩家的數據,Agnes已經達到8.16萬億的周處理量級,其商業化規模躋身全球前列。模型體驗比拼白熱化的背後,行業競爭重心同步還向下游推理基建轉移,SGLang作為支撐萬億級Token流轉的核心開源框架,成為各大技術團隊打磨硬核工程能力的關鍵。Agnes團隊也在參與SGLang開源社區建設,目前已提交4項代碼貢獻,其中3項已正式合併,另有1項已通過維護者審核,正在完成後續測試與合併流程。

結語:模型全方位升級落地,核心是對齊產業真實訴求 頭部大模型的能力比拼,正從文本模型的單一競賽,轉向圖像、視頻與文本協同運轉的一體化全模態體系建設。與此同時,全模態能力只有經過海量線上調用檢驗、份額穩步提升,才算完成從實驗室算法原型向穩定可用產品能力的迭代閉環。Agnes從模型、調用量、工具的全方位升級,也證明其模型的感知、理解、生成一體化能力已經真正匹配了產業實際需求。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

35 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前