智東西生成式AI

新榜單出爐,單週處理量破8萬億Token:Agnes公佈大模型最新成績單

2026年7月27日 11:50

重點摘要

智東西 作者 | 程茜 編輯 | 漠影 AI的競爭主戰場,已經從淺層的對話交互,全面轉向實際生產力比拼。 基於這一行業趨勢,各大廠商在加速迭代自家大模型的同時,還瞄準了用戶付費意願場景更高、AI商業化落地確定性更強的多智能體協同、AI編程等場景。 當下正處搶佔AI應用生態佈局的關鍵窗口期,AI賽道的企業以分層基礎模型為核心,搭配自研的專屬開發工具,從而兼顧用戶日常和專業生產場景需求,壓低AI落地使用門檻。 恰逢行業變革的關鍵時點,Agnes AI今日正式官宣文本大模型與AI編程產品矩陣的最新升級,包括Agnes-2.5 Flash正式上線、旗艦文本模型Agnes-2.5 Pro Alpha即將開放體驗,以及AgnesCode功能優化升級。 此次升級進一步強化了Agnes在複雜推理、Agent任務執行、專業Coding以及智能開發場景中的能力,為開發者和企業用戶提供更高效、更智能的AI生產力工具。 Agnes 2.5 Flash:專為日常編程、Agent和高頻開發任務打造,目前API與AgnesCode已全面上線,並繼續不限期免費開放。 Agnes 2.5 Pro Alpha即將上線:首款付費模型,支持百萬token上下文,面向複雜智能體、專業編程和高難度工程任務場景優化,登錄AgnesCode即可領取積分免費體驗。 AgnesCode:優化開發體驗,首字生成時延(TTFT)進一步降低,模型響應更快;新增CLI命令行功能,支持開發者直接在終端環境中完成代碼理解、修改、調試和多步驟開發任務。 Agnes AI產品矩陣全方位升級的背後,是緊跟AI應用形態邁入新一輪升級週期的佈局,如今用戶普遍將大模型深度對接內部業務系統、內嵌至全流程工作鏈路,實現全天候高頻調用,直接推動批量Token消耗量呈現指數級攀升。在此背景下,行業的模型競爭已告別單點性能比拼,進入綜合實力的全方位角逐階段。

站內 AI 整理稿

智東西 作者 | 程茜 編輯 | 漠影 AI的競爭主戰場,已經從淺層的對話交互,全面轉向實際生產力比拼。 基於這一行業趨勢,各大廠商在加速迭代自家大模型的同時,還瞄準了用戶付費意願場景更高、AI商業化落地確定性更強的多智能體協同、AI編程等場景。 當下正處搶佔AI應用生態佈局的關鍵窗口期,AI賽道的企業以分層基礎模型為核心,搭配自研的專屬開發工具,從而兼顧用戶日常和專業生產場景需求,壓低AI落地使用門檻。 恰逢行業變革的關鍵時點,Agnes AI今日正式官宣文本大模型與AI編程產品矩陣的最新升級,包括Agnes-2.5 Flash正式上線、旗艦文本模型Agnes-2.5 Pro Alpha即將開放體驗,以及AgnesCode功能優化升級。 此次升級進一步強化了Agnes在複雜推理、Agent任務執行、專業Coding以及智能開發場景中的能力,為開發者和企業用戶提供更高效、更智能的AI生產力工具。 Agnes 2.5 Flash:專為日常編程、Agent和高頻開發任務打造,目前API與AgnesCode已全面上線,並繼續不限期免費開放。 Agnes 2.5 Pro Alpha即將上線:首款付費模型,支持百萬token上下文,面向複雜智能體、專業編程和高難度工程任務場景優化,登錄AgnesCode即可領取積分免費體驗。 AgnesCode:優化開發體驗,首字生成時延(TTFT)進一步降低,模型響應更快;新增CLI命令行功能,支持開發者直接在終端環境中完成代碼理解、修改、調試和多步驟開發任務。 Agnes AI產品矩陣全方位升級的背後,是緊跟AI應用形態邁入新一輪升級週期的佈局,如今用戶普遍將大模型深度對接內部業務系統、內嵌至全流程工作鏈路,實現全天候高頻調用,直接推動批量Token消耗量呈現指數級攀升。在此背景下,行業的模型競爭已告別單點性能比拼,進入綜合實力的全方位角逐階段。 一、兩大模型+AI工作臺全升級,Pro Alpha模型上榜Artificial Analysis 榜單分數,是體現模型水平高低的直觀證明。 Agnes AI此次更新的Agnes 2.5 Pro Alpha在多個公開評測榜單中展現出較強的綜合能力。 首先,在Artificial Analysis的Intelligence Index中,Agnes 2.5 Pro Alpha得分39,在其同類模型中位列第9。 該指數由9項評測構成,覆蓋Agent任務、代碼執行、科學推理、知識可靠性和長上下文理解等能力,其中Agent和Coding相關評測合計佔據較高權重,更注重模型在真實任務中的綜合表現。 其次,Agnes 2.5 Pro Alpha在真實Linux終端智能體基準測試Terminal-Bench v2.1中得分為67%。 這一榜單的含金量在於,其全程在隔離Docker沙箱環境運行,固定保留89項真實工程任務,修復了28項環境配置、指令匹配、資源配額的底層問題,因此分數反映的是模型在模擬終端環境中完成工程任務的能力。 除了Agnes 2.5 Pro Alpha,Agnes AI還升級了Agnes 2.5 Flash,並配套完成其AI工作臺AgnesCode的使用優化。這兩款模型分別承接的是普通用戶日常需求和專業開發者的複雜需求。 先來看下Agnes AI此次升級的AgnesCode平臺。 在用戶體驗方面,該平臺完成首字生成時延(TTFT)優化。用戶下發提示詞後整體響應效率提升,連續編碼、多輪智能體任務流轉更加順暢,保障Vibe Coding編寫的心流不被加載卡頓干擾,高頻改碼、執行指令時的交互體驗顯著改善。 除了桌面端升級,AgnesCode將於7月28日上線CLI功能,用戶登錄部署後,可在本地項目文件夾用自然語言完成代碼解析、文件修改、故障排查、測試編譯等開發工作;授權後還可直接運行終端指令、安裝項目所需依賴。 憑藉模型的全棧能力迭代、分層定價策略、免費體驗以及對AI工作臺升級的組合策略,Agnes AI已經打通了從技術研發、用戶沉澱到商業落地的完整鏈路。 二、一手實測編程難題,直出複雜項目管理平臺 智東西提前體驗了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。 第一個輕量化模型是Agnes 2.5 Flash,其可以完成用戶日常編程、Agent和高頻開發任務,提升了代碼理解、Bug修復、項目重構、多文件修改、多步驟任務執行和複雜推理等能力。 與Agnes AI此前的定價策略一脈相承,該模型全面上線後將不限期免費開放,開發者可以通過AgnesCode或API調用。 智東西先用Agnes-2.5 Flash做了一輪測試,輸入提示詞:搭建一個macOS桌面界面,自帶文件管理、瀏覽器、筆記這類常用基礎功能。 可以看到,模型生成的界面整體視覺貼合原生macOS系統的經典UI風格,頂部菜單欄、桌面常駐圖標、底部Dock欄等元素齊全,同時配齊了文件管理器、瀏覽器、備忘錄、日曆、相機、音樂、黑屏終端、系統設置這些剛需程序,並且點擊日曆還能查看到對應的提醒事項,貼合真實系統的交互觀感。 另一道題目是讓模型生成“一個完整響應式科幻風格個人博客網站”。 整個網站的視覺風格統一,主標題設計了白色和紫色漸變的字體,符合科幻感,頁面佈局中自上而下采取了主標題、文章列表、博主個人介紹的排布,文章卡片使用半透明深色背景,主次分明。 第二個是Agnes 2.5 Pro Alpha,這一模型在Agnes AI的模型矩陣中定位較為特殊。 該模型是全新旗艦文本模型Agnes-2.5 Pro的體驗先行版本,支持100萬Token超長上下文窗口,面向複雜問題理解與推理、長鏈路任務執行、大型項目協作、複雜代碼分析及工程開發等場景進行了優化。 Agnes 2.5 Pro Alpha也是Agnes AI首款付費模型,當前API價格為每百萬輸入Token 0.45美元(約合人民幣3.05元)、每百萬輸出Token 0.90美元(約合人民幣6.09元)。用戶可通過Agnes充值後調用API服務;同時,為降低專業用戶體驗門檻,模型上線後,用戶可登錄AgnesCode領取免費積分,體驗Pro Alpha模型能力。 智東西提出了一個進階難題,要求Agnes 2.5 Pro Alpha“設計並實現一個企業級多租戶SaaS項目管理平臺”。 首先在登錄頁,其完整設計了賬號、密碼、租戶標識(Tenant Slug)輸入框,精準對應多租戶體系的登錄鑑權邏輯。 其次是後臺界面,其採用了左側導航欄、右側內容區的企業後臺佈局,匹配項目管理平臺的功能結構,並且組件化拆分、表單、篩選、卡片佈局都屬於成熟企業前端寫法,靜態頁面的還原質量合格。 Agnes-2.5 Pro Alpha作為先行體驗版本,已經在複雜平臺的構建方面展現出應用價值,再加上其Flash版本承接用戶日常的高頻業務調用,一普惠一旗艦的組合升級,適配當下AI應用的規模化落地。 三、周token處理量超8萬億,調用數據印證模型商業化進展 評判一款全模態大模型的技術成熟度,紙面參數、各類權威評測榜單固然有參考價值,但真實線上Token消耗結構是更為硬核的落地檢驗標準。 依託真實線上業務沉澱的數據能直觀反映用戶真實使用偏好與模型實用價值,根據Agnes AI披露的最新數據,其全模態模型的單週Token處理量已經達到8.16萬億,其中文本Token達到5.1萬億,佔總量的62.5%,多模態Token為3.06萬億,佔總量的37.5%。 這份Token配比數據釋放出清晰信號,Agnes全模態模型的整體調用規模走高,多模態佔比穩步提示,說明其圖像、視頻模塊具備獨立可用、穩定可靠的產品能力。用戶實際業務場景實現了全覆蓋,既包含文本對話、代碼編寫等傳統剛需場景,也落地了圖片處理、視頻解析等多元多模態業務需求。 這與當下AI產業趨勢相關,如今頭部模型比拼的核心落點,轉向技術能力能否匹配用戶真實需求、收穫市場認可,並最終轉化為真實調用流量。 根據全球AI模型聚合平臺OpenRouter的最新大模型周調用榜單,小米MiMo-V2.5以10.2T tokens位列第一,DeepSeek V4 Flash以6.01T tokens位列第二。對比兩家行業頭部玩家的數據,Agnes已經達到8.16萬億的周處理量級,其商業化規模躋身全球前列。 模型體驗比拼白熱化的背後,行業競爭重心同步還向下游推理基建轉移,SGLang作為支撐萬億級Token流轉的核心開源框架,成為各大技術團隊打磨硬核工程能力的關鍵。 Agnes團隊也在參與SGLang開源社區建設,目前已提交4項代碼貢獻,其中3項已正式合併,另有1項已通過維護者審核,正在完成後續測試與合併流程。 結語:模型全方位升級落地,核心是對齊產業真實訴求 頭部大模型的能力比拼,正從文本模型的單一競賽,轉向圖像、視頻與文本協同運轉的一體化全模態體系建設。與此同時,全模態能力只有經過海量線上調用檢驗、份額穩步提升,才算完成從實驗室算法原型向穩定可用產品能力的迭代閉環。 Agnes從模型、調用量、工具的全方位升級,也證明其模型的感知、理解、生成一體化能力已經真正匹配了產業實際需求。

Related

相關文章

一句話搭出9人旅行網站,奧特曼:ChatGPT Work名字起小了

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

不做加法做減法,可能會是智能眼鏡的新出路

智能眼鏡因「輕量化、長續航、高性能」不可能三角而難以普及,Moonix推出僅14.9克的AI眼鏡,放棄翻譯、導航等低頻功能,聚焦錄音、錄像與AI對話。此舉將眼鏡定位為手機的補充而非取代,試圖透過輕量化讓用戶先習慣佩戴,再逐步擴展功能。

剛剛

ChatGPT語音殺入桌面,你負責動嘴,一群AI負責幹活

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

AI這個細分賽道拐點已至

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛