對比 Codex,免費的 AgnesCode 也能在底層算子優化任務中打得有來有回

本文作者: 李娜 2026-09-30 16:13 導語: AgnesCode在部分芯片上跑出更高性能,免費模型完成專業級交付。AgnesCode在部分芯片上跑出更高性能,免費模型完成專業級交付。作者丨吳海明 曹PP 編輯丨李 娜 免費的 AI Coding Agent,能不能和付費 Codex 在真實工程任務裡打得有來有回?過去一年,我們已經習慣了讓 Coding Agent 寫網頁、做應用、修 Bug。但這一次,我們想把它往更底層推一步:讓 AI 去優化大模型自己運行時使用的算子。所謂“算子”,可以簡單理解為大模型運行時反覆執行的一小段底層計算程序。
模型每生成一個 Token,都要在 GPU 或其他 AI 芯片上執行大量矩陣計算、注意力計算和數據變換。單個算子看起來很小,但會被模型反覆調用。因此,一段高頻算子如果能快 10%、20%,最終就可能轉化為推理速度、硬件利用率和服務成本上的實際差異。這恰好提供了一種不同於常規 Coding Benchmark 的測試方式:如果 Agent 能夠讀懂任務、修改算子、適配不同芯片,並最終跑出真實的性能提升,那麼它觸及的已經不只是應用開發,而是 AI Infra 中一部分真正的工程工作。為了回答這個問題,我們把 AgnesCode + Agnes 3.
0 Flash 放進眾智 FlagOS 開放計算全球大賽的一道算子優化題:為 DeepSeek-V3 解碼階段使用的底層算子寫優化代碼,並在 8 款芯片上接受賽事官方自動化評測,同時,選擇 Codex + GPT-5.6 Sol 組合作為對照。兩組候選者使用完全相同的環境為算子撰寫優化代碼,最終都提交到賽事官方的自動化評測系統進行評測。結果很有趣:兩組選手都順利完成了任務,Codex + GPT-5.6 Sol 用 8 分 57 秒給出結果,AgnesCode + Agnes 3.0 Flash 在中途被測試人員催促了一次後,耗時 20 分 36 秒完成任務。
經過官方自動化評測後,對比 Codex 通過7款芯片的戰績,AgnesCode 略遜一籌,通過了 6 款芯片;但在雙方共同通過的 5 款芯片上,AgnesCode 有 4 項加速比更高,其中在國際通用芯片 B 上達到 4.81×,高於 Codex 的 3.71×,加速比分數高出約 29.6%;崑崙芯上也只有 AgnesCode 通過測試。這不只是一個“免費模型全面替代付費模型”的故事,還說明了另一件事:當任務邊界、工具鏈和評測閉環足夠清晰時,免費 Agent 已經可以進入底層工程任務,並交出可驗收、有性能收益的產物。Agent 時代,模型便宜只是入場券,能把任務交到終點才是分水嶺。
本文真正想回答的,是當 AI 開始擰緊自己的底層螺絲,免費的 AgnesCode 距離一個可用的工程助手還有多遠。((公眾號:))01一道題:優化 DeepSeek-V3 底層算子考慮到常見測試任務的數據很可能已經用於模型訓練,導致模型本身已經很擅長,因此,在這次測試中,我們直接跳過常見的網頁生成、數據看板、文案撰寫等常見測試場景,選擇讓 AgnesCode 直接挑戰更接近基礎工程的題目:大模型推理算子優化。具體來說,算子是模型算法能運行的基礎環節,模型每生成一個 Token,背後都要反覆調用矩陣乘法、注意力、歸一化、激活函數等底層算子。
在單個算子上幾個百分點的加速比,往往直接變成推理延遲、顯存佔用和服務成本的差異。更重要的是,算子優化正在成為 AI 自進化的一部分,過去,優化這類底層代碼高度依賴系統工程師手寫經驗;現在,Coding Agent 開始嘗試讀任務、寫算子代碼、跑測試、看報錯、再改代碼,這是 AI 開始反過來優化自身運行底座的一種工程樣本。所選測試題來源截圖1: 眾智 FlagOS 開放計算全球大賽賽季二的賽道一需要說明的是,這次的測試題目來自眾智 FlagOS 開放計算全球大賽賽季二的賽道一:SGLang框架算子在多款芯片的性能優化。
該比賽圍繞 SGLang 推理框架開放了 200 餘道算子任務,每週發佈一批算子題目,參賽者只能在本週內看到賽題內容。因此,這可以極大保證測試任務的數據沒有被測試模型提前學習,對評測對象來說,這完全是一次“摸底考試”。所選測試題來源截圖2: 200+算子的多芯片優化任務具體來說,我們選擇了一道 DeepSeek-V3 在解碼階段使用的融合 QKV-A 下投影算子 題目(Task66: dsv3fusedagemm)作為測試任務,該算子是將輸入特徵與合併後的投影權重相乘,一次完成 Q 分支和 KV 分支的前置投影,為後續注意力計算準備數據。
題目本身的計算並不難,真正的挑戰在於考察 AgnesCode 能否生成一套優化算子代碼能快速通過 8 款芯片(2款國際芯片、天數智芯、沐曦、燧原、海光信息、崑崙芯和華為)。所選測試題來源截圖3: Task66-dsv3fusedagemm 賽題02對打 Codex:入口名翻車,但性能結果並不弱為了更好知道 AgnesCode 的行業水平,我們選擇 Codex+GPT-5.6 Sol 組合作為對照組,AgnesCode 則用官方提供的免費模型 Agnes 3.0 Flash 作為後臺。
我們為兩個組合同時提供一個標準化的 Skill,該 skill 提供了賽制的全部信息,例如如何命名每個代碼文件、如何在代碼文件中命名函數名、寫完代碼以後要打包等。之後,我們在相同的環境下讓兩個組合為測試題撰寫代碼。具體地,我們首先讓兩個組合在一臺含有 NVIDIA 芯片的機器上撰寫第一個版本代碼,然後再基於這個版本代碼撰寫適配其他所有芯片的代碼。從運行過程來看,AgnesCode + Agnes 3.0 Flash 組合在第二階段生成代碼的時候,首先花費了7分10秒沒有給出答案,經過測試人員催促以後,再次經過13分26秒後給出了 針對不同後端調整優化的代碼。
包括語法、禁用項和文件依賴檢查,最終整理提交包,並更新開發記錄。整體來看,從編寫實現、跨芯片適配,到代碼自檢、打包和交付,這個組合已經能夠圍繞一個專業任務推進完整的工作流程。AgnesCode + Agnes 3.0 Flash 組合運行截圖再來看看 Codex+GPT-5.6 Sol 組合的表現,相對AgnesCode + Agnes 3.0 Flash 組合 整體使用 20 分 36 秒的時間開銷,Codex+GPT-5.6 Sol 組合僅用8分57秒就給出了結果。對比來看,Codex+GPT-5.6 Sol 組合的整體工作推進更快,也更加流暢。Codex+GPT-5.
6 Sol 組合運行截圖任務推進過程是一方面,兩個模型經過系統評測的效果如何呢?眾智 FlagOS 開放計算全球大賽賽事官方自動化評測結果截圖,第一行為 AgnesCode + Agnes 3.0 Flash 測評結果,第二行為 Codex+ GPT-5.6 Sol 測評結果。整體來看,雖然在芯片的適配數量上,AgnesCode 落後Codex 一個,僅有六個芯片通過了測試。但在雙方共同通過的五個芯片上,AgnesCode 有四項加速比更高,在天數智芯上,AgnesCode 為 2.16×,Codex為 1.72×;在國際通用芯片 B 上,AgnesCode 達到 4.
81×,高於對照組的 3.71×,加速比分數高出約 29.6%;在崑崙芯上僅有 AgnesCode 通過了測試,並取得來2.56X的加速比。該結果表明,AgnesCode + Agnes 3.0 Flash 交付了能夠在多個平臺獲得實際加速的算子成果,體現了一定的競爭力,但在跨平臺覆蓋和最終驗收,仍有繼續改進的空間。最後,對於一個繞不開的話題——成本,AgnesCode + Agnes 3.0 Flash 完全免費,這讓它在真實的業務場景裡更具吸引力。很多任務往往需要多輪問答才能獲得較為不錯的效果,而且模型還需要反覆讀取文件、根據用戶反饋進行調整。
若按閉源模型計費,賬單很可能快速爆炸,而免費模型至少把“敢不敢讓多試幾輪”的門檻降了下來。03AA榜單揭示 Agnes 3.0 Flash 的能力邊界上述測試可以發現,免費的 AgnesCode+Agnes 3.0 Flash 完全可以和付費訂閱的 Codex+ GPT-5.6 Sol 打的有來有回,這是個例還是普遍存在呢?對此,我們調取了 Artificial Analysis (AA榜單)公佈數據,其中的 Intelligence Index 指標綜合考察模型在工作任務、工具執行、編程、複雜推理、知識可靠性與長上下文等方面的表現,為模型的整體水平提供參照,Agnes 3.
0 Flash 的得分為 36 分,即為接近 GPT-5.6 Luna(max)的 38 分。這說明 Agnes 3.0 Flash 本身能力已經和主流模型能力不相上下了。Artificial Analysis (AA榜單)公佈數據截圖在 Artificial Analysis 的智能表現 × Token價格對比中,Agnes 3.0 Flash以約 0.03 美元/百萬 Token 的價格進入最具吸引力區間,並位於帕累託前沿。另外,把能力和價格放到同一張圖裡看,Agnes 3.0 Flash 的位置會更直觀。AA 榜單的智能表現 × Token 價格對比顯示,它以約 0.
03 美元/百萬 Token 的價格,進入了圖中最具吸引力的低價高能區間:橫向看,它的價格顯著低於多數同等智能表現的模型;縱向看,在相近價格帶裡,拿到了更靠前的智能表現,這直接讓模型坐穩帕累託前沿的位置。從實際的 Agent 工作流來說,這個位置尤其重要,因為長任務會不斷放大 Token 消耗,模型每便宜一點,都會直接影響用戶是否願意讓它持續讀文件、改代碼、跑測試和反覆迭代。Artificial Analysis (AA 榜單)的智能表現 × Token 價格對比數據截圖04免費又不失性能,為 AI 進化帶來更多探索空間通過代碼優化測試可以發現,AgnesCode + Agnes 3.
0 Flash 已經能自動化生成能被系統驗收、能被繼續迭代、能在成本上算得過賬的交付物。Agent 時代,模型便宜只是入場券,能把任務交到終點才是護城河。換句話說,隨著 AI 的發展,用戶需要的不再只是生成應用,而是 AI 開始擰緊自己的底層螺絲。從結果看,AgnesCode + Agnes 3.0 Flash 展示了兩個信號:1.在有明確工作流、任務文件和評測反饋的情況下,它已經能推進跨芯片算子適配,並在部分芯片上跑出更高加速比。2.Agent 可能會在“最後一公里”犯錯,例如入口命名、提交規範、覆蓋範圍等細節,這些問題不一定抹掉性能亮點,但會直接決定結果能不能被真實系統接收。
模型能力決定上限,工作臺能力決定它能不能穩定抵達上限。對開發者和企業用戶而言,AgnesCode 的優勢不只在模型本身,也在它把模型、項目文件、Skill、命令執行和評測反饋組織到同一個工作流裡,幫助用戶少打擾、少返工、少花錢地把事做完。從算子優化來說,這也是國產 AI 芯片生態正在面對的現實問題,不同芯片之間的差異,不會因為上層框架統一就自動消失;推理框架、算子庫、編譯工具鏈和真實業務負載之間,仍然需要大量適配工作。如果 Agent 能進入這條鏈路,它就有機會把過去依賴少數系統工程師經驗的優化工作,變成可以持續生成、持續驗證、持續迭代的工程流程。對比,Codex + GPT-5.
6 Sol 在任務推進速度和整體流暢度上依然更佔優,AgnesCode + Agnes 3.0 Flash 也暴露出交付細節上的不穩定。但同時證明了一件事:免費模型並非只能停留在簡單任務層面,只要工具鏈、上下文和評測閉環足夠明確,它同樣可以進入專業工作流,並交出有競爭力的結果。免費模型的真正價值,正在從讓 AI 變得更便宜轉向讓更多真實任務有機會被 AI 反覆嘗試。當試錯成本下降,Agent 才可能從“偶爾幫忙”變成“持續幹活”;當持續幹活成為可能,誰能把專業要求穩定寫進執行過程,誰就更接近下一代 AI 工作臺的入口。原創文章,未經授權禁止轉載。詳情見轉載須知。
0人收藏 分享: 相關文章 ai 大模型 評測 從 Codex Harness 開源,看 AI 公司的護城河是什麼?...在三張圓明園鼠首照片裡,我們看到了3D AI的Harness ...越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時 ...拆解 WorkBuddy、千問辦公和豆包工作,它們其實不是 ...李娜 編輯 發私信 當月熱門文章 阿里開源 Qwen3.8-27B 本地實測:性能很強,但 Agent 適配仍待補課 我們拆了 1.
1 萬個 DeepSeek Harness 插件,發現官方几乎沒有建立插件治理機制 萬字長文拆解DeepSeek V4 Pro與Harness:從後訓練到「代理自進化」,更大的變化在開源框架裡 流沙之上:陳冕、景鯤、倪正民和中國 AI 應用創業者的三種選擇 Qwen3.8-27B 登頂全球開源榜第一,曾經的「源神」又回來了!最新文章 實測 Qwen-3.8 與 GLM-5.3 的 Flash 版:誰能讓我提前下班半小時?從 Codex Harness 開源,看 AI 公司的護城河是什麼?全網最硬核 OpenClaw 2.
0 實測:從 ToC 到 ToB 的試探,Agent 網關能重塑工作流邊界嗎?從海拉魯到現實世界:視頻模型如何理解「變化」 在三張圓明園鼠首照片裡,我們看到了3D AI的Harness時刻 全球開源前二,階躍終於回來了 熱門搜索 深度學習 機器學習 智能家居 智能駕駛 金融 激光雷達 比亞迪 富士康 蔚來 Nexus 視頻
Related
相關文章

Muse爆火,dots入場:Personal Agent開始和互聯網平臺搶入口
本文作者: 李娜 2026-09-30 16:35 導語:Personal Agent 正試圖成為互聯網的新中間層。Personal Agent,正在成為這一輪 AI 產品競爭裡最熱的新概念之一。9 月 29 日,OpenAI 發佈了可以長期在線的個人 Agent 產品 dots,提出“always-on agents”。

OpenAI與紅帽等聯合推進OCE1.0研發,打造面向AI代理的“企業級Kubernetes”
該項目最初由 OpenAI 內部發起,現已捐贈給 OpenClaw 基金會統籌。OpenClaw 最初由開發者 Peter Steinberger 創建,是最早利用大模型實現郵件分析回覆與日程預約等自動化任務的代表性個人 AI 代理工具,Steinberger 此後也加入 OpenAI 負責個人代理項目。

Muse爆火,大廠急了
定焦One2026.09.30 16:10 · 來自北京全文5358字00:00 / 15:54中國版Muse,是不是妄想? 文 | 定焦One(dingjiaoone),作者 | 王璐,編輯 | 魏佳Muse的挑戰者,還在不斷增加。北京時間9月30日凌晨,OpenAI在開發者大會上發佈了個人Agent產品Dots,每個Dot運行在獨立雲端電腦上,通過ChatGPT的插件生態接入4000多款應用,能在後臺主動跟進任務,還能通過短信、Slack、Teams觸達用戶。業界普遍把這看作是OpenAI對Meta的正面回應。

從海拉魯到現實世界:視頻模型如何理解「變化」
本文作者: 李娜 2026-09-30 16:09 導語:HiDream-O1-Video 的三場世界回應測試。HiDream-O1-Video 的三場世界回應測試。作者丨Reah 編輯丨李 娜 在《塞爾達傳說:曠野之息》中,玩家點燃一片草地,火焰會沿著草葉蔓延,熱空氣隨之升起。

GPT-6 Astra 上手體驗:花了一週,它真在電腦裡建了座曼哈頓!
本文作者: 李娜 2026-09-30 15:50 導語:網友實測GPT-6 Astra:神操作很多,長任務翻車也很快。網友實測GPT-6 Astra:神操作很多,長任務翻車也很快。作者丨李娜 編輯丨岑峰 北京時間9月4日凌晨,OpenAI正式發佈了新一代旗艦模型GPT-6 Astra。

虧損超80億、算力承諾546億:Anthropic招股書揭開大模型頂流的真實賬本
數據顯示,公司2025年營收同比增長12倍至近46億美元,近三分之二來自美國市場,但同期運營虧損亦翻倍突破80億美元。在商業化結構上,Claude模型以用量計費為主導,貢獻約38億美元收入,訂閱業務僅實現7.89億美元(佔比不足20%)。招股書清晰顯現出其對頭部科技巨頭的深度綁定:2025年,Anthropic通過亞馬遜和谷歌雲平臺斬獲21.