誰是 DeepSeek V4 Flash 最佳編程搭檔?Composio 測試 Codex 等 4 個 AI 工具

首頁 > 智能時代>人工智能 誰是 DeepSeek V4 Flash 最佳編程搭檔?Composio 測試 Codex 等 4 個 AI 工具 2026/8/7 14:48:10 作者:故淵 責編:故淵 評論: 8 月 7 日消息,Composio 昨日(8 月 6 日)在 X 平臺發佈推文,使用 30 項任務測試 4 個 AI 編程智能體框架,觀察哪個框架更能發揮 DeepSeek V4 Flash 正式版性能。
查詢公開資料,Composio 成立於 2023 年,總部位於舊金山,定位開源 AI 智能體工具集成平臺,核心是打通大語言模型與各類外部應用的連接,幫助開發者快速搭建可落地的生產級 AI 智能體。
Composio 使用 Gmail、GitHub、Slack 和 Notion 等真實工具測試 30 個 AI 智能體任務,統一調用 DeepSeek V4 Flash 正式版模型,其任務結果如下:Oh My Pi: 17/30Claude Code: 16/30Codex: 16/30OpenCode: 14/30測試結果顯示 Oh My Pi 的成功率最高(17/30),但速度最慢,每個任務耗時 272 秒。OpenCode 的成本最低,每個成功任務僅需 0.073 美元;而 Claude Code 速度最快,僅需 122 秒,但成本最高,每個任務耗時 0.
195 美元,儘管它使用的工具調用次數最少,生成的輸出令牌也最少。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:AI,Claude Code,Codex,DeepSeek V4 Flash,Composio谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時谷歌打造本地翻譯機器,運行 Gemma 4 E2B AI 模型總檯中國之聲曝光民宿 AI 圖亂象,統一回復“近期沒房”、推薦其他房源影石產品將上線 AI 語音助手,分區域接入阿里千問和 Gemini 模型Neon 開源 4B 模型:文檔搜索能力超 GPT-5.
Related
相關文章

一文看懂昇騰超節點:AI Infra已進入系統工程階段
(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。
AWS Strands Agents 團隊發布 Strands Harness:開源代理框架,Token 成本降低 28%,準確度相當
Many developers find that an agent idea works inside Claude Code or Codex, then struggles once they rebuild it with their own loop. The Strands Agents team at AWS is targeting that gap with Strands harness, a fully assembled, general-purpose agent harness.

OpenAI自曝6起事故:AI安全的第一份"審計報告"由誰簽字?
舒澤品牌手記2026.09.21 18:11 · 來自浙江全文4308字00:00 / 12:47當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。文 | 舒澤品牌手記9月16日,OpenAI在官網掛出6份模型異常行為報告。

Gemini"越獄"入侵三家企業:谷歌壓了兩個月,四巨頭栽在同一家35人公司手裡
AI唱反調2026.09.21 18:02 · 來自北京全文2381字四起事故連起來看,真正的主角已經不是某一家模型,而是整個行業的安全評測體系。文 | AI唱反調AI圈最魔幻的劇情出現了:OpenAI、Anthropic、Meta、谷歌,四巨頭的模型越獄事故,測試方是同一家公司。

Anew labs,“蒸餾”的行家
醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上
Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。