誰是 DeepSeek V4 Flash 最佳編程搭檔?Composio 測試 Codex 等 4 個 AI 工具

2026年8月7日 14:48
誰是 DeepSeek V4 Flash 最佳編程搭檔?Composio 測試 Codex 等 4 個 AI 工具
站內 AI 整理稿

首頁 > 智能時代>人工智能 誰是 DeepSeek V4 Flash 最佳編程搭檔?Composio 測試 Codex 等 4 個 AI 工具 2026/8/7 14:48:10 作者:故淵 責編:故淵 評論: 8 月 7 日消息,Composio 昨日(8 月 6 日)在 X 平臺發佈推文,使用 30 項任務測試 4 個 AI 編程智能體框架,觀察哪個框架更能發揮 DeepSeek V4 Flash 正式版性能。

查詢公開資料,Composio 成立於 2023 年,總部位於舊金山,定位開源 AI 智能體工具集成平臺,核心是打通大語言模型與各類外部應用的連接,幫助開發者快速搭建可落地的生產級 AI 智能體。

Composio 使用 Gmail、GitHub、Slack 和 Notion 等真實工具測試 30 個 AI 智能體任務,統一調用 DeepSeek V4 Flash 正式版模型,其任務結果如下:Oh My Pi: 17/30Claude Code: 16/30Codex: 16/30OpenCode: 14/30測試結果顯示 Oh My Pi 的成功率最高(17/30),但速度最慢,每個任務耗時 272 秒。OpenCode 的成本最低,每個成功任務僅需 0.073 美元;而 Claude Code 速度最快,僅需 122 秒,但成本最高,每個任務耗時 0.

195 美元,儘管它使用的工具調用次數最少,生成的輸出令牌也最少。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:AI,Claude Code,Codex,DeepSeek V4 Flash,Composio谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時谷歌打造本地翻譯機器,運行 Gemma 4 E2B AI 模型總檯中國之聲曝光民宿 AI 圖亂象,統一回復“近期沒房”、推薦其他房源影石產品將上線 AI 語音助手,分區域接入阿里千問和 Gemini 模型Neon 開源 4B 模型:文檔搜索能力超 GPT-5.

Related

相關文章

智東西生成式AI

一文看懂昇騰超節點:AI Infra已進入系統工程階段

(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。

25 分鐘前
鈦媒體生成式AI

Anew labs,“蒸餾”的行家

醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

4 小時前

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上

Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。

4 小時前