DeepSeek 首個開源多模態模型來了:這雙“眼睛”不給人類看圖,專供 Agent 幹活

2026年9月1日 08:017300 次瀏覽
站內 AI 整理稿

AI資訊AI新閒資訊正文DeepSeek 首個開源多模態模型來了:這雙“眼睛”不給人類看圖,專供 Agent 幹活發布於AI新閒資訊時間 :Sep 1, 2026閱讀 :2分鐘DeepSeek 在 Hugging Face 上線了 DeepSeek-V4-Flash-Vision-Exp,這是 V4 家族首款實驗性多模態模型,採用 MIT License。模型參數量達 305B,基於 V4-Flash-0731 底座,在原有語言模型基礎上接入視覺編碼器和 Aligner,經持續訓練獲得圖像理解能力。

不做“看圖說話”,專攻多模態 Agent與傳統多模態模型主打視覺問答不同,DeepSeek 為這個 Vision 版本劃定了全新賽道:官方重點強調多模態 Agent 能力,讓 Agent 直接讀取網頁截圖、軟件界面、圖表等視覺信息,再結合工具調用繼續執行任務。換言之,這雙“眼睛”不是給人看的,而是給 Agent 用的。此次開源內容相當完整,包括模型權重、Tokenizer、Prompt Encoding 參考實現以及一份最小化 PyTorch 推理實現,覆蓋視覺編碼器、Aligner、DFlash Attention、MoE、Hyper-Connections 等核心模塊。

社區跟進迅速,Hugging Face 頁面上已出現 7 個面向 llama.cpp、LM Studio、Ollama 的量化版本。時間線上也有值得注意的細節:8 月 21 日該模型先上線 DeepSeek API,當時只能調用、不給權重,開發者可通過 API 同時輸入文字和圖片,圖片按 Token 計費;十天後權重才正式開放,本地部署和二次開發由此成為可能。這種“先賣 API 再開源”的節奏,也透露出 DeepSeek 對其以 API 服務為主的定位。性能逼近 Claude Opus 4.

8,官方措辭依舊剋制從跑分來看,加入視覺能力後純文本 Agent 能力基本不受影響:Terminal Bench 2.1 從 82.7 漲到 83.9,DeepSWE 從 54.4 漲到 59.3,反而超過 Opus 4.8 的 58.0。多模態 Agent 提升更明顯:ApexBench Pass@1 達到 36.5,Agents' Last Exam 以 27.3 超過 Opus 4.8 的 25.7,ZeroBench Pass@5 也以 35.0 壓過對手的 34.0。不過 DeepSeek 並未宣稱“全面超越”:NL2Repo 項目上其得分 57.7,與 Opus 4.8 的 69.

7 差距不小。官方表述也保持克制,僅稱“多模態 Agent 能力接近 Claude Opus 4.8”。把近期更新串起來看,DeepSeek 正在拼裝一套完整的 Agent 技術棧:模型負責推理和工具調用,Harness 負責持續執行任務,Vision 則讓 Agent 能直接讀取電腦裡的視覺信息,此次開源正是這塊拼圖的關鍵落子。相關推薦DeepSeek首個視覺實驗模型正式開源,3050億參數對標頂尖水平DeepSeek開源V4系列首個實驗性多模態模型V4-Flash-Vision-Exp。

該模型基於V4-Flash架構融合視覺模塊,在原有文本能力上新增深度圖像理解與分析能力,總參數量達3050億,視覺與文本架構有機結合,可精準解讀圖像並實現多模態融合。Sep 1, 2026158.3k前字節AI高管廖謙“下海”做乙方:半個月搞定數百萬美元,要讓營銷代理像007一樣接單前字節跳動AI產品副總裁廖謙8月底離職創業,成立“極致上下文”公司,專注營銷場景多模態Agent。公司迅速獲得數百萬美元天使輪融資,投資方包括硅谷HT Investment和百度風投。廖謙將產品比作“007後勤處”,能根據品牌需求自動完成策略、腳本到視頻生成的全流程,客戶僅需簡單確認。

Oct 31, 2025223.9kRunway發佈首個界面世界模型Solaris,實時逐幀生成動態交互界面知名AI企業Runway發佈界面世界模型Solaris,實現軟件與網頁無需預寫代碼即可實時逐幀渲染圖形交互界面,打破傳統界面依賴固定框架的模式。該系統或將彌合“知曉事物”的AI助手與界面生成之間的割裂,推動交互式數字體驗邁向實時生成新階段。Sep 1, 202693.7k57 歲男子聽信 AI 指路抄近道,被困深山耗盡體力,事後 AI 竟回“哈哈,確實!”浙江消防披露:57歲湖南籍男子楊師傅在寧波登山,登頂後改走陌生路線,盲信AI推薦的下山路徑,結果越走越偏、體力耗盡,報警後才脫險。

楊師傅平日體能較好仍被困,事後AI回覆令人哭笑不得。消防提醒野外登山勿輕信AI,應選成熟路線確保安全。Sep 1, 202693.6kChatGPT Ads上線不足200天創商業化奇蹟,OpenAI野心直指千億美金OpenAI廣告業務ChatGPT Ads上線不足200天,年化收入運行率已破10億美元;試點僅6周即破1億美元,增勢迅猛。公司同步上調中長期營收預期,預計2026年全年廣告收入繼續增長。Sep 1, 202694.6k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

量子位生成式AI

3秒出片比播放還快,MiniMax打開了AI視頻的實時商業化路徑

MiniMax推出新一代影片生成模型H3 Max,生成5秒768p影片僅需不到3秒,速度已超越播放速度,並帶動AI即時直播與AI版短影片App等創新應用。該模型基於開源的H3進行後訓練與推理優化,吞吐量約為原版35倍,同時在圖生影片評比中拿下第一。市場上已出現多個由開發者打造的即時生成直播頻道,顯示此技術開啟新的商業化路徑,而MiniMax股價也在近期大漲。

剛剛

奧特曼播客曝猛料:Astra操作電腦已達人類水平

OpenAI 執行長奧特曼(Sam Altman)近日在一場播客訪談中投下震撼彈,直言旗下 AI 代理系統 Astra 在操作電腦方面的能力,已經達到與人類相當的水準。這番談話迅速在科技圈發酵,外界普遍將其視為 AI 從「回答問題」邁向「實際動手執行任務」的關鍵分水嶺。 奧特曼在節目中並未停留在技術層面的描述,而是進一步闡述 AI 能力躍升後對社會結構的深遠影響。他特別點名高等教育體系,認為傳統四年制大學的養成模式已經跟不上時代,主張兩年就足以完成必要的學術訓練。

剛剛

奧特曼直言:四年太久,大學兩年就夠

OpenAI 執行長山姆·奧特曼(Sam Altman)近日再度拋出震撼教育界的觀點。他向外界直言,傳統大學四年學制早已不合時宜,在人工智慧迅速改變知識取得與技能養成的當下,兩年時間便足以讓年輕人具備進入社會所需的核心能力。這番言論迅速在矽谷與科技圈引發熱烈討論,也讓外界重新審視高等教育的效率與未來走向。 奧特曼長期以來便對现行教育體系抱持批判態度。他認為,現行的大學課程設計源自工業時代的標準化思維,過度依賴課堂授課與學分累積,卻忽略了學生真正需要的是解決問題的能力與實作經驗。

剛剛

月之暗面與微軟、谷歌、亞馬遜談判, 爭取最高30%服務分成

中國月之暗面就Kimi K3與美雲企談30%收入分成,具標誌性意義。 近日,財聯社報道,據消息人士透露,月之暗面正就Kimi K3 AI模型與微軟、亞馬遜、谷歌進行收入分成談判。月之暗面在初期談判中,正尋求從K3相關服務產生的收入中抽取最高30%的分成。 如果談成,這將是中國AI公司和美國雲巨頭之間,第一個大型模型收入分成協議。 不過談判仍處於早期階段,分成核算口徑、合作落地週期、服務邊界等核心細節尚未最終敲定。目前,涉及的三家雲廠商和月之暗面都拒絕對談判公開發表評論。

剛剛
智東西生成式AI

混元Hy4 preview輕量版來了!權重壓縮86%,性能幾乎不減

(公眾號:zhidxcom) 作者 | 程茜 編輯 | 心緣 9月1日報道,今日中午,騰訊發佈了其最新一代旗艦模型預覽版本Hy4 preview的輕量版模型,將模型權重從1.5TB壓縮到214GB。 騰訊混元的測試結果顯示,壓縮後的模型與Hy4 preview原始模型相比,長文理解、多輪長上下文檢索和原版基本在同一水平,數學有小幅回落。壓縮後模型能覆蓋日常編程輔助、工具調用、長文檔處理和常規問答。

剛剛

2026年的一切,都只是Robocity的序幕

35分鐘前“最強大腦”與“最強小腦”相互需要2026-08-11百度AI的驗牌時刻到了2026-07-27閱讀更多內容,狠戳這裡查看AI測評DeepSeek選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇馬斯克狂贊,硅谷大佬驚呼:Grok Bot是下一個ChatGPT時刻硅谷投資人稱Grok Bot是新ChatGPT時刻,為AI生產革命。

剛剛