說好“多模態不是主線”的梁文鋒,怎麼轉頭就發了個Vision模型?

字母AI2026.08.24 20:17 · 來自北京全文7138字00:00 / 18:44多模態這事上,梁文鋒還是梁文鋒,但他學會了放低姿態。文 | 字母AI在多模態這個問題上,梁文鋒在那次投資人交流會上曾這麼說過:“多模態佈局,我們一直在做。對產品來講,它很重要;對C端用戶產品來講,它很重要。但是對智能的上限,它是一個組件,它不是主線本身。我們應該會上相關的模型,就是我們V4的後續版本會支持原生的多模態。”梁文鋒也的確做到了。2026年8月21日,DeepSeek上線了DeepSeek V4 Flash Vision Exp,DeepSeek官方稱,這是一個多模態視覺理解模型。
和V4 Flash以及V4 Pro不同,DeepSeek V4 Flash Vision Exp沒有技術報告,也沒開源,官方只給了一張性能表和幾個演示案例。可DeepSeek V4 Flash Vision Exp怎麼看都不像是個“組件”。以往來看,DeepSeek OCR、DeepSeek OCR 2這樣的模型才貼合梁文鋒口中“組件”的定位。這些模型的作用,是把圖片以像素形式存在的文字,轉換成電腦可以識別的純文本字符。因此,相較DeepSeek OCR而言,DeepSeek V4 Flash Vision Exp更像是一個“主線”模型。難道梁文鋒對多模態的看法改變了?事實可能並非如此。
不過有一點可以肯定,那就是梁文鋒學會了放低姿態,用產品和用戶形成更密切的交流。梁文鋒此前曾說,“通往AGI要經過產品這個臺階,但不用花太多精力做C端、B端。”而隨著DSH的爆火,發佈後不到一個星期,DS就發佈更新,提升了多模態能力。過去的梁文鋒對於產品有一種“偏執”,不完美不發佈。DeepSeek V3.2版本和DeepSeek V4預覽版之間,相隔足足4個半月,如果從V3正式發佈開始算,僅僅1個大版本,就用了1年零4個月。現如今不僅更新變快了,還把DeepSeek V4 Flash Vision Exp這種實驗性質的模型開放給公眾,都是在說明梁文鋒態度上發生了一些轉變。
多模態是Agent和推理的入口如果你是練跑步的,那麼你應該給別人看的成績你跑了多少米用了多少秒,這樣別人才知道你到底是快還是慢。但如果你告訴別人的是三分球命中率是多少,那很顯然,你想告訴別人的是你有多準。DeepSeek V4 Flash Vision Exp也是如此,它想表達的事情,遠非是一個展示DeepSeek現有的多模態能力那麼簡單。明明是一個多模態模型,官方公佈的測評裡,放的卻是一串Agent基準。比如Terminal Bench 2.1得83.9,DeepSWE 59.3。其實在AI視覺模型圈裡有一套默認的考卷。
一個新視覺模型發佈,通常要放的是這幾項:MMMU,跨30個學科、大學水平的圖文理解與推理,考“看到圖能不能做對題”;MathVista,考圖片裡的數學推理;DocVQA,考從掃描文檔裡找到答案;ChartQA,考讀懂圖表裡的數字和趨勢;OCRBench,考最基礎的文字識別。無論是Qwen-VL、Gemini 還是GPT-4o,發新版本的時候,展示的都是這套基準。即便是DeepSeek V4 Flash Vision Exp也放了一些多模態側的基準,然而這些基準也“不太正經”,充滿了濃濃的Agent味。
Chartography考的是專業人士讀專業圖表做決策,ApexBench是多模態Agent基準,Agents’ Last Exam 是通用Agent評測。沒有一項是“看圖答題”,全是“看完圖,把事做下去”。這張跑分圖,本身就是DeepSeek的一種暗示。梁文鋒自始至終都認為多模態不是AGI的主線,DeepSeek V4 Flash Vision Exp是DeepSeek在Agent跟推理這條主線上的一個必然產物,只不過它剛好也是“多模態”罷了。
DeepSeek V4 Flash Vision Exp所展現出來的價值觀是,多模態從來不是讓你“看圖聊天”,而是讓Agent看懂網頁截圖、讀懂圖表數據、理解UI佈局,然後把任務做下去。多模態不是目的,是手段,是給主線用的插件。DeepSeek的主線仍然是Agent和推理,DeepSeek V4 Flash Vision Exp所幹的事,也不過是強化了產品的推理能力。雖然DeepSeek V4 Flash Vision Exp這個很神秘,但它也並非是一個憑空出現的模型。
4月29日晚,DeepSeek多模態負責人陳小康(Xiaokang Chen)在X平臺發文預告,配文 “Now, we see you”,宣佈DeepSeek多模態識圖功能開啟灰度測試。第二天,DeepSeek正式在GitHub發佈技術報告《Thinking with Visual Primitives》(以視覺原語思考)及配套倉庫。論文作者單位包含DeepSeek、北京大學、清華大學,屬於三方聯合研究成果。然而這篇論文在5月1日凌晨就被刪除,相關官宣推文也消失不見,GitHub官方倉庫直接變為404狀態,項目徹底無法訪問。DeepSeek全程未發佈任何撤稿公告,也沒有公開解釋原因。
好在,社區留下了這篇論文的拷貝版本。這篇論文沒有去講“我們模型看得多清楚”,而是提出一個問題:模型能看見,但不一定能想清楚。傳統多模態模型用自然語言描述圖片裡的對象,比如“左邊那個男的”“右邊那個高的”。可是在複雜場景裡,這種描述非常模糊,模型很容易越推越亂,最後導致整個邏輯崩塌。就拿集體照來說,左邊一共好幾個男的,那麼哪個男的才是模型所描述的那個?DeepSeek的解法,是把點座標和邊界框提升為“思維的最小單元”,直接嵌進推理鏈,讓模型“邊推理邊指向”,就像人數東西時會伸出手指,一個一個點著數。
靠這套機制,模型在計數、空間推理、迷宮導航這類任務上,把抽象的判斷精確錨定到圖像座標,從“左邊那個男的”、“右邊那個高的”,變成了“我手指的這個”、“我手指的那個”。6月,經過DeepSeek官方確認,其在客戶端和網頁端上線的Vision模式,底層就是這套視覺原語機制。而DeepSeek V4 Flash Vision Exp,是把同一套技術嫁接到了V4-Flash的API基座上,重點強化多模態Agent能力,核心推理邏輯完全沿用了論文的方案,沒有跳出其技術框架。不僅如此,論文當時的實驗,就是基於DeepSeek-V4-Flash作為語言骨幹所搭建的多模態方案。
這次的DeepSeek V4 Flash Vision Exp光看名字也知道,仍然使用的是DeepSeek-V4-Flash。除了DeepSeek V4 Flash Vision Exp這個模型,DeepSeek在多模態方面的進展還體現在DSH上,8月19日晚,作為DeepSeek目前的主力產品,DSH更新了rc.8版本,提升了Agent的多模態能力。rc.8的核心,是DeepSeek在多模態這件事上,“兩條腿”走路。一條叫“原生直通”。rc.
8給模型適配器加了可配置的原生圖片請求能力,只要底層模型聲明支持視覺輸入,比如GLM、Qwen,或者剛上線的V4-Flash-Vision-Exp,Harness就把圖片原封不動送進模型,不做任何中間加工。另一條叫“工具層視覺”,服務的是純文本模型。比如用DeepSeek自己的V4-Flash,直接讀圖會失敗。這時Harness不會報錯退出,而是自動降級成一套工具鏈,先做OCR識別文字,再統計圖片顏色比例、掃描部分像素行、讀取尺寸和顏色模式,把這些信息拆成結構化證據,最後交給文本模型去推理整張圖。
Cherry Studio的核心創始人Yinsen把這種方式稱為“偽視覺”,對付PPT截圖、流程圖、界面這類結構清晰的圖夠用,面對真實照片和複雜的空間關係就很勉強。但要說明的一點是,DSH在rc.8之前,甚至連“偽視覺”都沒有,全靠社區的視覺插件,還有通過pi2dsh橋接進來的視覺方案。它們的做法大同小異,先調一個外部的視覺模型(比如 GLM、Qwen)把圖片識別成文字,再把結果塞回文本模型。這些插件證明了DSH架構的開放性,也同時暴露了一件事,DeepSeek自己沒有視覺模型,只能借別人的眼睛。DSH還有哪些可以補足?正如開頭提到的,雖說梁文鋒沒有改變舊觀點,但梁文鋒也學會放低了姿態。
2025年,在DeepSeek R1驚豔全球之後,社區就開始等待DeepSeek發佈V4。2025年下半年,隨著V3.1、V3.2等迭代版本陸續推出,無數媒體“獨家爆料”,稱DeepSeek下一代旗艦大模型V4,計劃於2025年7月、8月、9月……直至2025年年底發佈。結果自然是無一準確,堪稱現代版狼來了。2026年春節前,距離V3 發佈已經過去400多天,所有人都在賭DeepSeek會復刻春節檔R1的奇蹟,把V4卡在農曆新年這個節慶日子上線。結果2月4日,外媒援引消息人士的話,稱春節期間V4不會發布,DeepSeek官方也對此事保持沉默。然後時間線一路後移。
最後到了4月24日,V4才以預覽版的形式登場,一次同時放出了V4-Pro和V4-Flash。梁文鋒的產品觀是,寧可跳票,也不肯在產品沒有完全做好的前提下發布。可也就是在這段時間裡,DeepSeek“掉隊”了。國際方面,2025年8月,OpenAI發佈了GPT-5;11月,Anthropic發佈Opus 4.5。這兩款模型都是問鼎全球的性能榜的產品。而在國內,2025年4月Qwen 3,不到半年後,阿里一口氣放出來了Qwen3-VL、Qwen3-Omni、Qwen3-Max、Qwen3-Coder。還有Kimi的首個原生多模態模型K2.5、智譜的GLM-4.7、MiniMax的M2.
1、騰訊的hunyuan world等等,數不勝數。與之相對的,DeepSeek發佈的產品只有V3.1(8月V3.1,9月V3.1-terminus)和V3.2(12月)。除了DeepSeek,全世界都在以月為單位發佈模型,Anthropic更是以天為單位,在2026年2月1日到3月末,52天的時間裡發佈了73款功能和產品。假如梁文鋒是大廠的產品經理,以他發產品的效率,恐怕撐不過試用期就得被開除。只可惜DeepSeek是他的。正式版更磨人。6月29日,DeepSeek給全體API開發者發郵件,明確表示V4正式版7月中旬上線。7月21日,有消息表示正式版將要延期,目標挪到7月底。
7月28日,又有消息說可能拖到8月10日至20日之間。7月31日,V4-Flash正式版才千呼萬喚始出來,而V4-Pro正式版,直到8月12日晚間才正式上線。梁文鋒對待產品,不做到自己滿意,絕對不放出來。可到了DeepSeek V4 Flash Vision Exp這裡,明顯味道變了。模型上線當晚,社區就開始對其進行檢測。根據實測顯示,DeepSeek V4 Flash Vision Exp連梁文鋒本人最具代表性的一張照片都無法識別。
不僅如此,還有用戶反饋,稱DeepSeek V4 Flash Vision Exp在理解複雜圖表時會漏掉關鍵信息,中文場景的處理偏弱,有人在對話裡插入圖片後,還發現上下文緩存機制受到牽連。一圈看下來,社區對DeepSeek V4 Flash Vision Exp的普遍看法是“效果好像也就那樣”。這個模型就像是在餐館等著上菜,看不見後廚,不知道這盤菜什麼時候才能端上來,廚師怕你等不及,於是從鍋裡盛了一勺給你嚐嚐,告訴你說菜還沒做好,但是在做了。其中的原因,很可能在於梁文鋒持續受到優秀產品的壓力。DSH從立項之初就對標Anthropic的Claude Code和OpenAI的Codex。
8月23日,外媒報道稱Anthropic或將於8月底遞表上市,因此目前正處於靜默期,Claude Code沒有較大的更新。OpenAI卻很激進,8月20日直接開源了Codex Harness,這是支撐Codex運行的底層系統。負責把模型和工具接起來,讓模型能打開文件、執行命令、記住任務進行到哪一步,以及遇到有風險的操作要停下來詢問。但這並不是重點,重點是,在產品邏輯上,Codex Harness把多模態放在了Agent運行時的核心位置。在Codex的工作流裡,圖片不是先交給某個外部視覺模型,再把識別結果轉述給文本模型。模型是可以直接接收截圖、界面和其他視覺輸入的,並把這些內容納入同一條任務鏈。
模型會先理解畫面,再決定要調用什麼工具、修改哪些文件、運行哪些命令,最後根據執行結果繼續修正。正如前文所述,DSH無論是哪條腿,在多模態這件事上,在DeepSeek V4 Flash Vision Exp之前,它都是割裂開的。DSH只負責以“模型處理過的圖片”進行推理,而非用圖片進行推理。顯然,Codex效果更強,首先是因為它減少了一次信息損耗。圖片經過OCR或摘要之後,模型看到的已經不是原始畫面,而是工具挑選出來的文字和特徵。只要處理過的圖片漏掉一些信息,那麼後面的推理就只能建立在不完整的證據上。舉個例子,前面的話就相當於模型處理後的圖片,後面那句話是原圖。
你會發現,僅僅只漏掉一個字,意思就完全相反了。要斷章取義——出自“不要斷章取義”原生視覺輸入則讓模型直接面對圖像,文字、佈局、位置和相互關係可以在同一上下文裡被判斷。其次,Codex把視覺理解和行動閉環連在了一起。它不是單獨回答“這張圖裡有什麼”,而是要根據截圖判斷下一步該做什麼,再通過終端、文件和其他工具驗證結果。就算是中間出錯了,新的截圖和執行反饋還能繼續回到同一條推理鏈裡。這樣一來,多模態就不再是“識別完了就完了,後面發生啥不關我事”的狀態了,而是一個持續的服務,以提高推理的性能。而這一步也是目前DSH所欠缺的。
所以這也是為什麼OpenAI在開源Codex Harness後,DeepSeek會立馬開源DeepSeek V4 Flash Vision Exp,梁文鋒是想告訴用戶,別急,別人有的我們也有,不過需要一點時間。社區正在補足DSH的最後一公里當然,DSH最明顯的短板,是它和普通用戶之間距離太遠了,沒點計算機知識,估計連DSH怎麼安裝都不清楚。好在的是,正是由於DSH開源,所以這最後一公里,社區已經開始接手了。最典型的例子是DSH Desktop,這個項目由一位06年的大二學生Benson Wang開發。它的核心就四個大字“一鍵安裝”。
把原本需要複雜安裝環境,以及輸入npm指令才能安裝使用的DSH,變成一個exe,下載以後雙擊安裝就能直接變成一個桌面工具。然而就是這麼簡單的一個項目,短短幾天,就在GitHub上獲得了1.8萬顆星星。可見,大家普遍都認為DSH就該有一個簡單方便的桌面版本,現在的DSH確實有些“反人類”了。順便一提,DSH Desktop這個項目的貢獻者也有DSH負責人崔添翼,不過這並不是說明他參與了開發,而是GitHub本身的開源協作機制,讓DSH原本的貢獻者出現在了這裡。Benson Wang表示,他正在開發手機版的DSH,項目名為anywhere DSH。
他計劃通過 iOS 和 Android 連接桌面端,讓用戶在手機上發起任務、查看 Agent 進度,並在需要時繼續跟進。這也是社區最有價值的地方。事實上,DSH官方團隊本身也非常關注社區。比如他們關注了DSH-better-sidebar這個項目,這是DSH第三方社區UI增強插件,給DSH原生Web界面提供了一套完整的服務化側邊欄工作臺框架。以及awesome-dsh-plugins,提供DSH插件精選和搜索雷達,相當於是一個DSH的插件市場。或許不久的將來,DSH會“收編”這些優秀的項目和開發者,豐富現在的DSH。誠然,社區項目不能自動等同於DeepSeek的戰略轉向。
開放生態越是發展,就越是會有版本兼容、權限控制、插件安全等問題出現。但官方的態度就說明,DSH正在通過社區吸納好的想法。或許不久的將來,DSH也將上線官方的插件市場,想用什麼插件,自己直接在官方的入口裡搜就行了。
Related
相關文章

卡迪夫大學新研究:AI 尚無法像人類教師一樣可靠地批改作業
首頁 > 智能時代>人工智能 卡迪夫大學新研究:AI 尚無法像人類教師一樣可靠地批改作業 2026/8/24 22:16:15 來源:IT之家 作者:清源 責編:清源 評論: IT之家 8 月 24 日消息,據外媒 Phys.org 今天(24 日)報道,卡迪夫大學和墨爾本大學的一項新研究發現,生成式人工智能(GenAI)目前還無法像人類教師一樣可靠地評判學生的書面作業。研究人員使用 ChatGPT 的兩個版本,對 50 篇生物科學專業本科生論文進行評分,以測試大模型評估學生作業的能力。ChatGPT 需要按照 7 項標準批改這些論文,研究人員還採用了 4 種不同的提示方式,隨後將大模型與人工評分的平均分和分數波動情況進行比較。圖源:Pexels卡迪夫大學生物科學學院威廉 · 凱博士指出:“研究結果顯示,模型給出的分數波動很大,無法準確預測人工評分。生成式 AI 與人類批改同一批論文時存在明顯差異。只看論文總分,兩者給出的結果相對接近;一旦具體到每項評分標準和每一篇論文,大模型與人工評分之間的差距就相當明顯。”除一種情況外,AI 模型給出的平均分普遍高於人工評分。平均分方面,AI 模型與人工評分的最大差距達到 16.1 分;具體到單篇論文,最大差距達到 40 分。IT之家獲悉,威廉 · 凱還發現,AI 往往會壓低高分論文的成績,又把低分作業的成績抬高,最終使分數系統性地向中間集中。研究結果說明,至少現階段,即使經過大量訓練,AI 仍無法可靠地對主觀性較強的書面作業給出與人類相當的分數。“我們測試的大模型目前並不適合取代教師,為學生預測作業成績。”研究人員指出,高等教育領域確實很關注大模型能否利用模式識別能力,讓學生作業評分更加客觀,同時提高批改效率、減輕教職人員壓力。但這項研究表明,目前並不適合這麼做。此外,未經學生明確同意便把作業提交給 AI 工具,本身還涉及倫理問題;大

路透社母公司湯森路透花 4000 萬美元研發 AI 模型,基於阿里千問
首頁 > 智能時代>人工智能 路透社母公司湯森路透花 4000 萬美元研發 AI 模型,基於阿里千問 2026/8/24 21:57:55 來源:IT之家 作者:潞源 責編:潞源 評論: IT之家 8 月 24 日消息,路透社母公司湯森路透集團近日正式公佈其首款大語言模型“Thomson”。該模型基於阿里千問構建,號稱擁有頂級表現。據介紹,該模型的研發成本大約是 4,000 萬美元(IT之家注:現匯率約合 2.69 億元人民幣),外界廣泛傳播的 45 萬美元(現匯率約合 302.8 萬元人民幣)數字只是最後一次訓練成本。該模型的基礎模型源自阿里巴巴的千問,目前使用的版本為 Qwen3.5-397B。湯森路透首先與帝國理工學院合作重新訓練基礎模型,使其符合安全、倫理和政治中立性要求。隨後再使用自有內容進行預訓練、後訓練,並在內部環境強化學習。湯森路透稱該模型已躋身全球最佳 AI 模型之列。在 Stanford LegalBench 測試中,該模型得分為 0.823,落後於 Gemini 3.1 Pro 和 GPT-5.5。而在 Harvey Legal Agent Benchmark 中,Thomson 僅略低於 Opus 4.8。但需要注意的是,該模型測試使用了推理階段擴展,而 GPT-5.5 則是在沒有開啟推理模式的情況下參與測試。在深度搜索測試時,該模型的得分為 0.53,GPT 5.4 為 0.65。湯森路透強調,公司之所以不採用 OpenAI、Anthropic 等美國閉源模型的原因在於,外部模型的長期成本較高,並且無法進行高自由度調整。相比之下小規模的自研模型更適合文檔審查等場景。 投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮 相關文章關鍵詞:湯森路透,阿里千問,Thomson,大語言模型,路透社阿里雲:GLM-5.3、Deepseek-V4-Pro

AI領域一週觀察:Codex 商業增速逆襲 Anthropic,具身智能迎來“GPT-2時刻”
產業 Mythos 2 不發,Astra 停訓,前沿模型的安全策略初現 8 月 18 日,OpenAI 披露,公司此前暫停了兩週針對擬部署模型的強化學習訓練。截至公告發布,最大規模的前沿 RL 訓練仍未恢復,較小規模的訓練和評測還在繼續。Anthropic同樣有一個新模型受阻,SemiAnalysis 主編 Dylan Patel 在 8 月 17 日的採訪中稱,據他獲悉,Anthropic 的下一代模型 Mythos 2 已經完成訓練,但不會發布。

值得買科技上半年營收增速回升,AI佈局成為新變量
王小娟 發表於 2026年08月24日 12:36 摘要:利潤同步改善 8月24日,值得買科技發佈2026年半年度報告。報告期內,公司實現營業收入約6.19億元,同比增長6.43%;利潤總額約1374萬元,同比增長53.45%;扣除股份支付影響後的淨利潤約1573萬元,同比增長9.

奧特曼最新訪談:AI還沒有到iPhone時刻,不缺技術缺交互
字母榜2026.08.24 20:17 · 來自河北全文8861字00:00 / 21:34奧特曼大談創業,我們為你總結了23條最有價值的信息。文 | 字母榜2026年8月24日,OpenAI創始人奧特曼做客主持人大衛·森拉(David Senra)的節目,聊了一個多小時。奧特曼在節目中袒露了很多心聲,包括產品、時間管理、創業的迷茫,以及他差點就不從事AI這個行業……信息量極大。奧特曼認為,技術跑得比人快,但人適應技術的速度要比想象中慢很多。
