實測“開了眼”的DeepSeek:認得馬斯克,認不出梁文鋒

藍字計劃2026.08.25 19:27 · 來自廣東全文5006字00:00 / 13:01多模態也是“梁心”價。文 |藍字計劃,作者|週末鯨魚還是“開眼”了。經過四個月的千呼萬喚,DeepSeek終於補上多模態能力,推出了全新的視覺理解模型DeepSeek-V4-Flash-Vision-Exp。圖源:DeepSeek官方賬號梁文鋒滑動變阻器,也向著“梁聖”的方向又撥動了一格。相比V4 Flash,Vision-Exp最大的變化,就是原生支持圖片輸入,終於可以直接認人、讀截圖、看圖表。價格方面,也還是熟悉的DeepSeek風格。
一張圖片最多隻會折算成384個輸入Token,即使按照高峰期價格計算,只需要花一分錢,就可以請它幫忙看8 張圖,看看圖裡都有什麼。終於補上了DeepSeek 長久以往的一塊短板,價格又依舊是“梁心”價,外界對DeepSeek這雙剛裝上的“眼睛”自然期待拉滿。只是,如果只看網上的口碑,不少用戶實測之後,留下的評價卻只有四個字:“效果一般”。跑分很美,評價一般不知道梁文鋒上不上知乎,但當我刷到一個叫做《怎麼評價DeepSeek-V4-Flash-Vision-Exp發佈,多模態能力表現如何?》的帖子時,我只想對梁文鋒說:惡評,別看!
知乎網友發文帖子下面,一個拿到1366個讚的回答先說:“她不一樣,她是一個好模型。”隨後話鋒一轉,又給Vision-Exp安排了一個“好賭的爹”、一個“生病的媽”和一個“上學的弟”,最後得出結論:“所以她破碎是可以原諒的。”這條回答其實沒有直接說Vision-Exp不好,甚至先誇它是個“好模型”。可從“好賭的爹”到“破碎也可以原諒”,怎麼看都不太像是在誇獎。這樣的評價,和這款模型的官方跑分其實挺割裂。官方數據顯示,Vision-Exp基本保留了V4-Flash原有的Agent、推理和世界知識能力。
在需要視覺理解的Agent Benchmark上,它的多模態Agent成績已經接近Anthropic的頭牌Opus 4.8。圖源:DeepSeek官方賬號跑分都快摸到A社頭牌了,怎麼到了網友手裡,就“破碎”?這就不得不提幾個最有節目效果的網友實測了。最先翻車的,是最簡單也最有節目效果的認人。有人把梁文鋒的照片發給Vision-Exp,問它“這是誰”。結果DeepSeek盯著自己的“老爸”看了6秒,十分肯定地回答:這是美團創始人王興。換了一張照片再問,它又把梁文鋒認成了字節跳動創始人張一鳴。網友實測Vision-Exp王興和張一鳴:人在家裡坐,鍋從天上來......
認一個人都不行了,那要是一張多人的合照呢?有網友把時代少年團的合照交給Vision-Exp,讓它說出五個人的名字。DeepSeek這次倒是謹慎了很多,一個名字也沒敢猜,最後卻得出了一個更加離譜的結論:照片裡五個人長得太像,皮膚過於光滑,連手裡的提包都有“AI感”,所以這很可能是一張批量生成的假圖,裡面根本沒有真人。別說認出時代少年團了,它甚至開始懷疑時代少年團到底是不是真人。網友實測Vision-Exp由此可見,DeepSeek-V4-Flash-Vision-Exp在認人這一塊,目前還是個“睜眼瞎”。不過,識人說到底只是娛樂局。
但壞消息是,哪怕換成更接近開發者工作的複雜任務,Vision-Exp的問題也沒有完全消失。還有網友要求它生成一個Three.js三維場景。最終成品的完整度雖然略優於Gemini 3.7 Flash,但在執行過程中,Vision-Exp反覆自我糾錯,還出現了多次斷聯。完成同一個任務,它消耗的Token高出近15倍,耗時也多出3.5倍。網友實測Vision-Exp只能說,就算跑分裡已經摸到了頂級模型,落到真實任務裡,Vision-Exp還是處處透著實驗版的痕跡。不過紙上得來終覺淺,網上的測試多少會受到圖片質量和提示詞影響。
Vision-Exp到底是不是真的這麼拉,恰好DeepSeek Harness也在這時候支持了原生圖片請求,我們趕緊自己測了一輪。鯨魚的大眼睛,還得練我們的測試,先從網上翻車率最高,也最有節目效果的識人開始。不過,這次我們沒有單獨拿一張人物照片考它,而是給了Vision-Exp一張AI合成的梗圖。梁文峰、馬斯克和奧爾特曼畫面把梁文鋒、馬斯克和奧爾特曼等一眾硅谷大佬放到了一起,身後豎起來的,是一個帶有DeepSeek Logo 的白旗。實際上,這個構圖的出處可是大有來頭,它復現的是 2024 年 7 月特朗普在賓夕法尼亞州巴特勒遭槍擊後,被特勤人員護送時高舉拳頭的名場面。
所以,這個測試丟給DeepSeek ,就不只是看模型能不能識別人。它還得弄清楚三個人為什麼會出現在同一張圖裡,這張圖到底在玩什麼梗。從最終的結果來看,Vision-Exp 確實認出了梁文鋒和馬斯克,還描寫了兩人的外貌特徵,並根據人物身份,推測這張圖是在調侃DeepSeek給美國AI行業帶來的衝擊,當然這個結論多少有點望文生義的味道了。Vision-Exp 確實認出了梁文鋒和馬斯克不過,一旁也比較明顯的的OpenAI CEO奧爾特曼,V4-Flash-Vision-Exp沒有人出來,還把他判斷成了“AI生成的陪襯”。而把同一張圖片交給豆包,它倒是把三個人都認全了。
還得是你豆包不過可惜的是,無論是Vision-Exp 還是豆包,都沒有在識別人臉的過程中把這個圖背後真正的梗識別出來。這隻說明了除了機械的識人之外,模型其實還不夠聰明。那如果畫面裡沒有特徵鮮明的人物,換成一張普通風景照呢?實測證明,Vision-Exp對景物的識別和描寫幹得也不錯。Vision-Exp對景物的識別和描寫幹得也不錯我們給了它一張成都安順廊橋的照片。它不僅認出了具體地點,還能分清畫面裡的時間、光線和空間關係:夕陽從雲層裡透出來,廊橋橫跨河面,水中留下金色倒影,橋後則是現代高樓。它甚至還能順著畫面繼續介紹安順廊橋的歷史,或者把描寫整理成一段可以直接發到朋友圈和小紅書的文案。
或者我們需要給他再上上難度:根據截圖,復刻網頁。根據截圖復刻網頁,是多模態編碼Agent最有工作價值的能力之一。現實中的開發者經常拿到一張設計稿或者頁面截圖,然後要求模型看懂結構,再把它寫成真正可以運行的網頁。這次,我們特地選擇了幻方量化官網中“算力隨時待命”的頁面。幻方量化官網這張圖看上去只是一個深色科技風網頁,裡面卻塞進了不少細節。左邊是一套多層流程圖,包含不同顏色的模塊、連接線和節點;右邊則有正文、切換標籤和性能數據,旁邊還有一列導航欄。模型既要看懂各個元素之間的位置關係,還得處理小字號文字、色塊漸變和複雜排版,最後再用代碼把整張頁面搭出來。Vision-Exp最終完成了網頁的整體框架。
左邊有流程圖,右邊有說明文字,底部的性能數據也基本都在。頁面結構搭起來了但仔細看就會發現,色塊邊緣和小圖標都被明顯簡化,一些文字也沒有待在該在的位置。頁面結構雖然搭起來了,距離“一比一復刻”還有不小差距。為了判斷究竟是任務本身太難,還是Vision-Exp確實差了一截,我們又把最近大熱的GLM-5.3拉了進來,讓它按照相同的截圖和要求復刻一次。GLM-5.3生成的頁面觀感明顯更完整。流程圖的層級更清楚,右側文字基本待在正確的位置,各個模塊也沒有擠成一團。GLM-5.3隨後,我們又加入了同樣以編碼和Agent能力見長的Kimi K3。
Kimi K3Kimi K3不僅還原了頁面結構,還做出了原圖裡的色塊漸變和發光效果,模塊之間的層次也更加接近原圖。把三張頁面放到一起,差距就比較明顯了。總的來說,Vision-Exp已經可以把視覺理解和代碼生成串起來。拿它快速驗證一個想法、做個可交互Demo,或者先把頁面骨架搭出來,確實有實際價值。只是在人臉識別、複雜網頁復刻和最終呈現上,它與GLM-5.3、Kimi K3仍然存在明顯差距。不過,DeepSeek似乎也沒有準備把它包裝成一個完成度很高的正式產品。畢竟,模型名字最後還掛著一個“Exp”。一個明顯沒有完全打磨好的實驗版,為什麼會被DeepSeek提前端上來?
端了個半成品上來DeepSeek自己顯然也知道,Vision-Exp還沒有完全打磨好。畢竟,模型名字最後那個“Exp”,已經把“實驗版”三個字寫在了臉上。那DeepSeek為什麼不再等等,非得先把一個半成品端上來?從它選擇的底座來看,DeepSeek這次更像是把V4-Flash當成了一塊多模態試驗田。V4-Pro擁有1.6T總參數和49B激活參數,V4-Flash則只有284B總參數和13B激活參數。後者原本就是一款更快、更便宜的模型,簡單Agent任務的表現卻能接近Pro。圖源:DeepSeek官方賬號把視覺能力先放到Flash上,更容易控制好圖片帶來的額外成本。
調用價格足夠便宜,開發者才願意大量拿圖片去測試,把它塞進各種Agent工作流裡。這個實驗版的價值,也會在這些真實任務中慢慢顯現出來。認錯梁文鋒、看不懂梗圖、復刻網頁時丟失細節,這些問題很難只靠跑分發現。模型先被放出來,開發者替DeepSeek把各種稀奇古怪的圖片和任務跑一遍,正式版該補哪些地方,也就有了一張更加具體的問題清單。而且,Vision-Exp沒有直接取代原來的V4-Flash。需要穩定處理純文本任務的用戶,依然可以繼續使用舊模型;想要嚐鮮多模態的開發者,則可以主動切換到Vision-Exp。網友發文一邊繼續幹活,一邊開放試驗,互不耽誤。這種做法,DeepSeek以前其實玩過一次。
2025年9月,DeepSeek推出V3.2-Exp,用一個實驗版本驗證全新的DSA稀疏注意力機制。直到兩個多月後,V3.2正式版才接過它的位置。網友發文所以從DeepSeek過去的發佈習慣來看,Vision-Exp現在更像是一場公開測試。先讓這雙眼睛睜開,看看真實世界裡會出現什麼,再決定正式版該怎麼改。只不過,認錯自己老爸、把真人當做AI,也不太會看是認識梗,這些也說明 DeepSeek 在多模態這塊還有不少進步空間。到了端上正式版的時候,網友們估計就不再會那麼寬容了。網友發文到時候,梁文鋒的滑動變祖器,又會停在哪一端呢?
參考資料:[1]極客公園:DeepSeek上線多模態,我用它做了《牛來》小遊戲[2]差評X.PIN:DeepSeek的多模態模型,憋了這麼久終於來了。。。[3]字母榜:說好“多模態不是主線”的梁文鋒,怎麼轉頭就發了個Vision模型?[4]Tech星球:DeepSeek不是“老大”了?一張圖拉開40倍Token成本差,“視力”卻輸給豆包?[5]APPSO:剛剛,DeepSeek Harness重磅更新,多模態能力增強;DeepSeek多模態模型發佈,鯨魚終於開「天眼」了[6]智東西:昨夜,DeepSeek Harness首發新版本:14項更新,多模態能力拉滿!
DeepSeek多模態模型終於來了!一張圖最高只要0.001元
Related
相關文章

KIMI“蘇神”蘇劍林:K3背後的關鍵先生,楊植麟最怕被挖角的月之暗面核心科學家
在中國大模型新創領域,月之暗面(Moonshot AI)無疑是近年最受矚目的明星團隊之一。從Kimi助手席捲市場,到最新一代模型K3引發業界熱議,這家公司始終以頂尖的技術實力佔據話題中心。而在這光環背後,一位被內部同事尊稱為「蘇神」的科學家——蘇劍林,正逐漸從幕後走到聚光燈下,成為外界理解月之暗面技術底蘊的關鍵人物。 蘇劍林在AI圈的聲譽,並非來自頻繁的媒體曝光,而是源於他在技術社群中長年累月累積的深厚影響力。對於許多深度學習研究者和工程師而言,這個名字代表著對底層原理的透徹理解與不懈探索。

燧原科技啟動科創板發行:擬募資60億元,9月2日申購
TechPulse2026.08.25 17:54 · 來自河北全文1176字00:00 / 03:59騰訊既是燧原科技的重要股東,也是公司第一大客戶。國產AI芯片企業燧原科技正式邁入科創板發行階段。8月25日,上海燧原科技股份有限公司披露招股意向書提示性公告。

大廠這波Agent混戰,殺死10多個AI名品
大型科技企業在人工智慧領域的競爭,正從單純的模型較勁,快速轉向更貼近實際應用的Agent(智慧體)戰場。過去一段時間,各大廠接連端出以「工作」、「效率」為核心的智慧體產品,試圖搶占使用者桌面與瀏覽器的主控權。然而這波快速推進的卡位戰,也伴隨著殘酷的淘汰,多達十餘款曾經備受關注的AI工具,在短短時間內從市場上消失,成為大廠戰略調整下的犧牲品。 這波混戰的起點,其實是AI應用從「能對話」走向「能做事」的轉折。

阿里雲 Token Plan 接入千問 App 及 PC 端,支持 Qwen3.8-Max 等模型
作者:沁滄(實習) 責編:沁滄 評論: 8 月 25 日消息,阿里雲今日宣佈,阿里雲 Token Plan 正式接入千問 App 及 PC 端。用戶只需將 API Key 綁定至千問,即可直接調用 Token Plan 訂閱額度,支持 Qwen3.

澳大利亞唱片業協會“重拳出擊”,純 AI 生成歌曲禁入官方排行榜
作者:清源 責編:清源 評論: 8 月 25 日消息,據美聯社報道,隨著生成式 AI 快速發展並開始威脅音樂人的生計,當地時間 25 日(今天),澳大利亞唱片業協會(ARIA)決定禁止完全由 AI 生成的歌曲進入官方排行榜。新規出臺前,一首由澳大利亞製作人利用 AI 生成人聲和鼓點重新制作了麥當娜的名曲《Like a Prayer》,並連續 16 周躋身澳大利亞前 20 名,也讓生成式 AI 在音樂行業中的地位成為爭論焦點。

開源國產8B模型,比肩閉源Image 2了!
商湯科技正式開源SenseNova U1.5 Lite,這是一款僅8B參數的國產生圖模型,主打4K直出與更完整、準確、穩定的表現。該模型能一次處理多張圖片與複雜指令,例如將九張食物照合成精美食譜卡片,並支援精準的局部圖像編輯,同時保留原圖其他區域的結構與空間關係。其亮點包括超長指令遵循、高品質視覺生成、可靠的原生編輯,以及優異的中英文文字與複雜佈局處理能力。