下載了千問3.8之後,我發現網上都吹錯了重點

2026年8月21日 10:06
下載了千問3.8之後,我發現網上都吹錯了重點
站內 AI 整理稿

藍字計劃2026.08.21 10:04 · 來自廣東全文4507字00:00 / 13:14越好用,越笑不出來。文|藍字計劃,作者|Hayward剛剛過去的一週,是讓無數AI人夜不能寐的一週。從8月13日的DeepSeek V4 Pro開始,再到後面的Gemini、智譜GLM 5.3和千問3.8 27B,每個大模型都很重磅,又偏偏挑在北京時間的凌晨時段發佈,要出稿的媒體們,想睡都睡不了。但在這一波新大模型熱中,有一個大模型的熱度始終貫穿整個8月:千問3.8系列。其實這一輪熱度其實從8月初就開始了。千問先發布了旗艦模型千問3.8-Max,隨後又把27B版本放上Hugging Face。

模型開放兩天,下載量便突破100萬次,連續幾天佔著全球模型熱榜第一。國外最大的本地大模型社區LocalLLaMA,很快被千問3.8系列的各種測試、部署和量化帖子淹沒。重複話題實在太多,版主幹脆專門開了一個集中討論帖。有人一本正經地發帖討論,千問3.8的出現,是不是說明大模型的規模定律已經快走到頭了;還有人看完測試結果,當場表示週一開盤就去買阿里股票。別以為反應激烈的只有網友,連一向對中國大模型不太對付的海外媒體,也有點陌生了。比如,《連線》雜誌把千問3.8放進了“中國開源AI正在挑戰硅谷玩法”的報道里;歐洲新聞臺認為,它已經開始追趕Claude一直對外宣傳的複雜工作能力。

就連X平臺彙總相關討論時,給出的標題也是“中國AI正在追上美國模型”。雖然,在大模型社區,每次新模型發佈,總少不了幾句“改變遊戲規則”,但這次熱度只空前,討論之熱烈,好像還真不止來至於新模型發佈的新鮮感。特別是當我們親自上手體驗了整個千問3.8系列之後,才發現它真正牛的地方。寫文章堪比Opus 4.6?既然要體驗千問3.8系列,那離不開的重頭戲,自然是讓無數國外友人震驚的千問3.8-Max。它是整個系列的旗艦,總參數達到2.4萬億,每次運行調用其中約950億參數,最長可以處理100萬token的內容。至於老外為什麼吹得這麼猛,看著兩個跑分其實就明白了。Terminal-Bench 2.

1考察模型能否獨立操作命令行,完成安裝軟件、修改文件和運行程序等任務。千問3.8-Max的平均通過率為86.6%,距離GPT-5.6 Sol只差2.2個百分點。IFBench考察模型能不能同時遵守多項要求。千問3.8-Max的提示詞通過率達到82.8%,超過GPT-5.6 Sol的72.7%和Claude Fable 5的63.5%,在這一項直接完成反殺。一個證明它能辦事,一個證明它聽得懂人話。如今千問3.8-Max已經可以直接和最新的GPT、Claude同場較量,而且還有來有回。而且這兩個測試,對我們這些幹編輯的來說也有價值,畢竟能乖乖根據提示詞來生成內容,就是寫出好內容的第一步。

只不過相比跑分,其實我更關心它最後寫出來的東西到底怎麼樣。尤其是海外社區已經有人聲稱,千問3.8的寫作能力可以接近Opus 4.6。後者一直是AI圈自媒體大神卡茲克心裡寫作最好的大模型。這個評價,可是連目前最牛的GPT和Claude都未曾擁有的。所以,我準備了一道專門考驗短文邏輯、段落組織和文風的題目,把它同時交給了千問3.8-Max和GPT-5.6 Sol。|可以看到,同樣一組材料交給兩款模型,最後寫出來的東西,風格確實很不一樣。GPT-5.6 Sol這一版,整體更像一篇已經搭好骨架的短文,鋪墊、轉折和前後承接都比較完整。不過,GPT的老毛病同樣存在。

像“問題也恰恰出在AI太認真了”“這讓AI清理相冊碰到了一個很典型的邊界”,還是過於生硬了,文章的轉折就顯得很刻意,為了轉折而轉折。而且它還出現了個致命問題:說好的500字,實際卻生成了超過1000字,完全不聽命令。而千問3.8-Max的處理方式要簡單粗暴不少。整個文章都跟著提示詞的節奏來,反差轉折?沒有的。情感鋪墊?沒有的。甚至它還鼓搗出了個“金句”:“按畫質衡量都是差照片,按記憶衡量卻都是絕版。”但也正是少了技巧、技法,有些地方甚至像是想到哪寫到哪,也因此少了幾分過度整理的痕跡。甚至像“那位差點失去父親背影的用戶,事先多半也不知道,最後一張會糊成這樣。

”這句,嚴格來說沒有提供新的信息,按照大部分AI的標準來看,就是個廢話。不過,大部分人說話、寫東西,就是會有一些廢話出現。恰到好處的囉嗦,反而更有活人感。而這點,在當前絕大部分的體驗、評測中都沒有提到,我甚至覺得那些狂吹的老外們,都沒有吹到了重點上。就在這個對比之前,我還試過讓千問3.8 Max寫過一段視頻腳本的開頭。它不僅獨自構思了一個比較有意思的視頻開頭,而且還會自己營造“懸疑解謎”的畫面,並藏住答案。|這顯然要比GPT那種理工直男思維的線性敘事更有意思。所以,至少從我自己的體驗來看,只論寫作,千問3.8-Max想要超過Opus 4.6還不現實。

但它寫出來的東西有時比GPT更像人,這一點確實出乎我的意料。如果再迭代幾個版本,把邏輯鏈和段落連接補上,它在日常寫作裡替代GPT,已經不是什麼遙遠的事。不過,在這幾天的體驗中,其實比起千問3.8 Max的“活人感”,真正讓我大受震撼的,是最近剛剛開放權重的千問3.8-27B。頂級大模型,普通人也可以擁有了千問3.8-Max確實很強,但它有2.4萬億參數。對普通人來說,這種體量基本只能在線使用。就算把權重下載回來,家裡的電腦也跑不動。千問3.8-27B就不一樣了。它只有270億參數,能力比Max弱一些,但它最大的價值在於整個模型卻可以下載回來,直接裝進你家的電腦裡。而且它的性能可不弱。

按照千問公佈的成績,千問3.8-27B在Terminal-Bench 2.1拿到73.0分,已經接近Claude Opus 4.6的78.2分。到了考驗真實軟件修復能力的SWE-bench Pro,它又拿到61.7分,超過Opus 4.6的53.4分。也就是說,這款可以本地部署到你家裡的模型,性能已經在部分測試中摸到了前代頂級閉源模型的邊緣。雖然並不是隨便一臺電腦都能裝,但整體看來只要有一塊一萬元左右的顯卡就能擁有這款旗艦級別的開源大模型,也難怪大家對這個版本的熱情高得有點嚇人。就在當天,我也把千問3.8-27b下載到了電腦裡。這是一個4-bit量化版本,模型文件佔用大約16GB。

我的電腦用的是一張16GB顯存的RTX 4080,外加48GB內存。那裝在本地的千問3.8 27B效果怎麼樣呢?實話說,有點超出我的預期。關閉思考模式以後,千問3.8-27B的生成速度可以達到每秒26個token。屏幕上的字往外冒得比人閱讀還快,一篇五百字左右的回答,通常不用等上一分鐘。而且,在速度沒問題的基礎上,寫出來的東西其實也可以。我把同一道題同時交給了本地運行的千問3.8-27B、線上的千問3.8-Max和GPT-5.6 Sol。題目要求它們詳細分析RTX 4080相比RTX 3080,在大模型本地推理上的優勢,寫五百字左右。

三家都用了一句翻案的話開頭,先否定只看算力的思路,隨後把重點轉到顯存容量。後面的論證也差不多,顯存負責撐起主線,架構、帶寬和功耗跟在後面補充,結尾再落到RTX 4080可以運行更大的模型。雖然結構類似,但風格卻不一樣。千問3.8-Max選擇列清單,GPT-5.6 Sol寫得更完整,本地27B則交付了一篇連續的短文。只不過,其實從易讀性來說,如果我想要的是一個“答案”,千問3.8 27B整出來的內容就足夠清晰明瞭了,沒有簡單粗暴的參數堆疊,給出的答案也有理有據。它還抓到了這道題最有價值的地方。

其實RTX 4080最核心的優勢是16GB的顯存,它是目前高性能量化大模型能部署到本地的生命線,也是對比只有10GB顯存的3080最核心的優勢。然而,正在我打算大誇特誇千問3.8 27B的時候,它又不可避免地翻車了。它聲稱RTX 4080的顯存帶寬大約是1024GB/s,RTX 3080則是936GB/s,但實際上3.8-Max和GPT-5.6 Sol給出的參數:RTX 4080是716.8GB/s,RTX 3080 10GB版是760GB/s,才是對的。部署在本地的千問3.8 27B,還是吃了沒能聯網搜索數據的虧。

這也說明了,除去了準確性之外,一個部署在本地的大模型,其實已經有了相當高的可用度。而且它所組織的語言也還算流暢,特別是體現出了一種比較罕見的特質:回答技術問題時,知道什麼該說詳細點,什麼可以一筆帶過,哪怕對參數完全不懂,也能知道個高低好壞。後續如果打算用它來修改文章、生成提示詞,後者接入愛馬仕等用來做一些簡單的內容生成,已經足夠了。而且這個部署在本地的千問3.8 27B,甚至還支持多模態,你把一張圖片丟給它,它還能幫你“看”這張圖。一個家用電腦裡的27B,已經有資格和千問旗艦、GPT最新模型放在一起批改作業。哪怕最後輸了一點,這件事本身也已經夠離譜了。

好用,但也非毫無代價可惜的是,隨著使用的日益深入,我也有了更多的遺憾。首先,前面提到千問3.8 27B每秒26個token的速度,有個重要前提:得關掉思考模式。打開以後,速度會跌到每秒5個token左右。模型會先輸出很長的思考過程,哪怕是一個很小的問題,也會先思考個一分鐘再作答,很折磨人。這甚至是整個千問3.8系列的弊病。海外社區裡也有人吐槽,千問3.8-Max有時會在思考過程中反覆繞圈,答案越寫越長,和GPT那簡單直接、真正的不繞圈子,形成了鮮明對比。不過更多的遺憾,是來自電腦配置這件事上。實際上,按照社區的反饋,千問3.8 27B最值得安裝的版本,是NVFP4量化的版本。

它同樣把權重壓到4位,NVIDIA還專門為這種格式做了硬件加速,儘量減少模型壓縮後的能力損失。可惜,我的RTX 4080屬於上一代Ada架構,吃不到這項原生加速。想把NVFP4的優勢用出來,至少要換到採用Blackwell架構的RTX 50系列。但眾所周知,當前的英偉達50系已經漲上天了。之前人厭狗嫌的RTX 5080 ,價格也漲到了12999元,已經比當年首發時的RTX 4090都要貴了,更不要說最適合部署NVFP4的顯卡,RTX5090。也就是說,最適合普通人用的,低成本又低成本的大模型實際上是離我們越來越近了;但又因為硬件漲價,又遠離了普通人。毫無疑問,千問3.

8 Max值得吹上一番,3.8-27B更是值得留在硬盤裡。只是這類好用開源模型的真正輝煌時刻,可能還是得看硬件價格什麼時候肯放過普通人了。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛
全天候科技生成式AI

企業AI最後一公里:三路人馬在此交鋒

鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。

剛剛