Qwen3.8-27B 登頂全球開源榜第一,曾經的「源神」又回來了!
Qwen3.8-27B開始和頂級閉源模型正面叫板,過度思考是最大問題。作者丨李娜 編輯丨岑峰 8月17日,阿里發佈的Qwen3.8-27B 成為 Hugging Face 上排名第一的熱門模型。Qwen正在成為全球開源社區的Base Model。01一個 27B 的模型,為什麼突然讓全球 AI 社區興奮?如果只看參數,Qwen3.8-27B 並不像一個會製造太大聲量的模型。27B參數,在今天動輒數千億甚至萬億參數的旗艦模型面前,甚至顯得有些“小”。但2026年8月14日,阿里千問正式開源Qwen3.8-27B之後,海外AI社區的反應卻異常熱烈。原因恰恰就在這個“小”字上。
在Qwen官方公佈的成績裡,Qwen3.8-27B 已經開始在部分 Coding 和 Agent 測試中,與 Claude Opus 4.6 Max 這樣的前沿閉源模型放在同一張表格裡比較。與此同時,4bit 量化後約 17.1GB,一張 RTX 4090 或 3090 就能完整裝下,進入了個人設備能夠嘗試本地運行的範圍。這形成了一種過去並不常見的反差:一邊是消費級硬件能夠承受的模型尺寸,另一邊卻開始出現過去只有雲端旗艦模型才會被期待的Coding和Agent能力。獨立開發者Simon Willison直接評價 Qwen3.
8-27B “excellent”,Reddit社區中 LocalLLaMA上有人把它稱作 “遊戲規則改變者”;另一些實際用它完成 Coding 任務的用戶,則開始用“接近Opus”來描述自己的體驗。圍繞它的討論,也很快從傳統的“這個模型Benchmark多少分”,變成了“我的3090能不能跑”“24GB顯存用什麼量化”“能不能直接接進Coding Agent”。過去談到本地部署模型,默認往往意味著一種交換:用戶獲得隱私、可控和更低的使用成本,同時接受能力上的明顯妥協。真正複雜的Coding、工具調用和長程Agent任務,仍然主要屬於Claude、GPT這類運行在雲端的前沿閉源模型。
Qwen3.8-27B正在挑戰的,正是這個默認前提。02Qwen3.8-27B開始達到旗艦模型的上限Qwen3.8-27B 最值得關注的是,它用 27B 的尺寸同時承載了 Coding、Agent、長上下文、多模態四項能力。27B 並不算一個極小的模型,但它已經進入個人硬件可以真正部署的範圍。經過 4bit 量化後,部分版本的模型權重只有 17GB 左右,一張 24GB 顯存的 RTX 3090 或 4090 就有機會把完整權重裝進顯存。相比動輒數百億、數千億參數,必須依賴多卡服務器運行的旗艦模型,這已經是完全不同的部署門檻。Qwen3.8-27B 對長上下文的設計也明顯服務於這個目標。
它共有 64 層,其中 48 層採用 Gated DeltaNet,16 層保留完整 Attention。傳統全注意力需要隨著上下文不斷增長 KV Cache,而 DeltaNet 使用固定規模的循環狀態,因此可以降低長文本帶來的顯存壓力。模型原生支持 262K 上下文,並可以進一步擴展到 100 萬 Token。但這些只是前提。真正讓它和 Opus 4.6 Max 放在同一張表格裡的,是 Agent 和 Coding。()在 Qwen 官方公佈的數據中,Qwen3.8-27B 在 SWE-bench Pro (真實GitHub issue修復)上達到 61.
7,官方列出的 Claude Opus 4.6 Max 成績為 53.4;OSWorld-Verified (電腦操作)為 84.3 對 72.7,AndroidWorld (手機操作)為 81.9 對 62.0,CoWorkBench(長週期辦公任務) 為 70.7 對 68.2。LiveCodeBench v6 (代碼生成)上,Qwen3.8-27B 也達到 90.3。官方榜單之外,一批社區橫向測試也在提供更直觀的參照。有開發者用完全相同的 Prompt,讓 Qwen3.8-27B 和上一代 Qwen3.6-27B 分別生成同一個 voxel pagoda。
在同一臺 DGX Spark、相同量化設置下,3.8 在場景完整度和視覺效果上都明顯更成熟。再往外看,有用戶把它和同體量的 Glimmer-30B 放在一起測試 Three.js 場景。此前 Glimmer-30B 已經是 30B 左右本地模型裡表現相當強的一檔,但換到 Qwen3.8-27B 後,用戶最終仍然把優勢判給了 Qwen。更有意思的是,社區已經開始直接拿它和 Claude Opus 做同 Prompt 的前端生成對比。
單個 Demo 顯然不能證明 Qwen 已經達到 Opus 的整體水平,但這種比較本身已經說明了問題:過去一個本地 27B 模型和頂級閉源模型之間,往往根本沒有正面對比的必要;現在至少在部分 Coding 和前端任務上,兩者已經可以放在同一個畫面裡比較。把這些結果放在一起,Qwen3.8-27B 目前的位置大致已經可以看清:和上一代 27B 相比,它的能力上限明顯往前走了一截;放到 30B 左右的本地開源模型裡,它已經處在第一梯隊;而在部分 Coding 和 Agent 任務上,它甚至開始摸到前沿閉源模型的能力區間。如果 Qwen3.8-27B 只能通過 API 調用,它最多隻是又一個強模型。
但經過量化後,它已經能進入個人工作站和企業私有環境,代碼、文檔和 Agent 工作流都可以留在本地。一個個人硬件能夠承受的 27B 模型,開始進入過去主要屬於前沿閉源模型的 Coding 和 Agent 能力區間。過去本地部署往往意味著犧牲能力,Qwen3.8-27B 正在縮小這種能力折扣。03過度思考,是它最大的問題在海外社區,有人已經把 Qwen3.8-27B 稱作“Opus at Home”。但榜單之外,圍繞它最集中的爭議也很明確:模型能力強,但是推理時間太長;而Benchmark上的領先,也還沒有完全轉化成真實Agent體驗。
▎為了一個答案,它能先想21分鐘問題首先出在 reasoning_effort上。Qwen3.8-27B 提供 xhigh、medium、low、none 四檔推理強度,默認使用最高的 xhigh。對於複雜Coding和長程Agent,這可以換來更充分的推理;但放到消費級硬件上,代價也非常直接——慢,而且大量消耗Token。Django 聯合開發者 Simon Willison 做過一個很典型的測試:讓模型生成一張“騎自行車的鵜鶘”SVG,Qwen3.8-27B 花了 21分鐘,產生 22,276 個推理Token,最終輸出只有3,223 Token;關閉深度思考後,同一個任務縮短到137秒。
社區裡類似反饋並不少見。有人讓它寫一個簡單遊戲,模型先思考了半小時;也有人把它接進Coding Agent,一次任務的思維鏈跑掉數萬Token。這也暴露了Qwen3.8-27B目前最明顯的矛盾:它的能力上限很高,但默認設置並不一定適合本地用戶。對於雲端旗艦模型,長時間推理更多表現為價格和等待時間;到了3090、4090這樣的個人硬件上,推理強度會直接變成速度、顯存和使用體驗。一個本來以“本地可跑”為最大優勢的模型,如果簡單任務也需要長時間思考,這個優勢就會被部分抵消。▎榜單贏了,真實Agent未必贏另一個需要降溫的,是“超Opus”這個說法。Qwen3.
8-27B在SWE-bench Pro、OSWorld-Verified等測試上的確表現亮眼,但這些仍然是標準化、受控環境下的任務。真實Agent面對的變量更多:任務可能持續幾個小時,需要反覆調用工具、修改代碼、處理異常,還要保證過程中不跑偏。(Qwen3.8-27B 總分 48.0%,排名第 15;該 Benchmark 共 60 項真實 Agent 任務。)在更復雜的真實任務裡,27B的優勢並沒有那麼絕對。例如在WildClawBench的60項Agent任務中,Qwen3.8-27B雖然明顯超過前代,但仍落後於一些更大的託管模型。
這也是為什麼不能直接把“某幾項Benchmark超過Opus”翻譯成“真實使用已經可以取代Opus”。實際使用最終看的不是一張榜單,而是幾個更難回答的問題:長任務能不能穩定完成,工具調用會不會出錯,代碼修改能不能收斂,以及為了得到這個結果,需要等待多久、消耗多少計算。因此,現在給Qwen3.8-27B一個更準確的位置,可能不是“本地Opus”,而是:它已經證明,27B開源模型有資格進入頂級閉源Agent的比較範圍,但還沒有證明自己能夠全面替代它們。04真正的變化:前沿 Agent 正在開始進入個人電腦回到開頭那個問題:一個27B模型,為什麼能讓全球社區這麼興奮?
過去幾年,本地模型一直有一個默認前提:隱私、便宜、可控,但能力要妥協。一個能在消費級硬件上運行的模型,意味著你得接受它在複雜Coding、多步推理、工具調用上的明顯短板。真正要幹活,還是得切回Claude或GPT。本地運行和前沿能力之間,存在一條清晰的分界線。Qwen3.8-27B第一次讓這條線變得模糊了,“本地運行”和“前沿Agent能力”正在第一次變成可以同時追求的東西。過去開源模型的敘事是“追上閉源”。Qwen3.8-27B的敘事是“閉源模型的能力,第一次以可部署的尺寸出現在本地硬件上”。前者是追趕,後者是下放。
追趕是總是暫時的,你今天追上,明天可能又被拉開;下放則是結構性的,一旦能力被壓縮到消費級硬件可承受的尺寸,它就不會再縮回去了。前沿Agent能力正在從雲端下放到個人電腦,這才是Qwen3.8-27B真正值得被記住的原因。它也許不是最終的答案,但它逼出了下一個必須回答的問題:如果未來所有27B級別的模型都具備這種Agent能力,開發者的工作流、企業的部署策略、甚至個人採購GPU的邏輯,是不是都要跟著重寫一遍?上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

3秒出片比播放還快,MiniMax打開了AI視頻的實時商業化路徑
MiniMax推出新一代影片生成模型H3 Max,生成5秒768p影片僅需不到3秒,速度已超越播放速度,並帶動AI即時直播與AI版短影片App等創新應用。該模型基於開源的H3進行後訓練與推理優化,吞吐量約為原版35倍,同時在圖生影片評比中拿下第一。市場上已出現多個由開發者打造的即時生成直播頻道,顯示此技術開啟新的商業化路徑,而MiniMax股價也在近期大漲。

奧特曼播客曝猛料:Astra操作電腦已達人類水平
OpenAI 執行長奧特曼(Sam Altman)近日在一場播客訪談中投下震撼彈,直言旗下 AI 代理系統 Astra 在操作電腦方面的能力,已經達到與人類相當的水準。這番談話迅速在科技圈發酵,外界普遍將其視為 AI 從「回答問題」邁向「實際動手執行任務」的關鍵分水嶺。 奧特曼在節目中並未停留在技術層面的描述,而是進一步闡述 AI 能力躍升後對社會結構的深遠影響。他特別點名高等教育體系,認為傳統四年制大學的養成模式已經跟不上時代,主張兩年就足以完成必要的學術訓練。

奧特曼直言:四年太久,大學兩年就夠
OpenAI 執行長山姆·奧特曼(Sam Altman)近日再度拋出震撼教育界的觀點。他向外界直言,傳統大學四年學制早已不合時宜,在人工智慧迅速改變知識取得與技能養成的當下,兩年時間便足以讓年輕人具備進入社會所需的核心能力。這番言論迅速在矽谷與科技圈引發熱烈討論,也讓外界重新審視高等教育的效率與未來走向。 奧特曼長期以來便對现行教育體系抱持批判態度。他認為,現行的大學課程設計源自工業時代的標準化思維,過度依賴課堂授課與學分累積,卻忽略了學生真正需要的是解決問題的能力與實作經驗。

月之暗面與微軟、谷歌、亞馬遜談判, 爭取最高30%服務分成
中國月之暗面就Kimi K3與美雲企談30%收入分成,具標誌性意義。 近日,財聯社報道,據消息人士透露,月之暗面正就Kimi K3 AI模型與微軟、亞馬遜、谷歌進行收入分成談判。月之暗面在初期談判中,正尋求從K3相關服務產生的收入中抽取最高30%的分成。 如果談成,這將是中國AI公司和美國雲巨頭之間,第一個大型模型收入分成協議。 不過談判仍處於早期階段,分成核算口徑、合作落地週期、服務邊界等核心細節尚未最終敲定。目前,涉及的三家雲廠商和月之暗面都拒絕對談判公開發表評論。

混元Hy4 preview輕量版來了!權重壓縮86%,性能幾乎不減
(公眾號:zhidxcom) 作者 | 程茜 編輯 | 心緣 9月1日報道,今日中午,騰訊發佈了其最新一代旗艦模型預覽版本Hy4 preview的輕量版模型,將模型權重從1.5TB壓縮到214GB。 騰訊混元的測試結果顯示,壓縮後的模型與Hy4 preview原始模型相比,長文理解、多輪長上下文檢索和原版基本在同一水平,數學有小幅回落。壓縮後模型能覆蓋日常編程輔助、工具調用、長文檔處理和常規問答。

2026年的一切,都只是Robocity的序幕
35分鐘前“最強大腦”與“最強小腦”相互需要2026-08-11百度AI的驗牌時刻到了2026-07-27閱讀更多內容,狠戳這裡查看AI測評DeepSeek選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇馬斯克狂贊,硅谷大佬驚呼:Grok Bot是下一個ChatGPT時刻硅谷投資人稱Grok Bot是新ChatGPT時刻,為AI生產革命。