源神啟動!一張消費級顯卡跑“Opus級”Agent,Qwen3.8-27B多項榜單反超Claude

2026年8月15日 14:13
源神啟動!一張消費級顯卡跑“Opus級”Agent,Qwen3.8-27B多項榜單反超Claude
站內 AI 整理稿

源!了!270億的總參數量,在官方Benchmark多項軟件工程和Agent評測中的表現吧,多少又有點讓Claude《危》了—— Agent編程評測SWE-bench Pro上,27B以8.3分的優勢卷超Claude Opus 4.6 Max。到了更考驗真實軟件工程能力的QwenSWEBench,甚至領先幅度進一步擴大到15.2分: 尺寸雖小,參數配置和模型表現配的可不孬—— 原生多模態、262K原生上下文、最高100萬Token擴展,重點強化的Coding、專業工作和長程Agent能力,也一項沒落下。好東西大家自然都想嚐鮮一番!!這不嘛,已經有一大波網友開始大roll特roll了。

下面這老哥用3.8-27B和3.6-27B分別做了個像素風寶塔效果,3.8-27B在色彩細節和主體結構明顯更next level~ 還有網友用Qwen3.8-27B做的俄羅斯方塊—— 甚至連空格鍵掉落時的屏幕抖動、消除行時出現的獎勵倍增器效果也都是模型自己添加的: 甚至還有網友說:好啊好啊,那這意思是,差不多咱以後可以在本地跑「Opus級」模型了!?Qwen這模型,多少還是有點說法的。。。270億參數,代碼和Agent多項榜單超過Opus 4.6 Max Qwen3.8這一代,說實話最近上新速度屬實有點快。。。而且這隻27B,開發者友友們其實已經蹲挺久了。

正式開源之前社區裡的《催更》就沒怎麼停過,也有不少人直接把它列進這一輪Qwen3.8裡最值得等的開源版本。大家之所以這麼惦記,一個特別現實的原因就是——這回,自家電腦真有機會帶得動了。(doge) 畢竟——總參數量就「270億」。換句話說,經過量化之後24GB顯存的RTX 3090、4090這類顯卡,都有機會把模型整卡裝下~ 尺寸下來了,上下文長度倒是一點沒跟著縮水,原生支持262K Token上下文,還可以繼續擴展到100萬Token。具體到幹活場景,這一代27B重點強化的方向也很明確: 編程、專業工作、研究以及長程Agent任務,基本都是現在開發者最常拿模型狠狠幹活的地方。但!

這裡我特別想單獨拎出來說一個能力—— 「原生多模態」。需要給友友們劃個重點,Qwen3.8-27B本身就帶視覺理解和解析能力。意思就是,它除了讀文字、啃代碼,還能直接看圖片、讀PDF文檔、理解圖表,甚至處理視頻!!!(歡呼.jpg) 尺寸夠小,能往本地塞,上下文夠長,能吃大工程,多模態和Agent能力又都保留了。至於這些本事到底練到什麼程度,官方榜單已經給出了一波答案。咱們先從最適合拿來幹活的兩項看——代碼和Agent。在編程評測SWE-bench Pro裡,Qwen3.8-27B比Claude Opus 4.6 Max高出8.

3分;到了軟件工程評測 QwenSWEBench,領先幅度進一步拉到15.2分。Agent評測中面向計算機、金融、法律、醫療等專業長任務的CoWorkBench達到70.7分,也超過Opus 4.6 Max的68.2的成績—— 再看多模態能力這邊,模型能力提升表現甚至更集中。在電腦操作評測OSWorld-Verified中,Qwen3.8-27B拿到84.3分,Opus 4.6 Max是72.7。(給到Claude一個拉!) 手機操作評測AndroidWorld中,Qwen3.8-27B達到81.9分,Opus 4.6 Max是62.

0,瀏覽器操作WebArena-Verified,則從上一代的48.8提升到了64.8—— 通用多模態智能這邊,也有幾項維度我們可以一起看一下。在視覺數學問題解決能力上,開啟CI後,Qwen3.8-27B拿到94.6分,是圖裡這一排可見模型中的最高成績,這類任務不只是識別圖片裡的字,還得把圖形、公式、空間關係一起理解。在通用視覺推理方面,Qwen3.8-27B開啟CI後做到85.6分,相比不開CI時的65.7提升非常明顯,它更偏向考模型面對普通視覺場景時,能不能從「看見東西」進一步走到「理解關係、做判斷」。

這成績也說明這代27B模型在看圖、讀文檔和視覺推理這些任務上,模型覆蓋的場景和性能表現更多更強~ 好東西大家自然要一試,這不嘛,各方網友大神已經開始集體研究「這小27B模型到底該怎麼跑」了。(doge) 比如下面這位友友用Qwen3.8-27B做了一個貪吃蛇遊戲後,直言感覺像擁有了一個Opus級別的Agent—— 還有網友直接把Qwen3.8-27B-FP8放到一張NVIDIA GH200上實測,同時跑10個真實請求,每個最高輸出16K Token、上下文拉到262K。

結果首批流式Token基本都在10ms內返回,10個請求也全部正常完成,高併發和長上下文下的運行穩定性確實夯: 還有網友直言模型的多模態理解能力也非常不錯。一次性丟給它一部1935年的11分鐘電影,讓模型識別其中96個帶時間戳的事件並逐字引用畫面文字。最終157秒完成,時間點對應到具體畫面時,整部片子的誤差大約只有2秒,而且是在單張GPU上跑完: 只能說,還是那個Qwen,還是不負眾望啊。。。從Thinking推理檔位到上下文理解,27B還有這些功能 除了前面這些榜單表現,Qwen3.8-27B這次還有一個很實用的變化。

那就是模型到底要「想多久」,我們現在可以自己手動調了,因為27B裡內置了個「推理檔位」—— 模型默認開啟Thinking模式,同時支持reasoningeffort調節推理深度,一共分成xhigh、medium和low三檔。複雜代碼、長程Agent這類任務可以把檔位拉高;簡單問答、摘要、輕量任務則可以降下來,優先換速度和成本。此外Thinking本身也能直接關閉,讓模型跳過推理過程直接回答,真diy私人定製了。此外在長任務這件事上,還有一個挺實用的功能——Qwen3.8-27B默認開啟了preservethinking。簡單說,就是Agent前幾輪「怎麼想的」可以繼續留在後面的上下文裡。

比如Coding Agent連續改十幾個文件,做到後面時還能沿著前面的決策繼續走,少一點每輪重新捋思路的重複勞動,同時也能更好利用KV Cache。小小的身形,想把長任務穩穩扛住,底層架構也得下點功夫。具體來說Qwen3.8-27B一共64層,其中48層採用Gated DeltaNet線性注意力,16層保留完整Attention,基本按照「三層線性注意力+一層完整Attention」的節奏循環。線性注意力負責降低長序列下的計算和緩存壓力,完整Attention則隔幾層做一次更充分的信息交互。這樣帶來的最大好處就是——Qwen3.

8-27B原生上下文能做到262K Token,還可以繼續擴展到100萬Token!!!最後說一下大家同樣比較關心的問題——怎麼把模型跑起來。其實,非常之簡單。官方已經給模型接上了Transformers、vLLM、SGLang和TokenSpeed。如果是生產環境或者需要高吞吐,Qwen更推薦SGLang、vLLM這類專門的Serving引擎。當然,本地玩家則可以更省事一點兒。Hugging Face也提供量化版本入口了,大家可以直接通過大家熟悉的工具鏈部署。換句話說,手裡有一張高端消費級顯卡或者大內存Mac,基本已經可以開始折騰這隻27B了。

(doge) 官方開源鏈接放下面了,感興趣的友友可以直接上手搓搓~ 參考鏈接: [1]https://mp.weixin.qq.com/s/Ttv5cMD5p6DkUQWyoOsqCA [2]https://huggingface.co/Qwen/Qwen3.8-27B[3]https://www.modelscope.cn/collections/Qwen/Qwen38 版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛
全天候科技生成式AI

企業AI最後一公里:三路人馬在此交鋒

鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。

剛剛