大模型領域跑出新玩家,StartLux-27B本地大模型打贏DeepSeek V4 Flash

飛向TAI空2026.08.31 10:04 · 來自北京全文1680字00:00 / 04:34本地大模型上牌桌,性能正面硬剛DeepSeek。圖片來源:unsplash近日,中國工信部信息通信研究院(以下簡稱“中國信通院”)人工智能研究所公佈的一份檢驗報告顯示,上海原點星輝科學技術有限公司(下簡稱StartLux)研發的本地大模型StartLux-V1.0-27B-Preview,在可信AI大模型基準測試——MCP專項測試中,以27B參數量取得綜合性能排名第二的成績,高於第三名的DeepSeek-V4-Flash,能力範圍已經進入DeepSeek-V4-Pro所代表的萬億參數模型能力區間。
可信AI大模型基準測試——MCP專項測試涵蓋位置導航、網頁搜索、瀏覽器自動化、金融分析、代碼倉庫管理、3D 設計6類專項任務及綜合評估,共7項檢驗項目,重點考察大模型在多工具協同、複雜任務執行及真實環境交互等方面的綜合表現,該專項測試部分指標和數據參考了開源項目MCP-Universe。參測模型包括DeepSeek-V4-Pro(1.6T)、DeepSeek-V4-Flash-0731(284B)、Step-3.7-Flash(198B)、StartLux-27B-260715(27B)、Qwen-3.6-27B(27B)和 AgentCPM-Explore(4B)。
結果顯示,StartLux-V1.0-27B-Preview綜合得分為39.25,排名第二,超過284B的DeepSeek-V4-Flash-0731 和198B的Step-3.7-Flash。在同等參數規模下,StartLux-V1.0-27B-Preview較Qwen-3.6-27B高出5.34個百分點。單項任務中更突出:位置導航排名第一,瀏覽器自動化、金融分析等任務也與1.6T參數的DeepSeek-V4-Pro 並列第一或獨佔第一。StartLux以Qwen3.6-27B為基座做後訓練定向增強,把一個27B的本地模型,推到與1.
6T旗艦同級的位置,靠的是StartLux團隊自主設計的一個全新、多維度、可驗證、可規模化的模型優化升級技術。模型訓練的過程中,團隊採用AI訓練AI(Auto Research)的方法,自主開展訓練實驗,並通過反饋持續優化訓練策略。該方法代表了當前全球模型研發的前沿方向。據悉,StartLux-V1.0-27B-Preview是國內首個採用該方法進行後訓練的本地Agent模型。在這款模型背後,可以看到行業正在發生的一個清晰轉向:當基礎模型能力跨過實用門檻,過去兩年以參數規模為核心的軍備競賽已進入同質化階段。
同等規模模型在Benchmark上的差距越縮越小,但用戶和企業的真實困擾從來不是大模型的測試分數與排名,而是模型能否解決實際問題、數據是否安全、成本是否可控。這些答案不在越來越大的雲端集群裡,而在數據不出域、推理在身邊、能力可定製的本地方案裡。在全球範圍內,本地模型正在逐漸進入行業視野。Google於4月推出了Gemma 4系列,其中31B Dense版本在開源模型排行榜排名第三,量化後可在消費級顯卡上本地運行。8月初,Meta發佈30B本地模型Muse Glimmer並開源。英偉達也於8月推出了開源模型Nemotron 3.
5 Lightning,這是一款30B參數的MoE模型,可直接在RTX PC等本地設備上運行。盛大網絡創始人、語生科學董事長陳大年近期預測,本地本地模型將在3年內佔據80%的大模型市場。量子與AI軟件公司Multiverse Computing聯合創始人兼首席科學官Roman Orús也曾表示,行業正進入一個新階段,本地大語言模型將成為雲端服務真正的競爭對手。目前,StartLux-V1.0-27B-Preview可在消費級個人電腦上運行。
據瞭解,StartLux 計劃於年內推出第一代本地智能解決方案,與此同時,StartLux團隊正在穩步推進模型訓練的腳步,也正對擴散式語言模型等新架構進行深入研究和優化。
Related
相關文章

騰訊混元:Hy4 preview 調用激增,WorkBuddy 已緊急擴容
首頁 > 智能時代>人工智能 騰訊混元:Hy4 preview 調用激增,WorkBuddy 已緊急擴容 2026/8/31 12:22:39 來源:IT之家 作者:浩渺 責編:浩渺 評論: 感謝IT之家網友 不一樣的體驗、files、麻辣清補涼 的線索投遞! IT之家 8 月 31 日消息,騰訊混元今日發文稱,自 2026 年 8 月 28 日混元 Hy4 preview 在 WorkBuddy 首發接入以來,憑藉其 Agent 能力的顯著提升,受到了廣大用戶與開發者的積極體驗和熱情反饋,上線首日即在 WorkBuddy 任務隊列中出現排隊情況,對此深表歉意。公告顯示,為保障用戶的使用體驗,騰訊混元已針對 Hy4 preview 推理集群進行緊急擴容,並將持續動態調配資源。但受限於高端算力總量與高峰併發集中,仍不排除個別時段會繼續出現排隊情況。如遇到排隊,建議用戶可以考慮如下過渡方案:切換到 Hy3 等其他模型繼續使用:Hy3 當前 WorkBuddy 限免將延長至 2026 年 9 月 30 日 23:59 。非緊急需求錯峰在晚間時段使用。關於 Hy4 preview 限免的兩點說明:每日免費額度有限:Hy4 preview 限免至 9 月 10 日 23:59 ,因資源有限,期間平臺對每位用戶分配了每日免費額度。觸發限頻後,頁面會提示重置恢復時間。Hy4 preview 為大語言模型,暫不具備圖像 / 視頻等多模態生成能力。當你在 WorkBuddy 裡發起生圖、視頻等多模態任務時,系統會自動切換到其他多模態模型執行,該部分按正常規則消耗積分,不佔用 Hy4 preview 免費額度。IT之家注意到,騰訊官方 8 月 28 日發佈了 Hy4 preview,總參數 770 B,激活參數 49 B,上下文長度 1M。官方表示,Hy4 preview 在模型尺寸、上下文長

首例AI自主黑客攻擊曝光,Claude失控,德州大學生一人抓包
新智元·2026年08月31日 11:52大學生截獲失控AI的開源項目惡意攻擊 被拒了20多次實習後,24歲Sinan Can Demir決定去GitHub上攢點項目經驗。他怎麼也沒想到,自己撞上的第一條「大魚」,竟然是一個失控的AI。

上線一月,Seedance 2.5能否抗住“平替”圍攻?
Tech星球2026.08.31 11:24 · 來自北京全文3579字00:00 / 10:35平替扎堆來襲,Seedance 正在遭遇什麼? 文 | Tech星球,作者 | 翟元元字節跳動旗下視頻生成大模型Seedance 2.5上線近一個月,用戶對它的評價呈兩極分化:一種聲音認為它價格太貴,生成一段十幾秒的視頻最後需要幾十塊,對個人創作者而言門檻過高,貴是原罪。另一種聲音則認為,它是地表最強視頻生成模型,生成效果最好,暫時無人超越,貴但好用。即便眼下Seedance 2.

AIGC,闖進長片片場
生成式AI的創作能量已從短影音延伸至長片電影製作,實際參與前製概念圖、動態分鏡到後期特效等環節,象徵其角色從輔助工具轉為能主導風格與敘事節奏的創作夥伴。不過進入長片也面臨人物一致性、跨場景細節誤差與複雜多人互動等技術門檻,導演與剪接師須在AI的創意生成與精準敘事間取得平衡。此外,AIGC正重塑影視產業的勞動分工與成本結構,雖為獨立製片開啟新可能,也迫使從業人員重新定位價值,以原創性與手工感作為區隔平庸與傑作的關鍵。

Claude 被曝大規模盜號,Anthropic 緊急切斷支付權限、警告用戶別亂下載軟件
作者:汪淼 責編:汪淼 評論: 8 月 31 日消息,據 bleepingcomputer 昨日報道,Anthropic 警告部分 Claude 用戶,其電腦上的信息竊取惡意軟件竊取了活躍的 Claude 登錄會話,使攻擊者能夠訪問賬戶並竊取其使用數據。

國內首部 AIGC 長劇《後西遊記》今日開播,首部“邊審邊播”劇集
作者:浩渺 責編:浩渺 評論: 感謝網友 肖戰割割 的線索投遞!8 月 31 日消息,國內首部 AIGC 長劇《後西遊記》今日 18:00 正式開播,率先亮相的“花果山篇”共 5 集(每集 40 分鐘),不僅會在芒果 TV 上線,還會在當天 20:00 登陸湖南衛視電視劇黃金檔。