姚順雨的半年考,Hy3的“三板斧”

重點摘要
騰訊混元大模型在正式版發布當天,帶動股價上漲4.82%,但市場的反應並非單一因素所致。同一日,騰訊透過大宗交易減持快手股票,套現約125億港元,加上港股整體情緒提振,股價的漲勢其實是多重結構共同作用的結果。真正值得關注的,反而是另一組數據:元寶獨立App的日活躍用戶曲線,在經歷春節紅包拉新的高峰後,已從高點回落至約900萬。這半年來,混元在資本市場與終端用戶之間,顯然呈現出截然不同的風景。 混元每一次大版本更新,幾乎都圍繞著三項核心能力:編碼、上下文長度與幻覺控制。
騰訊混元大模型在正式版發布當天,帶動股價上漲4.82%,但市場的反應並非單一因素所致。同一日,騰訊透過大宗交易減持快手股票,套現約125億港元,加上港股整體情緒提振,股價的漲勢其實是多重結構共同作用的結果。真正值得關注的,反而是另一組數據:元寶獨立App的日活躍用戶曲線,在經歷春節紅包拉新的高峰後,已從高點回落至約900萬。這半年來,混元在資本市場與終端用戶之間,顯然呈現出截然不同的風景。混元每一次大版本更新,幾乎都圍繞著三項核心能力:編碼、上下文長度與幻覺控制。在Hy3 preview版本發布時,SWE-bench Verified成績達到74.4%,Terminal-Bench 2.
0則為54.4%,當時業界曾因為參數量僅295B而存有疑慮。相隔74天後,正式版給出了新的成績單:270位專家基於真實工作場景進行盲測,Hy3以2.67/4的均分,優於GLM5.1的2.51/4,尤其在前端開發、數據儲存與CI/CD等類別表現突出。幻覺率從12.5%降至5.4%,常識錯誤率也從25.4%砍半到12.7%,WorkBuddy任務成功率則從72%躍升至90%,平均耗時縮短34%。上下文依然維持256K沒有擴增,但「常識錯誤率降一半、幻覺率降一半」這句話,在正式版的對外表達中被多次強調。有人可能會質疑,混元是否只會這幾招?但從騰訊內部業務落地的角度來看,這三項能力恰恰是最迫切的需求。
微信、QQ、遊戲與廣告等核心業務,無一不依靠大量代碼支撐,編碼能力是AI Agent的基礎;上下文長度則決定了Agent能否處理複雜任務鏈;幻覺率更是直接影響用戶體驗。元寶過去被詬病「胡說八道」的問題,並非空穴來風。在騰訊內部,這三項指標被視為模型能否規模化應用的門檻,若無法達標,混元甚至連上桌的資格都沒有。相較之下,DeepSeek V4的迭代更側重全能力維度的突破,在推理、多模態與成本效率上持續刷新榜單;而混元則選擇了一條更務實的路線,集中火力在與業務結合最緊密的方向上。這並非掉隊,而是姚順雨上任後定下的策略:先打好地基,再蓋高樓。
混元可能正在複製Claude與智譜的路徑,把代碼能力作為突破口。姚順雨在2025年9月低調加入騰訊,12月正式接管混元核心研發體系。他上任的第一件事並不是調整模型參數,而是啟動預訓練與強化學習基礎設施的全面重組,新設AI Infra與AI Data等部門。2026年3月20日,騰訊正式撤銷成立十年的AI Lab,將核心研發力量全部收攏至混元主線。姚順雨的核心方法論名為Co-design,亦即邊訓練邊使用,讓產品端的反饋倒逼模型迭代。他曾公開表示,「Hy3 preview是混元從讀萬卷書到行萬里路的開始。」
混元之所以如此急迫,背後有其深層原因。2026年1月的騰訊內部年會上,總裁劉熾平曾復盤混元此前的發展問題,並以高中生背題應考作為比喻,直指模型在榜單上成績好看,但真正上場就露了餡。馬化騰則更加直接,用「太慢了,慢了9個月到1年」來點評。數據也相當刺眼:據QuestMobile於2026年3月的監測,元寶獨立App在春節紅包拉新後,日活從高點回落至約900萬,月活約5735萬;而同期豆包獨立App的月活已達3.45億,兩者規模相差約6倍,留存率更是差到不忍直視。更大的問題在於內部。騰訊的業務線過去對混元是「不敢接、不想接」,寧可繞道尋找外部方案。
一個大廠自研的大模型,連自家產品都不願採用,處境相當尷尬。姚順雨沒有走「純技術炫技」這條路,因為參數量、聲量、用戶基數都不佔優勢,唯一的出路就是把模型塞進微信、QQ、騰訊文檔、企業微信與和平精英等產品,利用騰訊14億MAU的Context護城河,來彌補模型能力上的差距。正因如此,每次混元更新後,騰訊的產品線幾乎都會迅速跟進,形成一套奇妙的傳播節奏。姚順雨否定了「唯榜單論」,不打榜、不堆參數,選擇將參數量維持在300B這個他認為「能力與效率的最優平衡帶」。他並非做不出更大的模型,而是選擇不做,因為編碼能力最容易量化、也最容易獲得內部業務線的認可,是打開局面的最佳切口。
外界說混元被困在老三樣裡,但其實是他主動選的。然而,技術參數修得好,產品是否真的留住了用戶,才是真正的考驗。WorkBuddy任務成功率從72%提升到90%,看起來進步顯著,但「任務成功」的定義權在騰訊手裡,內部測試與真實場景之間仍有差距。270位專家的盲測結果雖然優於GLM5.1,但專家並非一般用戶,盲測也無法完全反映日常使用體驗。元寶Agent能生成PPT、Word、Excel、PDF與HTML,功能相當齊全,但春節紅包過後MAU迅速回落的現實,說明功能多並不代表用戶願意留下來。
據多家媒體引述騰訊內部員工的反饋,部分員工仍認為混元在處理複雜任務時的效率不如外部模型,而騰訊內部對GLM等外部模型設有調用額度限制。這種「內部優先」的推廣方式,也引發了究竟是行政驅動還是產品驅動的討論。姚順雨把編碼、上下文與幻覺這老三樣修得透徹,但信任感是否真的回來了,仍是未知數。編碼分數從74.4%漲到任務成功率90%,用戶感知到了嗎?元寶MAU停留在5735萬,技術參數在漲,但用戶基數沒有跟著放大,內部員工甚至寧可選用Claude與GLM。現在,混元的未來面臨兩種截然不同的結局。
若賭贏,老三樣修透後,騰訊14億MAU的Context護城河將開始發酵,混元從「內部工具」晉升為「生態底座」,如同當年微信從QQ附屬品獨立成為帝國一般,混元也有機會從「夠用」變成「離不開」。若賭輸,過度聚焦編碼能力可能成為舒適區陷阱,擠壓多模態、推理與創意生成等領域的資源,當競爭對手在萬億參數與多模態上拉開差距時,混元所謂的「夠用」就變成了「不夠用」,用戶需要那10%的極限能力時,Hy3可能給不出來。姚順雨把混元從「什麼都想卷」轉變為「先把一件事做透」,這步棋走得漂亮,但做透之後,用戶究竟買不買單,才是最終的答案。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。

內部賽馬暫停,騰訊、阿里、字節AI辦公產品“合兵”對陣
過去半年,騰訊、阿里巴巴、字節跳動等大廠在AI辦公產品領域經歷內部賽馬後,近期紛紛收攏資源,推出整合方案。騰訊將QClaw業務調整至雲產品六部,與WorkBuddy統一管理;阿里整合三款產品推出千問辦公;字節則將飛書團隊併入豆包。市場數據顯示,6月國內AI辦公智能體平臺月訪問量突破6000萬次,顯示此領域競爭日益激烈。