鈦媒體生成式AI

姚順雨和Hy3,能否跨過付費關?

2026年7月8日 18:33
姚順雨和Hy3,能否跨過付費關?

重點摘要

騰訊首席AI科學家姚順雨主導的Hy3模型正式版發布,成為騰訊AI階段性成果,在辦公場景測試中表現提升,但缺乏原生多模態能力且與競爭對手仍有差距。姚順雨強調模型實用價值高於刷榜,但騰訊AI仍需在應用端驗證模型付費能力與商業增量。

站內 AI 整理稿

姚順雨和Hy3,能否跨過付費關?隨著騰訊Hy3正式版發布,一個月前姚順雨與湯道生的對話,再度成為騰訊AI領域的熱議焦點。今年6月初,騰訊雲AI產業應用大會上,騰訊集團高級執行副總裁、雲與智慧產業事業群CEO湯道生,與騰訊首席AI科學家姚順雨同臺對談。當被問及外界對騰訊AI進展速度的質疑時,姚順雨對湯道生說:「感覺應該是我問你的問題。」這句話當時聽來像是一句玩笑,如今回顧,更像騰訊AI內部責任分工的一次公開表態:模型能力能否追上來,由姚順雨負責;模型能力能否落地產業、產品與營收,則由湯道生及騰訊各業務團隊共同承擔。

騰訊的AI產品起步其實不算晚,但通用大模型領域的聲量一直相對薄弱,從主力產品元寶的發展就能看出端倪。2025年2月,元寶接入DeepSeek-R1滿血版,用戶可在混元與DeepSeek-R1之間切換。此後混元團隊雖然在圖像、影片、3D生成方向取得一些關注,例如混元圖像、混元視頻與混元3D系列都有榜單與開源社群的下載量討論,但這些成果並未自然轉化為「騰訊通用大模型能力很強」的用戶認知。這種不溫不火的狀態,終於在今年被馬化騰點破。5月騰訊股東大會上,馬化騰用「上了船,後來發現船漏水,現在站上去了,還坐不下去」來形容騰訊的AI處境,並坦承騰訊早期AI基礎能力並不突出。

騰訊開始公開承認自己在補課,而姚順雨正是在這個背景下被推到臺前。去年底,騰訊升級大模型研發架構,新成立AI Infra部、AI Data部與數據計算平臺部;姚順雨出任「CEO/總裁辦公室」首席AI科學家,同時兼任AI Infra部與大語言模型部負責人。今年3月,騰訊撤銷AI Lab,部分人員調整至大語言模型部,加入混元團隊,並向姚順雨彙報。Hy3在測試中拿下高分,但具體表現仍有待實際應用檢驗。面對外界對騰訊AI掉隊的質疑,姚順雨與混元團隊至少先幫騰訊穩住了第一層人設。Hy3的成果,首先體現在騰訊終於拿出一份能被產品驗證的模型成績。

騰訊方面披露,Hy3已進入WorkBuddy、CodeBuddy、元寶、Marvis、ima等產品;從preview上線以來,日均Token消耗增長20倍。在WorkBuddy上,自主選擇Hy3 preview的用戶數增長6倍。Hy3在WorkBuddy辦公場景內部評測中,任務成功率從72%升至90%,平均耗時縮短34%。元寶藉Hy3上線文件交付後,常識錯誤率下降一半,幻覺率下降超過一半。在6月的騰訊雲大會上,姚順雨談到模型與產品關係時提到,「實用性價值大於刷榜價值」。Hy3正式版在產品體系中開始形成反饋,似乎正是這句話的真實寫照。

ima與Marvis也提供了類似證據:公開報導顯示,ima的知識庫問答推理質量提升近19%,Agent系統穩定性達95.1%;Marvis核心場景任務完成率提升至93.7%,多Agent協作派發正確率達92%。更早在Hy3 preview版本時,已有評測揭示了Hy3系列的設計理念。Hugging Face社群一篇技術部落格將Hy3 preview放在WorkBuddy場景中測試,任務是讓模型處理一份超過100頁的技術手冊,先從長文檔中抽取結構化知識,再自動設計10道深入測試題,最後將題目、計分與答案解釋打包成一個單檔HTML遊戲。

在長文本理解與程式碼生成任務中,Hy3 preview處理資訊速度較快,能理解複雜指令並拆解成清晰步驟;文本抽取環節能準確抓住關鍵資訊,程式碼生成結果也沒有錯誤,第一次運行就成功。這個案例說明了Hy3系列為何更適合在WorkBuddy這類長鏈辦公任務中觀察。姚順雨在大會上解釋自己為何加入騰訊時表示,這裡有「很多好問題、很多產品」。他認為,在預訓練與後訓練之後,模型究竟要應用在哪裡、產生什麼價值,最終要靠產品回答。Hy3正式版正是這個判斷的第一次集中驗收,也是騰訊混元團隊重組後第一個重磅公開成果。一個月前,湯道生在會上問姚順雨,Hy3 preview作為他在騰訊的首秀,具體做了哪些改變。

姚順雨回答說:「主要三點:第一,重建Infrastructure,無論是預訓練還是強化學習;第二,改變數據與Eval,如何定義更真實的問題、豐富數據的taxonomy、提高數據品質;第三,很多決策是taste driven的,沒有很清晰的公式。」他所提到的「定義真實的問題」,從Hy3公布的大量實測任務場景反饋來看,這一代模型更新的重點便是讓模型能力支撐真實任務,而這正是過去騰訊相對匹配不到位的領域。姚順雨還透露,團隊曾把「後訓練最強骨幹」派去協助元寶做後訓練。

他說,當時預訓練還沒準備好,很多算法同學不理解這個決定,但現在回頭看,這個動作讓產品團隊意識到模型團隊是真的為產品著想,也為Hy3 preview在元寶上線發揮重要作用。隨後他補充:「技術可以探討,最難的反而是信任和換位思考。」這個細節讓外界對大廠模型一號位有了更清晰的形象:他不僅是技術大牛,也要推動模型團隊與產品團隊建立協作關係。樹立姚順雨這面大旗後,騰訊也不遺餘力放大他的外部影響力。今年1月,姚順雨出席騰訊青雲獎學金頒獎活動,為青年研究者頒獎。首屆青雲獎學金為15位青年學者提供總價值50萬元支持,包括20萬元現金與30萬元雲異構算力資源。

6月,騰訊2026青雲計劃啟動,面向AI大模型、基礎架構與高性能計算等方向設置技術課題,支持青年人才參與混元、微信與遊戲等前沿課題。姚順雨為騰訊AI立住的第一層人設,便是認真打磨模型底座的形象,而Hy3的誕生,終於讓騰訊AI有了一份可驗證的階段性成果。對於騰訊來說,Hy3無疑是一份急需的答案。但放眼整個大模型行業,仍有待加強的短板。尤其是姚順雨本人曾提出「最強模型才會被付費」的理念。今年1月在清華主導的AGI-Next峰會上,他談到To B市場時說:「智能越高,代表生產力越高,溢價空間也越大。

」他表示,企業級市場對模型能力的付費意願呈現頭部效應,較弱模型在程式設計等高頻生產力場景中會帶來排錯與監控成本,隱性成本可能超過模型差價。這句話反過來成為Hy3的壓力。騰訊披露的270位專家真實工作盲測中,Hy3均分2.67/4,高於GLM-5.1的2.51/4。這個成績證明Hy3進步,但對比對象是競爭對手的上一代模型。GLM-5.1已不是智譜最新主力,最新的GLM-5.2擁有1M上下文視窗,以及更強大的Coding、Agent與長程工具調用能力。換言之,Hy3證明騰訊追上來一段,但離國產模型最前排還有距離。在6月的大會上,姚順雨談及性價比時,也把標準放在性能前面。

他說,很多人最後發現用Opus這樣的模型,反而比用更差的模型更省錢,因為更快把事情做對,也省了人的精力。他進一步拆解:性價比第一是「性」,如果性能不好,性價比就很難成立,第二才是成本。這句話也可以反過來審視Hy3:低價與低激活參數固然是吸引用戶走量的關鍵,但企業最終付費,看的是「一次做對」的能力。Hy3還需要在更多真實B端場景中得到驗證。Hy3的第二個能力邊界是原生多模態缺席,這個問題在歷代Hy通用模型的更新討論中由來已久。作為主打辦公場景的Agent能力底座,現實中用戶面對的輸入並不總是文本:PPT版式修改、Excel圖表辨識、網頁後臺各種圖標狀態。

Hy3若不能直接理解視覺輸入,就必須依賴混元多模態或其他OCR工具層協同。這個短板在騰訊的應用場景中尤其敏感,尤其是Hy3未來可能接入微信等C端用戶場景,用戶給AI的材料很多時候不是乾淨文本,而是一張截圖。與此同時,競爭對手已在原生多模態路線上耕耘許久。幾周前,火山引擎發布豆包2.1 Pro,公開報導提到其在Coding、Agent與VLM三大方向升級;發佈會還展示晶片設計RTL測試案例,模型連續運行近18小時,經歷9輪迭代,跑通模擬、測試與綜合檢查。在一個3D虛擬城市案例中,依託豆包2.1 Pro實現了500餘個智慧Agent同步協作,完成上千輪工具調用,生成超百棟建築。

阿里方面近期更新的Qwen3.7-Plus,也延續了統一視覺與語言的多模態Agent模型,面向圖像、影片、螢幕、網頁與文本輸入,並支援GUI、命令列與工具環境下的任務執行。相比之下,Hy3只能稱為一份語言模型答卷。在6月的大會上,姚順雨談及AI未來時說,AI是長期遊戲,「下半場才剛剛開始」。他還提到Coding Agent、多模態與具身智慧都會繼續發展。但以Hy3目前呈現的能力來看,騰訊拿到了進入下半場的門票,卻還沒拿到終局答案。姚順雨交出了Hy3作為階段性答卷,但騰訊AI到底快不快,還要看整個騰訊如何放大這一代模型的能力優勢。

回到姚順雨那句「感覺應該是我問你的問題」,這句話不只拋給湯道生,也拋給馬化騰、微信團隊以及所有渴望AI賦能的業務。應用層能否讓用戶感受到變化,比發布參數更重要。過去三個月,騰訊在B端與C端同時加速。6月,騰訊雲AI產業應用大會發布效率智慧體工具集;個人側升級QClaw、WorkBuddy、元寶、ima與騰訊文檔;企業側發布WorkBuddy企業版,並升級ClawPro、ADP與企點行銷雲。伴隨Hy3發布,這些產品都等來了新一代底座。Hy3已開始接入部分騰訊業務場景:微信公眾號AI分身與客服專項評測中,意圖辨識準確率提升至98.94%;微信讀書標籤標註準確率較Hy3 preview提高14.

1%;WeGame《流放之路:降臨》AI遊戲助手接入Hy3後,多輪推理與工具調度綜合成功率提升至92%,幻覺率從4.5%降至2.8%。這些數據顯示Hy3開始向騰訊核心生態外溢,但仍不夠。微信、遊戲、廣告與企業服務能否把Hy3變成高頻任務,決定了騰訊AI能否從階段性答卷走向長期人設。5月股東大會上,馬化騰說騰訊已經站上去了,但還坐不下去。坐不下去,不只因為模型不夠強,更現實的問題是應用層有沒有把模型能力變成新的用戶體驗與商業增量。在雲廠商正面交鋒的AI雲市場,競爭格局日益激烈。

字節方面,火山引擎此前披露豆包大模型日均Token調用量突破180萬億,過去一年增長超過10倍;IDC數據顯示火山引擎在中國公有雲MaaS服務市場份額為49.5%。Omdia發布的《中國AI雲市場份額2025》顯示,2025年中國AI雲市場規模約567億元,阿里雲以38.1%份額位居第一,火山引擎以20.4%位居第二,百度雲、騰訊雲、天翼雲分列第三到第五,騰訊雲的市場佔比只有個位數。而在雲戰場之外,騰訊要回答的題更複雜。微信、遊戲與廣告都在尋找AI增量,Hy3展現出不錯的Agent能力,但如何挖掘出C端用戶真正高黏著的使用場景,是相關產品團隊必須釐清的問題。

在1月的AGI-Next峰會上,姚順雨談C端競爭時提到,模型不只需要回答問題,還需要掌握額外Context。他舉例:「比如問『今天吃什麼』,今年問和去年問,答案不應一樣。」模型需要知道用戶狀態、位置、偏好與歷史,才能給出真正貼近個人處境的回答。這句話放在騰訊身上意義更明顯:微信、元寶與各種遊戲場景,騰訊不缺少能提供這種Context的用戶場景,但在過去幾年中,還沒有落地出能在C端掀起用戶聲量的使用案例。這個問題的答案,姚順雨與混元團隊只能回答一部分。AI產業不只是一場大模型一號位的工程,更是龐大企業技術實力、資本實力與產品組織能力的綜合考驗。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

26 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前