火速實測騰訊Hy4 preview:一條提示詞直出3D開放世界遊戲,緩存價格看齊DeepSeek
作者 | 陳駿達 編輯 | 雲鵬 8月28日報道,就在剛剛,騰訊發佈並開源了Hy4 preview,其最新一代旗艦模型的預覽版本。Hy4 preview擁有770B參數、激活參數49B、上下文長度1M,較Hy3 295B參數、21B激活、256k上下文有明顯提升。8月末的大模型圈格外熱鬧,僅在這兩天,就有阿里Qwen3.8-Flash、智譜GLM-5.3-Flash等模型開源,而騰訊是最新交出成果的玩家。今年騰訊在AI方面的迭代速度明顯加快,多位知名AI人才加入,外界也期待騰訊能否在這場拿出差異化的成果。騰訊公開了Hy4 preview的基準測試結果。
在多個編程、智能體和科研基準測試中,Hy4 preview的得分超過了DeepSeek V4 Pro 0824等模型,排名位居開源模型第一梯隊。編程、辦公、遊戲開發、科研等場景是Hy4 preview此次升級的重點。騰訊與內部的軟工、遊戲、金融、安全等領域專家進行了高質量數據的建設,最終提升了模型在上述領域的效果。在發佈前獲得了Hy4 preview的內測資格,得以提前深度體驗這款模型在真實開發和生產力場景中的完整能力。我們的本次測試主要在WorkBuddy內完成,可以感受到,Hy4 preview在長上下文任務中的任務拆解、工具調用與自我糾錯能力構成了本次升級的亮點。
騰訊官方曬出了不少Hy4 preview的demo。比如,通過MCP接入虛幻5引擎後,Hy4 preview可以實現純對話從零製作一個射擊遊戲Demo,包括環境美術搭建、玩法搭建、關卡搭建。在辦公場景,Hy4 preview可以從72份文件中自動判斷髮票是否合規,從3份規章制度中找到現行生效的規則,甄別發票報銷申請是否合規。目前,Hy4 preview已開源,並在騰訊雲TokenHub和OpenRouter上線,個人用戶也可選擇在WorkBuddy/CodeBuddy 、元寶、ima等產品上體驗。這一模型的API價格為6元/百萬輸入tokens、18元/百萬輸出tokens。
輸入命中緩存價格則為0.3元/百萬tokens,剛好與DeepSeek V4 Pro一致。開源鏈接: https://huggingface.co/tencent/Hy4-preview https://github.com/Tencent-Hunyuan/Hy4-preview https://modelscope.cn/models/Tencent-Hunyuan/Hy4-preview https://ai.gitcode.com/tencent_hunyuan/Hy4-preview 模型體驗: https://aistudio.tencent.
com/ 一、編程能力較Hy3提升明顯,前端代碼、3D建模效果成亮點 我們的實測從編程場景開始。在此前對Hy3的實測中,我們曾讓Hy3執行如下任務: 構建一個自包含的HTML5 Canvas場景,包含真實物理演示:一列火車從斷裂的橋樑上脫軌並墜入水中。同樣的任務交給Hy4 preview,可以看到它的完成度要明顯高於Hy3,火車落水的物理細節更為符合實際,每節車廂都有獨立的碰撞體積,沒有出現Hy3之前結果中穿模的問題。在更為複雜的開發任務中,我們讓Hy4 preview打造一個Art Deco風格的個人博客網站。
這一任務需要模型具備良好的前端開發能力之外,還要求它需要對抽象的風格有自己的理解——Art Deco是一種建築風格,如何將它融入到一個網頁中需要巧思。在正式開發之前,Hy4 preview先是檢查了一遍環境,確認所需的環境版本正確,然後才開始規劃開發方案。它直接將各種技術棧選擇列為交互框,我只需點擊即可快速確定方案。執行過程中,Hy4 preview先是迅速完成了初版網頁的開發,然後直接進入到驗證環節,它自主修復了高亮顏色顯示有誤、JS崩潰等問題,直到確保測試通過才向我交付了最終的成果。
從結果來看,Hy4 preview很好地理解了Art Deco的設計語言,從網頁logo設計到代碼塊顏色的選擇,都保持了統一的設計語言。功能方面,這一網站的渲染正常,沒有出現圍欄洩露、代碼高亮串色或標籤嵌套破損等自建解析器常見的問題。當Hy3拿到同樣的任務時,可以看到它的設計雖然也能看出Art Deco的痕跡,但在代碼塊等細節設計上有點出戲了。以上任務都還是相對輕量級的。最後,我讓Hy4 preview嘗試打造一個低多邊形風格的3D開放世界遊戲。
這個任務要求把此前分散考察的能力在一個項目裡交付,打造一個具備基本遊戲性的閉環,同時還需要處理水面反射、晝夜推移、晴雨霧天氣切換、腳步聲和環境音等諸多細節,難度不小。給足權限後,Hy4 preview連續工作了1小時,最終完成了任務。對於複雜項目,Hy4 preview可以充分利用WorkBuddy的任務列表機制,規劃合理的執行流程,先搭建框架再來實現細節。開發過程中,Hy4 preview可以運用WorkBuddy的視覺工具對開發結果進行檢查。比如,在考察遊戲的資源採集機制時,它可以通過命令操作遊戲人物,執行採集動作,並截圖確認是否成功。
Hy4 preview最終交付了一個多文件的項目,遊戲大小來到10MB左右,打開遊戲後,我們試著體驗了一下核心遊戲機制,像是採集、進食、建造等動作都可以正常進行,已經具備一定的可玩性。跑完這幾個任務,可以感受到Hy4 preview已經能承擔更為複雜、長程的開發任務,尤其是在前端審美方面有可感的提升。二、生產力場景實測:採購詢價、讀財報出PPT,還能自己揪出數據錯誤 體驗完Hy4 preview的編程能力,我們將測試場景挪到了生產力場景。此次Hy4 preview重點提升了文檔處理、信息分析等能力。
實測中,我們構造了一個虛擬的採購場景,讓它幫公司的3個會議室完成視頻會議設備的採購,預算為8萬元,要求兼容Zoom。拿到任務後,Hy4 preview進行了4輪並行的基礎檢索,把我在一開始點名的Poly Studio X、Logitech Rally Bar、華為CloudLink、MAXHUB等備選方案各摸了一遍公開報價。但它沒有順勢展開對比,而是停下來問了三件事:8萬預算是否包含顯示大屏、公司主用哪家會議軟件、期望原生一體機還是自帶設備接筆記本。
拿到更為具體的需求後,Hy4 preview在進一步調研後給出了最終的回答,並將這一結論只作為可視化的柱狀圖,屏幕、會議終端、隱性成本等成本項都考慮到了。在深度搜索場景中,Hy4 preview展現出不錯的專業素養和業務思維,在信息不足時,它主動向我澄清需求,最終給出了更準確的答案。在另一任務中,我們讓Hy4 preview下載騰訊近期財報,並從PDF中提取財務數據,最終輸出業績分析的PPT文件。在蒐集財務數據時,Hy4 preview對每個數字都進行了三層校驗,包括分部合計、基準值比對、會計恆等式,還是比較嚴謹的。
這一校驗機制也幫助它找到一個真實的錯誤,初稿中Hy4 preview把利潤率的分母搞錯了,隨後它自我進行了修正。最終,模型輸出的PPT結果如下。可以看到,這份PPT從設計上來看簡潔清晰,關鍵財務數據的呈現比較直觀。同時,我們還人工抽查核驗了部分數據,與實際財報的內容沒有出入。三、Hy4 preview進入科研場景:優化基礎設施端到端提升31.8% Hy4 preview還探索了在科學研究場景的應用。騰訊在博客中分享了不少案例,比如,在基礎設施優化場景,Hy4 preview可以自主分析推理系統瓶頸,並圍繞算子融合、通信優化等方向開展多輪優化,實現端到端吞吐相較基線提升31.
8%的結果,在不同上下文長度和併發度下均取得穩定收益。Hy4 preview還可以自主管理小型模型的後訓練,並根據結果持續調整探索方向。下方案例中,Hy4 preview作為研究者協調Codex同時優化多個評測目標,在8項評測上均優於Codex獨立探索。與騰訊自研的科研智能體Hyra結合後,Hy4 preview在機器學習力場分子動力學(MD)模擬上取得進步,32512原子磷脂雙分子層SO3LR在高度優化的JAX實現上進一步提速至2.02倍,達到4.9 ms/step,單張高端GPU可容納30萬原子。這一進展有望給新材料篩選、藥物分子研究和複雜生命體系模擬打開更大的計算空間。
結語:騰訊Hy迭代持續,思考效率或成優化方向 騰訊稱,Hy4 preview是Hy4迭代的一個早期版本,預訓練和後訓練均仍有較大的提升空間,也有一些已知問題,如複雜任務的長思考和過度自我驗證傾向。這也與我們的實際體驗一致:這一模型有時會困在自我驗證的循環之中,只有人工打斷、推進,才能完成任務,思考效率不算太高。不過,Hy4 preview已較騰訊上一代旗艦模型Hy3實現了明顯的提升。未來,隨著數據規模、質量的提升和訓練方法的優化,Hy4的能力應該還有進一步提升的空間。
Related
相關文章

真香:《我的世界》創始人佩爾松承認自己早期拒絕 AI 編程“可能錯了”
作者:清源 責編:清源 評論: 8 月 28 日消息,據《商業內幕》今天(28 日)報道,《我的世界》創作者、億萬富翁馬庫斯 · 佩爾松對 AI 的態度發生了徹底轉變。以“Notch”之名廣為人知的佩爾松,過去曾堅決反對用 AI 編程。今年 1 月,他甚至寫道:“(AI 編程)仍然是個糟糕透頂的主意,任何鼓吹這種做法的人,不是無能就是邪惡。

丹麥政府推出緊急方案引導學生合理使用 AI,遏制“AI 作弊”行為
作者:清源 責編:清源 評論: 8 月 28 日消息,據 CCTV 國際時訊報道,在今年夏天的考試季,丹麥多所高中 AI 作弊案例明顯增多。隨著生成式人工智能(AI)進入校園,學生利用 AI 完成作業甚至在考試中作弊的問題,給傳統教育和考試製度帶來新挑戰。

OpenAI 之後又是 Anthropic,Claude 將攻擊延伸至公共互聯網
44分鐘前谷歌突然發佈“最強聽寫模型”:Agent時代的落伍產品,還是關鍵拼圖?昨天智譜認領“牛來”模型,實測:“牛馬”友好昨天閱讀更多內容,狠戳這裡選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇跨境電商的“照騙”,AI承包了?

ChatGPT報警後:誰有權審判你的對話框?
腦極體2026.08.28 16:07 · 來自天津全文3780字00:00 / 11:54發現罪犯的AI,該不該報警?文 | 腦極體你敢相信,向AI吐露的私密想法,有一天會被直接遞交給執法部門嗎?在美國就發生了這樣一樁顛覆認知的事件。一名前高盛分析師在對話中向ChatGPT完整描述謀害前女友的犯罪計劃,OpenAI安全系統識別高危內容後,主動向FBI提交線索,當事人最終認罪獲刑。從結果來看,一場明確的預謀惡性案件被提前阻斷,但在行業規則、法律邊界、隱私權益層面,ChatGPT主動報警留下的爭議遠大於成果。

Claude開始接管物理世界,能用機械臂阻攔5000萬美元打款了
Anthropic的AI模型Claude近期從數位運算跨入實體世界,能直接控制機械設備。最新測試中,Claude透過機械臂成功攔截一筆5000萬美元的轉帳,展現即時物理操作能力。此突破讓AI應用範圍擴及金融安全、工業控制等需要高度即時反應的實體領域。

Pro 和 Flash 系列“冰火兩重天”,曝谷歌內部開始測試 Gemini 3.8 Flash 模型
作者:清源 責編:清源 評論: 8 月 28 日消息,谷歌本月才剛發佈新模型,下一款就已經進入員工測試階段,部分谷歌員工開始試用 Gemini 3.8 Flash 預覽版。據《商業內幕》今天(28 日)報道,為了追趕 OpenAI 和 Anthropic,谷歌正在以數週為間隔快速更新模型,AI 競賽的節奏也由此可見一斑。