告別盲目像素預測:PhiZero開創“物理語言”先河,讓AI世界模型學會像人一樣思考

2026年7月31日 06:306600 次瀏覽

重點摘要

研究團隊推出全新物理世界模型PhiZero,有別於主流直接預測像素,改以「物理語言」離散表徵進行顯式物理推理。該模型採用「先推理、後渲染」架構,先推斷未來動態軌跡再交給擴散解碼器生成影片,在Physics-IQ Verified等基準測試中獲領先成績,有望助益具身智能與長時程模擬。

Related

相關文章

何夕2077研究與前沿

無Key注意力緩存減半

無Key注意力緩存減半。 新機制直接移除傳統Key表示。僅保留數值緩存���降低內存開銷。五款模型多數達到相當或更優表現。高效注意力研究論文解釋路由設計。長文本解碼吞吐有望明顯提高。

7 小時前
何夕2077研究與前沿

多款模型出現零字節輸出

多款模型出現零字節輸出。 研究覆蓋31430次模型測試。十一款模型���出現無文本執行。嚴格配對記錄2505次空洞。跨模型驗證資料已開放複核。現象並非拒答或傳輸故障導致。

7 小時前

這這這…翁荔光速回OpenAI上班了

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 這這這…翁荔光速回OpenAI上班了 Jay 2026-07-30 08:31:19 來源:量子位 6位聯合創始人——只剩2名。

22 小時前
何夕2077研究與前沿

輕量視覺語言動作模型面世

近年來,視覺語言動作模型(Vision-Language-Action Model,簡稱 VLA)在機器人領域逐漸成為主流,這類模型能將自然語言指令直接轉換為機器人的動作序列,讓機器人更直觀地與人類互動。然而,目前性能領先的系統大多依賴三到七十億參數的大型骨幹模型,龐大的記憶體需求往往超出嵌入式機器人的硬體預算,限制了這項技術在輕量級邊緣裝置上的應用。

1 天前
何夕2077研究與前沿

通用視頻世界模型開發完成

通用視頻世界模型開發完成 近日,一款名為 Wonder 的通用視頻世界模型正式公開,迅速在人工智慧領域掀起討論。根據消息來源「何夕2077」指出,這項研究由 Jiacong Xu、Hanwen Jiang 等學者共同完成,實現了從靜態圖片或條件影片出發,即時生成可供使用者自由操控相機的動態三維世界。不同於傳統的影片生成工具,Wonder 讓使用者不再只是被動觀看,而是能像在遊戲中一樣主動探索場景,開創了影片生成的全新互動模式。 過去幾年間,影片生成模型雖然進步神速,但多數作品仍停留在「生成一段固定視角的短片」階段。

1 天前

比特幣慌了?Mythos 60小時撬開後量子密碼算法

Mythos團隊在60小時內成功破解後量子密碼演算法,引發比特幣長期安全性疑慮。比特幣的橢圓曲線數位簽章演算法對量子電腦脆弱,業界呼籲盡快導入抗量子簽章方案。儘管目前無立即危險,但這項突破已為密碼學領域敲響警鐘。

1 天前