Elorian AI主張直接使用圖像思考
重點摘要
Google DeepMind 前研究員 Andrew Dai 近日創立新公司 Elorian AI,指出目前主流的大型語言模型(LLM)已遇上瓶頸。他認為未來 AI 應直接以圖像思考,而非先將圖像轉化為文字再做推理。這套「視覺推理」技術方向已獲得 5,500 萬美元資金,公司估值達 3 億美元。
Google DeepMind 前研究員Andrew Dai近日創立新公司Elorian AI,並公開主張目前主流的大型語言模型(LLM)已遭遇發展瓶頸,未來人工智慧應直接以「圖像思考」,而非先將視覺資訊轉化為文字後再進行推理。這條名為「視覺推理」的技術路線,在亮相前已獲得5,500萬美元資金,公司估值更達到3億美元,吸引業界高度關注。目前市面上如Google Gemini這類多模態模型,雖然表面上能「閱讀」圖像,但實際運作方式是先利用文字詳細描述畫面內容,再將這些描述按意義排列成龐大的內部「文字地圖」。模型接著透過推理這些文字,才得出對圖像的觀察、判斷乃至建議。
換句話說,整個過程本質上仍是「讀字」,而非真正「看圖」。舉例來說,當畫面是一張摩托車引擎設計圖時,多模態LLM或許能推論出引擎發熱時鋁合金活塞頂會膨脹、導致與汽缸壁之間的間隙縮小,但這種理解終究是繞了一圈靠文字轉化而來,並未直接從視覺訊號中建立認知。Elorian AI則決定反其道而行。團隊正在建構的視覺推理模型,會直接就圖像本身進行「思考」,不先轉換成文字地圖,而是在內部形成細緻的3D立體地圖,模擬人類想像與理解事物的方式。由於這些模型內建對物理定律的理解,因此能夠做出更細膩且更準確的觀察,理論上比現有方法更接近人類的視覺認知。Andrew Dai如何看待當前LLM的侷限?
他明確指出,視覺圖像與語言對模型智慧同等重要,甚至更為關鍵。他認為前沿語言模型已經觸及天花板,因為這些模型仍無法有效推理物理世界,表現「極度不穩定」。他舉例,若一個模型連桌上有幾個杯子都數不清、無法判斷物體之間的空間關係,那麼無論寫作或寫程式的能力多強,都稱不上具備通用智慧。這項觀點也與先前Bloomberg的報導吻合;Andrew Dai曾直言,大型AI實驗室的模型在處理視覺提示時,智力水準大約只相當於3歲幼童。Elorian AI由Andrew Dai與前Apple機器學習研究員楊寅飛共同創立。團隊開發的模型將使視覺資料在架構內與語言token享有同等地位,不再只是文字的附屬。
公司於2025年成立,並在2026年4月正式公開亮相。資金方面,Striker Ventures、Menlo Ventures與Altimeter共同投入5,500萬美元,Nvidia、49 Palms以及資深AI研究員Jeff Dean等也參與投資。目前團隊規模約在11至50人之間,目標是在12個月內推出首個公開銷售的模型,並已同步展開客戶洽談。值得注意的是,Elorian AI並非唯一朝此方向前進的新創企業。Google前學者李飛飛創立的World Labs同樣堅信AI需要發展空間與物理世界的理解能力,目前正在建構一種能夠處理感官資料、並從中發展出物理世界理解的「世界模型」。
從這兩家公司的布局可以清楚看到,「視覺推理」正逐漸成為業界下一個兵家必爭之地。過去數年,AI業界幾乎全力押注文字型LLM,然而Andrew Dai等資深研究員認為,單靠文字已經走到盡頭,下一步的突破在於教會機器直接「看懂」這個世界。Elorian AI現階段尚未公開實際產品或基準測試成績,未來一年能否如期交出成績單,將是業界驗證這套理論的重要指標;同時,World Labs等競爭對手的進展也同樣值得密切觀察。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。