何夕2077生成式AI

Elorian AI主張直接使用圖像思考

2026年7月16日 00:00

重點摘要

Google DeepMind 前研究員 Andrew Dai 近日創立新公司 Elorian AI,指出目前主流的大型語言模型(LLM)已遇上瓶頸。他認為未來 AI 應直接以圖像思考,而非先將圖像轉化為文字再做推理。這套「視覺推理」技術方向已獲得 5,500 萬美元資金,公司估值達 3 億美元。

站內 AI 整理稿

Google DeepMind 前研究員Andrew Dai近日創立新公司Elorian AI,並公開主張目前主流的大型語言模型(LLM)已遭遇發展瓶頸,未來人工智慧應直接以「圖像思考」,而非先將視覺資訊轉化為文字後再進行推理。這條名為「視覺推理」的技術路線,在亮相前已獲得5,500萬美元資金,公司估值更達到3億美元,吸引業界高度關注。目前市面上如Google Gemini這類多模態模型,雖然表面上能「閱讀」圖像,但實際運作方式是先利用文字詳細描述畫面內容,再將這些描述按意義排列成龐大的內部「文字地圖」。模型接著透過推理這些文字,才得出對圖像的觀察、判斷乃至建議。

換句話說,整個過程本質上仍是「讀字」,而非真正「看圖」。舉例來說,當畫面是一張摩托車引擎設計圖時,多模態LLM或許能推論出引擎發熱時鋁合金活塞頂會膨脹、導致與汽缸壁之間的間隙縮小,但這種理解終究是繞了一圈靠文字轉化而來,並未直接從視覺訊號中建立認知。Elorian AI則決定反其道而行。團隊正在建構的視覺推理模型,會直接就圖像本身進行「思考」,不先轉換成文字地圖,而是在內部形成細緻的3D立體地圖,模擬人類想像與理解事物的方式。由於這些模型內建對物理定律的理解,因此能夠做出更細膩且更準確的觀察,理論上比現有方法更接近人類的視覺認知。Andrew Dai如何看待當前LLM的侷限?

他明確指出,視覺圖像與語言對模型智慧同等重要,甚至更為關鍵。他認為前沿語言模型已經觸及天花板,因為這些模型仍無法有效推理物理世界,表現「極度不穩定」。他舉例,若一個模型連桌上有幾個杯子都數不清、無法判斷物體之間的空間關係,那麼無論寫作或寫程式的能力多強,都稱不上具備通用智慧。這項觀點也與先前Bloomberg的報導吻合;Andrew Dai曾直言,大型AI實驗室的模型在處理視覺提示時,智力水準大約只相當於3歲幼童。Elorian AI由Andrew Dai與前Apple機器學習研究員楊寅飛共同創立。團隊開發的模型將使視覺資料在架構內與語言token享有同等地位,不再只是文字的附屬。

公司於2025年成立,並在2026年4月正式公開亮相。資金方面,Striker Ventures、Menlo Ventures與Altimeter共同投入5,500萬美元,Nvidia、49 Palms以及資深AI研究員Jeff Dean等也參與投資。目前團隊規模約在11至50人之間,目標是在12個月內推出首個公開銷售的模型,並已同步展開客戶洽談。值得注意的是,Elorian AI並非唯一朝此方向前進的新創企業。Google前學者李飛飛創立的World Labs同樣堅信AI需要發展空間與物理世界的理解能力,目前正在建構一種能夠處理感官資料、並從中發展出物理世界理解的「世界模型」。

從這兩家公司的布局可以清楚看到,「視覺推理」正逐漸成為業界下一個兵家必爭之地。過去數年,AI業界幾乎全力押注文字型LLM,然而Andrew Dai等資深研究員認為,單靠文字已經走到盡頭,下一步的突破在於教會機器直接「看懂」這個世界。Elorian AI現階段尚未公開實際產品或基準測試成績,未來一年能否如期交出成績單,將是業界驗證這套理論的重要指標;同時,World Labs等競爭對手的進展也同樣值得密切觀察。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

42 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前