WAIC五位首席科學家交鋒:多模態是LLM的“外掛”,還是下一代智能的“靈魂”?
重點摘要
在近日舉行的世界人工智慧大會(WAIC)上,五位首席科學家針對多模態技術與大型語言模型(LLM)的發展方向展開了一場激烈交鋒。這場討論的核心命題直指當前AI領域最受關注的焦點:多模態究竟是LLM的一個「外掛」工具,還是下一代人工智慧系統中不可或缺的「靈魂」?與會專家從不同技術路徑與應用場景切入,試圖釐清多模態在AI進化藍圖中的定位,也反映出學術界對未來智慧形態的深刻分歧。
在近日舉行的世界人工智慧大會(WAIC)上,五位首席科學家針對多模態技術與大型語言模型(LLM)的發展方向展開了一場激烈交鋒。這場討論的核心命題直指當前AI領域最受關注的焦點:多模態究竟是LLM的一個「外掛」工具,還是下一代人工智慧系統中不可或缺的「靈魂」?與會專家從不同技術路徑與應用場景切入,試圖釐清多模態在AI進化藍圖中的定位,也反映出學術界對未來智慧形態的深刻分歧。一部分科學家主張,當前的多模態能力更像是為LLM附加的感知擴展。在他們的觀點中,LLM本身以文字為核心,擅長處理語義、邏輯與知識推理,而多模態模組則像是為模型裝上「眼睛」與「耳朵」,讓它得以處理文字以外的影像、聲音與影片資訊。
這種擴展能大幅提升模型的實用性與互動體驗,例如讓聊天機器人看懂圖片中的物體、聽懂語音指令,或根據影片內容生成描述。從這個角度來看,多模態並非改變LLM的本質,而是為其提供更豐富的輸入與輸出介面,是一個強大的「外掛」。然而,另一派科學家則持截然不同的立場。他們從人類認知的本質出發,認為真正的智慧必須融合多種感知通道。人類並非僅靠文字理解世界,而是同時透過視覺、聽覺、觸覺等多種感官來建構認知。因此,多模態不該只是輔助插件,而應成為未來模型架構的核心設計邏輯。
這派觀點主張,下一代AI系統若想真正貼近人類智慧,就必須從底層設計就融入多模態訊號的處理,讓視覺、聽覺與語言等模態相互交織、彼此增強,而不是事後才加上一個感知模組。雙方在會上透過具體案例與前瞻預測,呈現出技術路線上的深刻分歧。舉例來說,支援「外掛」觀點的科學家展示了如何在不改變LLM核心架構的情況下,透過外部視覺編碼器讓模型完成圖片問答、文件理解等任務,且效果顯著。而支持「靈魂」觀點的科學家則提出,若從一開始就設計多模態聯合訓練的架構,模型能在更少的資料下學會跨模態的抽象概念,例如理解「紅色圓形水果」這個概念時,同時關聯文字描述、圖片中的蘋果形象與咬一口的聲音,從而產生更豐富的語意表徵。
這場交鋒不僅反映了學術界對AI發展方向的不同理解,也點出了產業在落地多模態應用時可能面臨的取捨。若將多模態視為「外掛」,企業可以快速為現有LLM產品增加多模態功能,降低開發成本與時間,但可能受限於模組間的耦合度,無法充分發揮多模態的潛力。反之,若選擇從底層重構為多模態原生架構,雖然可能帶來更強大的智慧表現,卻需要投入大量資源重新訓練模型,且目前多模態資料的標註與對齊技術仍未完全成熟,短期內商業化難度較高。無論最後哪種觀點勝出,這場對話都凸顯了多模態技術在LLM演進過程中的關鍵地位。
隨著GPT-4V、Gemini等多模態模型接連問世,產業界與學術界都已意識到,單純的文字模型已難以滿足日益複雜的應用需求。從自動駕駛、醫療影像診斷到智能客服,多模態能力正逐步成為AI系統的標配。而WAIC上五位首席科學家的這場交鋒,正好為業界提供了一次難得的思辨機會:我們究竟應該在現有LLM上疊加多模態能力,還是從零開始設計一個真正融合多種感知的智慧體?值得注意的是,雙方並非完全對立。有科學家在討論中提出折衷觀點,認為短期內可先以「外掛」方式快速落地,累積多模態應用的經驗與資料,長期則應逐步向多模態原生架構遷移。這種務實路線或許正是產業界在技術演進過程中採用的典型策略。
無論如何,這場交鋒的價值在於,它迫使學術界與產業界正視多模態技術的本質問題,而非僅僅停留在應用層面的追逐。從更宏觀的角度來看,多模態究竟是「外掛」還是「靈魂」,其實也反映了人工智慧發展的兩種哲學:一種是工具論,強調AI作為人類能力的延伸;另一種是認知論,追求AI建構出類似人類的感知與理解。這兩種路線在未來相當長一段時間內將並行發展,並在競爭與融合中推動AI技術的邊界。而WAIC的這場對話,無疑為所有關注AI進化的人們,提供了一個深度思考的起點。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。