WAIC五位首席科學家交鋒:多模態是LLM的“外掛”,還是下一代智能的“靈魂”?

重點摘要
2024年世界人工智能大會上,五位頂尖首席科學家針對多模態技術究竟是大型語言模型(LLM)的擴充工具,還是下一代智慧的核心基礎展開激烈辯論。一派認為多模態目前只是「外掛」,主要為LLM增加感知能力;另一派則主張智慧必須從訓練階段就融合多種模態,才能突破語言框架。雖然未達成共識,但這場交鋒為AI技術路線與通用智慧的發展方向畫出更明確的邊界。
在2024年世界人工智能大會(WAIC)上,一場集結五位頂尖機構首席科學家的深度對話,成為全場最受矚目的焦點之一。這場交鋒的命題直指當前人工智慧發展的核心矛盾:多模態技術究竟只是為大型語言模型(LLM)擴充感知能力的輔助工具,還是將成為驅動下一代人工智慧進化的核心靈魂?與會專家從模型架構設計、訓練範式到推理邏輯等層面,展開激烈辯論,不僅反映出學術界與產業界對當前AI路線的分歧,也觸及了通用智慧能否真正突破語言邊界的關鍵問題。在交鋒過程中,部分科學家主張,目前多模態的導入仍偏向「外掛」模式。
他們指出,現階段的主流做法是為LLM串接視覺編碼器或音訊處理模組,模型本質上仍以文本邏輯為運作核心,並未從底層改變理解與生成機制。這種疊加式的架構,雖然能讓模型處理圖片、聲音等非文字輸入,但推理過程依然高度依賴語言模型的權重與訓練資料,多模態資料僅作為輸入端的擴充,而非參與模型內部表徵的建構。另一派觀點則認為,人類的認知本身即是多感官統合的結果,真正的智慧不可能脫離影像、聲音與物理世界的互動訊號。這些科學家強調,LLM若要邁向更全面的智能主體,必須在多模態資料的融合方式上進行根本性革新,而非僅是疊加介面。
他們主張,未來的模型應該從訓練階段就將文字、圖像、音訊、影片甚至觸覺訊號視為同等重要的基礎資訊,並設計能同時處理異質資料的統一架構,這樣才能真正實現類似人類的感知與推理能力。這兩種立場的拉鋸,凸顯出業界對於「何謂智能本質」以及「技術路徑取捨」的深層辯證。持「外掛」觀點的科學家認為,當前LLM在語言理解與生成上的表現已相當成熟,多模態的加入主要是為了擴展應用場景,例如圖文問答、語音指令等,並不需要從根本上改變模型結構。他們擔心,若貿然將多模態資料全面納入訓練核心,可能導致模型訓練成本大幅上升,且難以保證現有語言能力的穩定性。
然而,認為多模態應成為「靈魂」的科學家反駁,若是僅將多模態視為外掛,模型的智慧上限將被語言介面所束縛。他們舉例,人類在學習時,視覺、聽覺、觸覺等資訊是同時作用於神經系統,彼此相互強化;若AI只能透過文字理解世界,就無法真正掌握物體的物理屬性、空間關係或因果連結。因此,他們主張下一代的LLM必須從架構設計階段就融入多模態,讓模型在預訓練時就能從不同模態的資料中學習統一的表徵,而非事後補上感知模組。這場討論也觸及到訓練資料與算力分配的實務問題。支持「外掛」模式的科學家指出,目前已有多模態LLM在特定任務上表現優異,例如圖像理解、語音辨識等,這些成果證明現有技術路線可行。
他們認為,與其耗費資源重新設計底層架構,不如集中精力優化編碼器與LLM之間的對齊策略,提升跨模態轉換的效率。但另一方則認為,這種做法只是權宜之計,無法真正解決多模態資訊在模型內部整合不足的問題,長期來看仍須走向統一架構。五位首席科學家並未達成單一共識,反而透過各自觀點的具體論證,為多模態在LLM發展中的地位畫出了更清晰的技術邊界。無論是「外掛」還是「靈魂」,這場交鋒都促使從業者重新思考模型架構的演化方向。對於正在開發下一代AI系統的團隊而言,選擇哪條路徑將直接影響產品的效能、成本與應用範圍。
部分與會者認為,短期內「外掛」模式可能更適合商業落地,因為它能夠快速將現有LLM轉化為多模態產品;但長期來看,若無法從根本上突破多模態融合的瓶頸,AI的智慧水準將難以超越語言模型的既有框架。值得注意的是,這場討論也反映出AI研究領域對於「通用智慧」定義的持續分歧。若將語言視為智慧的核心載體,那麼LLM本身就已經接近通用智慧的雛形;但若認為智慧必須包含感知、行動與環境互動,那麼多模態就絕非可有可無的附加功能,而是不可或缺的基礎能力。這場交鋒雖然沒有給出標準答案,卻讓與會者更清楚認識到,多模態研究可能成為區分下一代AI能力高下的關鍵分水嶺。
外界預期,未來一年內將有更多團隊投入多模態底層架構的創新,同時也會有更多產品嘗試將多模態能力以「外掛」形式整合到現有系統中。這兩條路線並非完全互斥,部分科學家認為,可行的策略是先用「外掛」模式快速驗證市場需求,同時布局下一代統一架構的研發。WAIC上的這場交鋒,無疑為人工智慧的下一波浪潮描繪出更清晰的技術路線圖,也讓外界更加關注這些理論如何落地為實際產品與應用場景,並影響全球AI產業的競爭格局。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。