百度CTO王海峰、微軟亞研院劉樹傑同臺:大模型下一戰,拼“全模態”和“真對齊”

2026年7月6日 09:03

重點摘要

智東西 作者 | 陳佳 編輯 | 雲鵬 智東西7月7日報道,昨日,中國中文信息學會把學界教授、企業負責人和投資人拉到了同一張桌子上,聯合聯想控股、中科院軟件研究所等單位,成立了產學研創新生態工作委員會(下稱“工委會”)。 聯想控股CEO於浩出任工委會首任主任。過去產學研的典型路徑是“成果後轉化”,即科研機構先做出成果,再找市場。於浩認為,現在要轉向“協同前創新”,讓產業端從研發階段就加入,資金同步跟進,形成閉環。

站內 AI 整理稿

中國中文信息學會於7月6日正式宣布,聯合聯想控股、中科院軟件研究所等機構,共同成立產學研創新生態工作委員會(簡稱工委會)。這個委員會集結了學界教授、企業負責人與投資人,目標是打破以往「成果後轉化」的線性模式,轉而推動「協同前創新」——也就是讓產業端從研發初期就參與,同時資金同步跟進,形成更緊密的閉環。此舉被視為回應當前AI技術從實驗室走向商業化過程中的瓶頸,期望透過跨領域合作加速創新落地。在工委會成立的同一場合,多位重量級人物發表了對大模型發展路徑的深刻見解。百度CTO、同時也是中國中文信息學會副理事長的王海峰,以「原生全模態大模型」為題發表演講。

他認為,當前許多大模型仍停留在語音辨識(ASR)、大型語言模型(LLM)與語音合成(TTS)等模塊的串聯,或者視覺模型與語言模型的簡單架構拼接。這種做法無法真正發揮多模態的潛力。王海峰主張,關鍵在於將文本、音頻、圖片、影片等不同類型的資料,統一轉化為離散的Token,在共享的表示空間與自迴歸框架下進行建模。換句話說,大模型不應該是各自獨立模組的組合,而應該從底層就具備處理多種模態資訊的能力。王海峰進一步指出,AI領域的競爭已經不再僅僅是單一模型能力的比拼,而是延伸至工程平台、算力適配與產業落地等系統層面的綜合實力。

他強調,只有當模型本身具備原生全模態的基礎架構,後續的應用開發與場景擴展才能獲得更高的效率與穩定性。這番話點出了當前業界對於多模態大模型的真實困境:許多模型雖然號稱多模態,但本質上仍是不同模組的拼湊,難以在實際應用中達到預期的流暢度與準確度。緊接著,微軟亞洲研究院首席研究員劉樹傑以圓桌引導報告的形式,進一步深化了這個討論。他從微軟先前提出的VALL-E語音模型切入,說明語音離散化技術如何成為多模態融合的基礎,並延伸至更廣泛的多模態大模型。劉樹傑直言,目前多模態大模型的推理能力偏弱、穩固性不足,問題的根源並不在於疊加了幾種模態,而是這些模態之間根本沒有達到真正的對齊。

他所謂的「真對齊」,指的是不同模態的資訊在語義層次上能夠相互對應與補強,而非只是表面的同步或轉換。劉樹傑的觀察呼應了王海峰的觀點——如果缺乏底層的共享表示空間,多模態模型就難以在複雜任務中展現出應有的智慧。他認為,學界與產業界需要投入更多心力在對齊機制的研究上,包括如何設計更有效的跨模態注意力機制,以及如何建立高品質的對齊訓練資料,這樣才能讓大模型從「看起來多模態」進化到「真正理解多模態」。在隨後進行的圓桌討論中,拓爾思董事長、同時也是中國中文信息學會監事的施水才,從產學研合作的角度提出反思。他指出,過去學術界先做出成果、再尋找市場應用的線性轉化路徑已經遠遠跟不上技術迭代的速度。

現在必須採取並聯融合的策略,讓研究、開發、應用與資金同時並進。對於科學家創業的議題,施水才也給出務實的建議:創業團隊不能「既要又要」,科學家必須認清自己的優勢互補需求,找能夠補足商業、管理與市場經驗的合作夥伴,才能提高成功率。另一位與談人、北京前沿國際人工智能研究院理事長暨英諾科創基金合夥人王晟,則從創投的視角揭露了產業創新的另一個面向。他直言,創投機構真正投資的對象「不是科學家,而是有科技基因的企業家」。這句話點出了學術界創業時常見的盲點:擁有頂尖技術並不等於能夠經營一家成功的公司,市場判斷、團隊領導與資源整合等能力同樣重要。

王晟認為,產學研生態要健康發展,必須培養更多兼具技術背景與商業嗅覺的跨界人才,而工委會的成立正好提供了這樣一個平台,讓不同背景的人才能夠碰撞出新的火花。整個會議的氛圍顯示,無論是學界、業界還是創投圈,對於大模型發展的下一階段已經形成高度共識:單一模型的能力固然重要,但真正的突破將來自於系統層級的創新,包含全模態的底層架構、模態之間的精準對齊,以及產學研之間更緊密、更早期的協作。工委會的成立正是在這樣的背景下應運而生,為各方提供了一個常態化的溝通機制,期望透過持續的對話與合作,加速中國在人工智慧核心技術上的原創能力與產業轉化效率。

從王海峰提出的「原生全模態」到劉樹傑強調的「真對齊」,再到施水才與王晟對於產學研協作機制的反思,這場會議不僅是一場技術觀點的交流,更反映了整個AI生態系統正在從「模型競賽」轉向「系統能力競賽」的深刻轉變。未來,誰能在全模態架構、模態對齊技術以及產學研融合這三個維度上同時取得進展,才有機會在下一波大模型浪潮中占據領先地位。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

5 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

7 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

10 小時前