專訪商湯首席科學家林達華:多模態的湧現時刻會在一兩年內到來

商湯科技首席科學家林達華近日接受專訪時拋出一個明確的時間判斷:多模態AI的「湧現時刻」可望在一到兩年內到來。他認為,目前模型已能同時處理文字、圖像、語音等多種訊息,但真正的爆發點在於這些模態彼此交融後,系統能展現出單一模態訓練時無法預期的新能力。這種跨越邊界而生的智能躍升,正是他口中「湧現」的具體樣貌。林達華進一步解釋,多模態的發展不會只是把不同資料簡單拼接,而是讓模型在理解、推理與生成過程中,自動尋找跨模態的關聯。當這套機制成熟,AI面對複雜情境時的判斷力與創造力將明顯提升。他預期這個時間點就在未來一兩年內,屆時不只是技術展示,而是實際應用上出現肉眼可見的突破。
對於商湯而言,這也意味著研發節奏必須提前布局。林達華在專訪中傳達的訊息是,多模態並非遙遠的願景,而是正要進入兌現期的技術轉折。企業若能在這個階段掌握跨模態的融合能力,就有機會在下一輪AI競賽中取得先機。
Related
相關文章

Łukasz Kaiser領銜,2026 奇點智能技術大會北京站正式官宣
11 月 20 -21 日,由奇點智能研究院與 CSDN 聯合主辦的「奇點智能大會北京站」正式舉行 2026 年,AI 世界最有權力的四個人,在同一件事上罕見地異口同聲:Sam Altman:「We are now, like, in the singularity.」——我們已經在奇點裡頭了。
StreamPI補上時序
機器人模型近年來在視覺語言動作(VLA)領域進展迅速,但單幀模型往往缺乏對時間序列的掌握,難以應付需要連續判斷的真實世界操作。根據業界消息指出,一項名為「StreamPI」的新框架正試圖補上這塊缺口,透過機器人時序框架的設計,讓原本只處理單一畫面的VLA模型也能具備「流式記憶」,也就是在動作決策時能參考過去一段時間的觀察與狀態,而非只看當下瞬間。 這項進展對機器人實務應用格外關鍵。

英國實施全球首例 AI 實時輔助腦外科手術,成功切除腦部腫瘤
作者:清源 責編:清源 評論: 感謝網友 I'm OK 👌 的線索投遞!8 月 27 日消息,據英國 BBC 今天(27 日)報道,英國貝德福德郡 48 歲的里斯 · 希伯特成為全球首位在 AI 實時輔助下接受腦部手術的患者,醫生成功切除了他的腦部腫瘤。

英偉達前AI總監顛覆Transformer,5萬億上下文物理AI,推演整個宇宙
英偉達前AI總監近日提出一套顛覆性的技術路線,試圖徹底改寫當前人工智慧領域由Transformer架構主導的局面。這項新方向鎖定「物理AI」與超大型上下文窗口,目標是讓模型具備推演整個宇宙運作邏輯的能力,消息一出立刻引發學界與產業界高度關注。 過去幾年,Transformer幾乎成為大型語言模型的代名詞,從自然語言處理到多模態理解,幾乎所有主流AI系統都建立在這個架構之上。然而,隨著應用場景從文字對話延伸到物理世界模擬、機器人控制與科學計算,Transformer在運算效率、記憶長度與時空推理上的瓶頸也越來越明顯。

研究發現嬰兒語言學習能力遠勝 AI 聊天機器人,學習效率也大幅領先
《麻省理工科技評論》在分析 AI 訓練過程時採訪了多位研究大語言模型效率的專家。一個很直觀的結論是:嬰兒學習語言的能力遠勝今天的 AI 聊天機器人,而且學習效率也高得多。