OpenAI人才流動:前研究員田永龍入職騰訊,深耕視覺語言模型研發
重點摘要
OpenAI前研究員田永龍正式加入騰訊大語言模型部,將主攻視覺語言模型(VLM)研發。業界認為此舉顯示騰訊正積極強化多模態大模型技術佈局,並藉由吸納頂尖人才來提升底層技術實力。
人工智能領域的人才流動近來持續引發關注,最新消息顯示,OpenAI 前研究員田永龍(Yonglong Tian)已正式加盟騰訊,未來將進入騰訊大語言模型部工作,主要負責視覺語言模型(VLM)的相關研發任務。這項人事動向不僅標誌著頂尖 AI 人才從國際實驗室回流中國企業,也反映出騰訊在多模態大模型技術上的佈局正加速推進。田永龍在 AI 學術與工業界擁有深厚背景,作為 OpenAI 的前研究員,他過去參與的多項前沿研究受到業界高度矚目。雖然具體的研究成果細節並未在此次消息中完整披露,但其技術實力與國際視野,使他成為騰訊在視覺語言模型領域重點延攬的對象。
此次加入騰訊大語言模型部,意味著他將直接投入 VLM 的設計、訓練與應用落地,協助騰訊在這一關鍵技術方向上取得突破。視覺語言模型是當前大模型技術的前沿方向之一,旨在讓 AI 同時理解圖像與文字資訊,進而完成跨模態的推理、生成與問答。與傳統僅處理文字的語言模型不同,VLM 能處理更複雜的視覺輸入,例如圖片、影片甚至即時畫面,並結合自然語言進行互動。這項技術被視為實現更高階人工智慧的核心環節,無論在自動駕駛、智慧客服、內容生成,還是醫療影像分析等領域,都有廣泛的應用潛力。騰訊近年來持續加大在大模型領域的投入,從底層基礎模型到應用層產品,皆展現出積極的擴張企圖。
此次引進田永龍,正是騰訊強化多模態技術研發的重要一環。透過吸納具備國際頂尖實驗室經驗的科研人才,騰訊得以在 VLM 的演算法設計、資料處理與模型最佳化等環節,獲得更多來自一線的實戰經驗與創新思維。業界分析認為,這項人事調動不僅體現騰訊對多模態路線的高度重視,也為其後續在相關領域的科研突破提供了更多可能性。從整個 AI 產業的角度來看,人才流動已成為技術競爭的關鍵指標。OpenAI 作為全球最受矚目的 AI 實驗室之一,其研究員的動向往往牽動業界神經。田永龍選擇加入騰訊,反映中國科技巨頭在吸引國際頂尖 AI 人才上仍具備相當的吸引力。
與此同時,多模態大模型的競爭正日趨白熱化,各大廠商紛紛推出自家 VLM 產品或開源方案,試圖在圖文理解、視覺問答等場景中搶佔先機。騰訊在大語言模型領域早已有深厚積累,其混元大模型系列涵蓋多種模態能力。田永龍的加入,預計將進一步補強騰訊在視覺語言融合方面的技術短板。透過將視覺編碼器與語言模型更緊密地結合,騰訊有機會開發出更具競爭力的 VLM 模型,不僅能提升既有產品(如搜尋、廣告、內容推薦)的智慧化程度,也可拓展至更多新興應用場景,例如智慧教育、工業檢測與自動化內容創作。值得注意的是,田永龍的研究興趣長期聚焦於視覺表徵學習與跨模態理解,這一技術路線與騰訊大語言模型部的發展方向高度契合。
他在 OpenAI 期間累積的經驗,尤其在處理大規模多模態資料與設計高效訓練策略方面的能力,將直接應用於騰訊的 VLM 研發流程中。業界人士普遍認為,這項人事案將有助於騰訊在視覺語言模型領域縮小與國際頂尖團隊的差距,甚至在某些細分方向上取得領先。除了技術層面的影響,此次人才流動也再次凸顯 AI 領域「人才爭奪戰」的激烈程度。隨著多模態能力成為下一代 AI 應用的核心,具備相關背景的科研人員成為各大公司爭相延攬的對象。騰訊不僅在薪酬與資源上提供競爭力,更透過打造開放的研究環境與充足的算力支持,吸引頂尖人才加入。田永龍的選擇,無疑是對騰訊 AI 研發實力與未來願景的肯定。
未來,隨著田永龍正式到崗並展開工作,騰訊大語言模型部在視覺語言模型上的研發節奏有望進一步加快。業界也將密切關注騰訊是否會推出新一代 VLM 模型,或將相關技術整合進旗下熱門產品中。整體而言,這項人事動向不僅是騰訊與 OpenAI 之間的人才流動案例,更是全球 AI 產業格局變遷的一個縮影——頂尖人才正從單一實驗室擴散至更多企業,推動多模態技術走向成熟與普及。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。