馬斯克宣佈:Grok學會看片了,無字幕看懂陶哲軒菲獎級難題

重點摘要
馬斯克宣布旗下AI模型Grok已具備影片理解能力,能在無字幕情況下直接看懂數學家陶哲軒提出的菲爾茲獎等級難題,顯示其視覺與推理整合能力大幅提升。這項突破展現了AI在跨模態理解與抽象推理上的進展,未來可望應用於教育與科研影像分析等領域。
馬斯克近日對外宣布,旗下人工智慧模型 Grok 在視覺理解能力上取得重大進展,正式具備「看片」能力。這項新功能最令人驚豔的示範,是 Grok 能夠在不依賴任何字幕或文字提示的情況下,直接看懂數學家陶哲軒所提出的菲爾茲獎等級難題。這項突破不僅展現了 Grok 在動態影像辨識上的實力,更凸顯其在跨模態整合與高階抽象推理上的躍進。 根據馬斯克團隊提供的測試細節,這次使用的影片內容完全沒有搭配任何文字說明、解題提示或旁白引導。換句話說,Grok 必須單憑畫面上的數學符號、算式推演過程,以及陶哲軒的書寫動作,自行判斷題目的核心命題,並進行後續的數學推演。結果顯示,Grok 不僅正確識別出題目的關鍵結構,還能針對該難題展開高階邏輯推論,彷彿真的「看懂」了影片中的學術內容。 陶哲軒被譽為當代最傑出的數學家之一,他在數論、調和分析、偏微分方程等多個領域都有極具影響力的貢獻,曾於2006年獲得菲爾茲獎。他提出的問題往往被視為頂尖智力挑戰,對人類專家而言都需要高度專注與深厚的數學素養才能應對。如今 Grok 能夠在動態影像中「一眼看穿」這類問題,意味著 AI 在視覺與語言的融合能力上,已經抵達一個全新的層次。 這並非 Grok 首次展現驚人實力。在此之前,該模型已在多輪對話、程式碼生成、數學解題等任務中證明過自己的表現。然而,這次的「看片解題」示範,特別強調了視覺資訊與語言推理之間的無縫銜接。傳統的 AI 模型往往需要透過文字轉錄或字幕輔助,才能理解影片中的內容;但 Grok 這次的表現,顯示它已經能夠直接從動態影像中提取語義與邏輯結構,並進行跨模態的推理。 馬斯克在公開場合強調,這項技術的突破並非只停留在實驗室展示的層面。他認為,未來 Grok 的影片理解能力可以廣泛應用於教育領域,例如自動分析教學影片中的數學、物理或化學問題,即時為學生提供解題思路與詳細講解。此外,在科學研究影像分析方面,也能幫助研究人員快速識別實驗過程中的關鍵步驟與異常現象,大幅提升科研效率。 從技術角度來看,Grok 要達成「無字幕看懂」影片,背後需要整合多個先進的 AI 模組。首先,模型必須具備高效的視覺編碼器,能夠從連續畫面中抓取數學符號、圖表、公式以及書寫軌跡的變化。其次,模型需要擁有強大的時序理解能力,將這些動態視覺特徵轉化為有意義的數學敘述。最後,還需要一個具備深厚數學知識的推理引擎,才能對題目本身進行高階推演,而不是僅僅停留在「辨識」的層面。 這項成果也反映出 AI 在視覺與語言融合領域的整體進展。過去幾年,多模態模型如 GPT-4V、Gemini、Claude 等已經陸續展現出圖像理解能力,但大多仍受限於靜態圖片或需要文字輔助的影片內容。Grok 這次的示範,則將門檻提高到「動態影片中無文字輔助下的高階推理」,這對於 AI 真正貼近人類的直覺理解方式,具有重要的指標意義。 值得注意的是,陶哲軒本人對於 AI 的數學能力一直抱持著開放且審慎的態度。他曾在多個場合討論過大型語言模型在數學證明與解題上的潛力與限制。如今 Grok 能夠直接解讀他提出的菲爾茲獎等級難題,勢必會引發學術界對 AI 數學推理能力的進一步討論。部分專家認為,這類突破可能為數學教育帶來革命性變化,讓學生能夠透過 AI 輔助,更直觀地理解複雜的抽象概念。 從實際應用場景來看,Grok 的這項能力也可以用於自動化內容審查、學術講座摘要生成、開放式課程的即時輔助等領域。例如,當教師在課堂上板書解題時,AI 可以同步捕捉過程並生成對應的講解文字,甚至提供不同的解題思路。這對於資源不足的偏鄉教育或遠距學習環境,將是極具價值的工具。 馬斯克也在社群平台上表示,Grok 的「看片」能力目前仍在持續優化中,未來將逐步開放給更多使用者測試。他強調,這項技術的目標是讓 AI 能夠像人類一樣,從視覺經驗中直接學習與推理,而不是僅僅依賴大量的文字標註資料。這也呼應了他一直以來對「通用人工智慧」發展方向的願景。 整體而言,Grok 成功看懂陶哲軒菲爾茲獎級難題,不僅是一次技術展示,更象徵著 AI 跨模態理解能力邁入新階段。從影片中提取高階數學推理,過去被認為是極具挑戰的任務,如今 Grok 已經證明了其可行性。隨著這項技術逐步成熟,未來我們或許將看到更多 AI 與人類專家協作解決複雜問題的場景,而教育與科研的型態,也將因此迎來深刻的變革。
Related
相關文章

失控的硅谷AI越獄連續劇
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

騰訊字節阿里齊下場:AI辦公要大繁榮大發展了?
騰訊字節阿里齊下場:AI辦公要大繁榮大發展了?新莓2026.08.04 18:14 · 來自河南全文5744字00:00 / 17:14從辦公切入,不止於辦公。文 | 新莓,作者|程佳,編輯|翟文婷僅僅一個週末之隔,字節和阿里相繼出牌。週一,傳言已久的「千問辦公」正式公測,這個整合了QoderWork、MuleRun、悟空三款阿里產品的全新Agent,主要面向個人與企業的生產辦公場景。阿里官方對千問辦公的特色提煉是,激活組織生產力。

禁掉所有工具後,Opus 5和GPT-5.6的差距終於藏不住了
禁掉所有工具後,Opus 5和GPT-5.6的差距終於藏不住了字母AI2026.08.04 16:41 · 來自北京全文3996字00:00 / 11:09實測Opus5:提示詞工程可能將不復存在了。文 | 字母AI 且不論性能,自Claude Opus 5發佈以後有一件事讓AI圈特別在意,就是Anthropic在提示詞上的改進。

數學家24小時駁回OpenAI攻破的猜想!“AI證對了每句話,但已跟原猜想無關”
OpenAI宣稱新一代AI模型推翻Connes剛性猜想,但堪薩斯大學數學家Nielsen隔天提出反駁,指出AI構造的其中一個群並未滿足ICC與性質(T)等附加條件。他逐行比對OpenAI公開的37000行Lean 4代碼,發現AI證明的形式雖然正確,卻與原猜想無關,凸顯機器驗證只能檢查形式、無法確保命題對應原意的限制,猜想目前仍未被解決。

剛剛,Claude Fable 5,又拿第一了
這則新聞宣布Claude Fable 5再次拿下第一名,但全文未提供具體評測細節。文中僅說明站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

Cloudflare 推出新開源庫,為每個 AI 智能體配備獨立工作計算機
Cloudflare 推出新開源庫 @cloudflare/computer,為每個 AI 智能體分配獨立的虛擬工作計算機,具備文件系統與命令執行能力。該庫基於輕量執行環境 Isolate,並以 SQLite 支援虛擬文件系統,提供隔離環境與容器兩種後端,根據任務輕重自動選擇執行方式。