何夕2077AI Agent

Astra攻堅數學難題

2026年8月2日 00:00

重點摘要

OpenAI 近日正式揭露其代號為「Astra」的新一代模型家族,並同步發表一份數學研究報告,宣告該系統已成功破解十個在數學與理論計算機科學領域懸而未決的難題。這些問題在過去至少十年內毫無進展,其中多數甚至已困擾學界數十年之久。OpenAI 在報告中首次公開確認 Astra 的名稱,並將其定位為「下一個主要模型系列」,展現出該公司在長時程推理與複雜問題處理上的突破性進展。 根據 OpenAI 釋出的技術報告,Astra 內部版本所解決的數學難題橫跨高維幾何、編碼理論、群論、量子複雜度、晶格密碼學與極值組合學等領域。

站內 AI 整理稿

OpenAI 近日正式揭露其代號為「Astra」的新一代模型家族,並同步發表一份數學研究報告,宣告該系統已成功破解十個在數學與理論計算機科學領域懸而未決的難題。這些問題在過去至少十年內毫無進展,其中多數甚至已困擾學界數十年之久。OpenAI 在報告中首次公開確認 Astra 的名稱,並將其定位為「下一個主要模型系列」,展現出該公司在長時程推理與複雜問題處理上的突破性進展。 根據 OpenAI 釋出的技術報告,Astra 內部版本所解決的數學難題橫跨高維幾何、編碼理論、群論、量子複雜度、晶格密碼學與極值組合學等領域。其中一項關鍵成果是證明了非 sofic 群的存在,這在群論中是一項重大的開放性問題。數學家托馬斯.布魯姆(Thomas Bloom)在 X 平台上將此成果稱為「大新聞」,並認為其重要性甚至超越今年五月發表的單位距離猜想反例。他強調,雖然單位距離猜想的證明可能更為震撼,但就構造性結果而言,這批成果絕對是重量級的。 布魯姆同時也對「AI 取代數學家」的論點提出反駁。他指出,當 AI 的運作基礎涵蓋超過一個世紀的數學理論、由數學家親手打造,並以數學家所有著作作為訓練資料時,宣稱 AI 取代數學家其實是不合理的。負責 Astra 測試時推理技術的研究員諾姆.布朗(Noam Brown)也在 X 上透露,OpenAI 其實也曾嘗試挑戰其他重大難題,但未能成功。他寫道:「可惜的是,還沒有解出千禧年大獎難題(至少目前還沒有)。」克雷數學研究所為七個千禧年問題各設一百萬美元獎金,但自 2000 年公布以來僅有一個被解決。布朗補充說:「不過,我們在每個問題上花的運算成本並不高。測試時推理還有很大的擴展空間。」他稱 Astra 是「科學推理的一大步」。 OpenAI 表示,生成這十個解答所消耗的 token 若以 API 費率計算,約為 2,000 美元。模型產出論證後,人類研究人員與同一模型協作,將成果轉化為正式論文。此外,模型也將每個證明用 Lean 語言形式化,產出機器可驗證的正確性憑證,OpenAI 並針對每個解題過程發布了推理流程的說明。公司強調,研究人員協助準備論文與形式化證明,並對其準確性負責,但數學論證本身確實來自 Astra。 針對這類由 AI 獨自生成的證明,OpenAI 在報告中特別指出,若將人類標示為作者,將扭曲系統的貢獻,也無法反映真正的人類智力勞動本質。他們引用《萊頓 AI 與數學宣言》作為歸屬指引,說明在 AI 輔助研究中的貢獻應如何分配。 Astra 的開發背景並非偶然。根據《The Information》早先的報導,OpenAI 正在打造一個全新的模型系列,專門設計用來處理需要長時間運行的任務,其能力遠超目前已推出的任何模型。執行長山姆.奧特曼(Sam Altman)已在華盛頓特區向政治人物與監管機構展示此系統,強調其能協調多個代理程式在長時間內協作,攻克高度複雜的問題。該公司指出,複雜的專案與進階數學是潛在應用場景。Astra 將與 OpenAI 現有的 Sol、Terra 與 Luna 模型系列並列,形成新的產品線。目前尚未決定它會以 GPT-6 的形式推出,還是作為 GPT-5 系列中的一個變體,例如 GPT-5.7,也未有具體發布時程。 值得注意的是,Astra 將成為第一個接受美國新監管框架測試的模型。根據報導,該模型已進入測試階段,預計將被納入川普政府規劃中的新 AI 審查機制,未來 AI 模型在公開發布前必須先提交給聯邦政府審查。政府目標是在本週內完成該框架的制定。一個關鍵問題在於,模型能否在長時間運作的工作流程中避免錯誤累積,並在上下文持續增長的情況下自我修正偏離的路徑,這仍是當前代理系統的主要弱點。而像 Astra 這樣的多代理架構,在規劃等緊密連結的任務上,也可能因為協調成本與錯誤疊加而表現不佳。 OpenAI 的長期目標是實現自主 AI 研究。首席科學家 Jakub Pachocki 去年夏天在官方播客中表示,公司希望打造能連續工作數小時甚至數天的 AI 系統,目前的系統大多受限於短期任務,但未來需要能規劃、推理並進行長時間實驗的模型。去年底,公司甚至提出了一個思考方向:如何評估能完成人類需要數百年才能解決的任務的系統。到 2028 年 3 月,OpenAI 希望擁有一個能自主執行研究計畫的 AI 研究員,而這套系統也將依賴於長時間運行的 AI 流程。今年 9 月,他們計劃推出一個技能相當於研究實習生的 AI 系統,能夠大幅加速人類科學家的工作。Astra 很可能就是這套系統。Pachocki 也指出,這些系統需要遠比現在更多的運算能力,而 OpenAI 的長期基礎設施計畫正反映了這個野心。至於這家新創公司的營收能否快速成長以支撐龐大的建設計畫,仍是個未解的疑問。

Related

相關文章

何夕2077AI Agent

奧特曼覆盤Sora取捨

奧特曼覆盤Sora取捨。 奧特曼曾連續刷短視頻三小時。沉浸���體驗影響Sora判斷。奧特曼產品路線訪談披露細節。代碼智能體進展改寫資源排序。更多算力轉向通用智能。

4 小時前
何夕2077AI Agent

企業代理走向自進化

企業代理正朝自進化方向發展,日常工作軌跡可轉化為訓練教材。相關框架採用三層更新機制,自進化智能體研究論文說明了具體路徑,其中記憶更新可先於模型調參,並以在線強化學習達成持續改善。

4 小時前
何夕2077AI Agent

微軟發佈智能體訓練新法

微軟發佈智能體訓練新法。 Echoverse把規格編成應用。模型從微軟規模訓練論文原文獲���滾動反饋。深環境令準確率升至85%。9B模型跨十二環境升至67.1%。

1 天前
AIBaseAI Agent

微軟雲端隱憂:千億營收背後的增速換擋與槓桿風險

AI資訊AI新閒資訊正文微軟雲端隱憂:千億營收背後的增速換擋與槓桿風險發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘在當下的雲服務賽道中,巨頭們的軍備競賽正在全面加速。微軟在剛剛過去的財年中,年營收首次突破 1000 億美元大關,同比增長達到43%。然而,這份成績單背後並非高枕無憂,其業務增速不僅面臨挑戰,甚至被以82%的驚人增速實現反超。

1 天前7500
MarkTechPost AIAI Agent

使用 Omnigent 建構政策控管的多代理金融研究流程

在本教學中,我們將使用 uv 建立的可靠隔離 Python 環境,搭配 Omnigent 來建構並執行多代理工作流程。我們設定了一個金融研究主代理,它會從外部 API 取得即時美元兌歐元匯率,產出一份簡潔且可直接交付客戶的摘要,並將其草稿委派給專門的文字審核子代理,以檢查清晰度與長度是否符合要求。我們將可重複使用的 Python 函式定義為可呼叫的代理工具,以 YAML 描述完整的代理結構,並使用 Claude Agent SDK 作為執行框架。

1 天前
何夕2077AI Agent

SkillBoost約束技能進化

「SkillBoost約束技能進化」成為報導焦點,重點在於SkillBoost與約束技能進化之間的關聯。消息指出,先前混入模型思考或安全判斷的文字已被移除,以確保主題不受干擾。現有資訊保留了可供追蹤的主題,為後續討論提供明確起點。

2 天前