留給開源模型的時間,就剩6個月?

2026年7月15日 16:43
留給開源模型的時間,就剩6個月?

重點摘要

美國白宮正在考慮透過行政命令限制開源AI,尤其針對中國開發的系統,此舉可能對開源產業造成重大衝擊。研究員指出,開源模型與封閉模型的能力差距可能在6個月內消失,屆時可能觸發更嚴格的禁令。此外,部分封閉模型公司被批評藉由安全疑慮遊說政府,試圖固化市場地位並阻礙開源模型生態發展。

站內 AI 整理稿

### 留給開源模型的時間,就剩6個月?開源模型正面臨史上最嚴峻的生存考驗。根據外媒報導,白宮正在研擬一項行政命令,可能針對開源 AI 祭出限制,特別是針對中國公司開發的系統。高級研究員 Adam Thierer 指出,如果這屆政府最終對開源 AI 的使用表明立場,甚至限制聯邦機構使用某些開源工具,他並不會感到意外。據了解,相關討論仍處於早期階段,目前還不清楚這些討論是否會轉化為具體政策;然而,即便最終沒有成真,這些風聲也已經讓外界對特朗普政府混亂的 AI 治理方式產生更多質疑。即使相關措施真的落地,最可能直接影響的對象,一是來自中國的模型,二是政府部門對這些模型的使用。

但第一塊骨牌倒下後,後續的連鎖效應恐怕難以控制。目前,開源模型缺乏一個強而有力、利益高度集中的美國經濟代表,能夠向政策制定者清楚說明打壓開源模型可能帶來的代價。據報導,Reflection AI 的代表曾提議,應根據模型的能力,為開源模型提供框架豁免。當下,DeepSeek 等中國開源模型明顯領先於其他可用的開源模型,而 Reflection 尚未發布公開模型。曾在 Meta、DeepMind 和 Hugging Face 任職的機器學習研究員 Nathan Lambert 直言,無論採取哪一種形式的禁令,從 AI 的長期發展軌跡來看,都將是一個嚴重錯誤。

他認為,最可能出現的政策,是禁止或無限期推遲任何能力明顯超過 GPT-5.5、Claude Opus 4.8 或 GLM-5.2 水平的開放權重模型。按照開源模型與閉源模型之間持續縮小的能力差距,這種情況很可能在未來 6 個月內就會出現。隨著 AI 應用逐漸成熟,越來越多企業正在轉向更輕量的模型。開源模型到底有沒有從矽谷前沿模型廠商那裡「虎口奪食」?AI 獨角獸企業 Decagon 就是典型的開源模型應用企業,目前約 90% 的工作負載都運行在開源模型上,而非 OpenAI 或 Anthropic 的模型。

Decagon CEO Jesse Zhang 解釋,這並非出於成本考量,也不是客戶強制要求,真正的原因是企業幾乎沒有其他選擇。當你在生產環境中運行客服 AI 智能體時,延遲直接決定產品能不能用,每輪回覆都要等 8 秒的產品沒人會用。因此,你需要體積更小、速度更快的模型。然而,開箱即用的小模型達不到客戶要求的品質標準,只有針對特定任務進行大規模微調,它們才能滿足需求。問題在於,前沿模型實驗室基本不提供這種組合,企業無法微調它們最強的模型,而它們的小模型也不屬於企業,無法任由塑造。

因此,「小模型加深度微調」本質上意味著必須使用開放權重模型,成本節省只是次要收益,對自託管模型更放心也只是附帶好處,並非根本原因。Jesse 還給出了一個「反直覺」的結論:企業在昂貴前沿模型上的整體支出幾乎沒有下降,但開源模型的支出佔比卻在下降。雖然他並未提供太多數據支撐,但 TechCrunch 找到了一些相關數據。Vercel 的 AI Gateway 儀表板顯示,在一週的時間裡,DeepSeek 的 Token 處理量迅速升至第一,目前已經佔到 Vercel 基礎設施總 Token 流量的三分之一以上。推出熱門模型 GLM-5.2 的智譜,也在同期躍升至第四名。

但如果繼續查看總體 Token 支出,就會發現 Anthropic 依然佔據該平台 AI 總支出的半數以上。由於近期變化中有相當一部分來自 Anthropic 自身價格上漲,其支出份額在過去一個月略有下降,但並不顯著。OpenRouter 的數據也呈現類似趨勢。從整體使用量來看,DeepSeek V4 Flash 是目前最明顯的贏家,每週處理約 5.3 萬億 Token;最受歡迎的前沿模型 Opus 4.8,每週處理的 Token 數量則略高於 2 萬億。OpenRouter 並未按照模型總支出進行排名,但其數據顯示,Opus 4.

8 的平均 Token 成本大約是 V4 Flash 的 23 倍,Opus 4.8 每百萬 Token 平均成本約 1.37 美元,而 V4 Flash 僅為 0.06 美元。按照這一價格差距推算,儘管 Opus 4.8 的 Token 使用量明顯低於 V4 Flash,但它很可能仍然佔據了平台大部分模型支出。這些數據還沒有包括最新入場的 Nvidia Nemotron,憑藉 Nvidia 強大的產業關係,這款模型有望迅速進入市場前列。在 Jesse 看來,前沿模型和開源模型之間並不是競爭對手,開源模型的成功也並非建立在讓前沿模型實驗室失去市場的基礎上。

它們更像是同一個生命週期中的兩個階段:企業先使用昂貴的前沿模型驗證某個應用場景是否成立,等到場景逐漸成熟,再將其遷移到成本更低的開源模型上。隨著越來越多成熟場景轉向輕量模型,新的應用場景也不斷湧現,因此企業在前沿模型上的總體投入並沒有明顯下降。他解釋,當一個應用場景剛剛出現時,企業會優先選擇能夠獲得的最聰明的通用模型,因為還不知道問題最終會呈現出什麼形態,會願意為一些未來可能根本用不上的智能能力支付溢價。但當應用場景充分成熟,企業已經了解輸入數據的分佈、模型需要表現出的行為,以及必須防範的失敗模式時,權衡就會逆轉,此時通用智能反而成了額外負擔。

一個幾乎不可避免的現實是,開源模型的能力正變得越來越強。Anthropic 的 CEO Dario Amodei 不久前曾攻擊過開源,認為在 AI 領域,開源是一個干擾項或偽命題。他表示,即使模型公開,也看不到它的內部運行機制,傳統開源軟體可以由社區共同修改、持續迭代的優勢,並不完全適用於大模型。因此,他看一款新模型時,從來不會先問它是否開源,只關心它夠不夠好,能不能在重要任務上擊敗他們。他強調,開源從來不等於免費,模型體量龐大,企業仍然需要花錢在雲端運行推理,也需要專業團隊進行部署和優化。與其糾結模型是否開源,不如關注誰的模型真正能夠把任務做到最好。

在 Lambert 看來,政府所謂「有權審查」的能力門檻會不斷變化,但一旦這種制度建立起來,開源模型獲得批准的速度,很可能會遠慢於閉源模型。閉源模型確實更容易實施安全控制,且閉源模型公司在遊說方面的能力也明顯更強。Lambert 將矛頭直接指向了 Anthropic,認為當前反對國內模型的行動主要由 Anthropic 推動,透過部落格文章、信件等方式詳細描述國內公司正在做什麼。他評價,這場行動最初或許源於真實的商業擔憂,但如今已經越來越像是在變相給自己建立市場壁壘。如果 Anthropic 所指控的模型公司被禁止,其產品就會獲得極大的收益保障。

Lambert 認為,Anthropic 實際上要求的,是在美國大範圍禁止幾乎所有中國開源模型。圍繞開源模型建立的產品,其商業邏輯都建立在模型持續進步之上,一旦這些模型被禁止,正在形成的開源模型經濟也會被摧毀,包括推理服務公司、微調公司、新產品以及整個產業鏈中的其他參與者。他認為,Anthropic 當然可以保護自己的知識產權,但不應該要求官方替它固化市場地位,更不應該因此讓美國與全球開源社區相互隔絕。目前,除了讓各家實驗室自行採取技術和商業措施進行約束,蒸餾問題並不存在好的政策解決方案。「開源生態無法被阻止。」Lambert 表示,即便只有美國禁止引進某些模型,全球開源社區仍會繼續發展。

真正能夠為開源發展設置上限的,只有一項關於如何管理 AI 模型風險的全球協議,而我們距離這種協議還非常遙遠。其他任何延遲措施,都只會讓 AI 的落地變得更不可預測、更混亂。要讓開源擺脫這場死亡螺旋,Lambert 指出有一條短期出口,那就是讓一家美國企業發布能力相近的開源模型。這樣,討論的焦點就會轉向「所有人都身處同一個生態,應該共同處理不斷變化且極其複雜的前沿問題」。他呼籲在商業上有理由發布開源模型的公司,例如 Microsoft 和 Meta,應該儘快行動,因為開源模型能夠把它們的互補業務變成基礎設施優勢。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前