三個月價格腰斬,大模型的“聰明”正在貶值?

近期大模型市場出現一波急遽的降價潮,短短三個月內部分模型價格甚至腰斬,引發業界對「模型聰明程度是否也在貶值」的討論。從國際到國內,各家廠商紛紛推出主打輕量、低成本的「Flash」系列模型,例如 Gemini Flash 3.8 與 GPT-6 Astra 相繼問世,而國內的競爭更是白熱化——智譜的「牛來」(GLM-5.3-Flash)與阿里 Qwen3.8-Flash 在同一天發布,緊接著 DeepSeek 也在 9 月 10 日先下架了 V4 Pro,並隨即推出 V4 版本。這些密集的產品迭代不僅讓價格戰升溫,也讓人質疑模型「聰明」是否真的在快速貶值,還是僅僅是市場策略的必然結果。
從國際巨頭到中國新創,降價的訊號幾乎同步出現。Google 推出的 Gemini Flash 3.8 主打更快的推理速度與更低的 API 呼叫成本,OpenAI 也不甘示弱地端出 GPT-6 Astra,同樣標榜輕量化與高效率。這兩款產品在技術文檔中均強調適合邊緣運算與即時應用場景,但並未像旗艦型號那樣強調通用智能的頂尖表現。業界觀察家指出,這波 Flash 系列的共同特徵就是「犧牲部分複雜推理能力,換取價格與速度的優勢」。中國市場的反應更為激烈。智譜 AI 在 9 月初突襲發布「牛來」GLM-5.3-Flash,同一天阿里雲也推出 Qwen3.
8-Flash,兩者價格直接對標,每百萬 token 的收費較前一代旗艦模型下降超過 50%。更令人矚目的是 DeepSeek 的動作:該公司先在 9 月 10 日無預警下架了發布不到四個月的 V4 Pro,隨後迅速推出結構簡化的 V4 版本,定價僅為 V4 Pro 的一半。這種「先停產再推新品」的做法,被部分開發者解讀為廠商為了在價格戰中搶佔聲量,不惜切斷既有產品線。當模型價格快速下探,開發者與企業用戶雖然短期受惠於更低的部署成本,但背後也隱藏著模型能力可能被稀釋的焦慮。
從目前發布的 Flash 系列來看,它們多半是針對特定場景最佳化的輕量版本,雖然推理速度更快、成本更低,但在複雜任務上的表現可能不如旗艦級模型。例如在需要多步驟邏輯推理、長文本理解或精確數學計算的場景中,這些輕量模型往往會出現準確率下降或遺漏關鍵細節的問題。不少開發者在社群論壇反映,同樣的 Prompt 在旗艦模型與 Flash 模型上得到的回覆品質差距明顯。然而,廠商透過頻繁更換產品線(如 DeepSeek 下架 V4 Pro 再推 V4)來維持市場熱度,也反映出大模型產業正進入一個「以價換量、以快取勝」的階段。
對於新創公司而言,快速迭代不僅能吸引預算有限的開發者,還能搶佔 API 調用量的市佔率。但這種策略也讓企業用戶感到困惑——剛花時間整合了 V4 Pro,幾個月後就被下架,被迫遷移到新版本,且新版本的能力定位還不明確。從技術角度分析,Flash 系列的出現並非偶然。隨著大模型訓練成本逐步下降,以及蒸餾、量化等模型壓縮技術的成熟,廠商有能力將原本數百億參數的旗艦模型壓縮到更小的體積,同時保持大部分常見任務的表現。這種技術進步確實降低了算力門檻,但代價是模型在最困難的推理任務上的「天花板」跟著降低。
換句話說,對於日常問答、翻譯、簡單摘要等輕度使用,Flash 模型已經足夠;但對於需要「真正聰明」的企業級應用,旗艦模型依然是不可替代的選擇。價格腰斬是否真的代表「聰明」在貶值,恐怕還需要更多實際應用場景的考驗才能釐清。目前市場上已經出現兩極化的跡象:部分開發者因為成本考量全面轉向 Flash 系列,並接受在某些任務上的妥協;另一部分開發者則堅持使用旗艦模型,認為模型的「智力」直接影響產品競爭力。這種分歧本身也說明了「聰明」的定義與場景密切相關,很難用統一的標準來衡量。值得注意的是,廠商在降價的同時,並未放棄高端模型的研發。
例如 OpenAI 仍在開發 GPT-6 的完整版,Google 也持續推進 Gemini Ultra 的迭代。這表明 Flash 系列更像是市場策略上的「前鋒部隊」,目的是快速擴大用戶基礎、搶佔開發者生態,而非取代旗艦型號。當廠商獲得足夠的用戶回饋與數據後,下一波旗艦模型的訓練可能更有效率,屆時「聰明」與「便宜」或許能更接近平衡。對於企業用戶而言,這波降價潮既是機會也是陷阱。機會在於可以用更低的成本嘗試大模型應用,加速產品原型驗證;陷阱則在於如果過早鎖定某一款 Flash 模型,未來可能面臨功能升級受限、模型被下架或被迫遷移的風險。
因此,業界建議在選擇模型時,除了關注當前的價格與速度,也應該評估廠商的產品路線圖、模型版本的長期支援政策,以及是否提供平滑的遷移方案。總體而言,大模型價格的快速下跌並非單純的「降級」,而是市場從「跑分競賽」轉向「應用落地」的必然過程。過去兩年,各家廠商忙於比拼參數數量與基準測試分數,但實際商業場景並不需要最強的通用智能,而是需要最匹配場景、最符合成本結構的模型。Flash 系列的出現與價格戰的升溫,恰恰是產業成熟化的信號之一。至於「聰明是否貶值」這個問題,或許答案不在模型本身,而在於使用者如何定義「聰明」——如果聰明是指特定任務的效率與成本平衡,那麼 Flash 系列正在重新定義這個詞的內涵。
回到 DeepSeek 的案例,該公司下架 V4 Pro 後不到一週就推出 V4,外界普遍認為此舉是為了在價格戰中重新奪回話題主導權。但這種「推倒重來」的做法也引發了投資人與客戶的憂慮:如果連 Pro 版本的生命週期都只有四個月,那麼企業若將關鍵業務流程綁定在該模型上,風險將遠高於預期。這也解釋了為什麼許多大型企業仍然傾向於使用 OpenAI 或 Google 的長期穩定版本,即便成本較高。未來幾個月,隨著更多 Flash 系列型號的發布,大模型市場的價格戰很可能會進一步加劇。業界預測,到今年底,主流輕量模型的 API 調用價格可能再下降 30% 至 50%。
屆時,開發者與企業用戶將面臨更細緻的選擇:是追求極致性能的旗艦模型,還是擁抱成本效益的輕量方案?答案或許不存在於統一的標準,而在於每個應用的具體需求。而這場關於「聰明是否貶值」的討論,也終將在真實的商業應用中得到檢驗。
Related
相關文章

美國 AI 巨頭提議開發減速,歐洲同行和政界並不認同
作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)報道,此前,阿莫迪、奧爾特曼和馬斯克先後發出警告,能力不斷增強的 AI 系統可能帶來風險,故有必要控制其發展節奏,但歐洲企業和官員對此表現出明顯懷疑。法國初創企業 Mistral 在聲明中指出,這些風險早在幾個月前就已十分明確了。

MiniMax Code CLI 正式開源,在評測中取得 76.7% 的任務通過率
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 Domado 的線索投遞!9 月 18 日消息,MiniMax 今晚宣佈,MiniMax Code CLI 的 v0.4.12 版本面向全球開發者正式開放,並且以 MIT 協議正式開放源代碼。

北京發佈“詞元經濟十條”:高標準建設詞元工廠,推動關鍵核心技術攻關
作者:浩渺 責編:浩渺 評論: 感謝網友 蛋殼兒 的線索投遞!9 月 18 日消息,北京市經濟和信息化局今日宣佈,北京市“詞元經濟十條”正式發佈。為貫徹落實《國務院關於深入實施“人工智能+”行動的意見》(國發〔2025〕11 號),率先培育智能經濟新形態,以詞元(Token)為抓手,發展詞元經濟新增量,制定《北京市加快詞元經濟發展的行動方案(2026—2028 年)》(注:以下簡稱《行動方案》)。
PrismML Releases Ternary Bonsai 2 27B: A 5.9 GB Apache 2.0 Model Retaining 98.2% of Qwen3.8 27B Performance
PrismML has released Ternary Bonsai 2 27B, a ternary-weight version of Qwen3.8 27B. The language model occupies 5.93 GB, against 53.80 GB in FP16. PrismML reports that it keeps 98.2% of the parent model’s average across 20 benchmarks.

OpenAI剛曝光循環架構,這家公司更早將其用於世界模型
鍵詞只有一個:循環。 Astra採用了一種被稱為“循環深度”(Recurrent Depth)的架構,本質是讓同一組Transformer層被反覆複用,用更少的參數實現更深的計算。 這被外界視為OpenAI對傳統“堆參數、堆算力”路線的一次重大修正——不再只是把模型做大,而是讓模型學會“反覆思考”。 消息一齣,整個AI社區迅速升溫。

千問辦公接入高德門店經營專家套件 提升實體店選址與經營效率
此項新功能自9月18日起正式上線,用戶只需在千問辦公添加相應套件並完成高德賬號授權,即可實現從門店選址到日常經營分析的全鏈路工作。隨著實體商業的不斷發展,傳統的人工選址和經營分析方式顯得效率低下且容易出錯。個體創業者在開新店時,往往需要花費大量時間進行實地勘察,整體耗時可達一週,而商家在監測門店熱度變化及競爭對手動態時,也面臨數據整理繁瑣、分析結果不準確的問題。