GPT-5.6 Sol一夜變笨,思考預算960砍到128,沒智力固定的模型了?

重點摘要
近期,一款名為 GPT-5.6 Sol 的語言模型引發使用者熱烈討論,原因在於該模型在一夜之間似乎「變笨」了。許多用戶發現,模型的回應品質明顯下滑,過去引以為傲的推理與分析能力大打折扣,甚至出現答非所問、邏輯跳躍等情況。這股抱怨迅速在社群與技術論壇蔓延,外界開始追查背後原因。 根據可靠資訊,這項變化的關鍵在於模型背後的「思考預算」遭到大幅縮減。
近期,一款名為 GPT-5.6 Sol 的語言模型引發使用者熱烈討論,原因在於該模型在一夜之間似乎「變笨」了。許多用戶發現,模型的回應品質明顯下滑,過去引以為傲的推理與分析能力大打折扣,甚至出現答非所問、邏輯跳躍等情況。這股抱怨迅速在社群與技術論壇蔓延,外界開始追查背後原因。根據可靠資訊,這項變化的關鍵在於模型背後的「思考預算」遭到大幅縮減。所謂思考預算,指的是模型在生成每一次回應時所能動用的運算資源上限。過去 GPT-5.6 Sol 的思考預算設定在 960 單位,但在近期的一次調整後,該數字驟降至 128 單位。
這相當於模型在回答問題時,可用於推論、比對與生成文字的計算力只剩原先的約七分之一。思考預算的縮減直接影響了模型的運作表現。在自然語言處理中,較高的思考預算讓模型能夠進行更深入的邏輯推演、更仔細的上下文比對,以及更謹慎的詞彙選擇。一旦預算被大幅降低,模型就必須在資源受限的條件下輸出結果,往往只能做出較為淺層的反應,進而導致使用者感受到「變笨」的現象。針對這起事件,平台方也迅速做出回應。根據可確認的資訊,技術團隊已經移除了先前混入模型思考過程或安全判斷環節中的相關測試文字。這項動作的目的是要釐清,當前的行為異常究竟來自於思考預算調整後的副作用,還是其他系統因素。
此舉顯示開發團隊正試圖隔離變數,確認問題根源。使用者對這項調整的感受相當直接。許多長期使用 GPT-5.6 Sol 的用戶表示,過去模型能夠流暢地處理複雜的數學題、邏輯推理題,甚至能撰寫結構嚴謹的長文;但現在同一模型在面對類似問題時,經常給出前後矛盾、資訊遺漏或過於簡化的答案。一些技術背景的用戶更進一步測試,發現模型在需要多步推理的任務上表現明顯衰退,印證思考預算縮減對效能的直接打擊。這次事件也讓業界重新審視一個根本問題:語言模型的「智力」究竟是否固定?過去,許多開發者與研究人員傾向於認為,一個訓練完成的模型,其能力大致是穩定的,只要不進行權重更新,輸出的品質就不會出現大幅波動。
然而,GPT-5.6 Sol 的例子清楚顯示,當思考預算可以動態調整時,模型的行為表現可能隨資源配置而劇烈變化。換句話說,所謂的模型「智力」不再是一個穩定的特徵,而更像是依賴即時運算資源的浮動參數。當預算充足時,模型能發揮接近全力的推理能力;一旦預算被壓縮,模型的表現就迅速退化。這意味著使用者所體驗到的「模型能力」,其實很大一部分來自於平台當下分配給該次查詢的算力多寡,而非模型本身的固定實力。這項發現對 AI 服務的商業模式與使用者體驗具有深遠影響。如果平台可以根據成本、流量或用戶等級來動態調整思考預算,那麼不同用戶、不同時間、甚至不同主題的查詢,都可能得到品質差異極大的回應。
對於依賴 AI 進行重要決策或專業工作的使用者而言,這種不確定性可能帶來風險。目前,技術社群正密切關注後續發展。平台方是否會恢復先前的預算設定,或者推出新的機制來確保回覆品質的一致性,仍有待觀察。部分專家則建議,思考預算應該成為透明公開的參數,讓用戶了解每次回應的運算資源投入,避免因為黑箱調整而產生信任危機。值得注意的是,思考預算的調整並非僅僅影響輸出品質,也可能與模型的安全表現相關。過去的測試中,較高的思考預算有時會讓模型產生更多自我校驗或安全過濾的步驟;而預算縮減後,這些步驟可能被省略,導致模型更容易輸出不當內容。平台方移除混入的測試文字,正是為了釐清安全機制是否因此受到干擾。
整體而言,GPT-5.6 Sol 的案例揭示了當前大型語言模型運作中一個容易被忽略的環節:即時運算資源的分配,可以從根本上改變模型的實際表現。當「智力」不再是固定資產,而是隨預算浮動的服務參數時,使用者與開發者都必須重新思考如何定義、評估與信任這些 AI 系統。這場由一夜之間「變笨」引發的討論,恐怕才剛剛開始。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。