何夕2077生成式AI

新型控制器優化大模型搜索成本

2026年8月1日 00:00

重點摘要

大型語言模型的應用場景持續擴張,除了聊天與程式生成之外,愈來愈多科學與演算法研究開始借助模型在推論階段進行自動化搜索,從大量候選結果中尋找最佳解答。然而,這類搜索過程往往需要消耗大量運算資源,尤其在不同提示長度、重試次數與引導呼叫的組合下,每次行動所付出的 token 成本並不相同,讓成本控管成為實際部署時的重要挑戰。一篇近期發表於 arXiv 的研究論文,針對此問題提出了一套全新的控制器機制,試圖在有限預算下,讓模型搜索既能維持品質,又不讓成本失控。

站內 AI 整理稿

大型語言模型的應用場景持續擴張,除了聊天與程式生成之外,愈來愈多科學與演算法研究開始借助模型在推論階段進行自動化搜索,從大量候選結果中尋找最佳解答。然而,這類搜索過程往往需要消耗大量運算資源,尤其在不同提示長度、重試次數與引導呼叫的組合下,每次行動所付出的 token 成本並不相同,讓成本控管成為實際部署時的重要挑戰。一篇近期發表於 arXiv 的研究論文,針對此問題提出了一套全新的控制器機制,試圖在有限預算下,讓模型搜索既能維持品質,又不讓成本失控。

這篇論文標題為《Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility》,由 Yansen Zhang、Yilu Liu、Tianyu Liu、Jiamin Chen、Xiaokun Zhang、Kai Xie、Xue Liu、Chen Ma 與 Yiyan Qi 共同完成。研究團隊觀察到,現有的自適應發現控制器在評估候選方案時,往往只看分數有沒有進步,卻忽略了不同搜索動作實際上消耗的 token 數量差異極大。換句話說,傳統機制的「信用分配」是成本盲目的,它不會區分一次低成本嘗試與一次昂貴的深度探索之間的差別。

這樣的做法在搜索範圍較小時也許還能運作,但一旦需要探索的前沿領域增多、各項行動的成本差距擴大,成本盲目的信用分配就會導致嚴重的效率問題。研究者在論文中以數學方式證明,當前沿領域數量增加且成本差異變大時,這種忽視成本的機制,最終可能只能達到理論上可獲得品質的極小部分,幾乎等於放棄了大部分可能的成果。面對這個問題,研究團隊提出了一種名為 CostAda 的成本校準自適應控制器。CostAda 的核心是所謂的「成本校準前沿效用」(cost-calibrated frontier utility),這項指標會將前沿領域的進展程度,與實際花費的行動成本進行對照,並且根據剩餘預算來調整信用評估。

也就是說,同一個進步幅度,如果花費較少的 token 就能達成,效用就會被認定為更高;反之,若消耗大量成本卻僅有微小進展,效用就會被壓低。更重要的是,CostAda 不把成本與剩餘預算當作單純的記帳數字或停止條件,而是讓它們直接參與搜索策略的決策過程。控制器會依據這項效用訊號,決定局部探索的強度要多大、資源要分配給哪些前沿領域,以及在何時介入調整策略。這樣一來,預算的多寡與消耗速度,會真正形塑搜索的路徑與節奏,而非只是事後統計或強制終止的依據。研究團隊在實驗中將 CostAda 與多種既有基線方法進行比較,測試涵蓋了十六組基準任務與模型骨幹的組合。

結果顯示,CostAda 在其中十二組組合中,只需要最多一半的 token 預算,就能達到最強基線方法在完整預算下才能獲得的品質水準。這代表在相同預算限制下,CostAda 有機會讓搜索效率提升近一倍,或者在相同品質要求下大幅節省運算資源。此外,在 GLM-5 與 GPT-5.4 兩種模型架構下,CostAda 於全部八個基準任務上,都取得了所有比較方法當中最高的平均最終品質。這說明了成本校準機制不是只對特定模型或特定任務有效,而是具備一定的通用性。研究團隊也強調,CostAda 的設計並不複雜,它是在現有控制器架構上加入成本感知的信用分配邏輯,因此有機會整合進更多既有的模型搜索流程。

這項研究背後反映的趨勢是,大型語言模型作為「發現工具」的價值雖然日益受到重視,但若無法有效控制搜索過程中的資源消耗,實際應用仍會受到很大限制。尤其是在科學發現這類需要反覆嘗試、逐步逼近最佳解的任務中,每一輪搜索都可能涉及長提示、多次重試、外部工具呼叫等成本高昂的操作。如何在品質與成本之間取得平衡,已經從理論問題轉變為工程上的迫切需求。從論文提供的實驗數據來看,CostAda 的優勢在於它能夠動態感知每一階段搜索的邊際效益,而不是盲目地將資源投注在看似有進展、實際上卻是成本黑洞的方向上。這種「花多少錢、值不值得」的判斷,正是傳統控制器缺乏的能力。

研究者認為,將成本與預算納入信用分配的計算,是提升大模型自動發現系統實用性的重要一步。該篇論文目前已更新至第二版,於 2026 年 7 月 29 日首次提交,隔日進行修訂。論文的學科分類屬於機器學習(cs.LG)與人工智慧(cs.AI),並已取得 DOI 編號。對於關注大模型推論效率、自動化科學發現以及預算感知演算法的研究人員來說,這項成果提供了一個具體可行的新方向,未來也有望延伸至更廣泛的模型代理與決策場景中。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前