新型控制器優化大模型搜索成本
重點摘要
大型語言模型的應用場景持續擴張,除了聊天與程式生成之外,愈來愈多科學與演算法研究開始借助模型在推論階段進行自動化搜索,從大量候選結果中尋找最佳解答。然而,這類搜索過程往往需要消耗大量運算資源,尤其在不同提示長度、重試次數與引導呼叫的組合下,每次行動所付出的 token 成本並不相同,讓成本控管成為實際部署時的重要挑戰。一篇近期發表於 arXiv 的研究論文,針對此問題提出了一套全新的控制器機制,試圖在有限預算下,讓模型搜索既能維持品質,又不讓成本失控。
大型語言模型的應用場景持續擴張,除了聊天與程式生成之外,愈來愈多科學與演算法研究開始借助模型在推論階段進行自動化搜索,從大量候選結果中尋找最佳解答。然而,這類搜索過程往往需要消耗大量運算資源,尤其在不同提示長度、重試次數與引導呼叫的組合下,每次行動所付出的 token 成本並不相同,讓成本控管成為實際部署時的重要挑戰。一篇近期發表於 arXiv 的研究論文,針對此問題提出了一套全新的控制器機制,試圖在有限預算下,讓模型搜索既能維持品質,又不讓成本失控。 這篇論文標題為《Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility》,由 Yansen Zhang、Yilu Liu、Tianyu Liu、Jiamin Chen、Xiaokun Zhang、Kai Xie、Xue Liu、Chen Ma 與 Yiyan Qi 共同完成。研究團隊觀察到,現有的自適應發現控制器在評估候選方案時,往往只看分數有沒有進步,卻忽略了不同搜索動作實際上消耗的 token 數量差異極大。換句話說,傳統機制的「信用分配」是成本盲目的,它不會區分一次低成本嘗試與一次昂貴的深度探索之間的差別。 這樣的做法在搜索範圍較小時也許還能運作,但一旦需要探索的前沿領域增多、各項行動的成本差距擴大,成本盲目的信用分配就會導致嚴重的效率問題。研究者在論文中以數學方式證明,當前沿領域數量增加且成本差異變大時,這種忽視成本的機制,最終可能只能達到理論上可獲得品質的極小部分,幾乎等於放棄了大部分可能的成果。 面對這個問題,研究團隊提出了一種名為 CostAda 的成本校準自適應控制器。CostAda 的核心是所謂的「成本校準前沿效用」(cost-calibrated frontier utility),這項指標會將前沿領域的進展程度,與實際花費的行動成本進行對照,並且根據剩餘預算來調整信用評估。也就是說,同一個進步幅度,如果花費較少的 token 就能達成,效用就會被認定為更高;反之,若消耗大量成本卻僅有微小進展,效用就會被壓低。 更重要的是,CostAda 不把成本與剩餘預算當作單純的記帳數字或停止條件,而是讓它們直接參與搜索策略的決策過程。控制器會依據這項效用訊號,決定局部探索的強度要多大、資源要分配給哪些前沿領域,以及在何時介入調整策略。這樣一來,預算的多寡與消耗速度,會真正形塑搜索的路徑與節奏,而非只是事後統計或強制終止的依據。 研究團隊在實驗中將 CostAda 與多種既有基線方法進行比較,測試涵蓋了十六組基準任務與模型骨幹的組合。結果顯示,CostAda 在其中十二組組合中,只需要最多一半的 token 預算,就能達到最強基線方法在完整預算下才能獲得的品質水準。這代表在相同預算限制下,CostAda 有機會讓搜索效率提升近一倍,或者在相同品質要求下大幅節省運算資源。 此外,在 GLM-5 與 GPT-5.4 兩種模型架構下,CostAda 於全部八個基準任務上,都取得了所有比較方法當中最高的平均最終品質。這說明了成本校準機制不是只對特定模型或特定任務有效,而是具備一定的通用性。研究團隊也強調,CostAda 的設計並不複雜,它是在現有控制器架構上加入成本感知的信用分配邏輯,因此有機會整合進更多既有的模型搜索流程。 這項研究背後反映的趨勢是,大型語言模型作為「發現工具」的價值雖然日益受到重視,但若無法有效控制搜索過程中的資源消耗,實際應用仍會受到很大限制。尤其是在科學發現這類需要反覆嘗試、逐步逼近最佳解的任務中,每一輪搜索都可能涉及長提示、多次重試、外部工具呼叫等成本高昂的操作。如何在品質與成本之間取得平衡,已經從理論問題轉變為工程上的迫切需求。 從論文提供的實驗數據來看,CostAda 的優勢在於它能夠動態感知每一階段搜索的邊際效益,而不是盲目地將資源投注在看似有進展、實際上卻是成本黑洞的方向上。這種「花多少錢、值不值得」的判斷,正是傳統控制器缺乏的能力。研究者認為,將成本與預算納入信用分配的計算,是提升大模型自動發現系統實用性的重要一步。 該篇論文目前已更新至第二版,於 2026 年 7 月 29 日首次提交,隔日進行修訂。論文的學科分類屬於機器學習(cs.LG)與人工智慧(cs.AI),並已取得 DOI 編號。對於關注大模型推論效率、自動化科學發現以及預算感知演算法的研究人員來說,這項成果提供了一個具體可行的新方向,未來也有望延伸至更廣泛的模型代理與決策場景中。
Related
相關文章
深度求索發佈閃電模型更新
Ad Skip to content All Topics AI and society AI in practice AI research Frontier Radar Short News Read full article about: Google Deepmind unveils Gemini Robotics 2 to power robots of all shapes from tabletop arms to humanoids Google Deepmind has introduced Gemini Robotics 2, which it calls its most advanced vision-language-action (VLA) model yet. VLA models combine image recognition, language processing, and action control to help robots operate in physical environments. Deepmind says the model can control systems ranging from tabletop arms to full-body humanoid robots. The company describes Gemini Robotics 2 as an "intelligence layer" for a new generation of adaptive robots. It can manage full-body movement, perform fine motor tasks, and coordinate multiple robots, according to Deepmind.
潛推理推薦模型實現大幅提速
研究團隊提出潛在推理推薦框架WhisperRec,將教師生成的鏈式思考壓縮為可學習的潛在推理token,避免顯式推理的延遲瓶頸。實驗顯示,WhisperRec在工業級快手資料集與公開基準上,其SID@64指標較顯式CoT方法提升17.44%,且線上推論吞吐量提升超過10倍。
前特斯拉大牛探討編程範式轉變
前特斯拉大牛探討編程範式轉變。 專家聲稱傳統編程正被大模型徹底顛覆。用戶在紅迪討論貼中可細讀現場觀點。他認為上下文窗口已成了新的控制槓桿。很多開發者仍用老標準衡量自身價值。這一趨勢讓不少資深程序員 ��� 感到焦慮。
誰在訓練 Kimi K3 ? 深挖貢獻者名單,這有一份最全檔案
起底 K3 背後核心極客天團,人均扛起 7 億估值! 作者丨高允毅 樊天驕 編輯丨馬曉寧 7 月 27 日,月之暗面拿出全部誠意,直接把滿血版 2.8T 模型 Kimi K3 全部開源了。在技術報告的最後,他們首次公佈了Kimi K3背後的實際貢獻者名單,我們細數了一下,有401位成員,可以說,這是月之暗麵人才團隊的一次全面亮相。
AI 正在變成一門製造業 | WAIC 2026 Agent 產品觀察
國內 Agent 產品當前主要是供給側繁榮,不是需求側繁榮。 作者丨李 娜 編輯丨馬曉寧 2026 年的 WAIC 真是太熱鬧了,人潮擁擠,在地鐵站排著隊進入 WAIC 場館的時候, 我看見地鐵站廣告牌上的百度智能體“百度搭子”的廣告,這場關於智能體沒有硝煙的戰爭,從入口處就拉開了帷幕。
JetBrains Open-Sources KotlinLLM: Smart Macros That Generate Kotlin Source Code at Runtime and Hot-Reload It Through JDI
JetBrains Research 開源 KotlinLLM,這款 IntelliJ IDEA 外掛為 Kotlin/JVM 專案加入 Smart macros 語言功能,可在執行階段產生 Kotlin 原始碼並透過 JDI 熱重載。根據測試,在改寫的 Spring Petclinic 專案中 24 個情境全部成功,熱重載成功率 100%,編譯與重定義僅增加約 1% 執行開銷。此專案屬研究原型,採用 Apache License 2.0,需搭配 IntelliJ IDEA 2025.2.x、JDK 21 與 OpenAI API 金鑰。