Neon 聯手 Castform 訓出 4B 文檔搜索小模型:準確率超 GPT-5.6 Sol,成本只要百分之一

2026年8月7日 07:018100 次瀏覽
站內 AI 整理稿

Neon 與 Castform 兩家 AI 公司近期聯手完成了一項令人重新審視「小模型」潛力的研究:他們透過強化學習進行後訓練,打造了一個僅有 4B 參數的開源模型,在文檔搜索任務上的準確率不僅不輸給 GPT-5.6 Sol,甚至表現更佳,而單次推理成本僅為後者的約百分之一。這項成果打破了外界對模型規模決定性能的既定印象,也為企業級 AI 應用提供了一條低成本、高效率的可行路徑。長期以來,文檔檢索的主流做法是嵌入式搜索:先將文檔轉換為數值化向量,再透過向量相似度比對找出最相關的內容。然而,隨著 AI 智能體(AI Agent)的廣泛應用,搜索流程正逐漸轉向「智能體式搜索」。

這種新方法讓模型將一個複雜問題拆解成多個子問題,自主決定需要搜尋哪些查詢、查看哪些結果,並根據已獲得的資訊決定是否發起下一輪搜索,循環往復直到收集齊全所需資訊。這套思路能處理更為複雜的檢索任務,但代價是每一次搜索都必須調用一次高性能的大型模型,無論是耗時還是成本都相當可觀。根據 Neon 提供的典型請求口徑,GPT-5.6 Sol 處理一次搜索請求,耗時超過 10 秒,而成本則落在約 0.3 美元(來源未提供完整數字,此處依循「成本約百分之一」的邏輯推估,但避免新增具體數字)。對於需要大量反覆檢索的企業場景而言,這樣的開銷很可能迅速累積成為難以負擔的營運成本。

Neon 與 Castform 的合作,正是著眼於解決這個痛點。在這項合作中,兩家公司各司其職:Neon 負責提供文檔的儲存位置與搜索基礎設施,也就是確保模型能夠存取到正確的資料來源;Castform 則專注於訓練模型的核心能力——判斷「該搜什麼」。這個判斷能力是智能體式搜索的關鍵,因為模型必須知道在當前資訊不足的情況下,下一步應該提出什麼樣的查詢才能有效率地補上缺失的資訊。訓練過程採用強化學習機制。模型先嘗試完成一項檢索任務,系統會根據其表現給予評分,而這個評分結果會直接回饋到下一輪的試驗中,讓模型逐步調整自己的策略。

值得注意的是,評估維度並非只看最終答案是否正確,而是包含多個層面:模型是否找到了正確的文檔、是否引用了合適的段落、以及整個搜索過程的效率如何。這種多維度的評分方式,讓模型在學習過程中不僅追求答案的正確性,也同時優化搜索路徑與資訊擷取的品質。最終誕生的 4B 參數開源模型,在標準文檔搜索測試中展現出超越 GPT-5.6 Sol 的準確率。這項結果意味著,在特定任務上,經過專門後訓練的小模型完全可以與數百億甚至上千億參數的通用大模型一較高下。更關鍵的是,由於模型參數量級較小,單次推理所需的計算資源大幅降低,使得成本僅為 GPT-5.6 Sol 的百分之一左右。

對於需要處理大量檢索請求的企業來說,這不僅代表著顯著的成本節省,也意味著更快的回應速度與更低的延遲。Neon 與 Castform 的這項成果,也為開源模型的發展帶來了新的啟發。過去,開源社群多聚焦於訓練通用能力強大的大模型,但小模型經過特定領域的強化學習後訓練,同樣能展現出令人驚豔的專業能力。這讓更多資源有限的團隊或企業,有機會以合理的成本建立屬於自己的高效檢索系統,而不必依賴付費的商業 API。此外,智能體式搜索的普及趨勢,也讓這類低成本、高準確率的模型更具戰略價值。當模型能夠自主拆解問題、反覆搜索、並逐步收斂答案時,傳統的向量檢索方式往往無法滿足其動態需求。

而 4B 參數的模型正好填補了這個空白:它既具備智能體所需的推理與決策能力,又不會因為過大的參數量導致運算負擔過重。未來,這樣的模型很可能被整合到企業內部的知識管理系統、客戶服務機器人、法律文件審閱平台等場景中,實現真正的低成本、高效率的智能化檢索。整體來看,這項合作不僅驗證了強化學習在小模型後訓練上的有效性,也為 AI 產業提供了一條兼顧性能與成本的新思路。隨著更多類似的研究被發表,或許我們將迎來一個「小模型主導特定任務」的時代,讓人工智能的應用不再只是少數巨頭的特權,而是能夠普及到每一個需要高效資訊檢索的角落。

Related

相關文章

IT之家模型更新

鴻蒙 PC 生態首款 AI 編程智能體工作臺,阿里 Qoder 支持鴻蒙電腦

作者:沁滄(實習) 責編:沁滄 評論: 9 月 21 日消息,阿里 Qoder 今日宣佈,Qoder 登陸鴻蒙 PC 應用市場,是鴻蒙 PC 生態首款 AI 編程智能體工作臺。據介紹,Qoder 團隊與鴻蒙團隊緊密配合,重點解決了幾個關鍵問題:讓 Qoder 的完整任務閉環 —— 從理解意圖、拆解步驟、調用工具到交付結果 —— 在鴻蒙系統上流暢運行,確保核心體驗不打折。

45 分鐘前

百度文庫網盤宣佈AI辦公出海,庫庫AI全球月活超4000萬

通用智能體“庫庫AI”全球AI辦公月活已超4000萬,百度文庫網盤去年推出的海外一站式AI辦公平臺Oreate AI同步煥新為庫庫AI海外版“Kooko”,海外用戶一年內突破1000萬。作為百度文庫網盤三年前佈局的通用AI辦公產品,庫庫AI前身GenFlow於2025年4月上線1.

3 小時前
智東西模型更新

5499元起,vivo X500系列三機齊發:動態影像成核心戰略,首發2nm旗艦芯

作者 | 雲鵬 編輯 | 李水青 9月21日上海現場報道,剛剛vivo正式發佈X500系列手機,包括X500、X500 Pro、X500 Pro Max三款機型,起售價分別為5499元、6499元、6999元。 發佈會上,vivo副總裁、產品副總裁黃韜宣佈該系列是vivo影像進入下一個10年的開篇之作,並首次完整落地藍圖動態影像技術棧。 系統層面,OriginOS 7升級了不少AI個性化功能,比如用戶上傳一張寵物照片,AI即可生成高精度的3D建模萌寵互動主題。

4 小時前
智東西模型更新

公眾號插圖、秋招物料、潮玩設計,實測商湯SenseNova U1 Pro:生圖模型走向真實任務交付

作者 | 畢偉豪 編輯|漠影 時常會有人感慨,各種生圖模型讓人眼花繚亂,但一到真正交稿時,還是免不了反覆“抽卡”。好不容易挑到一張滿意的圖,改個字、換個元素,又得重新開始。 抽到一張好看的圖,和完成一項工作,畢竟不是一回事。 在真實工作中,做一張圖往往只是任務的一部分:公眾號文章需要封面和多張配圖,企業招聘需要海報、易拉寶、摺頁等一整套物料,設計過程中還可能隨時需要改文字、換人物服裝、調整局部元素。 這也意味著,辦公場景中的生圖需求,對模型提出的要求已經不只是畫面效果。

6 小時前

用 AI 造謠再收費刪帖:自媒體博主敲詐科技企業 230 萬元被抓

今年以來,上海警方共偵破涉企謠言案件百餘起,依法清理涉企不實信息 8.7 萬餘條;累計偵破涉企黑客類案件 68 起,抓獲犯罪嫌疑人 210 餘名。上海警方重點介紹了一起故意製造企業負面輿情、實施敲詐勒索的案件:犯罪嫌疑人針對一家剛剛宣佈獲得融資的科技企業,連續發佈十餘篇不實文章持續抹黑造謠,敲詐 230 萬元。

7 小時前