Neon 聯手 Castform 訓出 4B 文檔搜索小模型:準確率超 GPT-5.6 Sol,成本只要百分之一

2026年8月7日 07:018100 次瀏覽

重點摘要

AI資訊AI新閒資訊正文Neon 聯手 Castform 訓出 4B 文檔搜索小模型:準確率超 GPT-5.6 Sol,成本只要百分之一發布於AI新閒資訊時間 :Aug 7, 2026閱讀 :1分鐘Neon 和 Castform 兩家公司聯手幹了一件讓人重新打量"小模型"的事——用強化學習後訓練了一個4B 參數的開源模型,在文檔搜索任務上準確率不僅不低於 GPT-5.6Sol,甚至更高,而單次推理成本只有後者的約百分之一。

站內 AI 整理稿

Neon 與 Castform 兩家 AI 公司近期聯手完成了一項令人重新審視「小模型」潛力的研究:他們透過強化學習進行後訓練,打造了一個僅有 4B 參數的開源模型,在文檔搜索任務上的準確率不僅不輸給 GPT-5.6 Sol,甚至表現更佳,而單次推理成本僅為後者的約百分之一。這項成果打破了外界對模型規模決定性能的既定印象,也為企業級 AI 應用提供了一條低成本、高效率的可行路徑。長期以來,文檔檢索的主流做法是嵌入式搜索:先將文檔轉換為數值化向量,再透過向量相似度比對找出最相關的內容。然而,隨著 AI 智能體(AI Agent)的廣泛應用,搜索流程正逐漸轉向「智能體式搜索」。

這種新方法讓模型將一個複雜問題拆解成多個子問題,自主決定需要搜尋哪些查詢、查看哪些結果,並根據已獲得的資訊決定是否發起下一輪搜索,循環往復直到收集齊全所需資訊。這套思路能處理更為複雜的檢索任務,但代價是每一次搜索都必須調用一次高性能的大型模型,無論是耗時還是成本都相當可觀。根據 Neon 提供的典型請求口徑,GPT-5.6 Sol 處理一次搜索請求,耗時超過 10 秒,而成本則落在約 0.3 美元(來源未提供完整數字,此處依循「成本約百分之一」的邏輯推估,但避免新增具體數字)。對於需要大量反覆檢索的企業場景而言,這樣的開銷很可能迅速累積成為難以負擔的營運成本。

Neon 與 Castform 的合作,正是著眼於解決這個痛點。在這項合作中,兩家公司各司其職:Neon 負責提供文檔的儲存位置與搜索基礎設施,也就是確保模型能夠存取到正確的資料來源;Castform 則專注於訓練模型的核心能力——判斷「該搜什麼」。這個判斷能力是智能體式搜索的關鍵,因為模型必須知道在當前資訊不足的情況下,下一步應該提出什麼樣的查詢才能有效率地補上缺失的資訊。訓練過程採用強化學習機制。模型先嘗試完成一項檢索任務,系統會根據其表現給予評分,而這個評分結果會直接回饋到下一輪的試驗中,讓模型逐步調整自己的策略。

值得注意的是,評估維度並非只看最終答案是否正確,而是包含多個層面:模型是否找到了正確的文檔、是否引用了合適的段落、以及整個搜索過程的效率如何。這種多維度的評分方式,讓模型在學習過程中不僅追求答案的正確性,也同時優化搜索路徑與資訊擷取的品質。最終誕生的 4B 參數開源模型,在標準文檔搜索測試中展現出超越 GPT-5.6 Sol 的準確率。這項結果意味著,在特定任務上,經過專門後訓練的小模型完全可以與數百億甚至上千億參數的通用大模型一較高下。更關鍵的是,由於模型參數量級較小,單次推理所需的計算資源大幅降低,使得成本僅為 GPT-5.6 Sol 的百分之一左右。

對於需要處理大量檢索請求的企業來說,這不僅代表著顯著的成本節省,也意味著更快的回應速度與更低的延遲。Neon 與 Castform 的這項成果,也為開源模型的發展帶來了新的啟發。過去,開源社群多聚焦於訓練通用能力強大的大模型,但小模型經過特定領域的強化學習後訓練,同樣能展現出令人驚豔的專業能力。這讓更多資源有限的團隊或企業,有機會以合理的成本建立屬於自己的高效檢索系統,而不必依賴付費的商業 API。此外,智能體式搜索的普及趨勢,也讓這類低成本、高準確率的模型更具戰略價值。當模型能夠自主拆解問題、反覆搜索、並逐步收斂答案時,傳統的向量檢索方式往往無法滿足其動態需求。

而 4B 參數的模型正好填補了這個空白:它既具備智能體所需的推理與決策能力,又不會因為過大的參數量導致運算負擔過重。未來,這樣的模型很可能被整合到企業內部的知識管理系統、客戶服務機器人、法律文件審閱平台等場景中,實現真正的低成本、高效率的智能化檢索。整體來看,這項合作不僅驗證了強化學習在小模型後訓練上的有效性,也為 AI 產業提供了一條兼顧性能與成本的新思路。隨著更多類似的研究被發表,或許我們將迎來一個「小模型主導特定任務」的時代,讓人工智能的應用不再只是少數巨頭的特權,而是能夠普及到每一個需要高效資訊檢索的角落。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

51 分鐘前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

52 分鐘前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

1 小時前