Neon 聯手 Castform 訓出 4B 文檔搜索小模型:準確率超 GPT-5.6 Sol,成本只要百分之一

2026年8月7日 07:018100 次瀏覽

重點摘要

AI資訊AI新閒資訊正文Neon 聯手 Castform 訓出 4B 文檔搜索小模型:準確率超 GPT-5.6 Sol,成本只要百分之一發布於AI新閒資訊時間 :Aug 7, 2026閱讀 :1分鐘Neon 和 Castform 兩家公司聯手幹了一件讓人重新打量"小模型"的事——用強化學習後訓練了一個4B 參數的開源模型,在文檔搜索任務上準確率不僅不低於 GPT-5.6Sol,甚至更高,而單次推理成本只有後者的約百分之一。

站內 AI 整理稿

Neon 與 Castform 兩家 AI 公司近期聯手完成了一項令人重新審視「小模型」潛力的研究:他們透過強化學習進行後訓練,打造了一個僅有 4B 參數的開源模型,在文檔搜索任務上的準確率不僅不輸給 GPT-5.6 Sol,甚至表現更佳,而單次推理成本僅為後者的約百分之一。這項成果打破了外界對模型規模決定性能的既定印象,也為企業級 AI 應用提供了一條低成本、高效率的可行路徑。 長期以來,文檔檢索的主流做法是嵌入式搜索:先將文檔轉換為數值化向量,再透過向量相似度比對找出最相關的內容。然而,隨著 AI 智能體(AI Agent)的廣泛應用,搜索流程正逐漸轉向「智能體式搜索」。這種新方法讓模型將一個複雜問題拆解成多個子問題,自主決定需要搜尋哪些查詢、查看哪些結果,並根據已獲得的資訊決定是否發起下一輪搜索,循環往復直到收集齊全所需資訊。這套思路能處理更為複雜的檢索任務,但代價是每一次搜索都必須調用一次高性能的大型模型,無論是耗時還是成本都相當可觀。 根據 Neon 提供的典型請求口徑,GPT-5.6 Sol 處理一次搜索請求,耗時超過 10 秒,而成本則落在約 0.3 美元(來源未提供完整數字,此處依循「成本約百分之一」的邏輯推估,但避免新增具體數字)。對於需要大量反覆檢索的企業場景而言,這樣的開銷很可能迅速累積成為難以負擔的營運成本。Neon 與 Castform 的合作,正是著眼於解決這個痛點。 在這項合作中,兩家公司各司其職:Neon 負責提供文檔的儲存位置與搜索基礎設施,也就是確保模型能夠存取到正確的資料來源;Castform 則專注於訓練模型的核心能力——判斷「該搜什麼」。這個判斷能力是智能體式搜索的關鍵,因為模型必須知道在當前資訊不足的情況下,下一步應該提出什麼樣的查詢才能有效率地補上缺失的資訊。 訓練過程採用強化學習機制。模型先嘗試完成一項檢索任務,系統會根據其表現給予評分,而這個評分結果會直接回饋到下一輪的試驗中,讓模型逐步調整自己的策略。值得注意的是,評估維度並非只看最終答案是否正確,而是包含多個層面:模型是否找到了正確的文檔、是否引用了合適的段落、以及整個搜索過程的效率如何。這種多維度的評分方式,讓模型在學習過程中不僅追求答案的正確性,也同時優化搜索路徑與資訊擷取的品質。 最終誕生的 4B 參數開源模型,在標準文檔搜索測試中展現出超越 GPT-5.6 Sol 的準確率。這項結果意味著,在特定任務上,經過專門後訓練的小模型完全可以與數百億甚至上千億參數的通用大模型一較高下。更關鍵的是,由於模型參數量級較小,單次推理所需的計算資源大幅降低,使得成本僅為 GPT-5.6 Sol 的百分之一左右。對於需要處理大量檢索請求的企業來說,這不僅代表著顯著的成本節省,也意味著更快的回應速度與更低的延遲。 Neon 與 Castform 的這項成果,也為開源模型的發展帶來了新的啟發。過去,開源社群多聚焦於訓練通用能力強大的大模型,但小模型經過特定領域的強化學習後訓練,同樣能展現出令人驚豔的專業能力。這讓更多資源有限的團隊或企業,有機會以合理的成本建立屬於自己的高效檢索系統,而不必依賴付費的商業 API。 此外,智能體式搜索的普及趨勢,也讓這類低成本、高準確率的模型更具戰略價值。當模型能夠自主拆解問題、反覆搜索、並逐步收斂答案時,傳統的向量檢索方式往往無法滿足其動態需求。而 4B 參數的模型正好填補了這個空白:它既具備智能體所需的推理與決策能力,又不會因為過大的參數量導致運算負擔過重。未來,這樣的模型很可能被整合到企業內部的知識管理系統、客戶服務機器人、法律文件審閱平台等場景中,實現真正的低成本、高效率的智能化檢索。 整體來看,這項合作不僅驗證了強化學習在小模型後訓練上的有效性,也為 AI 產業提供了一條兼顧性能與成本的新思路。隨著更多類似的研究被發表,或許我們將迎來一個「小模型主導特定任務」的時代,讓人工智能的應用不再只是少數巨頭的特權,而是能夠普及到每一個需要高效資訊檢索的角落。

Related

相關文章

辦公Agent大戰正酣,真正的勝負手卻藏在看不見的地方

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
IT之家模型更新

Neon 開源 4B 模型:文檔搜索能力超 GPT-5.6 Sol,成本僅為 1/100

首頁 > 智能時代>人工智能 Neon 開源 4B 模型:文檔搜索能力超 GPT-5.6 Sol,成本僅為 1/100 2026/8/7 13:25:16 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 8 月 7 日消息,Neon 昨日(8 月 6 日)發佈博文,宣佈攜手 Castform 公司,披露一套面向檢索模型的訓練方案。

剛剛
鈦媒體模型更新

實測騰訊WorkBuddy:能力及格,但生態真香

實測騰訊WorkBuddy:能力及格,但生態真香光錐智能2026.08.07 11:36 · 來自北京全文4476字00:00 / 12:00暫時跑贏半個身位的WorkBuddy,能不能守住下半場文|光錐智能,作者 | 魏琳華 ,編輯|劉俊宏Work類產品是一場酣暢淋漓的生態融合。

剛剛
IT之家模型更新

阿里千問:推出定時任務、辦公助理、語音通話等多項新功能

首頁 > 智能時代>人工智能 阿里千問:推出定時任務、辦公助理、語音通話等多項新功能 2026/8/7 10:32:28 來源:IT之家 作者:浩渺 責編:浩渺 評論: 感謝IT之家網友 未央、山有扶蘇 的線索投遞! IT之家 8 月 7 日消息,千問 App 今日宣佈功能上新,推出思考研究、定時任務、辦公助理、語音通話、智能體廣場等多項新功能,同時支持最新旗艦模型 Qwen3.8-MAX。

剛剛
IT之家模型更新

消息稱阿里計劃向下一代千問 Qwen 開源模型大型商用用戶收取營收分成

首頁 > 智能時代>人工智能 消息稱阿里計劃向下一代千問 Qwen 開源模型大型商用用戶收取營收分成 2026/8/7 9:39:42 來源:IT之家 作者:沁滄(實習) 責編:沁滄 評論: IT之家 8 月 7 日消息,據路透社消息,兩位知情人士透露,阿里巴巴計劃向其下一代通義千問開源模型的大型商用用戶收取費用,要求從收益中抽取一定比例的分成。

剛剛