Keenable AI 開源 NEEDLE:每小時重建查詢集的即時搜尋基準
搜尋引擎基準測試向來是評估 AI 代理程式與檢索系統效能的關鍵環節,但業界正面臨一個日益嚴重的結構性問題:當被測試的對象有能力讀取答案鍵時,這項測試還能否真實反映搜尋能力?Keenable 團隊近期開源的 NEEDLE 基準,正是針對這個痛點提出的全新解決方案。這套系統不再使用固定不變的查詢集,而是以每小時為單位、從最新公開來源持續重建查詢內容,試圖讓評估過程回到最本質的目標——確認檢索工具是否真的發揮了作用,而不是透過其他捷徑得到正確答案。傳統的搜尋 API 評估方式通常仰賴一組預先定義好的靜態查詢集,搭配對應的黃金標籤作為標準答案。然而這種做法在 AI 代理程式時代出現了明顯漏洞。
現代搜尋代理程式具備完整的抓取工具能力,如果黃金標籤就存放在公開資料集中,代理程式在評估過程中完全可以先下載這些資料,跳過實際的檢索流程,直接交出正確結果。這種情況下測出的高分,其實與搜尋 API 的品質好壞沒有直接關聯。另一個同樣棘手的問題來自模型參數記憶效應。當評估使用的查詢和答案早已存在於公開網路上,且這些內容可能在模型預訓練階段就被吸收進參數之中,那麼模型即使不呼叫任何外部搜尋工具,也能憑藉記憶給出正確回應。換句話說,這類正確答案無法證明「網路搜尋確實有貢獻」,只能證明模型記住了某些資訊。這兩種情況都讓傳統基準測試的有效性大打折扣,也促使 Keenable 重新思考評估基準的設計哲學。
NEEDLE 的誕生正是為了解決上述困境。它的核心概念是「即時重建」,而非「凍結」。傳統基準使用固定查詢集,NEEDLE 則讓查詢內容不斷流動更新。新聞類查詢每小時就會從 RSS 供稿與 Google Trends 重新產生一批全新的問題,這代表每天的查詢集都不盡相同,任何企圖預先下載答案的策略都無法奏效。因為當你鎖定某一批查詢時,這批查詢可能已經被下一批新產生的查詢取代。除了新聞領域之外,NEEDLE 也覆蓋了其他需要專業知識的查詢類型。金融、學術、法律以及稀有實體相關的查詢,採用每日更新的節奏,資料來源橫跨多個權威平台。
金融查詢來自 SEC XBRL 資料庫,學術查詢取用 arXiv 預印本平台與 Europe PMC 生醫文獻庫,法律查詢則來自 CourtListener 公開法庭紀錄,稀有實體查詢則從公開代理程式日誌中提取。透過這種跨領域、多來源的設計,NEEDLE 確保各種不同類型的搜尋需求都能在基準測試中獲得充分且新鮮的樣本。NEEDLE 的評估過程同樣具有透明性。所有受測對象都面對完全相同的即時查詢,目前共有十五個搜尋 API 被納入這個測試框架之中。
這種做法讓不同服務之間的比較具備對照基礎,同時因為使用即時熱門趨勢與最新公開文件,測試結果更能反映系統在真實世界場景中的表現,而非實驗室環境下的人為設定。這項開源基準的推出,也預示了搜尋評估領域一個新方向的成形。長久以來,研究人員與開發者已經習慣在固定資料集上反覆迭代模型效能,但 NEEDLE 提出的觀點更加尖銳:如果測試資料無法隔絕於受測系統的觸角之外,那麼任何精確到小數點後幾位的分數都可能只是虛幻的自我滿足。讓查詢本身成為不斷奔跑的目標,反而能迫使搜尋代理程式真正依賴自身的檢索能力,而不是依賴記憶或偷看答案。
另外值得一提的是,NEEDLE 在資料來源的選擇上,刻意把公開代理程式日誌納入稀有實體查詢的生成基礎,這意味著它也能捕捉一般靜態基準難以觸及的長尾搜尋行為。稀有實體往往涉及特定名稱、冷門術語或小眾知識,這類查詢最不容易被模型記憶覆蓋,也最能考驗搜尋 API 對即時資訊的掌握程度。搭配 SEC、arXiv 等更新節奏穩定的專業來源,NEEDLE 建立起一個多層次、多時間尺度的評估體系。對開發者與研究機構而言,NEEDLE 的開源特性降低了採用門檻。任何人都有機會在自己的環境中部署這套基準,針對內部系統進行相同標準的測試。這也讓不同團隊之間能共享同一套評估語言,減少因測試方法歧異而產生的比較困難。
回歸根本,搜尋 API 的價值最終要落在「能不能在對的時間找到對的資訊」這件事上。NEEDLE 的設計邏輯就是要把這個最樸素的要求重新確立為評估的核心,而不是讓基準測試淪為記憶力測驗或資料抓取競賽。當查詢集每小時重生一次,所有參與測試的系統都被迫面對一個無法提前準備的開放世界,而這恰恰是使用者在真實生活中每天面對的處境。可以預期的是,NEEDLE 的出現將帶動一波對現有評估方法的反思。無論是搜尋 API 的提供者、AI 代理程式的開發者,還是負責挑選技術方案的決策者,都需要重新審視自己過去依賴的測試數據究竟證明了什麼。
在生成式 AI 與代理式搜尋快速融合的當下,一個能杜絕捷徑、維持新鮮度的基準,也許正是這項技術走向成熟所需的最後一塊拼圖。
Related
相關文章

我國牽頭制定家用機器人國際標準,涵蓋 11 項核心測試
首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>智能家居 我國牽頭制定家用機器人國際標準,涵蓋 11 項核心測試 2026/9/1 18:11:41 作者:潞源 責編:潞源 評論: 9 月 1 日消息,據央視新聞今天報道,我國日前牽頭制定國際標準《家用和類似用途機器人性能評估方法》,為全球家用機器人行業提供統一性能評估框架,涵蓋避障、坡度運行、能耗等 11 項核心測試項目。

騰訊張軍:在職老師和高校大學生完成身份認證,可領取 WorkBuddy 1000 開學專屬積分
作者:漾仔 責編:漾仔 評論: 感謝網友 不一樣的體驗 的線索投遞!9 月 1 日消息,騰訊公司公關總監張軍發文,宣佈即日起,全體在職老師和高校大學生完成身份認證,即可領取 WorkBuddy 1000 開學專屬積分。全國普通高等學校(除港澳臺)在讀大學生,以及通過教育部‘中國教師’小程序完成認證的各級各類學校在職教師,打開 WorkBuddy,按照頁面提示完成各自身份認證,即可領取 1000 開學專屬積分。

華碩 ProArt GR1X 英偉達 RTX Spark 迷你主機 2026Q4 上市
作者:溯波(實習) 責編:溯波 評論: 9 月 1 日消息,華碩 (ASUS) ProArt 官方近日表示,其基於 NVIDIA(英偉達)RTX Spark 超級芯片的 ProArt GR1X 迷你主機即將於 2026 年第 4 季度上市。

小米澎湃 HyperOS 4 超級小愛交互煥新:動效實時反饋、任務上島運行
作者:歸瀧 責編:歸瀧 評論: 感謝網友 風見暉一、Autumn_Dream、順勢而為 的線索投遞!9 月 1 日消息,小米官方今日宣佈,澎湃 HyperOS 4 超級小愛交互煥新。輕盈動效實時反饋,回應自然流暢;任務上島運行,思考不斷、操作不停;思考結果自動展開,關鍵信息清晰呈現。

男子聽信 AI 抄近道下山被困深山,事後 AI 承認“要是直接跟導航走就不會遭那麼大罪了”
作者:故淵 責編:故淵 評論: 9 月 1 日消息,“浙江消防”官方公眾號昨日(8 月 31 日)發佈博文,報道稱一名 57 歲男子聽信 AI 抄近道下山,結果越導越偏,直接困在深山,事後 AI 回覆“哈哈,確實!”。援引博文介紹,被困男子楊師傅今年 57 歲,來自湖南,在寧波工作已有多年。

宇樹消防機器人亮相,能背水炮、不怕火燒
首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>具身智能 宇樹消防機器人亮相,能背水炮、不怕火燒 2026/9/1 10:06:16 作者:汪淼 責編:汪淼 評論: 9 月 1 日消息,宇樹科技昨日晚間曬出一段視頻,展示了其四足機器人消防應急解決方案。