BrowseComp被刷到90%後,美團LongCat甩出LoHoSearch:前沿模型集體跌回三成出頭
重點摘要
搜索智能體評測基準BrowseComp短期被“刷爆”,成績從30%飆到90%而逐漸失效。7月17日,美團LongCat發佈新基準LoHoSearch,基於含762萬實體的維基百科知識圖譜自動生成難題,意圖將評測重新推入高難度區,重設搜索智能體能力標尺。
人工智慧評測領域近期迎來一波劇烈變動,尤其在搜索智能體這一分支,原本被業界奉為圭臬的基準BrowseComp,在短短時間內成績從大約三成竄升至九成以上,幾乎被各家模型「刷爆」。這項發展使得該基準對模型真實能力的區分度大幅下降,形同失效。許多研究人員開始意識到,當模型表現快速逼近天花板,繼續使用舊有標竿,不僅無法反應技術的實際進展,甚至可能誤導研發方向。 BrowseComp之所以快速失去鑑別力,主因在於其題庫設計在當前模型能力躍升的背景下,已無法帶來足夠的挑戰。過去,BrowseComp被視為衡量搜索智能體能否在開放式網路上找出正確答案的重要工具,但當愈來愈多模型能在這項測試中獲得接近滿分的成績,它的參考價值也從原本的「能力指標」淪為「基本門檻」。換句話說,BrowseComp已無法區分哪些模型具備真正的搜尋推理能力,哪些只是恰好適應了該試題的題型。 面對這項困境,美團旗下的研究團隊LongCat在七月十七日正式發布全新基準LoHoSearch,目標就是要重新拉高評測的難度標準,讓前沿模型接受更嚴峻的考驗。LoHoSearch的建構基礎是涵蓋七百六十二萬個實體的維基百科知識圖譜,透過自動化流程,系統能生成高難度的搜尋問題,這些問題往往需要跨實體、跨脈絡的多步驟推理才能順利解答。 相較於BrowseComp題庫相對靜態且容易被「背題」,LoHoSearch的自動生成機制確保題目具備多樣性與即時性,模型無法靠單純記憶或模式匹配來取巧。每一個問題都需要搜索智能體真正理解使用者意圖,並在知識圖譜的連結中找出正確的答案路徑。這不僅考驗模型對資訊的檢索能力,也挑戰其邏輯推導與資訊整合的極限。 LongCat團隊在設計LoHoSearch時,特意將問題的難度設定在當前多數模型尚未完全掌握的區間,希望在業界形成一個新的能力標竿。從已公開的初步結果來看,即便是目前最頂尖的模型,在LoHoSearch上的成績也僅落在三成出頭,顯示該基準確實具備足夠的挑戰性。這也讓學術界與業界再次聚焦在「該如何設計真正具有鑑別力的評測」這一核心課題。 值得注意的是,Benchmark的快速迭代本身就是模型能力飛速成長的側面寫照。BrowseComp從推出到被「刷爆」歷經的時間並不長,如今LoHoSearch登場,恐怕也難以保證能長期維持優勢。如果模型的進步速度持續加快,未來可能每隔一段時間就會有新的基準問世,而舊有工具則迅速退場。這種動態發展雖然讓評測體系難以穩定,卻也真實反映出人工智慧領域的蓬勃生機。 對於搜索智能體的開發者而言,LoHoSearch的推出無疑提供了一個更嚴格的驗證環境。在這樣的基準下獲得高分,意味著模型真正掌握了大規模知識圖譜中的推理與查找能力,而不只是表面上的文字匹配。同時,這也將促使各家廠商重新審視現有模型的搜尋架構,思考如何突破目前成績低迷的瓶頸。 從技術層面來看,LoHoSearch的知識圖譜規模達到七百多萬個實體,涵蓋範圍極廣,這對模型在異質資訊之間的整合能力提出了極高要求。傳統的搜尋模式往往著重於關鍵字匹配或直接擷取段落,但LoHoSearch期待的是模型能夠在圖譜的節點與關係中自如穿梭,進行類似人類研究員的深度資訊探索。這樣的路線若能成功推廣,將對未來的搜尋引擎與智能助理設計帶來深遠影響。 當然,新基準能否真正取代BrowseComp成為業界通用的新標準,仍有待後續驗證。一方面,社群需要時間來適應並信任LoHoSearch的有效性;另一方面,題庫的自動生成是否會累積偏差或漏洞,也需要持續監控與維護。但可以確定的是,從BrowseComp到LoHoSearch的轉變,標誌著搜索智能體評測體系正進入一個更高強度的競賽階段。 在更宏觀的視角下,這種評測基準的快速更迭也反映出人工智慧研發不再只追求單一任務的突破,而是更加注重模型在複雜、開放場景中的真實表現。一個能長期維持區分度的基準,對於引導研究資源投入正確方向至關重要。如果LoHoSearch能成功維持其難度與鑑別力,它將不僅是一道新的門檻,更可能成為推動搜索智能體技術持續進步的重要動力。而未來是否會出現更多領域的類似基準,也值得產業界與學術界密切關注。
Related
相關文章
WrenAI讓企業問數更穩
WrenAI讓企業問數更穩。 項目面向生成式商業智能需求。企業問數項目倉庫已獲16.2k。開放語境層���約束查詢生成過程。系統覆蓋二十餘種企業數據源。可信看板方便團隊核驗結果。
Feyn AI Releases SQRL, a Text-to-SQL Model Family That Inspects the Database Before Writing a Query
這篇消息聚焦「Feyn AI Releases SQRL, a Text-to-SQL Model Family That Inspects the Database Before Writing a Query」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
數字永生?面壁智能開源企業數字員工平臺StaffDeck
面壁智能開源企業級數位員工平台 StaffDeck,不同於一般聊天機器人,旨在將組織的專業知識與流程轉化為可持續運作的數位勞動力。該平台由面壁智能、東北大學及清華大學等單位共同打造,強調知識的持續駐留與沉澱,避免因人員流動而流失。
OpenAI Details GPT-Red: An Internal Automated Red-Teaming Model That Beat Human Red-Teamers 84% To 13% On Prompt Injection
這篇消息聚焦「OpenAI Details GPT-Red: An Internal Automated Red-Teaming Model That Beat Human Red-Teamers 84% To 13% On Prompt Injection」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

納德拉疑似隔空開懟大模型頭部玩家:只許自己爬數據,不許別人蒸餾模型
智東西(公眾號:zhidxcom) 編譯 | 茄子 編輯 | 程茜 智東西7月13日消息,微軟CEO薩提亞·納德拉(Satya Nadella)昨日在X上發了一篇題為“反向信息悖論”(The Reverse Information Paradox)的長文,質疑當前AI行業存在的“學習不對稱”現象。