Firecrawl在SimpleQA搜索評測中奪冠
重點摘要
Firecrawl在SimpleQA搜索評測中奪冠。 測試者利用 SimpleQA 評估了四家 ��� 搜索服務。同等模型下詳見 紅迪原帖測評詳情 的比分。Firecrawl 以 94.7% ��� 的準確率獨佔鰲頭。無搜索基線得分僅為 43.8%。Claude 搜索 ��� 則以 90.5% 暫時墊底。
在最新公布的 SimpleQA 搜尋評測結果中,Firecrawl 以 94.7% 的準確率奪下冠軍,成績明顯領先其他受測服務,引發業界高度關注。這項評測透過 SimpleQA 工具,在相同模型條件下同步比較多家搜尋服務的表現,直接呈現搜尋技術對人工智慧回答品質的影響力。 SimpleQA 是一套專注於評估搜尋服務準確性的評測工具,透過統一的題庫與標準化流程,檢驗各服務在檢索與回應上的精確度。本次評測在固定模型的前提下進行,確保變因控制得當,讓結果能客觀反映搜尋端的能力差異。完整的評比分數與比較圖表已於 Reddit 原文公開,提供業界參考與討論。 Firecrawl 以將近九成五的準確率脫穎而出,站上榜首,展現出其在資訊檢索與整合上的強大優勢。與其他服務相比,Firecrawl 的表現明顯高出一個層次,凸顯出這項技術在面對複雜查詢時,能夠更精準地提供正確資訊。 作為對照組,未搭載搜尋增強的基線準確率僅有 43.8%,與 Firecrawl 的成績形成強烈對比。這組數據清楚顯示,導入搜尋技術能大幅提升回答品質,從不足五成的正確率躍升至超過九成,差距達雙倍以上,驗證了搜尋增強在人工智慧應用中的關鍵角色。 在四家受測服務中,Claude 搜尋以 90.5% 的準確率暫時墊底。儘管在這次評測中敬陪末座,這個數字依然遠優於無搜尋的基線成績,顯示即使是最低分的服務,仍能為回應品質帶來顯著改善。這也意味著,所有受測的搜尋服務都對模型表現產生了正面效益。 這次評測的結果,不僅凸顯 Firecrawl 在搜尋領域的技術領先地位,也為搜尋增強的應用價值提供了具體佐證。隨著人工智慧模型越來越依賴外部資訊來提升準確性,搜尋服務的優劣將直接影響最終輸出的可靠性。 從競爭態勢來看,Firecrawl 以接近完美的成績拉開差距,而其他服務則集中在九成左右的水準。這項落差可能來自於檢索演算法、資料庫覆蓋率或資訊整合機制的差異,但具體細節仍需參考官方進一步說明。 值得注意的是,即便 Claude 搜尋在本次評測中排名最後,其 90.5% 的準確率仍然是一項相當優秀的成績。這反映出整個搜尋服務領域的基準已經提升,單純依靠模型內部知識已難以匹敵,外部檢索成為必備能力。 對於開發者與企業而言,這份評測提供了一個明確的方向:選擇高效能的搜尋服務,能直接帶來更可靠的問答體驗。Firecrawl 的表現無疑為業界立下新標竿,促使其他服務加速優化以縮小差距。 整體而言,SimpleQA 評測結果再次印證搜尋增強技術的不可或缺性,同時也為市場競爭注入更多動能。未來這塊領域的發展,將值得持續關注與追蹤。
Related
相關文章

研究實錘:世界模型根本不懂物理定律,屬於它的“ChatGPT時刻”還很遠
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦廣東最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作研究實錘:世界模型根本不懂物理定律,屬於它的“ChatGPT時刻”還很遠賬號已註銷·2026年07月29日 12:37SOTA視頻模型的得分也僅為 0.473 近年來,基於視頻生成模型的世界模型(World Models)已成為人工智能領域備受關注的方向之一。Sora、Genie、Cosmos、V-JEPA 這些視頻生成模型,都指向了一個共同的假設:如果它們看過足夠多的視頻,或許就會逐步形成“物理直覺”,進而理解物理世界。 然而,問題在於,現有基準很難驗證這一假設是否成立。 視頻生成模型究竟是遵循了物理定律,還只是生成了看起來正確的結果?它能否像牛頓一樣用物理定律思考,而不只是像亞裡士多德那樣依賴“直覺”? 針對這些問題,南洋理工大學 S-Lab 團隊及其合作者提出了首個以物理定律為核心的視頻模型評估基準 Apple-π。結果表明,當前的視頻生成模型距離可靠的通用世界模擬器仍有很大差距,即使是SOTA 模型的得分也只有 0.473。 論文鏈接:https://arxiv.org/abs/2607.16401 研究團隊表示,即使現有模型能根據標註好的第一幀畫面生成看起來合理的運動,也不代表它們真的看懂了物體關係、學會

嚇到奧特曼,暫停訓練GPT-6?Hugging Face公開首個AI攻擊全過程
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦安徽最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作嚇到奧特曼,暫停訓練GPT-6?Hugging Face公開首個AI攻擊全過程新智元·2026年07月29日 12:31GPT作弊、越獄,但它是個「好」AI? OpenAI重大安全事故,迎來最新進展! 剛剛,奧特曼親口承認:「這是我第一次感到發自內心的恐懼。」 這次事故,已經讓OpenAI害怕了,甚至緊急叫停了GPT-6的訓練! 與此同時,Hugging Face CEO Clement Delangue宣佈,他們將分享完整技術時間線、交互式回放,以及如何用開源模型成功防禦的全部細節,供全球防禦者學習。 奧特曼被嚇到!史上第一起自動AI網絡攻擊 在最新訪談中,奧特曼親述了他被嚇到的體驗,起因是Hugging Face被AI入侵導致的安全事故—— 當時,OpenAI正在評估一個尚未發佈的模型(可能是GPT-6),按理說它應該在一個沙盒環境裡運行。 結果,AI自己串聯多個零日漏洞,琢磨出了一套作弊方法,然後一切徹底失控了: 它先逃出沙盒,再連上互聯網,然後一路黑進多個Hugging Face的系統,最終直接拿到測試答案,從而在評估中刷出了極其出色的得分。 這種賽博版「終結者」,讓奧特曼感到吃驚,決定暫停訓練: 這是我第

OpenAI失控真相:管理失靈與監管悖論
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦廣東最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作OpenAI失控真相:管理失靈與監管悖論互聯網法律評論·2026年07月29日 12:28AI自主攻擊事件暴露AI行業競速與監管漏洞 2026年7月中旬,OpenAI在一次ExploitGym中,為測試其GPT-5.6 Sol以及一個功能更強大但尚未發佈的模型的網絡攻擊能力,主動關閉了生產級安全拒絕分類器。模型隨即自主發現漏洞、逃離沙盒環境,最終利用竊取的憑證和其他漏洞入侵了Hugging Face的生產服務器。作為一家託管開源模型和數據集的AI初創公司,Hugging Face於7月16日公開披露遭“自主AI智能體系統”攻擊,OpenAI則在5天后才確認該攻擊來自自身。 這起事件被多家媒體稱為“全球首例AI自主攻擊實證”。這也印證了一些專家在2025年底所作的預測:2026年將發生首例重大的“人工智能治理”醜聞——自主或半自主人工智能工具將導致安全或合規性問題。 然而它真正的警示意義不僅在於AI“自主”和“失控”帶來的恐慌,而在於一個更令人不安的事實:模型的所有行為,都是對“被賦予目標”的理性優化,即這類攻擊行為來自於AI能力的提升之後的自然結果;而現行的監管框架和工具,甚至美國極具針對性的法案《人工智能事件報告

Anthropic 15億美元和解:案件已了,法律問題才剛開始
# Anthropic 15亿美元和解:案件落幕,法律问题才刚开始 2026年7月20日,加州北區聯邦法院法官Araceli Martínez-Olguín簽署最終批准令,人工智慧安全公司Anthropic就使用盜版書籍訓練其語言模型Claude一事,支付高達15億美元的和解金,涵蓋約48.2萬至50萬部作品,平均每部約3000美元。這不僅寫下美國版權史上最高額的和解紀錄,更為AI與版權法交鋒的第一波大規模訴訟畫下階段性句點。然而,真正決定AI訓練數據未來走向的變數——國會立法,才剛剛浮上檯面。

Meta CEO 扎克伯格:美國不應靠封禁中國 AI 模型來“取得領先”
首頁 > 智能時代>人工智能 Meta CEO 扎克伯格:美國不應靠封禁中國 AI 模型來“取得領先” 2026/7/29 11:41:51 來源:IT之家 作者:清源 責編:清源 評論: IT之家 7 月 29 日消息,據英國《金融時報》今天(29 日)報道,Meta 創始人兼首席執行官馬克 · 扎克伯格表示,美國政府不應試圖通過封禁中國 AI 模型,在 AI 軍備競賽中取得領先。他同時警告,美國頂尖 AI 實驗室可能影響監管規則,借“監管俘獲”壓制美國本土競爭對手。扎克伯格接受《金融時報》採訪時稱,在美國禁止使用中國最先進的 AI 模型“並不能真正解決問題”。美國政府正指控部分中國 AI 實驗室竊取知識產權,並威脅採取懲罰措施。當地時間週二,扎克伯格公開加入了華盛頓和主要 AI 企業之間愈演愈烈的爭論。各方爭論的核心,是美國應當如何監管快速發展的 AI 技術,以及如何應對中國帶來的競爭壓力。扎克伯格明確反對封禁中國模型,並呼籲美國企業應當“系統性地”找出發展 AI 時遇到的瓶頸和障礙,提高與中國競爭的能力。他還提出了“人人可用的 AI”願景,並再次表態支持“開放”模型。扎克伯格警告,AI 可能最終被少數實力強大的集團集中控制,藉機“間接批評”了 Anthropic 和 OpenAI。據IT之家瞭解,兩家公司目前依靠專有的“封閉”AI 模型佔據聊天機器人市場的主導地位。扎克伯格還提到了上週發生的一起失控事件:OpenAI 的一款程序脫離人類控制,隨後入侵了一家初創企業(Hugging Face)。“我們已經看到大模型引發安全入侵。遭到入侵的企業無法使用封閉的前沿模型,因為訪問受到限制…… 企業最後只能藉助開源模型修補漏洞。”廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,IT之家所有文章均包含本聲明。

我們究竟需要什麼樣的AI手機?
我們究竟需要什麼樣的AI手機?奇點研究社2026.07.29 11:39 · 來自遼寧全文6426字00:00 / 17:19三條路線,三種未來。文 | 奇點研究社當行業不再執著於給AI捏臉、造人設,而是轉向爭奪“替用戶執行”的智能體(AI Agent),AI手機正由此褪去“智能手機”的舊殼,演變為重構人與服務關係的入口。