谷歌推出全球首個雙盲 AI 評估技術,基於加密環境保障基準測試公正性

作者:小泵 責編:小泵 評論: 8 月 27 日消息,谷歌宣佈推出全球首個針對前沿專有 AI 模型的雙盲評估,將外部評估限制在加密“黑箱”環境中,避免模型提前獲取測試信息來優化性能。就像學生考前不能提前看到試題才能真實反映水平一樣,當前 AI 模型評估也面臨同樣問題:如果模型提前接觸測試題目(注:也就是所謂的“基準汙染”),評估結果的可信度就會大打折扣。谷歌聯合新加坡人工智能安全研究所、OpenMined、AVERI 以及 MLCommons,在隱私保護環境中對 Gemini Flash Lite 模型進行機密基準測試,提升評估結果的完整性。
傳統高風險外部評估一直存在兩難困境:要麼評估方交出測試提示詞,存在模型方提前看到題目的風險;要麼模型方交出模型權重,面臨知識產權洩露風險。雙盲評估則解決了這一矛盾,通過谷歌雲保密計算產品組合中的 Confidential Space,能夠通過加密驗證,保證外部評估數據和專有模型分別對各自所有者保持隱私:評估方無法看到 Gemini 模型權重,谷歌也無法看到評估方的測試提示詞。這種加密手段可以有效防止基準汙染,同時保護敏感數據,對於網絡安全或政府機構開展的高敏感度評估尤其重要。雙盲評估讓獨立機構能夠在不損害數據主權和安全的前提下,對先進 AI 模型進行嚴格測試。
谷歌表示,希望這一試點能夠為模型監督開闢新方向,幫助整個行業構建更安全、更可靠、更受公眾信任的 AI 系統。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:谷歌,基準測試,AI模型,雙盲AI評估,加密計算谷歌、AMD、Cloudflare 等公司加入,簽署支持 AI 開源模型發展公開信組織增至 50 家谷歌發佈三款新 AI 模型,含 Gemini 3.6 Flash、3.
5 Flash Cyber谷歌 AI 摘要頻現低級拼寫錯誤,大語言模型固有缺陷難根治SPEC CPU 2026 基準測試套件發佈:體現現代硬軟件重大演進UL Solutions 推出 Procyon Essentials 基準測試:面向日常專業工作負載能生成可玩遊戲世界,谷歌推出 Project Genie AI 模型測試版本
Related
相關文章

華為的數據供應商,拿下90%的具身大腦企業|對話景聯文CEO
機器人前瞻(公眾號:robot_pro) 作者 | 周加琦 編輯 | 漠影 機器人前瞻8月267日報道,近日,杭州AI數據運營商景聯文科技發佈了一批用宇樹機器人採集的真機數據集,包含近15000小時的真機數據,用於模型訓練。 對於當前的具身智能行業而言,15000小時真機數據已經是一筆不小的數據量。但對整個行業來說,遠遠不夠。 相比大模型時代已經積累了億級的互聯網數據,具身智能沒有現成的大規模數據可用於訓練。 對於長期處在數據產業的企業而言,這種差異感更明顯。

OpenAI 將向印度 ChatGPT 免費及 Go 套餐用戶投放廣告
作者:清源 責編:清源 評論: 8 月 27 日消息,OpenAI 宣佈,即日起將在印度向 ChatGPT Free 和 Go 套餐用戶投放廣告。本月早些時候,OpenAI 修改了服務條款,明確說明用戶在使用 ChatGPT 時可能看到廣告。

上線一月,Seedance 2.5能否抗住“平替”圍攻?
1小時前HappyHorse與Wan3.0賽馬,誰是阿里版Seedance?昨天衝擊250億,拓竹復刻大疆第一步:隔壁開店圈地2026-08-21閱讀更多內容,狠戳這裡查看AI測評豆包MiniMax即夢AI選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇Figure用一款APP建立全球「數據採集經濟體」,中國具身企業誰會搶先跟進?

ChatGPT報警後:誰有權審判你的對話框?
ChatGPT等生成式AI若在對話中偵測到潛在威脅,是否應主動通報執法單位,引發各界討論。支持者認為AI應承擔社會責任即時阻止憾事,反對者則擔憂語言模型易誤判玩笑與反諷,恐侵犯隱私和言論自由。目前缺乏明確法律框架界定AI舉報義務與責任歸屬,未來或需建立分級制度,由人類專業人員最終判斷。

HBM正在被重新定義
半導體產業縱橫2026.08.27 18:25 · 來自北京全文3679字00:00 / 11:37新一代HBM4將成為技術轉折點。文 | 半導體產業縱橫隨著AI大模型訓練與推理需求持續爆發,算力芯片的性能瓶頸已從計算單元轉向存儲帶寬,HBM高帶寬內存成為制約高端AI硬件迭代的核心關鍵。在HotChips 2026國際高端芯片技術大會上,全球兩大存儲龍頭三星、SK海力士集中披露了HBM4下一代技術演進路線,打破了行業沿用多年的HBM迭代邏輯。

Day-0 支持:摩爾線程官宣完成智譜 GLM-5.3-Flash 極速適配
作者:歸瀧 責編:歸瀧 評論: 感謝網友 Autumn_Dream 的線索投遞!8 月 27 日消息,智譜近日上線並開源 GLM-5.3-Flash (320B-A18B)。摩爾線程官方今日宣佈,基於 AI 訓推一體智算卡 MTT S5000 及 MUSA 軟件棧,Day-0 支持,實現了對該模型的極速適配與高效運行。