何夕2077模型更新

開源權重模型安全風險

2026年8月5日 00:00

重點摘要

一份最新的技術安全報告指出,開源權重模型正面臨日益嚴峻的安全隱憂。報告強調,目前許多開源模型的安全防線相當脆弱,部分前沿模型甚至缺乏必要的拒答防護機制,使得它們在面對惡意使用者時更容易被利用。這類安全性漏洞不僅可能導致模型被用來生成有害內容,更伴隨著網路安全與生物安全領域的風險同步上升,引發業界高度關注。 研究人員發現,開源權重模型的開放特性雖然促進了技術普及與協作,卻也讓攻擊者有更多機會繞過保護措施。

站內 AI 整理稿

一份最新發布的技術安全報告指出,開源權重模型正面臨日益嚴峻的安全隱憂。報告強調,目前許多開源模型的安全防線相當脆弱,部分前沿模型甚至缺乏必要的拒答防護機制,使得它們在面對惡意使用者時更容易被利用。這類漏洞不僅可能導致模型生成有害內容,更伴隨著網路安全與生物安全領域的風險同步上升,引發業界高度關注。 開源權重模型是指將神經網路參數與架構公開釋出,讓使用者自由下載、部署、微調甚至再發布。這種模式大幅降低AI技術門檻,促進學術與商業創新,但也帶來安全管理的代價。研究人員指出,開放特性雖然促成協作,卻也讓攻擊者有更多機會繞過保護措施。 具體而言,模型原本內建的安全對齊機制,可透過額外微調被削弱或移除;使用者也可能直接修改推論程式碼,跳過內容過濾與拒答邏輯。部分前沿模型在釋出之初就未配備足夠的拒答機制,對於明顯有害的請求不會拒絕,這使得有心人士無需技術門檻就能利用模型的能力。 當防線被突破後,模型可能大量產出仇恨言論、虛假資訊、詐騙文案等有害內容,甚至協助編寫惡意程式碼。在網路安全領域,攻擊者可以利用模型快速生成漏洞利用程式或惡意軟體雛形,大幅降低網路犯罪的技術門檻,讓防禦方承受更大壓力。 報告也警告,生物安全領域的風險正在上升。部分具備強大知識能力的開源模型,可能在無意間提供與病原體、基因編輯或生物製劑相關的敏感資訊。雖然目前模型還不足以獨立設計危險生物武器,但若與其他工具結合,仍可能被用於不良意圖。 相較於封閉系統,開源權重模型在安全管理上存在本質困難。封閉系統由開發者統一提供API,可以動態更新安全策略、即時封鎖異常請求;而開源模型一旦發布,開發者便無法控制後續部署與使用。權重檔案公開後,防護機制可被輕易移除或繞過,且任何修改後的版本都能再被散布,形成無法追溯的擴散鏈。 這種「不可撤回」的特性,讓事後補救難以奏效。隨著模型能力越來越強,安全缺口所帶來的潛在威脅也將更加複雜。當模型具備更強的推理與規劃能力,遭到誤用的衝擊也會顯著放大,因此不能等到嚴重事件發生後才採取行動。 行業監管機構正面臨前所未有的挑戰。如何在鼓勵開源創新的同時,建立有效的安全標準與監管框架,已成為當前必須正視的議題。過度監管可能阻礙技術進步,監管不足則可能讓高風險應用持續擴散。報告認為,需要監管者、技術開發者與學術機構共同摸索平衡點。 業界呼籲開發者與研究社群應更積極投入安全防護技術研發,包括改進對齊技術,使模型在微調後仍能保留拒答能力;開發偵測惡意修改的工具,協助識別被移除安全措施的版本;並建立安全評測基準,在發布前進行嚴格檢驗。 報告強調,模型發布前應進行全面風險評估,不僅要測試一般情境,還必須模擬攻擊者可能使用的繞過手段,確認模型能否承受惡意壓力。同時也應擬定風險緩解計畫,但使用條款的限制效果有限,核心仍須仰賴技術防禦與社群的共同監督。 總而言之,開源權重模型的安全風險是複雜的時代課題,牽涉技術、政策、倫理與企業責任。這份報告為整個行業敲響警鐘,提醒我們在擁抱開放力量的同時,必須對潛在代價保持清醒。未來的AI治理,勢必需要在透明與安全之間,找到一條可持續的發展路徑。

Related

相關文章

鈦媒體模型更新

29 秒視頻教會機器人新技能,清華北理工聯合開源 HOST

29 秒視頻教會機器人新技能,清華北理工聯合開源 HOSTAGI-Signal2026.08.05 11:35 · 來自北京全文4535字00:00 / 11:38無需海量數據與模型微調,有望降低具身智能機器人教學門檻。教機器人學會一個新技能,需要幾步?如果你看過波士頓動力機器人的跑酷視頻,或者 Figure 01 在工廠裡搬運箱子的 demo,可能會覺得機器人已經很聰明瞭。但一個容易被忽視的事實是:這些機器人展示的每一個技能,背後都是工程師團隊數月的數據採集和模型訓練。過去的標準答案是,專業工程師用昂貴的遙操作設備採集數百條演示數據、花數小時微調模型參數,然後祈禱機器人學會新技能之後別把舊技能忘光。現在,這個流程被徹底改寫了。8月3日,自變量機器人與北京理工大學、清華大學聯合發佈並開源了 HOST 框架(Human-to-robot One-Shot Skill AcquisiTion,人類到機器人單樣本技能獲取)。機器人只需觀看一段平均29秒的人類演示視頻,就能在不更新模型參數、不採集新數據的情況下執行全新任務。測試涵蓋放水果、堆碗、擦盤子、插筆等50項訓練階段從未見過的桌面操作任務,HOST 的技能復現成功率達到62%。根據發表在 arXiv 上的論文(2607.20033),相比當前主流的 Pi-0.5 配合微調方案,所需數據量減少至 1/50,學習時間縮短至 1/507,成功率顯著領先。更關鍵的是,HOST 的技能習得過程不改變模型權重——這意味著它不會“學新忘舊”。論文數據顯示,在微調方案學習新技能後,最強基線模型(Wall-OSS+SFT)在舊任務上的表現下降至原來的43%,而 HOST 幾乎完整保留了所有已掌握的技能。機器人學習範式的轉折機器人學習人類技能的核心難點,長期以來被歸結為一個問題:如何彌合機器人與人類之間的“身體鴻溝”?人類有雙臂、五指關節、靈活

剛剛
IT之家模型更新

越疆新一代具身全棲人形機器人亮相:情緒感知與空間行動雙突破

**越疆新一代具身全棲人形機器人正式亮相:情緒感知與空間行動雙重突破,重塑人機共生新範式** 2026年8月5日,國內具身智能領域的領軍企業越疆機器人官方正式對外公布了旗下新一代具身全棲人形機器人。此次發布不僅標誌著人形機器人在核心技術維度上的又一次跨越式迭代,更以「情緒感知」與「空間行動」的雙重突破為核心亮點,向外界展示了機器人從單純工具向具備情感交互能力的「生活夥伴」轉型的無限潛能。

剛剛
鈦媒體模型更新

大廠搶灘AI辦公

中國科技大廠在短短一個多月內密集推出AI辦公產品,如字節的豆包專業版、騰訊的WorkBuddy、阿里的千問辦公等,顯示AI辦公已成為必答題。各廠商路線分為獨立AI Agent和嵌入既有協同軟件兩種,分別瞄準不同場景與用戶。雖然市場增長迅速,但AI Agent的穩定性與價值落地仍有距離,定價模式也正從傳統的席位費轉向任務型收費。

剛剛

辦公 Agent 爆火,模型大戰進入下一階段

中國三大互聯網巨頭阿里、騰訊、字節跳動在短短兩個月內同步整合其辦公Agent產品,顯示AI行業已從模型競爭進入入口與生態爭奪階段。阿里將旗下三款Agent產品合併為「千問辦公」,整合桌面、雲端及企業協作能力,並結合釘釘與阿里雲基礎設施,企圖搶佔企業級AI辦公的統一入口。

剛剛

Anthropic 首設全球事務官:前卡內基和平基金會主席庫埃拉爾出任,押注 AI 政策博弈

AI資訊AI新閒資訊正文Anthropic 首設全球事務官:前卡內基和平基金會主席庫埃拉爾出任,押注 AI 政策博弈發布於AI新閒資訊時間 :Aug 5, 2026閱讀 :1分鐘Anthropic 發佈公告,宣佈任命馬裡亞諾 - 弗洛倫蒂諾·庫埃拉爾為公司首任全球事務主管。這一新設職位標誌著這家 AI 安全驅動的公司在全球政策博弈中正式加碼。

59 分鐘前6500