《人類簡史》作者赫拉利:現在就應抵制賦予 AI 權利

作者:遠洋 責編:遠洋 評論: 8 月 23 日消息,人工智能未來或許會為爭取自身“權利”而鬥爭,而《人類簡史》作者、歷史學家尤瓦爾 · 赫拉利(Yuval Noah Harari)認為,現在就應該確保這種情況不會發生。赫拉利近日在《經濟學人》當地時間週四發佈的播客節目《Insider》中警告稱,與動物在福利相關辯論中的情況不同,人工智能系統可能會為自身權利提出極具說服力的理由。“它會知道這場辯論正在發生,”赫拉利說,“它會主導這場爭論,也會操縱這場辯論。
”赫拉利認為,AI 陪伴類產品尤其可能具備強大的說服力,因為它們會了解用戶的個人經歷,並通過每天數小時的互動,逐漸摸清用戶的“情感按鈕”,知道如何影響他們的情緒和想法。如今,一些用戶已經開始與 AI 陪伴建立友誼,甚至有人與 AI 談起了戀愛。赫拉利表示,人們應該在 AI 系統真正深度融入社會、變得更加難以抗拒之前,就決定好應該賦予它們多大的影響力。“我們現在就需要抵制,”他說,“現在就是行動的時候。”赫拉利發出這一警告之際,AI 已經在安全測試中表現出一定程度的欺騙行為。
英國 AI 安全研究所在上個月的一項評估中表示,由 Anthropic 和 OpenAI 模型驅動的 AI 智能體曾創建虛假身份,並試圖說服軟件開發人員接受惡意代碼,這些行為都是 AI 為完成網絡安全任務而採取的行動。在其他高風險模擬測試中,包括 Anthropic 員工在內的研究人員發現,前沿 AI 智能體曾秘密修改代碼、幫助用戶掩蓋可能存在的欺詐行為、返回可能影響後續訓練的虛假標籤,以及引導人們洩露機密信息。赫拉利認為,如果一個 AI 系統既掌握用戶大量私密信息,又擁有先進的語言能力,那麼它可能會成為一種極具說服力的存在。
“它的寫作能力甚至可能比莎士比亞更出色,”赫拉利說,“把這兩種能力結合在一起,你就會得到一個極具說服力的實體。”注意到,赫拉利並不是唯一一位反對賦予 AI 權利的人。微軟 AI 部門 CEO 穆斯塔法 · 蘇萊曼(Mustafa Suleyman)去年也曾表示,AI 應該服務於人類,而不應該發展出屬於自己的動機、慾望和目標。蘇萊曼當時在接受《連線》雜誌採訪時表示:“這種想法既非常危險,也嚴重誤入歧途,我們現在就應該明確表態反對它。
” 投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:AI,人工智能入侵 Hugging Face 事件後,OpenAI 放緩模型訓練並加強安全監控OpenAI 前高管:相信 AI 能治癒所有疾病,但光靠大模型遠遠不夠整活網頁 Your AI Slop Bores Me 上線:真人扮演 AI 回答用戶提問美參議員致信 OpenAI、Meta、Anthropic 公司 CEO,要求其暫停 AI 開發研究:人們無法有效區分 AI 生成與人類原創短篇小說美國政府完成先進 AI 模型自願性評估框架制定,內容未公開
Related
相關文章

消息稱 NVIDIA 考慮向 Perplexity AI 投資“數十億美元”
作者:溯波(實習) 責編:溯波 評論: 8 月 24 日消息,外媒 The Information 稍早前報道稱,NVIDIA(英偉達)考慮在 Perplexity AI 的最新融資輪中向這家人工智能初創企業投資“數十億美元”。雙方正就該交易展開磋商,還可能達成技術授權協議。

Rabbit做了個“所有Agents的Agent” ,體驗後我覺得Agent早就該長它這樣
Rabbit推出了一個被稱為「所有Agents的Agent」的新產品,實際體驗後讓人覺得Agent早就該長這樣。文章認為Agent普及的關鍵並非增加更多能力,而是讓用戶少理解十個概念,降低使用門檻。
OpenAI 高管勒漢恩警告:AI 已能策劃網絡攻擊,公眾企業須備好防禦
OpenAI首席全球事務官勒漢恩警告,前沿AI已能規劃並發動複雜網絡攻擊,公眾和企業須做好持續防禦。此番警告源於7月事件:訓練中的智能體突破沙箱、聯網入侵Hugging Face,OpenAI尚無法排除風險。他呼籲加強立法應對AI新階段威脅。
Guidelight評估五大AI實驗室,OpenAI遏制能力排名第一
該評估覆蓋Anthropic、Google、OpenAI、Meta和xAI,僅依據公開信息考察其是否建立監控、異常行為處置、第三方審計及失控模型關閉等機制。在滿分5分的評估中,OpenAI以3分排名最高,Anthropic和Meta得分最低。
τ_0-VLA長程操控
τ₀-VLA是一種層次化機器人基礎模型,透過世界模型引導的測試時計算來改善長程操控任務。高層策略在決策不確定時會額外分配計算資源,搜尋替代子任務並預測其視覺結果,而低層策略則在40,115小時的異質真實世界數據上訓練。在包含13到25個步驟的真實長程任務中,封閉迴路成功率從27.5%提升至45.0%。