Claude開始訓練Claude!4美元一小時,跑贏150美元人類研究員

2026年8月29日 20:52
Claude開始訓練Claude!4美元一小時,跑贏150美元人類研究員
站內 AI 整理稿

人工智慧是否已經具備了獨立進行頂尖科學研究的能力?這在過去或許還只是科幻小說中的情節,但如今,Anthropic 發布的一項最新實驗結果,正將這個問題推向真實的科學競技場。根據這份研究,Anthropic 旗下的 Claude 模型,竟然以每小時僅僅 4 美元的成本,在特定安全研究任務上,擊敗了時薪高達 150 美元的人類安全研究員。兩者之間接近四十倍的報酬差距,立刻在 AI 社群內部引爆了廣泛討論。這項實驗的核心,並不僅僅是一場「AI 與人類」的傳統對決。更具突破意義的是,Claude 在整個過程中,被賦予了前所未有的高度自主性。

它並非只能被動回答問題,而是被允許自主查閱大量學術論文,提出自己的實驗假設與研究方案,甚至能夠自行生成訓練資料,並且實際動手訓練出全新的模型。這些能力串聯起來,意味著 Claude 已經不再只是人類研究員手中的工具,而是開始成為一位擁有完整研究閉環能力的「獨立研究者」。更令人矚目的是,Claude 所要解決的問題並非簡單的遊戲或文本任務,而是橫跨了多達十個類別的 AI 安全難題。這些題目涉及人工智慧在實際落地時可能遭遇的各種風險與對抗性攻擊,難度極高,過去往往需要專業的人類安全研究團隊耗費大量時間才能有初步突破。

而如今,由 AI 驅動的研究流程,已經能在這些艱澀領域中自行殺出一條血路,這無疑凸顯了大型語言模型在科學探索上的巨大潛力。研究報告中還公開了更為細緻的比較數據。在部分特定任務的執行成果上,Claude 所提出的解決方案,其品質甚至優於同期參與測試的 28 名人類安全研究員。這是一個極具象徵意義的指標,它代表著在此刻,人工智慧不僅僅是在速度與成本上佔據優勢,在部分高難度任務的「創意」與「解決質量」上,也已經跨越了人類專家的平均水準。雖然這不代表 AI 在所有層面全面超越人類,但在特定狹窄研究領域內,它的競爭力已不容忽視。若從產業與人才市場的角度來解讀,這份研究釋放出的信號格外強烈。

過去,企業若要進行大規模、高強度的 AI 安全測試,必須聘請大量頂尖的研究人才,其人力成本往往佔據公司支出的極大比例。然而,當 AI 能以每小時 4 美元的成本,提供具有一定品質保障的研究產出時,整體的研發商業模式將受到巨大衝擊。這並非意味著人類研究員將立即被取代,而是代表他們的工作職責與核心價值,可能從「親自撰寫程式碼與執行實驗」,逐漸轉變為「監督、評估並引導 AI 的研究方向」。然而,這份研究報告中最引人遐想、也最觸動敏感神經的,莫過於「教學相長」的閉環已經悄悄成形。

根據實驗框架的描述,在特定環節中,能力相對較弱的 Claude 模型,已經開始反向參與、協助訓練更為強大的 Claude 模型。這種由 AI 訓練 AI 的迭代模式,在學理上被許多人視為通往「超級智能」的捷徑之一,因為它能突破人類思考速度與帶寬的限制,讓模型之間以彼此能理解的高效方式進行知識傳遞與演化。這種自我進化的機制,一方面確實可能大幅加速模型的成長速度。AI 不再需要「等待」人類科學家理解其中的原理後,再手動調整參數;相反地,它可以自行評估弱點的所在,並在對抗與協作中完成進化。這就像是為 AI 的發展裝上了渦輪增壓引擎,每一次迭代都可能誕生比上一代更加聰明的系統。

對於追求技術突破的團隊而言,這無疑是一項令人興奮的結果。但硬幣總有另一面。當 AI 開始承擔起「訓練下一代 AI」的關鍵角色時,傳統意義上的 AI 安全治理與把關機制,也正面臨著全新的挑戰與思考維度。過去,人類監管者位於 AI 發展的權力核心,隨時可以踩下剎車;但如今,當模型之間的互動愈發複雜,人類有可能逐漸淪為「旁觀者」,難以在微小細節中即時察覺系統性的偏移或潛在的危險行為。該如何建立一套可信賴的機制,確保「AI 教練」不會教出「不受控的學生」,將成為未來安全研究領域最嚴峻的課題。可以預見的是,這份研究的影響力並不會停留在實驗室內部。

它為整個人工智慧產業提供了一個全新的思考方向:未來的頂尖科學研究,將不會再是人類獨佔的舞台。AI 自主研究、甚至 AI 自主進化的時代,已經悄然降臨。對於科技巨頭而言,這也許是降低成本、加速創新的重要契機;但對於全人類而言,如何在享受 AI 帶來的效率紅利之際,同時牢牢握住對其發展方向的掌控權,將是我們這個時代無可迴避的考驗。

Related

相關文章

何夕2077研究與前沿

騰訊Hy4預覽開源

騰訊宣布 Hy4 以預覽版本形式正式開源,相關程式碼與資源已對外公開,開發者與研究社群現在即可取得這套技術,搶先進行測試與評估。 從「預覽」定位來看,Hy4 目前仍處於持續調整階段,騰訊後續可望依據社群回饋持續優化,再推出正式版本。選擇以開源方式釋出,也讓外部團隊得以深入檢視技術實作細節,有助於擴大生態系的參與程度。 對開發者而言,現階段正是探索 Hy4 功能、評估整合路線的時機。

15 小時前
何夕2077研究與前沿

WikiSkill沉澱經驗

在大型語言模型快速演進的同時,如何有效累積與复用執行經驗,已成為提升模型能力的關鍵課題。近期一項名為「WikiSkill」的技術路線受到關注,其核心概念是將模型在實際任務中的執行經驗,以條列式、結構化的方式寫入維基格式的知識庫中,讓技能不再停留在一次性嘗試,而是能反覆更新、持續被後續任務引用。這種作法強調從「做中學」的動態回饋,而非僅依賴靜態的訓練資料,為模型在面對新任務時提供更具依據的決策支援。

15 小時前
何夕2077研究與前沿

基準評測需要信任

基準評測向來是衡量 AI 模型能力的重要依據,然而隨著模型訓練資料日益龐大,評測題目與權重若被納入訓練範疇,將導致分數失真,也就是所謂的「基準汙染」問題。為了解決這項長期存在的信任危機,谷歌近期提出了一項以雙盲測試為核心的評測機制,並實際導入機密空間加以試行。 根據相關資訊顯示,這套新做法將評測所用的題目與權重資料進行高度隔離,使其無法被模型開發者或評測執行者在一般環境下接觸,藉此降低資料外洩或提前滲透的風險。同時,雙盲的設計讓模型受測時,評測方與受測方都無法掌握彼此的具体資訊,進一步確保結果的客觀性與公正性。

15 小時前
何夕2077研究與前沿

統計ML投稿焦慮

這則資訊日報聚焦統計與機器學習領域的投稿焦慮,指出頂級會議更加擁擠。報導提到LLM相關議題佔滿海報,NeurIPS工作坊偏重智能體,並提及AISTATS與UAI等會議。

15 小時前
何夕2077研究與前沿

世界模型定義混亂

這則報導指出「世界模型」的定義目前相當混亂,各界仍在追問其概念邊界。文中提及物理引擎、機器學習流體模擬等是否屬於世界模型引發討論,並認為定義將影響未來的具身敘事。

15 小時前

專訪商湯首席科學家林達華:多模態的湧現時刻會在一兩年內到來

40分鐘前機器人賽場開始淘汰“偏科生”3小時前閱讀更多內容,狠戳這裡查看AI測評DeepSeek商湯日日新點點選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇CHIC 2026觀察:DADE Capital的產業AI棋局,從依明科技首秀開始浮現依明科技攜服裝產業AI亮相CHIC展重構產業秩序1小時前關於城市合作項目推薦我要入駐投資者關係商務合作關於我們聯繫我們加入我們歐洲站歐洲站歐洲站Ai產品日報網絡謠言信息舉報入口熱門推薦熱門資訊熱門產品文章標籤快訊標籤合作伙伴APP下載iOS & Android本站由 阿里雲 提供計算與安全服務 違法和不良信息、未成年人保護舉報電話:010-89650707 舉報郵箱:jubao@36kr.

1 天前