谷歌發佈 SensorFM AI 模型:500 萬人、1 萬億分鐘可穿戴數據預訓練

重點摘要
谷歌研究團隊推出可穿戴健康基礎模型 SensorFM,利用全球 500 萬名參與者、超過 1 萬億分鐘的可穿戴數據進行預訓練。該模型在 35 項健康任務中有 34 項優於特徵工程監督基線,涵蓋心血管、代謝風險、心理健康、睡眠等領域。此外,團隊還開發了由 LLM 智能體驅動的「classroom」系統,能自動生成與優化預測頭,進一步提升模型表現。
Google 研究團隊於 7 月 9 日正式發表一篇技術博文,宣布推出全新可穿戴健康基礎模型 SensorFM。這個模型利用全球 500 萬名參與者的授權可穿戴數據進行預訓練,展現出在多項健康任務上的強大表現,號稱在 35 項健康任務中,有 34 項的表現優於傳統特徵工程監督基線。SensorFM 的預訓練資料來自信眾生廣泛使用的穿戴式裝置。資料收集時間橫跨 2024 年 9 月至 2025 年 9 月,覆蓋超過 100 個國家與地區,並且涵蓋超過 20 種不同型號的 Fitbit 與 Pixel Watch 裝置。
研究團隊從每位參與者身上隨機抽取數週的資料,最終累積形成超過 20 億小時,也就是超過 1 萬億分鐘的信號時長,規模極為龐大。在這龐大的預訓練語料中,模型輸入的是 34 個以每分鐘為單位的聚合特徵。這些特徵來自五種主要傳感器:光電容積脈搏波(PPG)、加速度計、電皮膚活動(EDA)、皮膚溫度以及高程計。透過這些傳感器資料,SensorFM 能夠捕捉並學習 24 小時內的多種生理訊號,包括心率和心率變異性、血氧飽和度、睡眠階段、運動與步數、皮膚電導以及體溫變化。SensorFM 提供四種不同規模的版本,分別命名為 XXS、XS、S 與 B。
其中規模最大的 SensorFM-B 與最小的版本相比,在重建損失上降低了 31%,在分類任務的平均 AUC 指標提升了 9%,而在迴歸任務的平均 Pearson 相關係數則提升了 21%。這顯示出更大的模型規模能有效提升對穿戴式資料的理解與預測能力。為了進一步驗證模型的效能,研究團隊在 35 項判別式健康任務上進行測試。SensorFM-B 在其中 33 項任務中取得最佳成績。此外,團隊也採用線性探針(linear probing)的方式,將預訓練特徵應用於下游任務,結果顯示,線性探針在 35 項任務中有 34 項優於傳統的特徵工程監督基線。
這些任務涵蓋的範圍相當廣泛,總共分為六大類:心血管健康、代謝風險、心理健康、睡眠品質、人口統計與生活方式。這意味著 SensorFM 不僅能處理與生理疾病相關的預測,也能觸及心理狀態與生活習慣等領域,展現出多面向的應用潛力。除了模型本身,研究團隊還開發了一套名為 agentic「classroom」的系統。這套系統由多個協作與競爭的大型語言模型智能體組成,能夠迭代地生成、測試並優化推理程式碼。
在實驗中,該系統探索了超過 3 萬個候選方案,最終產生的預測頭(prediction head)在 20 項分類任務中有 16 項優於線性探針,在 15 項迴歸任務中有 12 項同樣優於線性探針,顯示出自動化機器學習在此領域的潛力。整體而言,SensorFM 的推出代表谷歌在可穿戴健康人工智慧領域的一次重要進展。藉由大規模、多樣化且長時間的真實世界資料進行預訓練,該模型有機會成為未來健康監測、疾病風險評估與個人化健康建議的核心基礎。雖然目前仍處於研究階段,但已為後續的應用與開發奠定了堅實的科學基礎。
研究團隊也強調,所有參與者的資料都經過明確授權同意,並且在資料處理與模型訓練過程中嚴格遵守隱私與倫理規範。隨著穿戴式裝置越來越普及,這類基礎模型有望在不久的將來,幫助更多人透過隨身裝置獲得更即時、更準確的健康洞察。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。