美國公衛測試雙巨頭模型
重點摘要
美國公衛測試雙巨頭模型。 公共衛生機構已經開始測試商業大模型。這次項目將覆蓋美國範圍內的十個轄區。公衛模型測試報道披露了目前的進展。醫療機構🏥希望用大模型提升監測效率。對個人隱私的審核工作仍然需要進一步規範。
美國公共衛生機構近日正式宣布啟動一項全新測試計畫,針對兩大科技巨頭所開發的商業大模型進行實地部署與評估,試點範圍涵蓋全美十個轄區。這項被視為前瞻性嘗試的計畫,旨在探索大型語言模型如何融入現有的公共衛生監測體系,進一步提升數據處理效率與疫情應變能力。據了解,相關單位已在初步階段對外揭露部分進展,顯示這項測試已從概念驗證邁入實際營運階段。公共衛生監測系統長期以來仰賴人工通報、實驗室檢測與流行病學調查,雖然基礎紮實,但在面對大規模傳染病爆發或新興病原體威脅時,即時數據整合與分析往往成為瓶頸。
近年來,大型語言模型在自然語言處理、文本分類與趨勢預測等領域展現出驚人潛力,促使公衛主管機關開始思考如何將這類工具導入日常監測作業。這項測試計畫的核心目標,正是希望藉助大模型的技術優勢,突破傳統系統的時效限制,加速從數據蒐集到決策警示的整個流程。據悉,本次測試選定的兩家科技巨頭,其商業大模型已在醫療保健、生物醫學文獻檢索等領域累積一定應用經驗,因此被納入實地評估對象。試點區域涵蓋都市與鄉村、不同人口結構與公共衛生資源分布,以確保測試結果具有足夠的代表性與可推廣性。
相關機構透露,已開始將模型部署於部分轄區的監測後台,讓模型定期處理來自醫院、診所與實驗室的匿名通報資料,並嘗試自動生成風險摘要與初步預警建議。在初步階段,測試團隊已揭露部分進展:模型在識別異常症狀集群、分類非結構化報告文本,以及比對歷史疫情模式等任務上,表現出超越傳統規則式系統的靈活性與準確度。不過,相關官員也強調,目前仍處於「人類在迴圈中」的監督模式,所有模型輸出都須經由公衛專家審核後,才能正式納入監測報告或發布警報。這項設計旨在避免黑箱決策帶來的風險,同時累積模型與專業人員協作的最佳實務。醫療機構對這項測試寄予高度期待。
多位醫院管理層與感染控制專家指出,若能成功將大模型整合進現有的監測流程,將可顯著強化數據分析能力的深度與廣度,並大幅縮短從資料出現到預警發布的時間差。例如,在季節性流感或新興呼吸道病毒流行期間,模型能即時處理急診就診量、實驗室陽性率與藥局銷售數據,提前數天預測疫情高峰,讓醫療資源調度更從容。此外,醫療機構特別關注模型在語言理解與跨語境整合方面的潛力。美國公共衛生系統經常需要處理來自不同語系、不同書寫習慣的報告,傳統關鍵字搜尋與人工分類耗時費力,而大語言模型的多語言能力與上下文理解能力,被認為能有效降低資訊遺漏率。
幾家參與試點的大型醫院已開始提供內部回饋,協助調整模型對特定醫學術語與縮寫的辨識準確度。當然,這項測試並非沒有挑戰。數據隱私與安全是最受關注的議題之一。儘管測試所用的資料皆已去識別化,且模型部署在符合聯邦規範的雲端環境,但公衛機構仍持續監控潛在的資料外洩風險。此外,模型偏見問題也引發討論:若訓練資料主要來自特定族群或地區,可能導致模型對其他群體的監測效果不佳。測試團隊表示,將在試點期間定期進行公平性評估,並根據結果調整模型或補充訓練資料。另一項挑戰是模型的「幻覺」現象——即大語言模型可能生成看似合理但實際錯誤的資訊。在公共衛生監測中,錯誤的預警可能造成不必要的恐慌或資源浪費。
為此,測試計畫設計了多重驗證機制,包括交叉比對多個數據源、由專家隨機抽查模型輸出,以及建立錯誤回饋循環,讓模型能從錯誤中學習。這些措施將在十個轄區持續運行至少六個月,以累積足夠的實證數據。目前,這項測試計畫仍在進行中,後續成果將作為評估是否擴大應用的重要參考依據。若初步結果顯示模型在準確度、時效性與公平性上均達到預設標準,美國公共衛生機構不排除在未來兩年內將測試範圍擴展至更多州,甚至納入聯邦層級的監測網路。此外,測試過程中累積的技術規範與操作指南,也將開放給其他國家的公共衛生單位參考,推動全球公共衛生領域的數位轉型。
業界專家分析,這項測試不僅是美國公衛體系數位化的一個里程碑,更可能為大語言模型在高度監管領域的應用建立標竿。由於醫療與公共衛生涉及生命安全與社會穩定,任何技術導入都必須經過嚴謹的實證與風險評估。本次測試的設計與執行方式,將為後續類似計畫提供寶貴的經驗與教訓,影響層面遠超公共衛生本身。總體而言,美國公共衛生機構選擇直接走入實地,以真實數據與真實場景考驗兩大科技巨頭的商業模型,展現了務實與創新的態度。在疫情時代之後,全球各國都在尋找更敏捷、更智慧的監測工具,這項測試的結果無疑將成為各方關注的焦點。
未來若成功整合,大語言模型可望成為公衛人員的得力助手,協助人類更早、更準地掌握疾病動態,進而保護更多民眾的健康與安全。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。