何夕2077生成式AI

美國公衛測試雙巨頭模型

2026年7月21日 00:00

重點摘要

美國公衛測試雙巨頭模型。 公共衛生機構已經開始測試商業大模型。這次項目將覆蓋美國範圍內的十個轄區。公衛模型測試報道披露了目前的進展。醫療機構🏥希望用大模型提升監測效率。對個人隱私的審核工作仍然需要進一步規範。

站內 AI 整理稿

美國公共衛生機構近日正式宣布啟動一項全新測試計畫,針對兩大科技巨頭所開發的商業大模型進行實地部署與評估,試點範圍涵蓋全美十個轄區。這項被視為前瞻性嘗試的計畫,旨在探索大型語言模型如何融入現有的公共衛生監測體系,進一步提升數據處理效率與疫情應變能力。據了解,相關單位已在初步階段對外揭露部分進展,顯示這項測試已從概念驗證邁入實際營運階段。公共衛生監測系統長期以來仰賴人工通報、實驗室檢測與流行病學調查,雖然基礎紮實,但在面對大規模傳染病爆發或新興病原體威脅時,即時數據整合與分析往往成為瓶頸。

近年來,大型語言模型在自然語言處理、文本分類與趨勢預測等領域展現出驚人潛力,促使公衛主管機關開始思考如何將這類工具導入日常監測作業。這項測試計畫的核心目標,正是希望藉助大模型的技術優勢,突破傳統系統的時效限制,加速從數據蒐集到決策警示的整個流程。據悉,本次測試選定的兩家科技巨頭,其商業大模型已在醫療保健、生物醫學文獻檢索等領域累積一定應用經驗,因此被納入實地評估對象。試點區域涵蓋都市與鄉村、不同人口結構與公共衛生資源分布,以確保測試結果具有足夠的代表性與可推廣性。

相關機構透露,已開始將模型部署於部分轄區的監測後台,讓模型定期處理來自醫院、診所與實驗室的匿名通報資料,並嘗試自動生成風險摘要與初步預警建議。在初步階段,測試團隊已揭露部分進展:模型在識別異常症狀集群、分類非結構化報告文本,以及比對歷史疫情模式等任務上,表現出超越傳統規則式系統的靈活性與準確度。不過,相關官員也強調,目前仍處於「人類在迴圈中」的監督模式,所有模型輸出都須經由公衛專家審核後,才能正式納入監測報告或發布警報。這項設計旨在避免黑箱決策帶來的風險,同時累積模型與專業人員協作的最佳實務。醫療機構對這項測試寄予高度期待。

多位醫院管理層與感染控制專家指出,若能成功將大模型整合進現有的監測流程,將可顯著強化數據分析能力的深度與廣度,並大幅縮短從資料出現到預警發布的時間差。例如,在季節性流感或新興呼吸道病毒流行期間,模型能即時處理急診就診量、實驗室陽性率與藥局銷售數據,提前數天預測疫情高峰,讓醫療資源調度更從容。此外,醫療機構特別關注模型在語言理解與跨語境整合方面的潛力。美國公共衛生系統經常需要處理來自不同語系、不同書寫習慣的報告,傳統關鍵字搜尋與人工分類耗時費力,而大語言模型的多語言能力與上下文理解能力,被認為能有效降低資訊遺漏率。

幾家參與試點的大型醫院已開始提供內部回饋,協助調整模型對特定醫學術語與縮寫的辨識準確度。當然,這項測試並非沒有挑戰。數據隱私與安全是最受關注的議題之一。儘管測試所用的資料皆已去識別化,且模型部署在符合聯邦規範的雲端環境,但公衛機構仍持續監控潛在的資料外洩風險。此外,模型偏見問題也引發討論:若訓練資料主要來自特定族群或地區,可能導致模型對其他群體的監測效果不佳。測試團隊表示,將在試點期間定期進行公平性評估,並根據結果調整模型或補充訓練資料。另一項挑戰是模型的「幻覺」現象——即大語言模型可能生成看似合理但實際錯誤的資訊。在公共衛生監測中,錯誤的預警可能造成不必要的恐慌或資源浪費。

為此,測試計畫設計了多重驗證機制,包括交叉比對多個數據源、由專家隨機抽查模型輸出,以及建立錯誤回饋循環,讓模型能從錯誤中學習。這些措施將在十個轄區持續運行至少六個月,以累積足夠的實證數據。目前,這項測試計畫仍在進行中,後續成果將作為評估是否擴大應用的重要參考依據。若初步結果顯示模型在準確度、時效性與公平性上均達到預設標準,美國公共衛生機構不排除在未來兩年內將測試範圍擴展至更多州,甚至納入聯邦層級的監測網路。此外,測試過程中累積的技術規範與操作指南,也將開放給其他國家的公共衛生單位參考,推動全球公共衛生領域的數位轉型。

業界專家分析,這項測試不僅是美國公衛體系數位化的一個里程碑,更可能為大語言模型在高度監管領域的應用建立標竿。由於醫療與公共衛生涉及生命安全與社會穩定,任何技術導入都必須經過嚴謹的實證與風險評估。本次測試的設計與執行方式,將為後續類似計畫提供寶貴的經驗與教訓,影響層面遠超公共衛生本身。總體而言,美國公共衛生機構選擇直接走入實地,以真實數據與真實場景考驗兩大科技巨頭的商業模型,展現了務實與創新的態度。在疫情時代之後,全球各國都在尋找更敏捷、更智慧的監測工具,這項測試的結果無疑將成為各方關注的焦點。

未來若成功整合,大語言模型可望成為公衛人員的得力助手,協助人類更早、更準地掌握疾病動態,進而保護更多民眾的健康與安全。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

40 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前