如何讓大語言模型思考得更準確

重點摘要
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。
2026年7月,一家三甲醫院的信息科主任帶著滿臉困惑找上門來。他們用GPT-4建置了一套輔助診斷系統,測試階段準確率表現亮眼,不料上線僅兩週,ICU主任就氣得拍桌——AI系統竟然建議一名血鉀偏高的患者補充鉀離子。問題出在哪?模型看到「患者乏力」與「心電圖異常」兩項線索,便依照統計機率聯想到低血鉀症,完全忽略了同一張檢驗單上清楚標示的血鉀數值高達6.2 mmol/L。這不是AI不會思考,而是它思考的方式出了根本性的問題。 大語言模型的本質,說穿了就是一個巨大的機率生成器。它根據訓練資料中詞彙與句子的關聯強度,逐字逐句推測最可能出現的下一個字詞。當面對邏輯推理、因果判斷或需要多步驟驗證的任務時,這種「聯想式」的生成機制便容易產生看似合理、實則錯誤的結論。史丹佛大學2026年AI指數報告指出,即便在最先進的模型中,複雜專業領域的幻覺發生率仍高達15%至30%。換句話說,每十次回答,就可能有一到三次是「一本正經地胡說八道」。 要讓大語言模型思考得更準確,首先必須承認它的侷限,並從架構與方法上進行補強。業界已經累積出多種對策,可歸納為「四把鑰匙」與「三道防線」。所謂四把鑰匙,指的是四種能夠提升模型推理品質的技術路徑,分別是思維鏈提示(Chain-of-Thought, CoT)、自我一致性(Self-Consistency)、反思機制(Reflection)以及外部工具整合。這些方法並非取代模型原有的生成能力,而是引導模型按照更嚴謹的步驟進行思考。 思維鏈提示是最基礎也最廣泛應用的一種做法。它要求模型在給出最終答案之前,先逐步寫出推理過程,就像解數學題時必須列出算式一樣。研究顯示,只要在提示詞中加入「請一步一步思考」這句話,就能顯著降低多步驟推理任務的錯誤率。然而,這並不保證每一步都正確,因此需要搭配其他機制來交叉驗證。 自我一致性則是從機率角度出發的補強策略。讓模型針對同一個問題生成多條不同的思維鏈,然後比對這些路徑最終收斂的答案,選取出現頻率最高的結果作為最終輸出。這種集體投票的概念,可以有效過濾掉單一路徑上偶然發生的錯誤推論。實務上,只要生成三到五條思維鏈,就能讓準確率明顯提升。 反思機制更進一步,要求模型在產生初步答案後,自行回頭檢查推理過程是否有漏洞或矛盾。這類似人類的「覆盤」行為,模型可以針對自己的回答提出質疑,並修正其中不合理之處。目前已有不少研究團隊設計出專門的反思提示模板,讓模型能夠在對話中迭代改進,最終產出更可靠的結果。 外部工具整合則是把模型不擅長的計算、查詢、比對等工作交給專用工具。例如,當模型需要進行數學運算或搜尋最新資料時,可以讓它呼叫計算機、搜尋引擎或資料庫,而不是憑記憶推算。這種「腦手分離」的架構,使模型專注於語言理解與推理,而將精確性要求高的任務分流給可靠的外部系統。 三道防線則是在系統層面建立防護網,確保即使模型內部出現錯誤,也不至於直接影響最終決策。第一道防線是輸入清洗與提問設計,也就是在問題送入模型前,先過濾掉模糊、矛盾或可能誘導幻覺的表述,並以結構化的方式拆解複雜任務。第二道防線是輸出驗證,模型生成答案後,由另一套規則引擎或較小的驗證模型進行合理性檢查,例如對比已知事實、檢查數值單位是否一致。第三道防線則是人機協作,在關鍵決策點保留人類審核環節,尤其在高風險領域如醫療、金融、法律,系統只能給出建議,最終決定權必須交給專業人士。 從CoT到推理模型,這條路徑反映了業界對大語言模型能力邊界的認知深化。早期的提示工程側重於如何問問題,後來逐漸發展出專門的推理模型,這些模型在訓練階段就針對邏輯推理任務進行強化,例如OpenAI的o1系列、Google的Gemini Thinking等。它們透過大量合成資料與獎勵模型,學習如何在內部生成更長的思考鏈,並在推理過程中自動進行自我校驗。 不過,即便有了這些技術,模型仍然無法完全消除幻覺。史丹佛大學的報告特別強調,幻覺在半數以上的案例中來自訓練資料的偏差或缺失,而非推理過程的失誤。這意味著,單純靠方法論優化是不夠的,資料品質與領域知識的注入同樣關鍵。一些先進團隊開始嘗試將領域專家知識庫以向量嵌入的方式整合進模型推理流程,讓模型在思考時能夠隨時查閱權威來源,而非只依賴參數記憶。 回到醫院的案例,如果當時的輔助診斷系統採用了上述任一方法,結果可能截然不同。例如,若系統在建議補鉀前先自我提問:「患者的血鉀數值是多少?」並將這個數值與標準範圍比對,就能立刻發現矛盾。又或者,讓模型同時生成多條推理路徑,其中一條會因為偵測到高血鉀而排除補鉀方案,最終透過多數決避免錯誤。這些看似簡單的防護,正是當前AI落地應用中最容易被忽略的環節。 大語言模型的思考方式正在從「猜答案」轉向「想答案」,而這一切的核心,是讓它學會像人類一樣建立假設、驗證矛盾、修正錯誤。雖然距離真正可靠的推理還有距離,但至少我們已經有了方向,也開始有了工具。未來的發展,或許會讓AI從「偶爾出錯的助手」逐步進化為「可信任的協作者」,而這正是每一位開發者與使用者共同的期待。
Related
相關文章

小紅書、B站、知乎“暗戰”WAIC
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作小紅書、B站、知乎“暗戰”WAICAI價值官·2026年07月24日 16:38三家內容平臺WAIC卡位AI原生開發者生態 2026年的WAIC,算力、大模型、AI硬件、具身智能無疑是絕對焦點,行業比拼仍圍繞技術參數、基建投入與工程落地能力展開,延續著過去幾年AI行業的核心敘事。 但在這條主線之外,還有一條容易被忽略的脈絡暗線——內容平臺正集體下場,成為WAIC不容忽視的玩家。從黑客松作品展示,到開發者專屬論壇,再到AI創作公開賽成果亮相,小紅書、B站、知乎不約而同地將AI原生Builder推到臺前。 這並非巧合。本屆WAIC首次增設OPC一人公司專區,本身就釋放出明確信號:當大模型能力逐步趨同,應用落地的創造力正在向中小團隊、超級個體下沉。而三家平臺本就是國內AI內容消費、學習交流與Vibe Coding作品展示的主陣地,手握龐大的創作者儲備與需求場景,天然承接了這股個體創造的浪潮。 當AI持續拉低開發門檻,內容平臺也迎來跳出傳統內容賽道的契機。依託社區沉澱的需求場景、創意供給與用戶反饋機制,小紅書、B站正在順著創作者生態向上滲透,打通創意發現、項目孵化、商業化服務的全鏈條完整路徑,從單純的內容分發渠道,向AI應

Kimi衝上3300億,揭秘楊植麟和他的萬億模型
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道安徽最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作Kimi衝上3300億,揭秘楊植麟和他的萬億模型中國企業家雜誌·2026年07月24日 16:34中國大模型,拿回定價權。 7月16日晚9點,距離WAIC(世界人工智能大會)開幕不到24小時,月之暗面(Kimi)突然“空降”發佈Kimi K3,搶走了最大的焦點。 Kimi K3最具顛覆性的標籤,是其2.8萬億的參數規模。作為全球首款萬億級開源大模型,K3支持100萬Token上下文窗口,在多項主流測評中得分超過了GPT-5.6、Fable 5。不少AI一線從業者評論:在全模態、長上下文、複雜的任務場景裡,Kimi K3在國內斷層式領先。 與之配套的定價策略同樣引發熱議。Kimi K3未緩存輸入20元/百萬Token、輸出100元/百萬Token,位列國產模型最貴一檔——比DeepSeek V4 Pro貴20倍;是海外模型Fable 5價格的30%、GPT-5.6 Sol的60%。 高盛在研報中給出定性:“這標誌著中國模型走向定價權的全新節點。” “Impressive(令人印象深刻)。”馬斯克在X上為K3點贊。隨後,他在預熱Grok 4.5時喊話:“有望超過Kimi。”對此,月之暗面聯合企業業務負責人黃震昕7月21

677億,全球大模型“二道販子”要賣身了
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道安徽最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作677億,全球大模型“二道販子”要賣身了智東西·2026年07月24日 16:25多模型策略催生“路由層”價值。 智東西7月24日報道,今天,據《華爾街日報》報道,美國金融科技公司Stripe正洽談收購頂流大模型中轉站OpenRouter。目前,交易的具體價格尚不清楚,但部分知情人士稱,這筆交易估值可能達到約100億美元(約合人民幣677.55億元)。 知情人士補充說,還有多家大型科技公司也在考慮收購OpenRouter。Stripe與OpenRouter的交易可能很快宣佈,但談判仍可能破裂,也可能出現其他競購者。 OpenRouter成立於2023年,由Alex Atallah、Louis Vichy聯合創立,總部位於美國舊金山。該公司CEO Alex Atallah曾創辦全球最大NFT平臺OpenSea,並在泡沫破裂前退出,轉行AI賽道。 OpenRouter屬於AI基礎設施領域的一個新興賽道——大模型中轉站,其本質是一個模型路由器或模型聚合平臺。 ▲OpenRouter官網 具體來說,OpenRouter的平臺接入了400多個大語言模型,既包括OpenAI的GPT系列、Anthropic的Claude系列等閉

海外收入超90%,萬興科技為何要回國"卷"?|WAIC2026
海外收入超90%,萬興科技為何要回國"卷"?|WAIC2026出海參考2026.07.24 16:35 · 來自廣東全文3140字00:00 / 09:16出海企業進入“雙循環”策略後,萬興科技下探模型邊界外的機遇,計劃靠算力投資打開OPC創作者市場。AI生成圖片“國內市場再卷,我們也一定要來,就是為了把萬興的部隊訓練得更有戰鬥力。”在2026世界人工智能大會(WAIC)西岸會展中心,萬興科技創始人兼董事長吳太兵對出海參考說到。作為23年的出海老兵,萬興科技海外收入長期佔比超過90%,這次回身國內首次參加世界人工智能大會,背後是AI短劇賽道快速變熱的產業現實。中國網絡視聽協會數據顯示,2026年一季度,全行業上線微短劇約12.8萬部,其中AI短劇佔比超95%。另據Omdia研究表明,2025年全球微短劇收入達到110 億美元,預計2026 年將達到140 億美元。AI短劇將成為短劇全球化的最大增量。視頻公司和技術廠商紛紛嗅到機會。愛奇藝、騰訊視頻、芒果TV等長視頻平臺加速將AI內容納入核心策略;字節跳動Seedance、快手可靈、生數科技Vidu、商湯Seko等視頻生成模型切入基礎設施層;騰訊雲、阿里雲、火山引擎、百度、360、科大訊飛紛紛入局AI短劇製作的應用層,LibTV、ELSER.AI、有戲AI等AI原生團隊也進入AI短劇製作領域。在整個AI短劇漫劇產業鏈中,AI影視創作應用成為競爭最密集的地帶,這也成為吳太兵所說的“練兵場”。萬興科技的策略可以概括為“中國市場練兵,全球市場掙錢”,在國內最卷的賽道中練兵,再帶著這套習得後的體系化能力回到全球市場。近年來,不少以海外市場為主的出海企業走向“海內外雙向循環”,開始向國內市場找增量。影石2015年成立後,先從歐美市場做起再轉身國內;安克創新完成A股上市後,成立單獨的中國團隊;Plaud則在海外市場驗證產品後,再上線國內市

模型越來越強之後,Infra將被AI接管?
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作模型越來越強之後,Infra將被AI接管?極客邦科技InfoQ·2026年07月24日 16:21在異構與異步的新浪潮下,AI Infra 走向更高層次。 模型的架構正在以超出工具鏈進化速度的方式膨脹,與此同時,國產算力的崛起讓異構管理從可選項變成了必答題。那麼,推理工程核心挑戰如何破局?AI Infra 下一階段技術演進方向在哪裡? 近日,InfoQ《極客有約》X AICon 直播欄目特別邀請華為 AI 開源生態總監黃之鵬擔任主持人,和Inferact vLLM committer 莫梓峰、範式智能(第四範式)系統研發專家楊守仁一起,在 AICon全球人工智能開發與應用大會(https://aicon.infoq.cn/2026/shanghai/track)2026 深圳站 即將召開之際,共同探討 AI 基礎設施從“可用”走向“高效可規模化”的關鍵路徑。 部分精彩觀點如下: 龍蝦、Hermes 等 agent 開源項目,本質上就是把 CPU 的時鐘借過來,讓 Agent 有一個時間概念,但大模型本身還是沒有時間概念。 軟件工程屎山這個事情是所有人逃不開的,但現在可能確實有可能會逆轉,軟件不用越做越麻煩,模型的能
