一個Token是怎麼“造”出來的?黃仁勳的“五層蛋糕”理論給出答案

2026年8月25日 21:09
一個Token是怎麼“造”出來的?黃仁勳的“五層蛋糕”理論給出答案
站內 AI 整理稿

大型語言模型每一次回答,背後都涉及數以億計的運算,而這一切最終呈現為一個又一個Token。外界多半只注意到模型「吐出」文字的速度,卻很少追問:這些Token究竟是如何被「造」出來的?NVIDIA創辦人黃仁勳曾經用「五層蛋糕」來拆解AI運算的底層結構,解釋從一塊顯示卡到一個Token之間,究竟經歷了哪些關鍵環節。這個比喻如今已成為理解AI產業鏈的重要框架。所謂Token,是大型語言模型處理文字時的最小單位,可能是一個單字、一部分單詞,甚至一個標點符號。模型接收問題後,會先把輸入內容拆解成Token序列,接著透過神經網路進行推論,逐步預測下一個最可能的Token,再輸出成我們讀到的回答。

整個過程看似一瞬間,實際上是多層軟硬體協作的結果。黃仁勳把這條路徑比喻成蛋糕,用意在於凸顯不同層級各有分工,缺一不可。他提出的「五層蛋糕」理論,大致從最底層的硬體開始堆疊。最基層是實體的GPU與伺服器,這是所有AI運算的物理基礎。沒有足夠的顯示卡與高速記憶體,模型根本無法在合理時間內完成推論。第二層則是系統軟體與運算庫,像是NVIDIA自家的CUDA平台,它讓開發者能夠直接呼叫GPU的運算潛力,把硬體效能轉化為實際可用的算力。這個中間層往往最容易被忽略,卻決定了硬體能被發揮到什麼程度。第三層是深度學習框架,例如PyTorch或TensorFlow。

研究人員在這些框架上撰寫模型架構、定義訓練流程,框架則自動把高階指令翻譯成底層的CUDA呼叫。再往上一層,則是大型語言模型本身,像是GPT系列或其他開源模型。模型透過數以兆計的參數儲存知識,推論時一層層神經網路對輸入Token進行運算,輸出下一個Token的機率分布。愈大的模型,往往需要愈多算力來支撐每一次回答。最頂層則是應用與使用者介面,涵蓋聊天機器人、文件摘要工具、程式碼助手等產品。使用者只看到對話框與文字輸出,但每一次互動都由底下四層共同完成。黃仁勳用蛋糕來形容,正是要傳達一個核心概念:AI不是單靠晶片就夠了,也不是單靠模型就夠了,而是需要一整套垂直整合的層級分工。

任何一層出現瓶頸,最終都會反映在Token的產出速度與品質上。這個理論也解釋了為什麼NVIDIA近年來積極投入資料中心整合方案,而不只滿足於銷售GPU晶片。當GPU效能持續提升,真正決定AI服務體驗的關鍵,往往在於系統軟體、網路架構、儲存與模型部署的協同效率。黃仁勳反覆強調「買越多,省越多」,背後的邏輯正是基於五層蛋糕的整體性思維:單獨更換某一層硬體,未必能帶來等比例的速度提升,唯有全棧同步優化,才能讓每個Token既快又準地被生成。從產業角度來看,五層蛋糕理論也勾勒出AI供應鏈的權力分布。

NVIDIA同時掌握GPU硬體與CUDA軟體生態,等於把持了最底層兩塊關鍵領域;而雲端服務商則佔據了基礎設施與佈署層級;模型公司專注於演算法與參數調整;應用開發者則在頂層直接面對終端用戶。各方在不同層級各據山頭,但也都需要依賴其他層級的配合,彼此之間既有合作,也存在激烈博弈。值得注意的是,五層之間的界線並非一成不變。近年來出現的「推理時擴展」技術,讓模型在回答前可以進行多次內部思考,消耗更多算力來換取更精準的結果;同時,開源框架與輕量化模型也不斷出現,試圖把更高層級的能力下放到更低的硬體門檻。

黃仁勳的模型雖然看似簡單,卻提供了一個動態框架,讓業界可以清楚定位每一次技術演進究竟發生在哪一層,以及它會如何影響Token的生成成本與體驗。回到最根本的問題:一個Token到底是怎麼被造出來的?答案是:它既來自GPU晶片的電晶體運算,也來自CUDA的指令解析,來自模型參數的權重調整,也來自應用層介面的流暢設計。黃仁勳的「五層蛋糕」把這些看似遙遠的技術環節串聯成一條清晰的路徑,讓外界得以理解AI時代背後看不見的基礎工程。每一次對話框冒出文字,都是整座蛋糕堆疊的結果。

Related

相關文章

OpenAI「親兒子」反水,認中國模型做「賽博義父」

OpenAI 自家陣營突然出現「內鬼」?近日科技圈最熱的話題,莫過於被外界戲稱為 OpenAI「親兒子」的產品,竟在關鍵時刻選擇與中國 AI 模型深度綁定,甚至被網友調侃是認了中國模型做「賽博義父」。這起看似「反水」的事件,瞬間點燃了關於全球 AI 生態系、開源與閉源路線之爭,以及地緣政治對技術選擇影響的激烈討論。 這款被視為 OpenAI 陣營嫡系成員的產品,過往一直被認為會優先採用自家母公司最前沿的模型技術。

剛剛

50位院士、14場平行會議:科學智能的“中國主場”為什麼是北京?

(公眾號:zhidxcom) 作者 | 王涵 編輯 | 漠影 “這是中國科技創新史上最好的機會,沒有之一。” 在2026科學智能大會現場,北京大學數學科學學院講席教授、北京科學智能研究院學術委員會主任、中國科學院院士鄂維南在與包括在內的媒體交流時說了這樣一句話。 他說,這句話他從2017年就開始醞釀,思索了5年,直到2022年才真正說出口。“沒有之一”四個字,是他反覆確認的結論。 ▲鄂維南 2026年8月22日下午,2026科學智能大會落下帷幕。

剛剛

衝刺“全球視頻大模型第一股”,每經獨家透視可靈AI:客戶都在哪?運營狀況如何?

衝刺“全球視頻大模型第一股”,每經獨家透視可靈AI:客戶都在哪? 」學修機器人的學員開始懊悔:無單可接,零件難求,只能修修掃地機1小時前搶跑北京東四環! 中建智地聯手太古地產瞄準75億元高價地1小時前閱讀更多內容,狠戳這裡查看AI測評可靈AIMiniMax選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇去巴西吧,找一個未來“未來之國”不相信快錢。

剛剛

估值暴漲570億,三個80後幹出AI獨角獸:突然賣身

鉛筆道·2026年08月25日 20:45全球最大的開源AI社區正在尋找買家。全球最大的開源AI社區正在尋找買家。8月24日,美國《商業內幕》報道稱,全球最大的開源AI社區Hugging Face正在評估整體出售,潛在估值至少130億美元(約合人民幣874億元)。

剛剛

大批博主停更上熱搜,靠AI搞錢已經越來越難

近期,大批部落客無預警停更的消息接連登上微博熱搜,引發外界對於「靠AI搞錢」這條捷徑是否已經走到盡頭的討論。過去一年,隨著生成式AI工具快速普及,大量創作者利用AI生成文章、影片、圖片,甚至虛擬人直播,試圖以低成本、高產出的方式在各大平台變現。然而,這股風潮似乎正在退燒,越來越多內容創作者選擇默默退出,背後原因值得深思。 這些停更的博主當中,不少人過去以「AI代寫」、「AI繪畫」、「AI剪輯」等教學或服務為主要營收來源。他們透過社群平台吸引流量,再販售課程、工具代理或代客製作服務。

剛剛

Ilya交卷,黃仁勳砸50億押注SSI,首個模型疑本週發佈

AI 領域今日接連傳出多項重磅消息,涵蓋人才動向、投資佈局與技術突破,成為市場關注焦點。其中最受矚目的,莫過於 Ilya Sutskever 交出了離開 OpenAI 後的首張成績單——他所創辦的 Safe Superintelligence Inc.(SSI)獲得 NVIDIA 創辦人黃仁勳高達 50 億美元的資金押注,且 SSI 的首個 AI 模型預定於本週內發布,引發業界對安全超級智能發展路線的熱烈討論。

剛剛