Meet Token Saver: An Open-Source MCP Extension Using Local Hybrid RAG to Cut Claude PDF Token Costs 90-99%
重點摘要
處理大量 PDF 文件時,背後運作的語言模型往往需要耗費可觀的 Token 用量,這也直接反映在帳單上。對於經常使用 Claude 等大型語言模型的開發者與團隊而言,每次處理合約、研究報告或技術文件時,整份文件的完整內容幾乎都被送入模型,Token 費用也因此居高不下。
處理大量 PDF 文件時,背後運作的語言模型往往需要耗費可觀的 Token 用量,這也直接反映在帳單上。對於經常使用 Claude 等大型語言模型的開發者與團隊而言,每次處理合約、研究報告或技術文件時,整份文件的完整內容幾乎都被送入模型,Token 費用也因此居高不下。如今一款名為 Token Saver 的開源擴展工具正式問世,其訴求非常明確:將 Claude 在處理 PDF 時的 Token 成本大幅壓低 90% 至 99%,讓 AI 應用的部署不再因高昂的運算開銷而卻步。
Token Saver 以開源專案的形式釋出,主要設計為符合 Model Context Protocol(MCP)的擴展,能夠無縫整合進現有的 Claude 工作流程。MCP 是一種標準化的通訊協定,負責在 AI 模型與外部工具或資料來源之間建立橋樑,讓模型能夠在可控的範圍內存取所需的資訊。Token Saver 扮演的就是這座橋樑上的過濾器,它不讓 Claude 直接讀取整份 PDF,而是先由本機端進行一次關鍵資訊的擷取與篩選,只把真正需要的段落傳送給模型進行後續生成。這種架構從根本上改變了過去「整本送上」的處理模式,也讓 Token 用量出現跳躍式的下降。
這項工具的核心技術是本地混合檢索增強生成(Hybrid RAG)架構。傳統上,若要讓語言模型回答 PDF 裡的問題,最直接的方式就是將整份文件作為提示(prompt)的一部分送給模型,Token 消耗量因而與檔案大小成正比。Token Saver 的做法則是先在本機端建立文件的索引,並透過混合檢索策略—可能結合關鍵字比對與語意向量檢索—快速找出與使用者提問最相關的段落,再將這些精簡後的上下文送入 Claude。換句話說,模型收到的不再是數百頁的原始文字,而是經過挑選、濃縮且與任務高度相關的內容片段。這種「先檢索、後生成」的流程,所帶來的效益不僅止於 Token 費用的下降。
由於傳送給模型的資料量大幅減少,每次回應的等待時間也有機會同步縮短,同時模型在處理較少不相關資訊的情況下,生成結果的品質與穩定性往往也能獲得提升。對於那些每天需要處理大量文件的企業或研究單位而言,這樣的改善意味著更快的產出與更低的營運成本,整體效率的提升相當有感。就技術親和力而言,Token Saver 的安裝與整合門檻並不高。由於它遵循 MCP 標準,使用者只需要在 Claude 的環境中設定好相應的 MCP 伺服器,便能讓工具開始運作。開源的本質也意味著程式碼完全公開,開發者可以自行檢視其運作邏輯、調整檢索參數,甚至針對特定類型的文件進行最佳化。
這種透明度在 AI 工具鏈中日漸重要,尤其是當成本與資料隱私都成為關鍵考量時,本地端的先行處理也能減少資料外洩的風險,讓敏感文件不必離開使用者的基礎設施。雖然 Token Saver 目前仍屬於早期階段的專案,但其開源社群的潛力不容小覷。工具釋出後,開發者可以實際測試在不同類型 PDF 上的效果,並針對檢索準確率、延遲以及成本削減幅度提供反饋。社群的集體除錯與最佳化,往往能讓專案快速成熟,未來也有望支援更多文件格式,例如 Word 文件、簡報或試算表,甚至進一步擴展到 Claude 以外的語言模型平台,讓更多 AI 應用都能受惠於這種低成本的文件處理策略。
從宏觀角度來看,Token Saver 的出現反映了 AI 產業在成本控管上的迫切需求。隨著模型能力持續提升,應用場景也更加多元,Token 用量與對應的帳單已經成為許多團隊在規劃部署時無法迴避的現實。Token Saver 提供了另一條兼顧效能與開銷的實作路徑,讓開發者不必為了省錢而犧牲模型的回應品質,也不必因為擔心成本過高而放棄使用 AI 處理大量文件的可能性。對於經常與 PDF 檔案打交道的團隊而言,這款工具最大的價值或許不在於那些令人印象深刻的百分比數字,而在於它把選擇權交還給使用者。
過去要處理一份百頁合約,幾乎無可避免要付出對應的 Token 費用;現在則能透過本地端的混合 RAG 機制,主動決定哪些內容才需要動用到模型的理解與生成能力。這種細緻的控制能力,正是許多開發者在追求成本效益時最渴望的。當然,任何工具在初期都會面臨適用範圍與穩定性的考驗。Token Saver 的檢索效果高度依賴索引品質與文件本身的結構,若文件包含大量掃描圖片或非結構化排版,檢索的準確率可能需要進一步調校。但開源社群最大的優勢就在於迭代速度快,這些挑戰反而成為推動專案進化的動力。
可以預見的是,隨著越來越多開發者投入測試與改進,這套工具的適用場景將逐步擴大,不僅限於 PDF,也可能延伸至其他格式或多模態內容。整體而言,Token Saver 為語言模型的文件處理任務提供了一種務實且具體的成本解方。它沒有使用花俏的模型壓縮技術,而是從工作流程著手,透過混合 RAG 將 Token 的浪費降到最低。對於正在摸索如何讓 AI 工具在現實世界中落地,同時又必須緊盯預算的開發者與團隊來說,這無疑是一條值得關注的技術路線。在未來幾個月內,隨著專案持續演化與社群反饋累積,Token Saver 能否成為文件處理領域的標配工具,值得持續觀察。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。