PPIO正式發佈“Fusion融合模型”:用十分之一的價格超越頂級模型的智商

PPIO於8月6日正式推出智能模型網關的全新功能「Fusion融合模型」,這項技術突破傳統API網關僅做請求轉發的框架,將每次模型調用轉化為一場「專家會診」。當用戶發出請求時,網關會將複雜任務同時分配給多個各具專長的模型並行處理,再透過思考編排與交叉驗證,由主模型融合各方意見生成最終答案。這套機制以智能優先、兼顧性價比為核心,透過工程化的融合手段,將回答品質穩定在頭部旗艦模型的水準,同時將成本控制在較低梯隊。在DRACO深度研究基準測試中,PPIO以三個開源模型融合後的評分超越Claude Fable 5,成本卻僅為後者的十分之一,證明智能的提升不再只發生在參數層,也能在調用層實現。
2026年大模型市場進入密集迭代期,Claude、GPT、Kimi、GLM等主流模型幾乎每季都有新版本發布,排行榜頭部位置頻繁更替。對應用開發者而言,可選擇的模型雖然增多,但每個模型都有各自的短板。從評測數據觀察,所有模型能力均存在偏科現象,且偏科方向各不相同,程式碼生成、長文檔理解、數學推理、多語言翻譯等任務,目前沒有一個模型能在所有維度同時領先,排行榜頭部位置按任務類型切分後分屬不同模型。比偏科更難應對的是幻覺問題。模型產生幻覺時無法自我察覺,錯誤答案與正確答案在語氣、格式、流暢度上幾乎沒有差異,模型不會對自己不確定的部分做出標記。
在法律條款解讀、醫療建議、金融合規等場景中,錯誤一旦被採納,糾錯成本遠高於重新生成一次答案,而單一模型架構下不存在第二個視角來攔截錯誤。偏科與幻覺的根源在於單一模型對同一問題只有一條推理路徑,而複雜問題往往存在多個切入角度,單一路徑的遺漏必須透過引入另一條獨立路徑才能被發現與補齊。這些限制在Agent場景中的代價尤其顯著。Agent逐步執行任務,步驟之間存在依賴關係,一旦某個關鍵步驟因偏科、幻覺或視角遺漏而出錯,後續整條鏈路便會跟著走偏,產生的返工成本包含錯誤之後所有步驟消耗的Token。
模型數量持續增加、迭代速度不斷加快,但單一模型的這三項限制不會因為更換新模型而消失,它們屬於架構層面的問題,需要在架構層面解決。Fusion融合模型正是為解決上述問題而設計。用戶只需發送一次請求,網關便會在內部組織多個模型各自獨立作答,再將這些答案經過篩選與融合後回傳一份最終回覆。市面上常見的API網關僅做轉發,請求進入後選一條線路送出,網關本身不改變答案品質。PPIO智能模型網關在轉發之外增加了一層編排,讓多個模型的產出在返回前經過比對與融合,因此網關本身成為智能增量的來源。一次完整的Fusion融合模型調用,在網關內部依序執行四個步驟。
首先是請求分發,網關將問題同時發送給多個參考模型;接著是並行作答,各模型獨立運作互不干擾;第三步是思考編排,提取共識、標記分歧、排除錯誤,同時壓縮上下文;最後是融合作答,由主模型基於整理後的多方論證生成最終回覆。其中第三步決定融合品質的關鍵,多個模型給出一致結論的地方互相印證,降低偏科帶來的盲區;出現衝突的地方被標記出來進一步推敲,為攔截幻覺提供第二視角;不同推理路徑彙總後,覆蓋面大於任何一條單獨路徑,補齊單模型視角遺漏的部分。經過這一步整理,主模型定稿時面對的資訊量遠大於原始問題本身,因此融合結果的品質高於其中任何一個參考模型的單獨作答。
由於多個模型同時執行,等待時間取決於最慢的一個,不會隨模型數量線性增長,因此引入更多視角並不會造成延遲成倍增加。同時,當某個模型調用失敗時,網關會跳過該模型繼續完成融合,多路徑結構反而讓整條鏈路比單模型調用更穩定。在Agent的多輪交互中,同一回合內已獲得的參考結果會被複用,避免重複消耗Token,因此實際成本增幅遠低於「調用了多個模型」的直覺判斷。每次調用經過的模型、消耗的Token、耗時與成本全部留痕可查,使智能水平的變化可度量、可追溯。在DRACO深度研究基準測試中,這套評估AI智能體執行複雜深度研究任務能力的標準下,PPIO以Kimi K3、GLM 5.
2、MiniMax M3為參考模型,DeepSeek V4 Flash為融合主模型進行融合模型推理,最終獲得57.34分,超越Claude Fable 5的55.14分;總成本僅為57.59元,約為Claude Fable 5所需566元的十分之一。值得注意的是,參與融合的三個模型單獨拿出都不是各自賽道的榜首,性能提升的部分完全來自編排層的組織方式,這說明智能增量可以來自調用層的組織方式,不必全部依賴基座模型的參數規模。在2026年世界人工智能大會期間,PPIO聯合創始人兼CEO姚欣提出了Agent時代的核心公式:Agent生產力等於Token智能密度乘以Agent Loop時長。
Token智能密度決定Agent每一步決策的品質上限,Agent Loop時長則決定它能持續運行多久、完成多複雜的任務。過去提升Token智能密度只能被動等待下一代模型發布,但現在模型的選擇權掌握在使用者手中,沒有人會被綁死在某一個模型上。PPIO Fusion融合模型在調用層做編排以提升智能密度,讓用戶無感實現智能的提升。Agent的使用方式與人類差異很大,人類偶爾提問,Agent則高頻調用工具、長上下文持續交互、多模型協同,對延遲、穩定性和成本的敏感度遠高於傳統場景。執行主體從人換成Agent,模型的服務對象也隨之重構。
這套能力在規模上已獲得驗證,截至2026年6月,PPIO日均Token調用量超過1.2兆,較2025年同期成長超過8倍。根據灼識諮詢統計,在中國獨立AI雲端運算服務提供者中,PPIO日均Token消耗量排名第一。今年PPIO入選中國信通院首批「企業級Token服務效能攀登基線」,在通用場景下達成TPS大於等於55個每秒、TTFT小於等於0.9秒、調用成功率大於等於99.9%的指標。讓大模型從「用得起」走向「用得聰明」,讓大模型從「單一智能」走向「融合智能」,這是PPIO智能模型網關正在做的事。
透過在調用層引入多模型協同與交叉驗證機制,Fusion融合模型為Agent時代的應用開發者提供了一條兼顧品質與成本的新路徑,也為大模型服務的演進方向提供了新的思考框架。
Related
相關文章

一文看懂昇騰超節點:AI Infra已進入系統工程階段
(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。
AWS Strands Agents 團隊發布 Strands Harness:開源代理框架,Token 成本降低 28%,準確度相當
Many developers find that an agent idea works inside Claude Code or Codex, then struggles once they rebuild it with their own loop. The Strands Agents team at AWS is targeting that gap with Strands harness, a fully assembled, general-purpose agent harness.

OpenAI自曝6起事故:AI安全的第一份"審計報告"由誰簽字?
舒澤品牌手記2026.09.21 18:11 · 來自浙江全文4308字00:00 / 12:47當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。文 | 舒澤品牌手記9月16日,OpenAI在官網掛出6份模型異常行為報告。

Gemini"越獄"入侵三家企業:谷歌壓了兩個月,四巨頭栽在同一家35人公司手裡
AI唱反調2026.09.21 18:02 · 來自北京全文2381字四起事故連起來看,真正的主角已經不是某一家模型,而是整個行業的安全評測體系。文 | AI唱反調AI圈最魔幻的劇情出現了:OpenAI、Anthropic、Meta、谷歌,四巨頭的模型越獄事故,測試方是同一家公司。

Anew labs,“蒸餾”的行家
醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上
Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。