PPIO正式發佈“Fusion融合模型”:用十分之一的價格超越頂級模型的智商

PPIO於8月6日正式推出智能模型網關的全新功能「Fusion融合模型」,這項技術突破傳統API網關僅做請求轉發的框架,將每次模型調用轉化為一場「專家會診」。當用戶發出請求時,網關會將複雜任務同時分配給多個各具專長的模型並行處理,再透過思考編排與交叉驗證,由主模型融合各方意見生成最終答案。這套機制以智能優先、兼顧性價比為核心,透過工程化的融合手段,將回答品質穩定在頭部旗艦模型的水準,同時將成本控制在較低梯隊。在DRACO深度研究基準測試中,PPIO以三個開源模型融合後的評分超越Claude Fable 5,成本卻僅為後者的十分之一,證明智能的提升不再只發生在參數層,也能在調用層實現。
2026年大模型市場進入密集迭代期,Claude、GPT、Kimi、GLM等主流模型幾乎每季都有新版本發布,排行榜頭部位置頻繁更替。對應用開發者而言,可選擇的模型雖然增多,但每個模型都有各自的短板。從評測數據觀察,所有模型能力均存在偏科現象,且偏科方向各不相同,程式碼生成、長文檔理解、數學推理、多語言翻譯等任務,目前沒有一個模型能在所有維度同時領先,排行榜頭部位置按任務類型切分後分屬不同模型。比偏科更難應對的是幻覺問題。模型產生幻覺時無法自我察覺,錯誤答案與正確答案在語氣、格式、流暢度上幾乎沒有差異,模型不會對自己不確定的部分做出標記。
在法律條款解讀、醫療建議、金融合規等場景中,錯誤一旦被採納,糾錯成本遠高於重新生成一次答案,而單一模型架構下不存在第二個視角來攔截錯誤。偏科與幻覺的根源在於單一模型對同一問題只有一條推理路徑,而複雜問題往往存在多個切入角度,單一路徑的遺漏必須透過引入另一條獨立路徑才能被發現與補齊。這些限制在Agent場景中的代價尤其顯著。Agent逐步執行任務,步驟之間存在依賴關係,一旦某個關鍵步驟因偏科、幻覺或視角遺漏而出錯,後續整條鏈路便會跟著走偏,產生的返工成本包含錯誤之後所有步驟消耗的Token。
模型數量持續增加、迭代速度不斷加快,但單一模型的這三項限制不會因為更換新模型而消失,它們屬於架構層面的問題,需要在架構層面解決。Fusion融合模型正是為解決上述問題而設計。用戶只需發送一次請求,網關便會在內部組織多個模型各自獨立作答,再將這些答案經過篩選與融合後回傳一份最終回覆。市面上常見的API網關僅做轉發,請求進入後選一條線路送出,網關本身不改變答案品質。PPIO智能模型網關在轉發之外增加了一層編排,讓多個模型的產出在返回前經過比對與融合,因此網關本身成為智能增量的來源。一次完整的Fusion融合模型調用,在網關內部依序執行四個步驟。
首先是請求分發,網關將問題同時發送給多個參考模型;接著是並行作答,各模型獨立運作互不干擾;第三步是思考編排,提取共識、標記分歧、排除錯誤,同時壓縮上下文;最後是融合作答,由主模型基於整理後的多方論證生成最終回覆。其中第三步決定融合品質的關鍵,多個模型給出一致結論的地方互相印證,降低偏科帶來的盲區;出現衝突的地方被標記出來進一步推敲,為攔截幻覺提供第二視角;不同推理路徑彙總後,覆蓋面大於任何一條單獨路徑,補齊單模型視角遺漏的部分。經過這一步整理,主模型定稿時面對的資訊量遠大於原始問題本身,因此融合結果的品質高於其中任何一個參考模型的單獨作答。
由於多個模型同時執行,等待時間取決於最慢的一個,不會隨模型數量線性增長,因此引入更多視角並不會造成延遲成倍增加。同時,當某個模型調用失敗時,網關會跳過該模型繼續完成融合,多路徑結構反而讓整條鏈路比單模型調用更穩定。在Agent的多輪交互中,同一回合內已獲得的參考結果會被複用,避免重複消耗Token,因此實際成本增幅遠低於「調用了多個模型」的直覺判斷。每次調用經過的模型、消耗的Token、耗時與成本全部留痕可查,使智能水平的變化可度量、可追溯。在DRACO深度研究基準測試中,這套評估AI智能體執行複雜深度研究任務能力的標準下,PPIO以Kimi K3、GLM 5.
2、MiniMax M3為參考模型,DeepSeek V4 Flash為融合主模型進行融合模型推理,最終獲得57.34分,超越Claude Fable 5的55.14分;總成本僅為57.59元,約為Claude Fable 5所需566元的十分之一。值得注意的是,參與融合的三個模型單獨拿出都不是各自賽道的榜首,性能提升的部分完全來自編排層的組織方式,這說明智能增量可以來自調用層的組織方式,不必全部依賴基座模型的參數規模。在2026年世界人工智能大會期間,PPIO聯合創始人兼CEO姚欣提出了Agent時代的核心公式:Agent生產力等於Token智能密度乘以Agent Loop時長。
Token智能密度決定Agent每一步決策的品質上限,Agent Loop時長則決定它能持續運行多久、完成多複雜的任務。過去提升Token智能密度只能被動等待下一代模型發布,但現在模型的選擇權掌握在使用者手中,沒有人會被綁死在某一個模型上。PPIO Fusion融合模型在調用層做編排以提升智能密度,讓用戶無感實現智能的提升。Agent的使用方式與人類差異很大,人類偶爾提問,Agent則高頻調用工具、長上下文持續交互、多模型協同,對延遲、穩定性和成本的敏感度遠高於傳統場景。執行主體從人換成Agent,模型的服務對象也隨之重構。
這套能力在規模上已獲得驗證,截至2026年6月,PPIO日均Token調用量超過1.2兆,較2025年同期成長超過8倍。根據灼識諮詢統計,在中國獨立AI雲端運算服務提供者中,PPIO日均Token消耗量排名第一。今年PPIO入選中國信通院首批「企業級Token服務效能攀登基線」,在通用場景下達成TPS大於等於55個每秒、TTFT小於等於0.9秒、調用成功率大於等於99.9%的指標。讓大模型從「用得起」走向「用得聰明」,讓大模型從「單一智能」走向「融合智能」,這是PPIO智能模型網關正在做的事。
透過在調用層引入多模型協同與交叉驗證機制,Fusion融合模型為Agent時代的應用開發者提供了一條兼顧品質與成本的新路徑,也為大模型服務的演進方向提供了新的思考框架。
Related
相關文章

一文看懂昇騰超節點:AI Infra已進入系統工程階段
(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。

OpenAI自曝6起事故:AI安全的第一份"審計報告"由誰簽字?
舒澤品牌手記2026.09.21 18:11 · 來自浙江全文4308字00:00 / 12:47當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。文 | 舒澤品牌手記9月16日,OpenAI在官網掛出6份模型異常行為報告。

Gemini"越獄"入侵三家企業:谷歌壓了兩個月,四巨頭栽在同一家35人公司手裡
AI唱反調2026.09.21 18:02 · 來自北京全文2381字四起事故連起來看,真正的主角已經不是某一家模型,而是整個行業的安全評測體系。文 | AI唱反調AI圈最魔幻的劇情出現了:OpenAI、Anthropic、Meta、谷歌,四巨頭的模型越獄事故,測試方是同一家公司。

Anew labs,“蒸餾”的行家
醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上
Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。
Alibaba Qwen Releases Qwen-Image-2.1: A 7B Open-Weight Model for Image Generation and Editing
Alibaba’s Qwen team has released Qwen-Image-2.1, a unified text-to-image generation and image editing model. Its visual generation component has 7B parameters across 32 single-stream DiT layers.