Falcon TST 2.0獲世界權威測評第一名,推動時間序列基礎模型從通用預測走向金融應用

螞蟻國際日前正式發佈自研時序AI預測大模型“鷹序TST”2.0版。螞蟻國際日前正式發佈自研時序AI預測大模型“鷹序TST”(FalconTST,Time-Series Transformer)2.0版。“鷹序TST”2.0在全球權威基準測試中取得最優成績(SOTA),平均絕對比例誤差(MASE)降至0.666,超越多家全球頂尖科技公司的時間序列預測模型。該模型專為跨境支付外匯風險管理打造,並將拓展至電商供應鏈需求預測、航空運營管理等更多行業場景。目前,巴克萊銀行、花旗銀行、德意志銀行、渣打銀行等大型金融機構已將“鷹序TST”2.0應用於現金流預測與外匯管理,提升流動性風險敞口的預測能力。
“鷹序TST”2.0的預測準確率已穩定超過93%,具備向物流、航空、電商等金融以外行業拓展的應用能力。2025年以來,Amazon Chronos-2、Google TimesFM 2.5、Salesforce Moirai 2.0和IBM FlowState相繼把多變量、長上下文、概率預測、跨採樣率適配等能力推向前臺;與此同時,金融市場的低信噪比、機制切換、厚尾風險和跨市場聯動,使通用榜單優勢很難直接轉化為穩定的金融預測收益。螞蟻國際Falcon TST的演進具有代表性:2025年先在外匯敞口和資金管理中完成業務驗證,2026年又以Falcon-2.
0強化單變量預測效率,以Falcon-X補足異構多變量關係建模,Falcon TST 2.0是“通用時序基礎能力+金融流程驗證”的專用化嘗試,持續迭代和穩定進步展現了螞蟻國際在AI+金融領域的先鋒力量。一、金融時間序列正在檢驗通用基礎模型的真實能力 通用時間序列基礎模型已經具備明顯的跨數據集遷移能力。Salesforce AI Research於2024年11月發佈的GIFT-Eval基準覆蓋28個數據集、超過14.4萬條時間序列和1.77億個測試數據點,並配套約2300億個不與測試集重疊的預訓練數據點。該基準推動行業從“一個數據集訓練一個模型”轉向“預訓練一次、跨任務零樣本預測”。
Google TimesFM、Amazon Chronos、Salesforce Moirai等模型隨後快速升級,核心目標已從單一預測精度擴展到跨頻率、跨變量和不確定性輸出。金融市場對通用模型提出了更苛刻的檢驗。金融收益率通常具有低信噪比、厚尾、波動率聚集和機制切換等特徵,日內行情、日度收盤、利率曲線和宏觀數據還存在頻率不一致、節假日錯位和缺失值。曼徹斯特大學、倫敦大學學院等研究者2025年11月發佈的大規模金融實證工作論文發現,直接使用現成預訓練TSFM進行零樣本預測和常規微調,整體效果較弱;在金融數據上重新預訓練後,預測表現和經濟收益明顯改善。
該結果說明,通用預訓練提供了有價值的時間模式先驗,但金融領域仍高度依賴訓練分佈與目標任務的匹配。金融TSFM的價值應與“穩定產生交易收益”區分開來。2026年6月一項針對5只美國高流動性股票的獨立研究比較TimeGPT、TimesFM 2.5、Moirai 2.0、Chronos和Chronos-2等模型,TSFM拿下10個任務中的8個最優結果,但相對隨機遊走基準的增益總體較小,只有少數任務通過顯著性檢驗,且META的兩個任務仍由本地監督訓練的iTransformer勝出。金融機構因此更適合把TSFM視作可遷移的預測底座和開發效率工具,再通過領域數據、滾動回測和風險約束完成二次驗證。
二、主流TSFM已轉向多變量、長上下文和概率預測 Chronos-2把Amazon的技術路線從單變量預測推進到通用上下文學習。Amazon於2025年10月20日發佈120M參數的Chronos-2,原生支持單變量、多變量和協變量條件預測,並通過Group Attention在相關序列之間共享上下文信息。需要區分的是,初代Chronos確實採用“縮放和量化後轉為離散Token、再以語言模型交叉熵訓練”的路線;Chronos-2已經引入新的組注意力和通用上下文學習機制,不能簡單沿用“數值分桶導致尾部精度受限”來評價新版本。
Amazon公佈的“超過90%勝率”指Chronos-2相對Chronos-Bolt的頭對頭比較,並非GIFT-Eval總榜勝率。Chronos-Bolt的“最高250倍推理加速、20倍內存節省”同樣是相對初代同規模Chronos的對比結果。TimesFM 2.5用更小參數量換取更長上下文和連續分位數預測。Google Research於2025年9月15日發佈TimesFM 2.5,將模型規模從2.0版的500M降至200M,上下文長度從2048擴展至最高16384,並增加可選的30M連續分位數預測頭,最長支持1000步分位數預測。
其後,Google在2025年10月恢復XReg協變量支持,2026年3月增加Agent技能接口,4月加入基於LoRA的微調示例。因此,“2.5版在2026年一次性加入分位數、LoRA和Agent”的說法並不準確,模型發佈與生態增強分屬不同時間節點。Moirai 2.0證明時間序列基礎模型並不需要持續堆大參數。Salesforce於2025年8月8日發佈Moirai 2.0,將早期Moirai的Masked Encoder改為Decoder-Only Transformer,並把訓練目標改為分位數損失和多Token預測,同時增加缺失值信息嵌入、隨機Patch掩碼和數據質量過濾。
Salesforce公佈的小型版本約11.4M參數,相比此前Moirai Large參數量縮小約96%、推理速度提高44%,當時在GIFT-Eval無測試數據洩漏模型中取得領先MASE。其意義在於,TSFM競爭正在從“更大”轉向“更合適的數據、目標函數和訓練策略”。FlowState用狀態空間模型回應Transformer對採樣頻率變化適應不足的問題。IBM Research於2026年7月6日公佈ICML 2026論文FlowState,以狀態空間模型編碼器和函數基解碼器實現連續時間建模,可在輸入採樣率變化和預測區間變化時動態調整時間尺度。IBM公開的GIFT-Eval提交中包含9.
1M參數版本,規模顯著小於主流Transformer TSFM。該路線更關注跨採樣率和計算效率,目前公開論文的重點並非複雜異構多變量關係,因此在金融場景中仍需要與跨資產、跨因子建模能力組合評估。三、Falcon TST的差異化已有金融場景驗證支撐 Falcon TST先形成金融業務驗證,再逐步形成公開模型家族。2025年5月,螞蟻國際已與Barclays開展TST外匯預測合作;7月與Citi開展航空客戶外匯風險管理試點;8月與Standard Chartered把TST接入其SCALE流動性引擎;10月Falcon-1.0才正式在Hugging Face開放。
由此看,Falcon的發展路徑與典型“先刷公開基準、再尋找行業應用”的TSFM不同,真實資金管理和外匯敞口預測在其公開發展史中出現得更早。Falcon-1.0的核心設計是用層次化混合專家處理多尺度時間模式。螞蟻國際官方倉庫將Falcon-1.0定義為分層混合專家模型,通過Patch級專家特化和樣本級層次路由處理不同時間尺度。當前Falcon官網展示3000億個時間點和25億參數的產品口徑,而2025年與多家銀行的聯合公告普遍表述為“接近20億參數”。兩組數字很可能對應不同模型階段或統計口徑,公開材料沒有給出完整對照,因此本文不把參數規模作為Falcon優勢的核心證據。
更可靠的公開證據是其對小時、日和周等多時間尺度現金流及外匯敞口的業務預測。四、Falcon-2.0和Falcon-X分別強化單變量效率與多變量關係建模 Falcon-2.0把模型重點轉向單變量預測效率和概率輸出。螞蟻國際2026年7月開放Falcon-2.0 API,官方將其定義為基於ORBIT訓練框架的Encoder-Only單變量TSFM。相比初代層次化混合專家架構,Encoder-Only更適合一次前向計算完成直接預測,減少自迴歸逐步生成帶來的延遲和誤差累積。公開API可直接輸出0.01、0.05、0.10至0.95、0.
99共21個分位點,並提供input_mask顯式標記缺失值,對節假日、停牌或交易日錯位等金融數據處理更友好。Falcon-X補上了金融場景最關鍵的異構多變量建模能力。螞蟻國際團隊於2026年5月26日公開Falcon-X論文,最大公開實驗版本為591M參數。Falcon-X將不同物理含義的變量轉換為統一的隱空間表示,通過差分注意力同時識別正向和負向關聯,再處理變量間關係並重建各變量軌跡。論文在GIFT-Eval報告0.687的MASE,並在fev-bench進行多變量評測。
對金融業務而言,更重要的含義是模型開始直接處理“匯率—利率—波動率—商品”等異構變量之間的關係,而不再只依賴單條序列自身歷史。多變量輸入只有在變量關係真實有效時才會帶來增益。Santa Clara University研究者2026年5月使用Chronos-2對“美股科技龍頭”和美國國債利率進行2000—2025年滾動預測,發現相關變量聯合輸入總體優於單變量輸入,但把股票和利率兩個面板直接混合後,預測精度反而下降。該結果對Falcon-X同樣具有啟示:共享隱空間能夠擴大信息來源,金融生產環境仍需嚴格控制變量選擇、信息時點和滾動回測,避免無關因子把噪聲帶入模型。
分位數預測可以進入風險管理流程,但不能直接等同於監管意義上的VaR和ES。Falcon-2.0和Falcon-X均提供多分位數輸出,可用於構造悲觀、中性和樂觀情景,也可作為風險價值和預期損失模型的重要輸入。若預測目標本身是資產收益或組合損益,低分位數可以用於估計尾部損失;但在真實風控體系中仍需經過覆蓋率檢驗、條件覆蓋檢驗、壓力情景和模型風險管理,才能判斷分位數是否具備穩定校準能力。僅憑API能夠輸出1%或5%分位點,不能直接推導模型已滿足VaR或ES要求。五、金融機構合作開始把預測能力嵌入真實資金管理流程 巴克萊銀行合作驗證了Falcon進入銀行外匯對沖平臺的可行性。
2025年5月7日,螞蟻國際宣佈巴克萊銀行將TST模型接入BARX NetFX外匯對沖平臺,用於提高螞蟻國際外匯敞口預測準確度。公開材料稱TST可按小時、日和周預測現金流及外匯敞口,螞蟻國際自身場景準確率超過90%。合作的核心價值是用更準確的敞口預測減少不必要對沖和銀行風險溢價,再由銀行既有Guaranteed FX流程執行風險管理。花旗銀行試點將Falcon用於航空客戶的線上售票外匯風險管理。2025年7月18日,花旗銀行與螞蟻國際宣佈聯合試點,將Falcon TST與花旗銀行固定匯率解決方案(Citi Fixed FX Rates)結合,面向跨幣種線上售票的航空公司客戶。
花旗銀行官方公告確認首個航空客戶已在實際交易中降低對沖成本,並援引螞蟻國際數據稱試點客戶對沖成本節省約30%。該合作表明,時間序列基礎模型開始以“預測即服務”的方式進入銀行產品,最終定價與交易仍由花旗銀行既有外匯系統執行。渣打銀行合作將Falcon接入24小時外匯流動性管理流程。2025年8月25日,渣打銀行與螞蟻國際宣佈把Falcon TST接入該行SCALE聚合流動性引擎,實現實時、24小時外匯敞口預測。渣打銀行公告稱整合後對螞蟻國際外匯敞口預測準確率超過90%,並披露Falcon當時已覆蓋螞蟻國際超過60%的涉及外匯轉換交易;相關外匯成本最高下降60%、流動性管理成本最高下降50%。
上述降本數據屬於合作雙方披露的業務口徑,更適合作為商業落地成效,不宜與公開學術基準直接比較。Capital A提供了目前較清晰的第三方企業客戶效果數據。2025年10月7日,Capital A旗下AirAsia在官方新聞稿中披露,Falcon用於多幣種現金流和外匯敞口預測後,按小時、日和周的預測準確率達到90%,外匯對沖成本最高下降40%。Capital A稱該項目為Falcon首個商業部署,並披露航空行業版本加入旅行行業相關數據。該案例說明,行業專用化的實際價值更多來自模型、行業數據、銀行交易設施和企業資金管理規則的組合,而非單個基礎模型替代現有Treasury體系。
六、通用基準領先不能直接等同於金融業務領先 GIFT-Eval仍是觀察TSFM通用能力的重要窗口,但榜單成績需要結合時間和數據重疊情況解讀。Salesforce建立GIFT-Eval的初衷就是統一零樣本測試、減少數據洩漏並比較不同頻率和變量數量。2026年以來,Falcon-X、Falcon-2.0、FlowState新版本以及多種Agent模型持續加入,榜單排名頻繁變化。部分後續論文還專門區分“可能與GIFT訓練數據存在重疊”的Chronos-2結果和更嚴格的無洩漏版本。
對於金融機構而言,固定引用某一時點“全球第一”容易失真,更有意義的是檢查模型是否在自己的資產、頻率、市場狀態和回測窗口中保持穩定。現階段沒有一條技術路線在金融任務上形成絕對優勢。Chronos-2擅長把相關變量和協變量作為上下文,TimesFM 2.5依託長上下文和成熟生態保持較強即插即用能力,Moirai 2.0證明小模型也能在通用基準上保持競爭力,FlowState突出跨採樣率適應,Falcon-2.0和Falcon-X則分別押注高效單變量預測與異構多變量關係建模。金融任務對極端行情、時間對齊、外生變量、分位數校準和部署時延的要求不同,模型選擇需要從具體業務目標倒推。
表1 主流時間序列基礎模型的公開技術路線與金融應用觀察 模型 公開版本與規模 核心技術路線 多變量與外生信息 金融應用觀察 Falcon TST 2.0 Falcon-2.0最大實驗版本585M;Falcon-X最大公開實驗版本591M Falcon-2.0為Encoder-Only+ORBIT;Falcon-X採用共享隱原型空間 Falcon-X原生異構多變量;兩者均提供分位數預測API 已有外匯與Treasury場景驗證;Falcon-2.
0完整論文尚待公開 Amazon Chronos-2 120M Encoder-based Group Attention與上下文學習 原生支持單變量、多變量和協變量條件預測 獨立金融研究顯示相關變量聯合輸入有效,無關跨市場變量可能引入噪聲 Google TimesFM 2.5 200M;可選30M分位數頭 Decoder-Only,最高16k上下文 原生以單變量為主,可通過XReg加入協變量 金融基準平均表現較強,但部分資產仍被本地監督模型超過 Salesforce Moirai 2.0 Small約11.
4M Decoder-Only,分位數損失和多Token預測 Moirai家族面向通用多序列預測,2.0強化缺失值和魯棒性處理 通用效率突出;公開訓練語料並非金融專用 IBM FlowState GIFT-Eval公開提交含9.1M版本 狀態空間模型編碼器+函數基解碼器 重點解決跨採樣率和可變預測區間 適合跨頻率任務;複雜異構多變量關係仍需額外驗證 數據來源:各模型官方論文、技術博客與GIFT-Eval公開資料 注:GIFT-Eval為動態榜單,且部分提交存在訓練數據重疊標記。為避免把階段性排名固化為長期結論,表中不列統一“當前排名”。
七、金融TSFM競爭將更多取決於數據適配、風險校準和工程落地 金融TSFM的下一階段競爭重點將從“能否零樣本預測”轉向“能否在真實風險流程中穩定使用”。通用模型已經證明大規模跨領域預訓練可以顯著降低時間序列建模門檻,金融實證又反覆顯示領域數據和任務適配仍然關鍵。對資金管理、流動性預測和外匯敞口等場景,衡量模型的核心標準應逐步轉向滾動回測穩定性、極端行情失效邊界、分位數校準、數據洩漏控制、推理成本和系統接入能力。通用榜單仍有價值,但只能回答模型“會不會預測”,無法單獨回答“能不能進風控”。Falcon TST 2.0已經形成一條較清楚的金融應用路徑。
2025年的主線是把TST模型嵌入Barclays、Citi、Standard Chartered以及Capital A等真實資金管理和外匯業務;2026年的主線是以Falcon-2.0和Falcon-X分別解決高效單變量預測和異構多變量預測。公開證據顯示,這條路徑具備較強的金融產品化基礎。後續仍需補齊Falcon-2.0完整論文、預訓練數據構成、可復現評測和極端市場壓力測試等信息,才能進一步驗證其領先能力的可持續性。時間序列基礎模型正在形成“通用底座與行業專用模型並存”的市場格局。
TimesFM、Chronos等通用TSFM適合低成本試驗、冷啟動和跨行業快速遷移,金融專用模型更適合數據充足、指標明確、風險敏感的生產場景。Falcon TST 2.0的意義在於把競爭焦點進一步推向真實金融流程:模型要同時理解時間規律、變量關係和不確定性,還要被銀行與企業既有風控、對沖和流動性管理體系消化。金融機構最終購買的是一套能夠被驗證、被校準、被治理並持續產生業務價值的預測能力,模型規模只是其中一項技術參數。八、主要資料來源 1.
Salesforce AI Research,GIFT-Eval: A Benchmark for General Time Series Forecasting Model Evaluation,2024-11-12。2.Amazon Science / GitHub,Chronos-2: From Univariate to Universal Forecasting / Chronos repository,2025-10-20。3.Google Research / GitHub,TimesFM 2.
5 release and 2026 updates,2025-09-15—2026-04-09。4.Salesforce AI Research,Introducing Moirai 2.0,2025-08-08。5.IBM Research,FlowState: Sampling-Rate-Equivariant Time-Series Forecasting,2026-07-06。6.Ant International,Falcon-TST Official Repository,截至2026-08-17。7.
Liu Yiding等,Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling,2026-05-26。8.Citi,Citi and Ant International Pilot AI-Enabled Forecasting Solution to Enhance FX Risk Management for Airline Customers,2025-07-18。9.
Standard Chartered,Standard Chartered and Ant International Collaborate on AI-Powered Treasury and FX Management Solutions,2025-08-25。10.Capital A / AirAsia Newsroom,Capital A採用Ant International AI-Enabled FX Solution,2025-10-07。11.
Ant International,Ant International Partners with Barclays on Global Treasury Management with Proprietary AI-Powered FX Model,2025-05-07。12.Rahimikia, Ni, Wang,Re(Visiting) Time Series Foundation Models in Finance,2025-11-18。13.
Noguer I Alonso, Franklin,Pretrained Time-Series Foundation Models for Financial Return Forecasting,2026-06-25。14.Das, Goyal, Yadav,Multivariate Financial Forecasting using the Chronos Time Series Foundation Models,2026-05-08。15.
Salesforce / Hugging Face,GIFT-Eval Live Results Repository,截至2026-08-17。
Related
相關文章

深度實測「豆包工作」+飛書:目前最接近企業Agent終局的答案
豆包工作推出獨立電腦版並與飛書深度整合,實測能自動完成製圖、影片、網頁及採購比選等任務。其最大亮點是能直接讀取飛書中的群聊、文件與表格,理解企業上下文並整理選題、追蹤專案進度,被認為是目前最接近企業級Agent終局的答案。

湯道生內部發文回應騰訊 AI 慢了:AI 競爭不是短跑,熬得久比起得早更重要
作者:汪淼 責編:汪淼 評論: 8 月 26 日消息,據鞭牛士今日報道,騰訊集團高級執行副總裁、雲與智慧產業事業群 CEO 湯道生 8 月 25 日晚在騰訊內部刊物《知點》年刊上發表一篇文章。湯道生表示,這篇文章由他和 AI 協同完成,AI 已經從單純的執行工具,變成輔助思考的協作夥伴。

斯坦福研究:22~25 歲職場新人受 AI 衝擊最大,高等教育可緩衝影響
作者:故淵 責編:故淵 評論: 8 月 26 日消息,斯坦福數字經濟實驗室於 8 月 12 日更新論文,依託薪資服務商 ADP 覆蓋數百萬美國勞動者的高頻薪資數據,揭示生成式 AI 普及後勞動力市場的真實變化,報告提示,應屆與初入職場的年輕人正承受 AI 帶來的最直接衝擊。

Windows 任務管理器之父打造:Win11 版 TMOG 發佈,107 頁文檔讓 AI 編碼
Linux 系統發佈原生任務管理器 TMOG,最新版本號為 0.1.1。普拉默在推文中表示,1995 年在開發 Windows 任務管理器時,使用一臺 P90 配置的電腦,就是在 CPU 使用率不超過 2% 的情況下,實現更新、滾動和繪圖功能。

OpenAI 重啟 ChatGPT Plus 賬號五小時限額機制,Pro 賬號暫不受影響
作者:遠洋 責編:遠洋 評論: 感謝網友 肖戰姊姊、咩咩洋、我家小妞很拽、不一樣的體驗、這個暱稱不怎麼樣、秦淮一夢 的線索投遞!8 月 26 日消息,經過自 7 月 13 日開始為期六週的無每日使用額度限制後,OpenAI 正式恢復了針對標準版 ChatGPT Plus 用戶的嚴格“五小時使用上限”,該限制適用於使用 Codex 和 ChatGPT Work 環境的用戶。

雄安“一人公司”湧動:被大廠裁員的P7,用AI組裝自己的“資本夢”
大模型之家2026.08.26 09:19 · 來自北京全文3010字00:00 / 08:16“當一個人就是一家公司,技術槓桿是蜜糖,也是砒霜。”文 | 大模型支架“當一個人就是一家公司,技術槓桿是蜜糖,也是砒霜。”在雄安新區幾處安靜的科技孵化器裡,一種全新的辦公形態正在悄然蔓延。這裡的辦公桌上沒有成排的顯示器和忙碌的團隊,往往只有一臺筆記本電腦、幾杯咖啡,以及一位眼神專注的創業者。他們中的相當一部分人,是過去兩年從北京後廠村或杭州離職後,出來創業的互聯網大廠中高層——曾經的P7、P8級架構師、高級產品經理。