對話螞蟻百靈負責人:AGI不止Coding一條路,好模型要走向真實世界

2026年9月10日 05:06
站內 AI 整理稿

作者 | 李水青 編輯 | 心緣 9月10日報道,在2026 Inclusion·外灘大會期間,螞蟻百靈開源其首個原生多模態大模型Ling-3.0-flash-VL,引發開發者社區關注。幾天前,百靈剛開源其首個金融增強模型Ling-3.0-flash-Fin,在金融投研多項相關能力測評中超越了前沿通用模型。另一邊,百靈也成為少有的支撐起國民級AI應用的基模。螞蟻阿福在外灘大會期間公佈最新數據:其用戶突破1.5億,日諮詢量2000萬,按用戶規模看應已成為全球第一大健康AI App。同時AI版支付寶“阿寶”、AI原生助手“靈光”等應用也在增長。百靈基座模型如何支撐這些國民級應用?又如何被應用反哺?

國產大模型突圍走出了什麼新路子?成為外界關注焦點。本次外灘大會期間,百靈技術團隊罕見公開面對媒體,螞蟻基礎智能技術部負責人、百靈大模型負責人西亭,百靈金融模型負責人月引,阿福技術負責人進捷,百靈語言基座負責人零么,與等媒體進行了對話。圍繞好模型定義、智效比、金融醫療反哺、模型邊界等話題,各位負責人給出了深入的解讀。西亭說,好模型應走向真實世界,幫人類解決更多更難的Task(任務),“我們不認為Coding是實現AGI唯一的路線”。螞蟻百靈團隊如何看待AGI的下一站?以下十問十答能為我們勾畫出一幅未來圖景。對話內容較長,做了不改變原意的編輯和刪減。

Q1:在當前這個時間點,一個好模型到底應該怎樣定義?西亭:什麼是好模型,很難說清楚。Claude最早跟OpenAI競爭時,發現的好可能不是Chat,而是偶然發現了Coding。今天也有觀點認為Coding是不是飽和了,但人類世界還有很多task沒被很好解決。我認為有幾個維度:第一,好模型應走向人類真實世界,Scaling可以從Coding擴展到更廣泛維度,尤其是高經濟價值、高難度領域,幫人類解決更多更難的Task,這才是AGI最終應該有的走向。第二,另一個Scaling在能力、響應速度、成本上。無論古代、今天還是未來,人類總是在新的條件和約束下做決策。

模型發展也一樣,如果智能是另一種表現形式,那麼能力、速度、成本一定要考慮。有沒有一種更好方式,以合理成本、更快響應速度,端到端解決問題,而不是隻看生成效率?進捷:我對好模型的定義,來自過去跟百靈、阿福團隊做產品時幾個印象很深的場景。如果模型能像一個專家或金融理財師一樣,幫用戶解決那個問題,很多人就會真正理解模型對他的幫助。第二要解決普惠問題,我們希望通過小模型、端側,讓模型進入更多真實環境。所以,在真實場景裡帶來價值,以及讓模型更普惠,是當下和未來比較重要的方向。零么:從模型架構角度談,實用上ROI足夠高,能滿足大家需求,就是好模型。

從技術角度也類似,我們一直追求用更低的flops撬動更大的智能。到底大尺寸模型好還是小尺寸模型好?我的觀點是,沒有絕對答案。智能提升、Scaling這件事一定帶來智能提升,到目前為止沒有失效。所以大尺度和小尺度某種程度上是交替往前走。當小尺度上也能壓縮足夠高智能,而按現在的科學發現,大尺度能壓縮更高智能,這就是持續交替迭代的過程。月引:我的判斷標準很簡單:它能不能幫我完成工作。比如今天的PPT我覺得還不好,它昨晚幫我踩了半天車輪子,我還不是很滿意。在金融裡,它能不能幫助二級分析師完成工作?能不能把原來分析一個標的的時間,用來看10個標的?這就是我希望模型演進的方向。

Q2:最新數據顯示,阿福用戶已經突破1.5億,日諮詢量達到2000萬。這些AI應用用戶交互量級大幅提升,對技術架構提出了哪些很突出的挑戰?它會是一個質變的挑戰嗎?團隊是怎麼解決的?進捷:今天我們有一個主題叫智效比。阿福已經遇到這樣的問題:當用戶量達到一定規模,推理成本非常高。以前用最大最好模型,現在部分問題小模型也能超過水位線,要提升推理效率、降成本。C端應用反應要快,等5秒用戶可能就走了;ToB/機構更重安全。第二個非常重要的命題:現在海外已經有很多人不太願意把Cloud接入到自己的工作流裡面,因為他覺得會有很多隱私數據,會不斷持續被大模型整流進去。

反過來,在我們的業務場景裡,我們在思考的是,我們對這些場景的認知或者對一些新功能的探索,模型能不能更好適配?模型能不能更好被加工?或者在場景裡持續演化?這個話題也討論比較多。所以我們和百靈還在合作很多項目,更多是看百靈大模型項目能不能被我們各種“揉”。比如我們這個場景非常快,最近我們的Tiny在內部很多場景都可以用。所以模型能夠更好被定製化,更好適應場景,還能保障場景裡的隱私或者數據安全,現在也是非常重要的課題。另外,我想分享一個趨勢:現在看到很多AI工作站,金融、醫療等行業,說白了就是想離AI更近一點,AI也想離人更近一點。另外有一些數據敏感場景,還有些數據是工作中產生的,沒有辦法帶回家。

所以我覺得,這個趨勢肯定是把更好的智能裝到更便捷式的設備裡面,離用戶更近、離那個問題更緊,這是非常重要的趨勢。月引:剛剛進捷說的效率非常重要。效率為什麼重要?如果你的效率本來達不到,你是沒有辦法完成一個領域上真正的長程任務的。例如在金融領域,我如果在當日的一個短盤裡面,等它兩個小時還出不來,這個事兒也不要乾了。第二點,進捷提及的海外,我們看到很多領域模型,它會更專注數據的Privacy(隱私)和經濟效率來源。更多的是私有數據和私有環節,傾向開源模型+行業數據做私有模型,用最小參數模型達到接近最好模型效果。這也是我們開源模型和基準、共建智能的原因。

Q3:阿福作為一款ToC產品,它在普惠醫療這件事情上想要長期發展的話,您覺得最重要的一個因素是什麼?西亭:我們接觸了很多用戶,年後沒大規模宣傳,而是在持續思考。三四線用戶難找頭部醫療資源、買藥不便;一線用戶有資源但生活不健康、壓力大,0點後失眠、情緒問題多。我們看的是當有了這些問題之後,怎麼繼續沿著這個問題往下走?我發現遇到了很大的問題。就像我們今天推出在線醫生確認,為什麼選皮膚這個科室?比如在線醫生確認選皮膚科,因為皮膚問診量大且適合線上,但很難讓醫生一直在線。現在兩個方向:一是幫患者連接醫生、機構,提供更普惠健康方式;二是幫醫生,用AI構建醫生團隊,提高接診和患者管理效率。

Q4:螞蟻做AI金融為什麼選投研領域?螞蟻的優勢是什麼?未來會從ToP(面向專業領域/人士)轉To B(面向企業)?月引:其他廠商營收大頭在銀行,主要是客服和信貸審批,偏工作流。客服類似Query/RAG可解決;信貸審批偏決策邏輯,不需要那麼長和難。我們要做領域智能上限,所以選足夠難的行業。行研不是整體可校驗,而是能找到可校驗部分:分析、估值建模可校驗,推斷主觀性強。我們從可校驗部分入手。現在做相對短的行研,未來走向更長決策鏈路。螞蟻的優勢在於,海外數商在專業難度數據上不佔優,給我們Samples三條錯兩條。我們有一二級市場十年二十年專家一起做數據,把專業knowledge帶進來。

我們不僅做Post-train,也從Pre-train輸入數據和知識,專家沉入預訓練環節。除了模型,還要結合Harness、產品、私域數據,是生態。螞蟻定位有較大空間。Q5:百靈基座模型的迭代,跟阿福、阿寶等AI應用實現了很完美的聯動迭代。在迭代過程中,應用需求與技術路線哪個優先?內部應用與外部商業化哪個優先?進捷:其實我們內部很早之前也討論過這個事情。今天最大的變量其實是技術。我們跟靈光、阿福都會講,要沿著技術發展的延長線去探討應用的落腳點。阿福最近有一個升級,會更多考慮模型整體能力和多模態,我們也在音視頻方面做了強化。所以內部還是會專注看技術未來的發展,特別是AGI發展的延長線是哪些。

另外一塊,我們也通過場景思考AGI積累和切口。今年AGI比較在意工作場景,我們看到理財師、金融裡面有大量工作場景未被滿足;醫療裡面,中國所有醫生都在被臨床工作困擾,但沒有辦法解決。所以我們還是會沿著AGI發展到Work這個階段去看,但選題時會看跟我們的稟賦或者連接在哪裡。核心會看技術發展趨勢,同時也會在技術核心命題裡面找我們的切入口,這是過程中反覆討論和探討的。Q6:為什麼螞蟻能鮮明提出並落地智效比?智效比能否更量化?按效果付費?西亭:一個聰明的模型應該會怎麼樣?我們提出了三個大的理念:計算Efficiency、參數Efficiency、Token Efficiency。

帶著這個理念我們當時做了幾件事情: 第一,我們很早就做了MoE的Scaling law,從而發現MoE模型越稀疏,某種意義上,當沒有到那個臨界點之前,它的智能表現反而會在漲。第二,做混合線性。人最重要的一大能力是要忘掉一些事情,所以我們想能不能轉化成注意力上面的一種機制?我們也學習了很多,從最早的Attention+MoE,到今天的KDA+MLA。第三,當我們去年9、10月份跟友商一起發了全球第一個萬億模型後,也覺得這個卡資源消耗似乎不太適合我們國情發展的道路。於是嘗試把大size智能壓縮到小size,通過更好架構、data、項目組織實現。

高質效比模型進入業務場景,也能獲取行業Know-how反哺模型。所以回到這個點上,首先從理論層面,我們收集了很多人對高智商物種的反饋,把它泛化成了技術路線。同時跟真實場景做了大量結合,其實是一種實證科學。同時,我們也沒有放棄過對於一個特別大的智能上限的模型的探索。由於模型要走向真實環境,另外一個可能也是由於資源的約束,國內廠商反而能長出能力,發展出不一樣的東西。所以,這也是為什麼我們要進入金融跟醫療。我們不認為Coding只是實現AGI唯一的路線,實現AGI應該還有更廣泛的路徑,或許我們今天的實踐是給到社區的一種大家能看得到的方式,看看我們哪裡做好了,哪裡沒有做好。

關於所謂的量化目標,總結起來就是端到端的任務成功率。前面說的,我們不認為生成成功率就等於端到端的任務成功率。當一個模型在完成一個任務的時候要執行幾十輪,如果我們每一輪的成功率都比較好,然後做端到端的任務成功率比較好,這些可能是我們下一步會更關心的目標。當然,這個會非常難。它無法靠自己單一模型就能搞定,因為還包含Harness、評估、行業安全規則,是聯合系統。產品到商品必經這條路。零么:標品要有確定性,現在智能很多維度不確定。Token相對好量化,任務完成率不確定。模型能力提升後,不同任務確定性會變高,高到一定程度就可能變標品,更好量化。Q7:金融、醫療如何反哺螞蟻基座模型?

月引:行業怎麼去反哺基模?我們在行業上選的是ToP(面向專業領域)以及ToC(面向消費者)相結合。通過把ToP的專業學好,然後把ToP的知識,包括它的推理、能力拿回來,然後再把它帶給我們每一個真實的用戶。所以,從金融或者從醫療,都是能夠把P的Professional知識沉澱回基座。另外,今天希望模型幫我做什麼?我希望它能夠做得更快。在專業領域裡面,如果足夠拿到task,那麼這份專業的工作流的能力它也會帶來基模裡面。基模上面我可以服務到,以及會孵化到其他所有需要進行辦公或者信息處理行業的能力,它會把它反哺回來。

所以從這兩個角度,其實行業上的這些模型只要它的task和knowledge足夠難,最終都會能夠在基模得到一個反哺的能力。Q8:模型現階段可能會繼續犯錯,但是比起不犯錯誤,模型知道自己不能做什麼是很重要的,想了解一下,基於這個思考,我們在模型層面做了哪些設計?零么:現在模型有迎合、舔用戶特點,因為聽話會得較好Reward(獎勵)。基模研發多由Benchmark引導,但大部分流量對模型幫助不大,因為不夠難,所以構建難Benchmark。很多Benchmark只要輸出就可能得分,不輸出說不會大概率沒分。於是全世界圍繞模型做大規模RL,只要試就可能對,不試就錯。

部分Benchmark開始看模型能否拒絕、說不會。但準確率和拒答是trade off(權衡取捨),拒得越多準確率可能下降。我們會在部分Benchmark加入類似觀察,評估方式要改進:不僅衡量說得多對,也衡量知道自己不知道,以及兩者平衡。這樣模型才會瞭解知識邊界。月引:不管在金融行業還是醫療行業,這其實是非常重要的一個事情。在金融智能體評測基準FAB等Bench中,有些模型用多口徑路徑,不確定就把85條全答出來,以拿好分。但真實行業用戶不能接受行研給85條、80條決策,頂多接受2-3個判斷。所以訓練中不僅看結果,還要對行為設Reward和懲罰。

嚴肅場景中,對幻覺的拒絕Reward要更重;寧願說不知道,也不要給很多口徑讓用戶猜。Q9:Scaling路線變多,哪些邊際效應最高?擴基座和加強後訓練,資源如何取捨?零么:Scaling可理解為效果-尺度二維圖。尺度可以是模型、計算、數據、RL訓練、推理Token;效果可以是Loss或Benchmark。至於邊際收益最高的是什麼?邊際收益的度量取決於座標系。Benchmark像Sigmoid曲線,有湧現和飽和,不是好的邊際收益指標。以我做過大量預訓練和訓練實驗的觀察,目前只有一個沒有觀察到邊際收益遞減,就是Pre-train Scaling。

把模型尺度和數據大小乘在一起,也就是Scaling FLOPs,Loss curve繼續可以往下降,以Log-linear方式下降;其他維度如推理Token通常收斂。其他維度,比如用更多推理時Token,能不能換取持續上漲的Benchmark效果?一般能觀察到明顯收斂趨勢。不過確實越大尺度效果越好。為什麼不全投入訓練最大模型?很簡單,算力稀缺。把Scaling策略、算力放到Pre-train,還是Post-train,還是其他維度?這取決於我們在某個技術點位上發現這個地方非常有收益,就會嘗試做得更大。

預訓練很吃資源,必須有架構、數據、數據消費策略上的明顯收益才投;後訓練迭代快、數據量小、並行組多,用短週期迭代。基本基於科學實驗做決定。所以很多時候,我們會以更長的軸看新的預訓練,用更短的軸看後訓練上的迭代。基本基於這個判斷,如果我們有信心方向對,就把資源投上去,基本是基於科學實驗做決定。西亭:我們一直在探索另外一組Scaling。現實中可能存在非常聰明的醫生,股票也炒得很好,金融也特別懂。人類歷史上這樣的人一閃而過。我們希望模型在通用能力和專業能力上都非常好,可能會出現一個新物種。另外,當流量便宜到沒人在乎時,會不會出現新的東西顛覆智能本身?不知道。

但另一種維度是,用的人越多,走向真實世界越多,有可能會延伸出社會學上的Scaling。如果發生,人們會越來越關注可能的ROI。所以還有大小模型協同和路由的Scaling,至少從人的智能和認知上看,比較符合。另外一個維度,今天的AGI不應只有一個維度,人人都在卷Coding本身,這就一定正常嗎?AGI應該還有一個更廣義上的Scaling,就是怎樣更好解決真實中的問題。真實中的問題可能有很多數據,並不像Coding這麼豐富,但我們也應該投向更多注意力去解決這裡面的問題。或許把這些問題解決了,回頭再看技術問題,可能自然而然就能得到解決。Q10:模型做到什麼程度才能進入真實世界?

如果只選三個最重要的指標,是什麼?西亭:直觀上我認為第一是智效比,第二是專業性,第三是開放性。閉塞模型很難讓人相信它解決真實問題。一個連COT都不讓大家看到的模型,我想應該沒有多少人會相信它。比如我跟醫生交流,醫生不能上來給你拍個片告知得了重大疾病,應該要告訴為什麼做決策。所以,我覺得第三點就是開放性,對於模型走向真實環境是極其關鍵的一件事情。專業性也是一樣,不同的行業見不同的人,我們判斷這個人是不是值得跟他聊,是不是從他身上能學到東西,這是人和人之間交往一個非常重要的東西。智效比前面說的比較多了,是在合理成本約束下把問題推得更廣。

如果要加一個,我會加反饋的閉環,這個模型一定要在真實的環境中能收到一些反饋。我們還做原生多模態VL,因為金融醫療等場景需要視覺反饋,比如PPT、年報換行是否正確。有反饋才能在醫療任務中補專業數據、報告,進一步增強能力。

Related

相關文章

量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

56 分鐘前
IT之家生成式AI

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作

作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

4 小時前
鈦媒體生成式AI

月之暗面遞表之後,Kimi 的成色要被驗算三遍

舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

6 小時前

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"

這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。

8 小時前