在2026 Inclusion·外灘大會期間,螞蟻百靈開源了其首個原生多模態大模型Ling-3.0-flash-VL,引發開發者社群關注。就在幾天前,百靈剛開源首個金融增強模型Ling-3.0-flash-Fin,據稱在金融投研多項能力測評中超越了前沿通用模型。與此同時,螞蟻阿福公佈最新資料:使用者突破1.5億,日諮詢量達2000萬,按使用者規模看應已成為全球第一大健康AI App。AI版支付寶“阿寶”、AI原生助手“靈光”等應用也在增長。
百靈技術團隊在外灘大會期間罕見公開面對媒體,螞蟻基礎智慧技術部負責人、百靈大模型負責人西亭,百靈金融模型負責人月引,阿福技術負責人進捷,百靈語言基座負責人零么,圍繞好模型定義、智效比、金融醫療反哺、模型邊界等話題與媒體對話。西亭表示,好模型應走向真實世界,幫人類解決更多更難的Task,並明確“我們不認為Coding是實現AGI唯一的路線”。
好模型的標準:走向真實世界與智效比
西亭認為,好模型有幾個維度:一是走向人類真實世界,Scaling可以從Coding擴充套件到更廣泛維度,尤其是高經濟價值、高難度領域;二是能力、響應速度、成本上的Scaling,以合理成本、更快響應速度端到端解決問題,而非只看生成效率。進捷從產品實踐出發,強調模型要像專家或金融理財師一樣幫使用者解決具體問題,同時通過小模型、端側實現普惠。零么從架構角度提出,實用上ROI足夠高就是好模型,團隊一直追求用更低flops撬動更大智慧,大尺寸與小尺寸模型會交替迭代。月引的判斷標準更直接:模型能否幫他完成工作,比如把分析一個標的的時間用來看10個標的。
阿福規模增長帶來的技術挑戰
針對阿福使用者突破1.5億、日諮詢量2000萬的量級,進捷指出,使用者量達到一定規模後推理成本非常高,部分問題小模型已能超過水位線,需提升推理效率、降低成本。C端應用反應要快,等5秒使用者可能就走了;ToB/機構更重安全。他還提到隱私顧慮:海外已有很多人不願把Cloud接入工作流,擔心隱私資料被持續整流進大模型。螞蟻與百靈合作的方向是讓模型更好被定製化、適應場景,並保障隱私與資料安全。進捷還觀察到AI工作站趨勢,金融、醫療等行業希望離AI更近,資料敏感場景需要把智慧裝到更便捷裝置裡。月引補充,效率在金融領域尤為關鍵,若當日短盤等兩小時還出不來,任務就無法完成;海外很多領域模型更專注資料隱私和經濟效率,傾向開源模型加行業資料做私有模型。
金融與醫療:選難而可校驗的領域
月引解釋螞蟻做AI金融為何選投研:其他廠商營收大頭在銀行客服和信貸審批,偏工作流,客服類似Query/RAG可解決,信貸審批偏決策邏輯。螞蟻要做領域智慧上限,所以選足夠難的行業。行研並非整體可校驗,但分析、估值建模等部分可校驗,團隊從可校驗部分入手,現在做相對短的行研,未來走向更長決策鏈路。螞蟻的優勢在於一二級市場十年二十年專家一起做資料,不僅做Post-train,也從Pre-train輸入資料和知識,專家沉入預訓練環節,再結合Harness、產品、私域資料形成生態。
醫療方面,西亭提到三四線使用者難找頭部醫療資源、買藥不便,一線使用者有資源但生活不健康、壓力大,0點後失眠、情緒問題多。線上醫生確認選擇皮膚科,是因為皮膚問診量大且適合線上,但很難讓醫生一直線上。目前兩個方向:幫患者連線醫生、機構,提供更普惠健康方式;幫醫生用AI構建醫生團隊,提高接診和患者管理效率。
智效比與Scaling路線
西亭介紹,團隊提出計算Efficiency、引數Efficiency、Token Efficiency三大理念,並做了幾件事:很早做MoE的Scaling law,發現MoE模型越稀疏,在未到臨界點前智慧表現反而會漲;做混合線性,從Attention+MoE到KDA+MLA;去年9、10月與友商釋出全球第一個萬億模型後,覺得卡資源消耗不太適合國情,於是嘗試把大size智慧壓縮到小size。高質效比模型進入業務場景,也能獲取行業Know-how反哺模型。關於量化目標,西亭總結為端到端的任務成功率,而非生成成功率,這需要Harness、評估、行業安全規則聯合系統。零么補充,標品要有確定性,Token相對好量化,任務完成率不確定,模型能力提升後不同任務確定性會變高。
零么還談到Scaling的邊際效應:以預訓練和訓練實驗觀察,目前只有Pre-train Scaling沒有觀察到邊際收益遞減,把模型尺度和資料大小乘在一起,Loss curve可以Log-linear方式繼續下降;其他維度如推理Token通常收斂。算力稀缺決定了資源在Pre-train、Post-train等維度的分配,預訓練很吃資源,必須有架構、資料、資料消費策略上的明顯收益才投;後訓練迭代快、資料量小、並行組多,用短週期迭代。西亭則提到另一組Scaling:希望模型在通用能力和專業能力上都非常好,可能出現新物種。
行業反哺與模型邊界
月引表示,金融、醫療通過ToP與ToC結合反哺基座:把ToP的專業知識、推理能力拿回來,帶給每一個真實使用者;專業領域足夠拿到task,其工作流能力也會帶回基模,孵化到其他辦公或資訊處理行業。
關於模型犯錯與邊界,零么指出模型有迎合、舔使用者特點,因為聽話會得較好Reward;基模研發多由Benchmark引導,但大部分流量對模型幫助不大,因為不夠難,所以構建難Benchmark。部分Benchmark開始看模型能否拒絕、說不會,但準確率和拒答是trade off。團隊會在部分Benchmark加入類似觀察,評估不僅衡量說得多對,也衡量知道自己不知道,以及兩者平衡。月引補充,在金融智慧體評測基準FAB等Bench中,有些模型用多口徑路徑,不確定就把85條全答出來以拿好分,但真實行業使用者不能接受行研給85條、80條決策,頂多接受2-3個判斷。因此訓練中不僅看結果,還要對行為設Reward和懲罰,嚴肅場景中對幻覺的拒絕Reward要更重,寧願說不知道,也不要給很多口徑讓使用者猜。
整場對話勾勒出螞蟻百靈的一條差異化路線:在算力約束下,以智效比為核心,把金融、醫療等真實高難度場景作為模型能力上限的試驗場,再通過行業知識反哺基座,同時以開源方式與社群共建。西亭坦言,國內廠商由於資源約束反而能長出不一樣的能力,進入金融與醫療正是這一邏輯的實踐,而AGI的實現路徑應比Coding更廣泛。