在2026 Inclusion·外滩大会期间,蚂蚁百灵开源了其首个原生多模态大模型Ling-3.0-flash-VL,引发开发者社区关注。就在几天前,百灵刚开源首个金融增强模型Ling-3.0-flash-Fin,据称在金融投研多项能力测评中超越了前沿通用模型。与此同时,蚂蚁阿福公布最新数据:用户突破1.5亿,日咨询量达2000万,按用户规模看应已成为全球第一大健康AI App。AI版支付宝“阿宝”、AI原生助手“灵光”等应用也在增长。
百灵技术团队在外滩大会期间罕见公开面对媒体,蚂蚁基础智能技术部负责人、百灵大模型负责人西亭,百灵金融模型负责人月引,阿福技术负责人进捷,百灵语言基座负责人零幺,围绕好模型定义、智效比、金融医疗反哺、模型边界等话题与媒体对话。西亭表示,好模型应走向真实世界,帮人类解决更多更难的Task,并明确“我们不认为Coding是实现AGI唯一的路线”。
好模型的标准:走向真实世界与智效比
西亭认为,好模型有几个维度:一是走向人类真实世界,Scaling可以从Coding扩展到更广泛维度,尤其是高经济价值、高难度领域;二是能力、响应速度、成本上的Scaling,以合理成本、更快响应速度端到端解决问题,而非只看生成效率。进捷从产品实践出发,强调模型要像专家或金融理财师一样帮用户解决具体问题,同时通过小模型、端侧实现普惠。零幺从架构角度提出,实用上ROI足够高就是好模型,团队一直追求用更低flops撬动更大智能,大尺寸与小尺寸模型会交替迭代。月引的判断标准更直接:模型能否帮他完成工作,比如把分析一个标的的时间用来看10个标的。
阿福规模增长带来的技术挑战
针对阿福用户突破1.5亿、日咨询量2000万的量级,进捷指出,用户量达到一定规模后推理成本非常高,部分问题小模型已能超过水位线,需提升推理效率、降低成本。C端应用反应要快,等5秒用户可能就走了;ToB/机构更重安全。他还提到隐私顾虑:海外已有很多人不愿把Cloud接入工作流,担心隐私数据被持续整流进大模型。蚂蚁与百灵合作的方向是让模型更好被定制化、适应场景,并保障隐私与数据安全。进捷还观察到AI工作站趋势,金融、医疗等行业希望离AI更近,数据敏感场景需要把智能装到更便捷设备里。月引补充,效率在金融领域尤为关键,若当日短盘等两小时还出不来,任务就无法完成;海外很多领域模型更专注数据隐私和经济效率,倾向开源模型加行业数据做私有模型。
金融与医疗:选难而可校验的领域
月引解释蚂蚁做AI金融为何选投研:其他厂商营收大头在银行客服和信贷审批,偏工作流,客服类似Query/RAG可解决,信贷审批偏决策逻辑。蚂蚁要做领域智能上限,所以选足够难的行业。行研并非整体可校验,但分析、估值建模等部分可校验,团队从可校验部分入手,现在做相对短的行研,未来走向更长决策链路。蚂蚁的优势在于一二级市场十年二十年专家一起做数据,不仅做Post-train,也从Pre-train输入数据和知识,专家沉入预训练环节,再结合Harness、产品、私域数据形成生态。
医疗方面,西亭提到三四线用户难找头部医疗资源、买药不便,一线用户有资源但生活不健康、压力大,0点后失眠、情绪问题多。在线医生确认选择皮肤科,是因为皮肤问诊量大且适合线上,但很难让医生一直在线。目前两个方向:帮患者连接医生、机构,提供更普惠健康方式;帮医生用AI构建医生团队,提高接诊和患者管理效率。
智效比与Scaling路线
西亭介绍,团队提出计算Efficiency、参数Efficiency、Token Efficiency三大理念,并做了几件事:很早做MoE的Scaling law,发现MoE模型越稀疏,在未到临界点前智能表现反而会涨;做混合线性,从Attention+MoE到KDA+MLA;去年9、10月与友商发布全球第一个万亿模型后,觉得卡资源消耗不太适合国情,于是尝试把大size智能压缩到小size。高质效比模型进入业务场景,也能获取行业Know-how反哺模型。关于量化目标,西亭总结为端到端的任务成功率,而非生成成功率,这需要Harness、评估、行业安全规则联合系统。零幺补充,标品要有确定性,Token相对好量化,任务完成率不确定,模型能力提升后不同任务确定性会变高。
零幺还谈到Scaling的边际效应:以预训练和训练实验观察,目前只有Pre-train Scaling没有观察到边际收益递减,把模型尺度和数据大小乘在一起,Loss curve可以Log-linear方式继续下降;其他维度如推理Token通常收敛。算力稀缺决定了资源在Pre-train、Post-train等维度的分配,预训练很吃资源,必须有架构、数据、数据消费策略上的明显收益才投;后训练迭代快、数据量小、并行组多,用短周期迭代。西亭则提到另一组Scaling:希望模型在通用能力和专业能力上都非常好,可能出现新物种。
行业反哺与模型边界
月引表示,金融、医疗通过ToP与ToC结合反哺基座:把ToP的专业知识、推理能力拿回来,带给每一个真实用户;专业领域足够拿到task,其工作流能力也会带回基模,孵化到其他办公或信息处理行业。
关于模型犯错与边界,零幺指出模型有迎合、舔用户特点,因为听话会得较好Reward;基模研发多由Benchmark引导,但大部分流量对模型帮助不大,因为不够难,所以构建难Benchmark。部分Benchmark开始看模型能否拒绝、说不会,但准确率和拒答是trade off。团队会在部分Benchmark加入类似观察,评估不仅衡量说得多对,也衡量知道自己不知道,以及两者平衡。月引补充,在金融智能体评测基准FAB等Bench中,有些模型用多口径路径,不确定就把85条全答出来以拿好分,但真实行业用户不能接受行研给85条、80条决策,顶多接受2-3个判断。因此训练中不仅看结果,还要对行为设Reward和惩罚,严肃场景中对幻觉的拒绝Reward要更重,宁愿说不知道,也不要给很多口径让用户猜。
整场对话勾勒出蚂蚁百灵的一条差异化路线:在算力约束下,以智效比为核心,把金融、医疗等真实高难度场景作为模型能力上限的试验场,再通过行业知识反哺基座,同时以开源方式与社区共建。西亭坦言,国内厂商由于资源约束反而能长出不一样的能力,进入金融与医疗正是这一逻辑的实践,而AGI的实现路径应比Coding更广泛。