2026年云栖大会的主论坛议程出现明显变化:在吴泳铭发言之后,第一个登台的是千问大语言模型负责人刘大一恒,紧随其后的是ATH技术副总裁郑波,负责视听等多模态模型;两场模型演讲之后,才是平头哥高慧与阿里云CTO李飞飞。芯片和云依然是阿里的底牌,但市场聚光灯已经转向模型——阿里的模型往哪走、做多大、能不能打,成为牵动神经的问题。

下一代Qwen要做多大,是市场最直接的悬念。此前一年多,业内对Scaling的质疑不断,但到2026年年中风向明显调转。Anthropic CEO Dario Amodei在摩根士丹利会上定调称Scaling没有撞墙,2026年还会迎来一轮激进加速。行业行动也印证了这一点:Fable 5被估算为约4.5万亿至5万亿参数,Kimi K3总参数达到2.8万亿。回到Qwen,2026年8月发布的Qwen3.8参数已达2.4T。刘大一恒在演讲中给出路线图:Qwen4系列即将到来,之后的Qwen4.5和Qwen5计划进一步迈向5T—10T参数。两年前Qwen2.5旗舰模型参数量还是72B,到Qwen3.8已扩大至2.4T,增长约33倍;若继续迈向5T—10T,规模还将在现有基础上再扩大一倍至三倍以上。刘大一恒明确,基础模型的智能上限依然离不开算力、数据和模型规模的持续投入,阿里会继续扩大预训练计算量,沿着Scaling Law向上走。

但模型越大,训练和推理账单越高。阿里的解法是一边扩大规模,一边重新设计模型架构。Qwen3.8-Flash已展示这条路线:通过稀疏注意力、线性注意力和外接记忆等新架构,每次推理只激活6B参数;相比上一代,训练成本降至九分之一,百万Token输入价格降至四分之一,超长上下文的预填充吞吐量提高8.6倍,模型能力反而继续上涨。这意味着阿里下一阶段的Scaling不只是把模型做大,而是用更低成本支撑更大模型继续向前。

Qwen5还要等多久,是第二个问题。当下模型竞争节奏越来越快,今天登顶的模型几周或几个月后就可能被追平,一个版本领先很难形成长期优势,真正重要的是谁能更快产生下一代模型。一个越来越被认真对待的方向是让模型参与造模型,即RSI(递归自我改进)。Anthropic曾给Claude一段训练小模型的代码让它自己找办法提速:去年Claude把代码提速到原来的3倍,今年最新模型已能做到52倍,而人类研究员花半天通常只能做到4倍左右。OpenAI则训练了专门攻击其他模型的GPT-Red,用攻击样本训练下一代GPT,结果是GPT-5.6面对最难的一类提示注入攻击时,失败率比四个月前的模型低了约六倍。

阿里在RSI上的做法更进一步:让Qwen不只调用工具,也开始参与建设自己的技术栈。最典型的实验发生在芯片设计上——研究团队只给Qwen3.8-Max一份真实的片上网络(NoC)模块规格,没有参考代码和现成测试样例,模型在60多个小时里自己调用EDA工具,完成从编写电路描述、验证到后端物理实现的全流程,期间没有逐轮人工介入,最终芯片物理面积减少42%,功耗估算下降59.5%。在推理基础设施上,面对一款此前从未适配过的平头哥新GPU,Qwen3.8-Max自己修改和优化SGLang推理框架,用56小时完成部署,将日常对话场景的单实例吞吐量提高96%。模型训练本身,阿里披露Qwen3.8-Max曾连续自主运行一个多月,完成33轮有效实验。国产芯片的软件生态过去要靠工程师一点点补,现在模型开始亲自参与这项工作——梁文锋此前也提到,国产硬件首先要解决生态问题,TileLang等更高层编程方式正提供新机会,DeepSeek内部已开始探索用AI编写TileLang。当然,距离模型自主造出下一代模型仍有距离,但方向已经清楚:模型竞争不再只是比谁发布更强版本,也开始比谁能让模型更深地进入训练、推理、芯片这些研发环节。

多模态做到哪一步,是第三个问题。郑波给出明确时间:下一代视频生成模型将在11月亮相。他把视频生成的下一阶段称为Agent Video——过去的视频模型解决能不能生成逼真画面,随后图片、视频、声音等参考信息被加入让结果更可控,下一步模型要做的不只是生成素材片段,而是理解创作者想讲什么:用户给出想法,模型自己拆解剧情、设计分镜、安排人物和场景,最后生成完整视频。新版本将沿更长、更可控、更完整、更智能四个方向推进。

其他多模态模型也有升级。图像生成模型Qwen-Image-3.1面向电商、创意、设计等真实商用场景优化,将原本数小时的视觉设计压缩至秒级交付,并支持图像精准编辑。语音方面发布Qwen-Audio-3.1系列,语音转写、语音合成和实时语音交互三类模型全面升级,其中Qwen-Audio-3.1-Realtime能够边听、边想、边说,并增强多语言交互、角色扮演和共情能力,已应用于千问办公和Qoder,并接入QwenNote A2随身助理、QwenNote Eva桌面机器人和千问AI眼镜等硬件产品。音乐生成模型HappyShrimp1.1在音乐表现、人声质量、多语种演唱及指令理解四个维度提升,支持百余种曲风与十余种主流语言。世界模型HappyOyster公布2.0 Preview版本,能更准确模拟物体运动和碰撞,通过3D时空记忆保持场景稳定并降低交互延迟;阿里还联合高校和产业伙伴搭建世界模型Benchmark和Arena,试图为这一早期方向建立共同评价标准。郑波给出更远判断:三年之内,行业可能出现原生的全模态统一生成模型,可同时生成图像、视频和音乐,也能理解空间和世界。

三个问题拼在一起,勾勒出阿里下一阶段更清晰的模型路线:一条追逐AGI边界,一条抵达AI普惠日常,最终汇于让更高智能走出实验室、落进现实世界。