在9月22日举行的2026杭州云栖大会上,阿里云CTO李飞飞系统阐述了阿里云的Agentic Cloud战略布局。阿里云将Model、Harness、Context作为核心构建场景,并推出全新的云上算力底座、Agent构建治理平台AgentCore、Agent Sandbox以及新一代高性能存储CPFS等一系列新品,目标是让AI真正进入生产流程、走向规模化价值创造。
李飞飞认为,随着2026年Agent爆发式增长,越来越多智能体正跨过“问答型”分水岭,进入自主规划、实时决策阶段,这对算力和云提出了更高要求。企业级Agent大规模落地需要四方面能力:以全面、统一、持续更新的上下文形成全域认知;支持自主运行与持续进化;融入安全、控制、信任和身份认证,实现人与Agent、Agent之间的可信协作;从静态规则走向实时感知、动态推理和自主行动。围绕这四大支柱,阿里云重构了从AI Native Cloud、Agent Native Cloud到Context Engine的完整技术栈。
在AI Native Cloud层面,模型尺寸正从万亿向十万亿参数跃迁,训练范式从预训练、后训练Agentic RL走向递归式自我改进RSI,要求云底座同时解决超大规模集群稳定性、毫秒级弹性、百万级并发以及训练、推理和环境交付的统一协同。阿里云展示了全栈自研算力底座,覆盖计算、存储、网络等产品线。以灵骏真武M890超节点为例,这是首个国产十万卡超节点集群,支撑了Qwen3.8 Max、KIMI K3等超2T参数大模型对外提供商业服务。即将在明年推出的灵骏真武V900超节点,性能提升三倍,搭载业界首发200Pbps通信带宽,6us时延集群架构,自研SNPO支持全光互联,支持千卡Scale-Up互连,单集群可扩展至50万卡规模,向广域超节点演进。
存储方面,阿里云推出新一代全栈自研高性能存储CPFS,提供高达百TB/s级吞吐和亿级IOPS,单文件系统规模提升5倍至100PiB,支撑大规模模型训练和多模态数据处理。在实际模型训练中,可将模型启动平均耗时降低50%、峰值算力利用率提升30%、AI存储成本降低69%,使GPU从“等待数据”转向持续高效计算。
推理方面,面对容量激增的KVCache和多轮任务普及,阿里云推出大模型KVCache管理和调度系统Tair KVCM,统一编排Mempool、KVCacheStore与远端共享存储等多级缓存,有效命中率可达99%,每token成本下降50%;推出存储加速引擎KV CacheStore,位于G3.5存储层,承接长上下文、多轮对话和复杂Agent任务产生的大量缓存,满足千亿级KV存储规模,在客户生产环境下实现缓存覆盖时间窗口扩大900%,吞吐提升20%,首token延迟降低54%;全新的智算中心融合网络TPN采用2层网络设计,访问带宽增加2.5倍,网络规模增加10倍,延时降低1/3。此外,人工智能平台PAI新增支持异步AgenticRL训练框架,打通轨迹采样、回报累计、模型训练、参数更新的环路,在支持Qwen模型后训练的实战中,实现5天完成一次SOTA模型的后训练。
在Agent Native Cloud层面,随着Harness工程和skill的成熟与普及,大模型竞争正从能力比拼转向业务价值兑现。阿里云推出企业级Agent构建治理平台AgentCore,将企业级Agent基础设施标准化、托管化,支持长任务、失败重试、断点恢复和异步执行;提供安全执行环境、资源隔离、身份权限和全链路审计,统一管理模型、MCP Server、Skill等资产,可提升任务完成率99%,TCO成本降低70%。此外,阿里云还准备了系列Agent相关产品:Agent Sandbox为Agent提供开箱即用、极致弹性、安全可靠的执行环境,创建吞吐10万/分钟,深休眠唤醒<600ms,兼容E2B和K8s;Agentic OS作为Agent原生操作系统,可节省Token消耗30%以上,沙箱部署密度提升3倍;Agentic Computer为智能体提供统一、长期在线的专属云电脑工位,兼容主流Agent框架,具备Computer Use和GUI操作能力,权限可控、操作可审计。
在Context Engine层面,决定Agent能力上限的不只是模型参数,还包括能否持续理解企业知识、业务状态和执行反馈,因此上下文正成为企业需要统一建设和治理的新型数据资产。阿里云提出“存储—计算处理—上下文工程”三位一体的引擎Context Engine,将企业全域数据转化为实时上下文。底层以多模态数据存储承接对话、视频帧、点云、轨迹和Agent反馈;中间层覆盖数据集成、转换、治理、质量和建模;上层通过全域知识库、多模态语义整合、持续记忆管理和实时上下文装配,把分散数据组织成Agent可按需调用、动态更新的上下文。产品层面,Agent Context面向复杂知识检索,将准确率提升50个百分点,Token使用效率提升3倍以上;OpenLake提供统一全模态数据湖仓,通过一份数据支持多引擎计算,使总体拥有成本降低38%;Apsara Lakebase支持亚秒级、零拷贝创建数据分支;MC-MaxFrame以自研分布式计算框架处理多模态数据,计算性能提升12%;Flink Streaming Agent提供60多种全模态算子,把实时数据流转化为可触发业务流程的实时行动。
从面向Model的模型生产,到面向Harness的自主运行与持续进化,再到面向Context的实时智能决策,阿里云正把算力、网络、存储、运行环境、身份安全和企业数据组织成统一的Agentic Cloud。李飞飞表示,阿里云已形成从AI芯片、服务器CPU,到互联、网卡、存储主控和AI软件栈的完整布局,可以从计算、网络到存储做全栈协同和联合调优,把智能生产效率做到更高。