英伟达在IFA 2026上宣布了一系列加速本地AI的举措,与微软及合作伙伴共同推动智能体在个人电脑上的本地化运行。新发布的紧凑型NVIDIA RTX Spark Windows PC将于十月上市,联想和宏碁将推出相关产品,为AI爱好者、开发者和创作者提供更多本地运行强大智能体的选择。同时,英伟达还发布了个人AI路由器工具NVIDIA PAIR,能够智能地在用户家庭局域网内的多台PC之间分配AI推理任务,从而提升整体效率。

在软件优化方面,英伟达宣布通过llama.cppvLLM的新优化,本地推理速度最高可提升1.9倍,这些优化现已通过LM Studio和Ollama提供。此外,Hermes Agent、OpenClaw和Perplexity Portable Computer这三款主流智能体应用将获得简化本地模型设置的支持,减少手动配置,让用户更轻松地在RTX和DGX系统上运行本地智能体。Perplexity Portable Computer此前已支持Linux系统,Windows版本即将推出,允许用户在不消耗云端积分的情况下运行完整工作流,并在需要时选择性升级到云端15+前沿模型。

在游戏生态方面,Electronic ArtsEmbarkUbisoft等游戏发行商和开发商将把其热门游戏带到RTX Spark平台,进一步丰富本地AI的应用场景。

回顾八月,本地AI领域也迎来多项进展。英伟达发布了Nemotron 3.5 Lightning,这是一个300亿参数的模型,可运行于RTX PC、RTX PRO工作站、DGX Spark和Jetson设备。此外,Z.ai的GLM-5.3-Flash多模态MoE模型将智能体AI引入DGX Station;Qwen发布了Qwen3.8-Flash-NextQwen3.8-27B模型,后者为270亿参数,针对本地智能体和编码工作负载优化。LTX的LTX 2.5是面向RTX GPU、DGX Spark和DGX Station优化的开放世界视频生成模型,支持NVFP4、FastVideo和ComfyUI增强。MiniMax-H3是支持同步音频的开源视频生成模型,而FastVideo与英伟达研究人员合作发布了FastH3,通过四步蒸馏将性能提升7倍。Meta的Muse Glimmer是300亿参数的开源模型,适用于编码和智能体工作负载。此外,英伟达还发布了支持DGX Spark的NVFP4量化技术,以及DeepSeek v4 Flash——一个2840亿参数的MoE模型,可在双DGX Spark集群或DGX Station上运行。

这些举措表明,英伟达正积极推动AI从云端向本地设备延伸,通过硬件、软件和生态合作,降低本地AI的使用门槛,提升性能。对于AI产业而言,本地推理的加速可能减少对云服务的依赖,同时为PC硬件市场带来新的增长点。英伟达与微软、游戏开发商等伙伴的合作,也预示着AI应用将更深入地融入个人计算和娱乐场景。