PPIO于近日正式发布Fusion融合模型,这一创新方案通过智能模型网关将多个专家模型的输出进行融合,旨在以远低于旗舰模型的成本实现超越顶级模型的智能水平。在DRACO深度研究基准测试中,PPIO使用三个开源模型融合后的评分超越了Claude Fable 5,而成本仅为后者的十分之一。这一成果表明,智能的提升不再局限于参数规模的扩大,也可以通过调用层的工程化编排来实现。

Fusion融合模型的核心在于其网关架构。与传统API网关仅做简单请求转发不同,PPIO的智能模型网关将每次调用组织成一场“专家会诊”:复杂任务被同时分发给多个各有所长的“专家模型”并行作答,再通过思考编排与交叉验证,由主模型融合生成最终答案。这一过程使得网关本身成为智能增量的来源,而非仅仅是一个转发通道。

2026年的大模型市场进入密集迭代期,Claude、GPT、KimiGLM等主流模型几乎每季度都有新版本发布,排行榜头部位置频繁更替。然而,所有模型均存在“偏科”现象,代码生成、长文档理解、数学推理、多语言翻译等维度上,没有一个模型能同时在所有领域领先。更棘手的是幻觉问题——模型产生幻觉时无法自我发现,错误答案与正确答案在语气、格式、流畅度上没有区别,在医疗建议、金融合规等场景中,错误一旦被采纳,纠错成本极高。

PPIO认为,偏科和幻觉的根源在于单个模型对同一问题只有一条推理路径,无法覆盖复杂问题的多个角度。Fusion融合模型通过引入多条独立推理路径,让多个模型的一致结论互相印证,降低偏科盲区;冲突之处被标记出来进一步推敲,为拦截幻觉提供第二视角;不同路径汇总后的覆盖面大于任何单一路径,补上了视角遗漏。由于多个模型并行执行,等待时间取决于最慢的一个,不会随模型数量线性增长,且某模型失败时网关会跳过它继续融合,使整条链路更抗抖动。在Agent多轮交互中,同一回合已获得的参考结果会被复用,避免重复消耗Token,实际成本增幅远低于“调用了多个模型”的直觉。

在DRACO深度研究基准测试(专门评估AI智能体执行复杂深度研究任务的能力)中,PPIO以Kimi K3、GLM 5.2、MiniMax M3为参考模型(Advisors)、DeepSeek V4 Flash为融合主模型(Aggregator)进行融合推理。值得注意的是,这三个参考模型单独拿出来都不是各自赛道的榜首,性能提升主要来自编排层,这印证了智能增量可以来自调用层的组织方式。

在2026年世界人工智能大会(WAIC)期间,PPIO联合创始人兼CEO姚欣提出了Agent时代的核心公式:Agent生产力 = Token智能密度 × Agent Loop时长。Token智能密度决定Agent每一步决策的质量上限,Agent Loop时长决定它能持续运行多久、完成多复杂的任务。过去提升Token智能密度只能被动等待下一代模型发布,而现在,模型的选择权在使用者手里,Fusion融合模型在调用层做编排提升智能密度,让用户无感实现智能提升。

PPIO的这套能力已通过规模验证。截至2026年6月,PPIO日均Token调用量超1.2万亿,较2025年同期增长超8倍。根据灼识咨询统计,在中国独立AI云计算服务提供商中,PPIO日均Token消耗量排名第一。今年,PPIO入选中国信通院首批“企业级Token服务性能攀登基线”,通用场景下跑出TPS ≥ 55个/秒、TTFT ≤ 0.9秒、调用成功率 ≥ 99.9%的指标。

Fusion融合模型的发布,为AI应用开发者提供了一种“用得起”且“用得聪明”的新选择。在模型能力普遍偏科、幻觉问题难以根除的背景下,通过调用层融合多模型,或许能成为提升智能水平的另一条可行路径。随着Agent应用的普及,对延迟、稳定性和成本的敏感度将远高于传统场景,PPIO的融合方案能否在更广泛的生产环境中持续兑现其宣称的性能与成本优势,值得持续关注。