在近期关于模型所有权、开源与闭源、以及主权 AI 的激烈讨论中,Poolside AI 的联合 CEO Eiso Kant 通过一期深度播客访谈,详细拆解了其团队如何以极小的规模和惊人的速度,训练出性能超越近 10 倍规模对手的模型。

Kant 在访谈中透露,Poolside 最新发布的 Laguna S 2.1 模型拥有 118B 总参数,其中仅 8B 参数 在推理时被激活。该模型在多项基准测试中击败了 Thinking Machines 近期发布的、拥有近 1T 参数 的开放权重模型。这一成果的取得,并非依靠庞大的算力堆砌,而是源于其自建的 「模型工厂」(Model Factory)——一个端到端的系统,能够将模型从预训练到发布的全周期压缩至 8 周

支撑这一效率的核心是工程创新。Poolside 的团队规模不到 70 名研究人员,但每月能运行 1 万至 2 万次实验。Kant 强调,模型构建最终 90% 是工程问题。他们通过将数据直接流式传输到训练过程中、使用不可变数据和版本化代码确保实验可复现、以及采用低精度计算来提升效率。这种系统化的实验流水线,使得团队能在模型训练开始后的 30 分钟内 就对新的检查点进行初步评估。

Kant 回顾了 Poolside 的创业历程。早在 2015 年,受 Andrej Karpathy 的 RNN 工作启发,他就开始为代码构建语言模型,并在市场尚未关注前投入了 4 年时间和 1200 万美元。ChatGPT 的发布被他视为一种「平反」,并促使 Poolside 回归开源路线。他明确表示,宁愿生活在一个有 100 家基础模型公司 的世界,也不愿看到只有 5 家寡头垄断,即使 Poolside 是那五家之一。

在技术哲学层面,Kant 认为 持久性、验证和回溯 可能比原始智能更重要。他指出,较小的模型可能处理的知识工作远超预期,而 强化学习(RL) 将更早地融入预训练阶段。他批评当前的 MCP(模型上下文协议 和传统工具调用方式「愚蠢」,认为未来的智能体将直接编写脚本,而非从数十个预定义工具中选择。

关于模型开发的真实成本,Kant 透露,最终的训练运行往往是「反高潮」的,真正的投入在于前期海量的实验和工程调试。Poolside 此前完成了 5 亿美元 的融资,当时投资者仍在质疑 AGI 是否真实存在。他预测,智能可能成为世界上需求最大但也最商品化的资源。

访谈还涉及了开源 AI 的监管问题。Kant 警告,单方面的 AI 安全措施在全球化竞争环境中难以奏效,而不当的监管可能意外地锁定一个由两三家 AI 公司组成的寡头垄断格局。他同时承认,英伟达(NVIDIA)台积电(TSMC) 的硬件系统是基础模型进步的关键支撑。