一家尚未公开名称、也没有正式产品的创业公司,已经拿到了近3000万美元融资,投后估值2亿美元。投资方包括五源资本和IDG,团队规模约10人,计划在2027年前后发布完整模型。这个价格放在当下的世界模型赛道并不算离谱,但放在创始人田柯宇身上,故事就多了一层反差。
两年前,田柯宇还是字节跳动的一名实习生。字节称他因严重违规被辞退;几乎同一时间,他参与的论文拿下了NeurIPS 2024最佳论文。如今,他带着同一份技术履历进入世界模型创业。
这笔钱买的是什么
五源资本今年组织的一次讨论,把世界模型归纳为在动作条件下预测世界状态变化。这个定义尚未成为行业共识,但它点出了资本为何开始关注这个方向:AI下一步要处理的,不只是文字和图片,还包括空间、时间和动作。
田柯宇的公司选择此时进入,吃的是一个明显的时间窗口。世界模型还没有稳定的产品形态,行业也没有统一的评测标准。对投资人来说,这意味着风险很大,但也意味着技术路线、创始人和论文成绩仍然可以先拿来定价。
田柯宇最有价值的资产,是一篇论文。2024年,他作为第一作者发表《Visual Autoregressive Modeling》,提出让模型按照图像的不同尺度逐层生成,而不是像传统模型一样逐个像素或逐个视觉Token处理。论文称,这种方法能提高图像生成的速度和效率。这篇论文后来获得NeurIPS最佳论文奖。面对相关争议,NeurIPS回应称论文采用盲审,评奖依据是科学质量。
此次创业方向基本延续了这条思路。据报道,田柯宇的团队正在为AI建立一套新的视觉符号系统,包含约20万个符号,用来处理视频信息。他们计划向系统输入1亿小时的视频,并希望把视频生成成本降低至少一个数量级。
这与五源资本今年5月组织的一场世界模型社群讨论一脉相承。在一篇题为《2026年了,我们还在用爱迪生试灯丝的方式评估World Model》的文章中,其强调世界模型本质上是一场效率竞争:谁的压缩比更高,谁就能占据优势位置。对技术效率的共同追求,可能是五源资本押注人的关键。毕竟目前,田柯宇的公司没有公开模型,没有产品,也没有明确的商业模式。他的计划是先把技术做出来,再在2027年左右发布完整模型。
天才少年的以火攻火
2024年10月,关于字节跳动实习生攻击模型训练的消息在社交媒体上成为AI圈的离经叛道传奇。当时最夸张的版本是:事件涉及8000多张GPU,给字节造成上千万美元损失。
字节跳动随后回应,称确有实习生因严重违纪被辞退,但受影响的只是商业化技术团队的某个研究项目,不涉及字节的大模型,也没有影响线上业务;8000多张卡和上千万美元损失的说法严重夸大。第一财经后来报道称,字节内部通报认为,这名实习生在2024年6月至7月因不满资源分配,通过编写、篡改代码等方式干扰研究项目的模型训练任务。字节因此与他解除实习协议,并向法院提出800万元损失、2万元合理支出及公开道歉等诉求。之后字节否认了网上流传的损失金额和GPU数量。
最新报道中披露,田柯宇也给出了自己的说法。他承认自己关闭过另一名实习生的程序,目的是释放计算资源给其他研究人员。他把这件事形容为用火攻火,并表示如果重新来一次,会采取更谨慎的做法。报道还称,最终的结果是赔偿50万元,并没收全部工资。
东方贝尔资本合伙人Vita Gu表示,国家政策对具身智能给予了强力支持,市场上的资金也同样积极。该机构参与了田柯宇公司的投资。她还表示,在众多创业者中,田柯宇给她留下了特别深的印象,因为他能够把一个复杂的想法讲得很简单。
全球世界模型竞赛加速
田柯宇开始创业之际,全球范围内的世界模型竞争正在加速。9月,AMD宣布以约82亿美元的全股票交易收购李飞飞创办的World Labs。World Labs此前已完成10亿美元融资,做的是能够生成、重建和模拟三维空间的模型。Google DeepMind的Genie 3可以根据文字生成能够实时探索的虚拟环境,运行速度达到每秒24帧,并在几分钟内维持场景的一致性。中国公司也开始把视频生成往实时交互上推,PixVerse今年发布R1、R2,主打连续生成和可交互的视觉世界。
这些产品看起来仍然像视频工具,但行业想要的东西已经不只是画面更逼真。视频模型负责生成下一帧画面;更严格意义上的世界模型,还要理解动作和结果之间的关系:机器人向左移动之后会发生什么,摄像机换一个角度后原来的物体是否仍然存在,某个物体受到外力后会如何运动。田柯宇的公司能否在2027年前后交出完整模型,将检验这笔2亿美元估值买下的究竟是论文光环,还是可落地的技术效率。