Architect Labs 近日宣布,其人工智能系统根据人工编写的规范,自主生成并完全验证了端到端的、可用于生产的人工智能加速器 Redwood。该项目由 Ebrahim Hussain 和 Aaditya Subedi 领导的定制芯片 AI 研究实验室完成,仅由两位人类架构师提供技术规范,AI 系统在不到两周的时间内完成了芯片的设计和全面验证,并参与了固件和定制内核的设计,将现代 AI 模型映射到硬件上。目前,Redwood 运行在 FPGA 平台上,可对包括 Llama 和 Qwen 在内的数十亿参数模型进行推理。
据相关人士介绍,Redwood 代表着半导体行业的一个重要里程碑:一个人工智能系统自主设计出了一款可运行 AI 模型的量产型 AI 芯片。这种方法在 AI 模型和为其优化的硬件之间建立了反馈回路,有望将芯片设计速度提升到超越传统开发周期的水平。性能测试结果也表明,Redwood 不仅仅是概念验证。基于三星的 8nm 工艺,Redwood 的吞吐量是 NVIDIA Jetson Orin Nano 的 1.75 倍,功耗却降低了 1.9 倍,这意味着在相同的 AI 模型下,其每瓦性能提升了 3.4 倍。
传统芯片设计可能需要数年时间和数亿美元投入,而专业人才的日益匮乏使得先进半导体研发集中在少数几家大型公司手中。因此,AI 工作负载往往需要适配远在最新型号问世之前设计的硬件。Redwood 采取了不同的方法,从一开始就将硬件和软件进行协同设计。内核、固件和 RTL 代码共同开发和优化,使芯片能够根据 AI 工作负载进行定制,而不是强迫软件去适应现有的硬件。这形成了一个持续的反馈循环:改进的 AI 模型可以为更好的硬件设计提供信息,而更高效的硬件可以实现更好的 AI 性能,从而有可能加速开发周期的两端。
英特尔前工程高级副总裁 Sunil Shenoy 评论道:“四十年前我刚入行时,芯片设计只需要一两个工程师。从那时起,设计的复杂性、耗时和风险都呈指数级增长。即使 EDA 工具和技术不断进步,一个芯片项目仍然需要耗费数年时间和庞大的工程团队。Redwood 真正实现了范式转变,树立了技术前沿的标杆。Architect Labs 正在以我以前难以想象的速度,将曾经只有少数巨头才能掌握的能力普及化。他们的方法有望将硬件带回未来。”
Redwood 是一个端到端的 AI 推理平台,专为需要在严格的功耗限制下实现实时性能的物理 AI 应用(例如机器人、无人机和边缘设备)而设计。其核心是一个可扩展的矩阵和向量计算引擎网格,这些引擎通过专用的片上网络连接起来。完整的 AI 推理流程,包括注意力机制、键值缓存和即时量化,都直接在芯片上运行,无需依赖主机处理器。计算引擎、网络、固件和定制内核作为一个统一的系统进行设计和优化,使硬件能够紧密匹配现代 AI 工作负载。Redwood 还可以扩展到更大的数据中心 SoC,或作为独立的芯片组运行。
关于自主 Redwood 设计的关键统计数据:100% 的 RTL、UVM 验证环境、形式验证、固件、驱动程序和自定义计算内核均由 Architect Labs 的 AI 系统根据人工编写的规范在不到两周的时间内端到端生成,而该项目由两名人类架构师参与。达到签核级验证标准,硬件零缺陷:从单个 IP 到整个 SoC,每个模块的代码和功能覆盖率均超过 95%,验证过程使用了商用 EDA 工具、Architect Labs 专有的形式化验证引擎以及硬件在环验证。从仿真到 FPGA 平台的首批 RTL 代码均未发现任何缺陷。
Redwood Nano 部署在 AMD Versal FPGA 上,运行频率为 250MHz,可对包括 Qwen 在内的开放权重模型执行实时单批次推理。Architect Labs 在今年的设计自动化大会(DAC)上进行了现场硬件演示,是展会上为数不多能够展示 AI 设计的加速器并实时运行模型推理的公司之一。在与 NVIDIA Jetson Orin Nano 采用相同工艺的三星 8 纳米工艺平台上,Redwood 的吞吐量提升了 1.75 倍,功耗降低了 1.9 倍,每瓦性能提升了 3.4 倍(以运行相同模型的 Jetson 基准测试为基准)。这些预测结果基于 FPGA 的直接测量数据,而非仅基于仿真。
架构迭代以天为单位,而不是以季度为单位:对高级规范的任何更改都会导致硬件在 48 小时内完全重新生成、重新验证和重新部署,但受 EDA 工具运行时间限制的 SoC 级运行除外。递归式自我改进:部署在 Redwood 上的 AI 模型以 API 端点的形式公开,发现了加速器本身的计时和内核优化,推理成本几乎为零,从而闭合了 AI 和驱动它的硅芯片之间的闭环。
Kindred Ventures 的创始人兼管理合伙人 Steve Jang 表示:“每个计算时代的进步都离不开底层硬件的支持,但也受限于谁有能力制造相应的芯片。Redwood 芯片的问世初步证明,这道门槛可以打破:两个人——从一份书面规范和目标 AI 模型入手——利用 Architect Labs 的系统,在短短几周内就完成了极具竞争力的 AI 加速器的设计、验证和部署。无论你是前沿研究实验室、机器人制造商还是云运营商,为你的产品或平台量身定制芯片的概念如今正逐渐成为现实。”
Architect Labs 的 AI 系统能够并行优化整个计算堆栈,从模型和内核到固件和 RTL 代码,而非采用传统芯片设计中常见的顺序、孤立的工作流程。这使得软件和芯片能够在流片过程中进行协同优化,设计迭代时间可能从数月缩短至数周。这种方法可以根据效率在软件和硬件之间切换功能,例如,用专用硬件逻辑替换数千个软件周期,或者将调度任务移至编译器。Redwood 证明,这些权衡取舍现在可以在几天内通过硬件完成设计、验证和测试,从而为将该方法扩展到更复杂的芯片奠定了基础。
Architect Labs 联合创始人兼首席执行官 Ebrahim Hussain 表示:“三十年前,像台积电这样的晶圆代工厂让任何拥有设计方案的人都能获得世界一流的制造能力,由此催生了以英伟达、博通和苹果等公司为代表的无晶圆厂半导体产业。同样,我们正在引领无设计半导体产业的发展,像 Redwood 这样的芯片可以与运行的工作负载共同设计和演进。我们设想,拥有密集型工作负载或专用 AI 模型的软件公司可以获得共同设计的定制芯片,而无需组建庞大的设计团队,无需在架构上投入十年时间,也无需退而求其次使用现成的通用解决方案,从而节省性能、功耗和成本。每一项重要的工作负载都值得拥有专属的定制芯片。我们正在构建这样一个未来。”
Architect Labs 表示,公司已将同样的方法应用于财富 500 强合作伙伴,以软件开发的速度共同设计定制芯片,并将原本需要数月才能运行的程序压缩到数周内即可完成。Redwood 是这项技术首次公开展示其成果。
从产业角度看,Redwood 的意义在于它展示了 AI 系统能够自主完成从规范到硬件的完整设计流程,且性能超越现有主流边缘 AI 芯片。这有望降低芯片设计的门槛,使更多软件公司能够获得定制芯片,从而改变 AI 硬件市场的竞争格局。同时,AI 与硬件的协同进化可能加速整个 AI 产业的创新节奏。不过,Redwood 目前仍基于 FPGA 验证,其量产和实际应用效果尚待观察。