Architect Labs 近日宣佈,其人工智慧系統根據人工編寫的規範,自主生成並完全驗證了端到端的、可用於生產的人工智慧加速器 Redwood。該專案由 Ebrahim Hussain 和 Aaditya Subedi 領導的定製晶片 AI 研究實驗室完成,僅由兩位人類架構師提供技術規範,AI 系統在不到兩週的時間內完成了晶片的設計和全面驗證,並參與了韌體和定製核心的設計,將現代 AI 模型對映到硬體上。目前,Redwood 執行在 FPGA 平台上,可對包括 Llama 和 Qwen 在內的數十億引數模型進行推理。

據相關人士介紹,Redwood 代表著半導體行業的一個重要里程碑:一個人工智慧系統自主設計出了一款可執行 AI 模型的量產型 AI 晶片。這種方法在 AI 模型和為其最佳化的硬體之間建立了反饋迴路,有望將晶片設計速度提升到超越傳統開發週期的水平。效能測試結果也表明,Redwood 不僅僅是概念驗證。基於三星的 8nm 工藝,Redwood 的吞吐量是 NVIDIA Jetson Orin Nano 的 1.75 倍,功耗卻降低了 1.9 倍,這意味著在相同的 AI 模型下,其每瓦效能提升了 3.4 倍。

傳統晶片設計可能需要數年時間和數億美元投入,而專業人才的日益匱乏使得先進半導體研發集中在少數幾家大型公司手中。因此,AI 工作負載往往需要適配遠在最新型號問世之前設計的硬體。Redwood 採取了不同的方法,從一開始就將硬體和軟體進行協同設計。核心、韌體和 RTL 程式碼共同開發和最佳化,使晶片能夠根據 AI 工作負載進行定製,而不是強迫軟體去適應現有的硬體。這形成了一個持續的反饋迴圈:改進的 AI 模型可以為更好的硬體設計提供資訊,而更高效的硬體可以實現更好的 AI 效能,從而有可能加速開發週期的兩端。

英特爾前工程高階副總裁 Sunil Shenoy 評論道:“四十年前我剛入行時,晶片設計只需要一兩個工程師。從那時起,設計的複雜性、耗時和風險都呈指數級增長。即使 EDA 工具和技術不斷進步,一個晶片專案仍然需要耗費數年時間和龐大的工程團隊。Redwood 真正實現了範式轉變,樹立了技術前沿的標杆。Architect Labs 正在以我以前難以想象的速度,將曾經只有少數巨頭才能掌握的能力普及化。他們的方法有望將硬體帶回未來。”

Redwood 是一個端到端的 AI 推理平台,專為需要在嚴格的功耗限制下實現即時效能的物理 AI 應用(例如機器人、無人機和邊緣裝置)而設計。其核心是一個可擴充套件的矩陣和向量計算引擎網格,這些引擎通過專用的片上網路連線起來。完整的 AI 推理流程,包括注意力機制、鍵值快取和即時量化,都直接在晶片上執行,無需依賴主機處理器。計算引擎、網路、韌體和定製核心作為一個統一的系統進行設計和最佳化,使硬體能夠緊密匹配現代 AI 工作負載。Redwood 還可以擴充套件到更大的資料中心 SoC,或作為獨立的晶片組執行。

關於自主 Redwood 設計的關鍵統計資料:100% 的 RTL、UVM 驗證環境、形式驗證、韌體、驅動程式和自定義計算核心均由 Architect Labs 的 AI 系統根據人工編寫的規範在不到兩週的時間內端到端生成,而該專案由兩名人類架構師參與。達到籤核級驗證標準,硬體零缺陷:從單個 IP 到整個 SoC,每個模組的程式碼和功能覆蓋率均超過 95%,驗證過程使用了商用 EDA 工具、Architect Labs 專有的形式化驗證引擎以及硬體在環驗證。從模擬到 FPGA 平台的首批 RTL 程式碼均未發現任何缺陷。

Redwood Nano 部署在 AMD Versal FPGA 上,執行頻率為 250MHz,可對包括 Qwen 在內的開放權重模型執行即時單批次推理。Architect Labs 在今年的設計自動化大會(DAC)上進行了現場硬體演示,是展會上為數不多能夠展示 AI 設計的加速器並即時執行模型推理的公司之一。在與 NVIDIA Jetson Orin Nano 採用相同工藝的三星 8 奈米工藝平台上,Redwood 的吞吐量提升了 1.75 倍,功耗降低了 1.9 倍,每瓦效能提升了 3.4 倍(以執行相同模型的 Jetson 基準測試為基準)。這些預測結果基於 FPGA 的直接測量資料,而非僅基於模擬。

架構迭代以天為單位,而不是以季度為單位:對高階規範的任何更改都會導致硬體在 48 小時內完全重新生成、重新驗證和重新部署,但受 EDA 工具執行時間限制的 SoC 級執行除外。遞迴式自我改進:部署在 Redwood 上的 AI 模型以 API 端點的形式公開,發現了加速器本身的計時和核心最佳化,推理成本幾乎為零,從而閉合了 AI 和驅動它的矽晶片之間的閉環。

Kindred Ventures 的創始人兼管理合夥人 Steve Jang 表示:“每個計算時代的進步都離不開底層硬體的支援,但也受限於誰有能力製造相應的晶片。Redwood 晶片的問世初步證明,這道門檻可以打破:兩個人——從一份書面規範和目標 AI 模型入手——利用 Architect Labs 的系統,在短短幾周內就完成了極具競爭力的 AI 加速器的設計、驗證和部署。無論你是前沿研究實驗室、機器人制造商還是雲運營商,為你的產品或平台量身定製晶片的概念如今正逐漸成為現實。”

Architect Labs 的 AI 系統能夠並行最佳化整個計算堆疊,從模型和核心到韌體和 RTL 程式碼,而非採用傳統晶片設計中常見的順序、孤立的工作流程。這使得軟體和晶片能夠在流片過程中進行協同最佳化,設計迭代時間可能從數月縮短至數週。這種方法可以根據效率在軟體和硬體之間切換功能,例如,用專用硬體邏輯替換數千個軟體週期,或者將排程任務移至編譯器。Redwood 證明,這些權衡取捨現在可以在幾天內通過硬體完成設計、驗證和測試,從而為將該方法擴充套件到更復雜的晶片奠定了基礎。

Architect Labs 聯合創始人兼執行長 Ebrahim Hussain 表示:“三十年前,像台積電這樣的晶圓代工廠讓任何擁有設計方案的人都能獲得世界一流的製造能力,由此催生了以輝達、博通和蘋果等公司為代表的無晶圓廠半導體產業。同樣,我們正在引領無設計半導體產業的發展,像 Redwood 這樣的晶片可以與執行的工作負載共同設計和演進。我們設想,擁有密集型工作負載或專用 AI 模型的軟體公司可以獲得共同設計的定製晶片,而無需組建龐大的設計團隊,無需在架構上投入十年時間,也無需退而求其次使用現成的通用解決方案,從而節省效能、功耗和成本。每一項重要的工作負載都值得擁有專屬的定製晶片。我們正在構建這樣一個未來。”

Architect Labs 表示,公司已將同樣的方法應用於財富 500 強合作伙伴,以軟體開發的速度共同設計定製晶片,並將原本需要數月才能執行的程式壓縮到數週內即可完成。Redwood 是這項技術首次公開展示其成果。

從產業角度看,Redwood 的意義在於它展示了 AI 系統能夠自主完成從規範到硬體的完整設計流程,且效能超越現有主流邊緣 AI 晶片。這有望降低晶片設計的門檻,使更多軟體公司能夠獲得定製晶片,從而改變 AI 硬體市場的競爭格局。同時,AI 與硬體的協同進化可能加速整個 AI 產業的創新節奏。不過,Redwood 目前仍基於 FPGA 驗證,其量產和實際應用效果尚待觀察。