在近日于无锡举办的第三届中国计算机学会芯片大会(CCF Chip 2026)上,中科通量发布了全球首款RISC-V数据流架构视频智能AIGC芯片——金刚GC3。该芯片采用12核设计,主频2.0GHz,单芯片INT8算力达200 TOPS,FP16算力为32 TFLOPS,支持128路1080P@30fps硬解码和64路硬编码,专为视频场景定制,旨在解决通用芯片在视频处理中的效率瓶颈。

大会期间,两院院士与工程师围绕底层架构的“根技术”创新展开讨论。核心议题是:当摩尔定律逼近物理极限、制程红利稀薄时,堆核心、拼频率的传统路径是否已到尽头?与会者提出,与其在通用架构上打补丁,不如从数据流动的本质出发,为特定场景原生设计芯片。金刚GC3正是这一思路的产物,其定位并非通吃所有AI负载,而是专注视频流处理。

当前,AI算力消耗中视频占据主导,从文生视频到城市摄像头实时解析,再到工业产线质检,视频流已成为AI基础设施的主航道。然而,传统CPU、GPU基于控制流架构,依赖程序计数器逐步推进指令,数据在内存与计算单元间频繁搬运。中科通量总工程师罗鑫指出,在视频处理中,数据搬运消耗的能量往往是实际计算的数倍,这种“搬砖式”算力难以应对视频流的海量、连续、高并发特性。此外,视频编解码与AI推理深度耦合,需要细粒度并行和极低延迟,通用架构的缓存未命中、分支预测失败等问题在视频场景下被放大。

数据流架构则采用“数据就绪即执行”模式,没有程序计数器,计算节点在输入齐备时自动触发,结果直接传递,无需频繁访问全局内存。这种模式天然契合视频流的多路并行需求,可大幅降低访存开销。中科院计算所研究员叶笑春在大会“数据流计算分论坛”上表示,数据流架构没有程序计数器,只有“数据就绪即执行”。现场专家比喻,GPU如同万人协同的大工厂,而数据流芯片则是自动化的智能流水线,无空转、无堵车。

金刚GC3的发布被视为数据流架构从理论走向实战的标志。上海交通大学教授冷静文评价,该芯片在视频AI推理上具备与主流GPU掰手腕的峰值能力,同等功耗下的视频处理密度是其差异化优势。不过,现场也有专家提出编译器易用性、生态建设、大规模工程落地等现实挑战,这些问题表明数据流技术已进入实战检验阶段。

金刚GC3的定位折射出国产算力演进的新路径:不在通用赛道追赶巨头,而是在视频等场景深水区构筑护城河。从跟随适配到场景定义,该芯片释放的信号是,算力效率的最优解可能并非对通用架构的修补,而是从数据流动本质出发,为特定应用量身定制芯片。这一方向对AI基础设施中的视频处理环节具有潜在影响,也为RISC-V生态在高端算力领域的商业化提供了新案例。