文章

国产 GPU+类脑芯片异构混合推理系统:大模型推理的国产化新路径

中国算力大会上,移动云联合南湖研究院等五方发布国内首个国产 GPU+类脑芯片异构混合推理系统:Attention 交 GPU、FFN 交类脑芯片,在 DeepSeek V4 Flash 上能效提升 1 倍以上、成本降低 40% 以上。

一句话总结

2026 年 9 月 12 日,移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学,在 2026 中国算力大会“算力首创首发发布会”上发布国内首个国产 GPU+类脑芯片大模型异构混合推理系统:将 Transformer 的 Attention 计算交给国产 GPU、FFN 模块交给类脑芯片,在 DeepSeek V4 Flash 大模型上验证实现推理输出与能效提升 1 倍以上、业务运营成本降低 40% 以上。

背景:大模型推理的双重瓶颈

随着人工智能产业重心从模型训练转向规模化推理服务,推理算力已成为支撑词元工厂、AI 智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求,传统单一 GPU 推理架构面临双重瓶颈:一方面,数据频繁搬运带来“内存墙”和“功耗墙”;另一方面,国内先进芯片制程供给受限,单纯依靠硬件工艺升级提升算力的空间有限。

技术方案:国产 GPU 与类脑芯片分工

该项目从系统架构创新入手,首次将国产通用 GPU 与类脑芯片深度融合,创新实现 Transformer 模型 PD/AF 分离推理模式:

  • Attention(注意力)计算:交由国产 GPU 承载。
  • FFN(前馈网络)模块:交由类脑芯片处理,发挥类脑芯片存算一体、片上大容量 SRAM 的架构优势,突破传统 GPU 推理的固有瓶颈。

团队同时自研模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度、结果聚合,使两种架构的算力优势互补。

验证结果:在 DeepSeek V4 Flash 上完成调优

项目已在 DeepSeek V4 Flash 大模型上完成完整调优验证。对比同类国产 GPU 算力集群:

  • 推理输出和能效:均提升 1 倍以上;
  • 业务运营成本:降低 40% 以上。

这意味着依托国内成熟工艺的国产芯片,通过系统架构创新可以实现对标国际下一代推理架构的业务能力,为大模型推理国产化落地提供可复制的技术范式。

产学研协同与落地计划

该成果是产学研用协同创新的典型实践,整合运营商、芯片企业、科研院所、高校多方力量,打通从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续团队将持续迭代异构推理系统,面向词元工厂、AI 代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证,并计划将核心异构推理框架逐步开放,赋能国内 GPU、类脑芯片厂商及算力运营商。

数据来源与参考