时政新闻
网站首页 国内 国际 读数 军事 航空 科技 政务 公益 学“习”进行时 媒体 教育 健康

中国移动云发布异构混合推理系统,类脑芯片与国产GPU协同突破算力瓶颈

更新时间:2026-09-13 浏览量: 

类脑芯片“牵手”国产GPU,探索大模型推理新架构

随着生成式人工智能快速发展,大模型规模持续扩大,推理阶段对算力资源的需求也不断增长。如何在提升模型响应效率的同时降低算力投入,正在成为AI基础设施建设的重要课题。

9月13日,在2026算力中国展览会首发首秀活动上,中国移动云公司类脑与光实验室技术总监杜宇健发布了一套面向大模型推理的异构混合推理系统。

与传统依赖单一GPU架构的方案不同,这套系统采用“类脑芯片+国产GPU”的组合方式,将不同类型的计算资源进行协同调度,希望通过优势互补提升整体推理效率。

从单一架构走向异构协同

此次发布的系统采用灵汐科技类脑芯片与天数智芯GPU进行混合部署,针对大模型推理任务进行算力协同。

传统GPU集群虽然具备较强的通用计算能力,但随着模型参数量不断增长,单纯增加GPU数量并不意味着计算效率能够同步提升。同时,持续扩充高性能GPU资源,也会带来较高的建设和运营成本。

异构计算的思路,则是根据不同任务的计算特征,将任务分配给更适合的芯片完成。通过这种方式,可以减少单一计算架构承担所有任务带来的资源浪费。

中国移动云方面将此次方案定位为对大模型推理架构的一次探索,其技术路线对标英伟达Vera Rubin与Groq等异构算力方案。

DeepSeek V4 Flash场景性能提升超过1倍

从实际测试数据来看,这套异构混合推理系统的性能表现成为此次发布的重要看点。

在DeepSeek V4 Flash推理场景下,采用类脑芯片与国产GPU组合的系统,相较同类GPU集群,整体性能提升超过1倍。同时,系统运营成本降低40%以上。

这意味着,在相同或相近算力资源条件下,通过合理组合不同类型的计算芯片,有机会进一步释放现有基础设施的计算潜力。

杜宇健表示,引入类脑算力相当于给现有GPU资源增加了一层“涡轮增压”。这一比喻也体现出异构算力并非简单替代GPU,而是希望通过协同方式放大现有GPU资源的使用效率。

国产芯片协同成为重要方向

此次系统的另一个关注点,在于其采用了国产类脑芯片和国产GPU的组合。

当前,AI大模型产业对算力基础设施提出了越来越高的要求,从训练到推理,不同阶段对计算资源的需求并不完全相同。单一芯片架构很难覆盖所有场景,因此,将CPU、GPU、NPU、类脑芯片等不同类型的计算资源进行组合,正在成为算力基础设施的重要探索方向。

对于国产算力产业而言,异构协同也意味着竞争重点可能从单颗芯片的性能,进一步延伸至芯片、服务器、软件平台和调度系统之间的整体协作能力。

如果不同国产芯片能够在统一的软件和系统框架下实现高效协同,就有望提高算力资源利用率,并进一步拓展国产算力在AI推理场景中的应用空间。

大模型推理进入“效率竞争”阶段

过去,大模型算力竞争更多关注芯片数量、峰值算力以及模型训练能力。随着AI应用逐渐进入实际生产和消费场景,推理效率的重要性正在不断提升。

对于云计算企业而言,大模型推理不仅需要满足用户对响应速度的要求,还需要控制单位请求背后的算力成本。尤其是在高并发应用场景下,即使单次推理成本出现小幅下降,规模化运行后也可能形成明显的经济效益。

因此,如何让不同算力资源各司其职,并通过软件调度实现高效协同,可能成为下一阶段AI基础设施竞争的重要方向。

从“堆算力”到“用好算力”

此次中国移动云发布异构混合推理系统,也反映出AI算力产业正在从单纯扩大资源规模,逐步转向提升资源使用效率。

“类脑芯片+国产GPU”的组合,并不意味着传统GPU路线失去价值,而是尝试通过增加新的计算单元,为现有GPU资源提供补充。对于算力基础设施运营商来说,如果能够在不大规模增加硬件投入的情况下获得更高的推理性能,同时降低运营成本,这种技术路线无疑具有进一步探索的价值。

随着大模型持续演进,未来AI算力体系可能越来越呈现多元化特征。不同类型芯片之间的协同能力,以及软硬件一体化调度水平,都可能成为决定算力效率的重要因素。

从这个角度看,此次异构混合推理系统的发布,不仅是一次具体产品和技术方案的亮相,也体现了国产算力产业围绕大模型推理效率和自主可控能力进行的新一轮探索。


文章来源:网络  文章作者:小编 

上一篇 : 菏泽“元青花杯”举报再有进展:文旅部门称调查接近尾声,举报人