科技
设为书签Ctrl+D将本页面保存为书签,全面了解最新资讯,方便快捷。
业 界/ 互联网/ 家 电/ 通 信/ 数 码/ 手 机/ 平 板/ 笔记本/ 相 机 培训 学校 课程
当前位置:科技 > 快讯 >

重大突破!国产GPU2:1等效国际主流GPU,摩尔线程联合硅基流动发布技术白皮书

重大突破!国产GPU2:1等效国际主流GPU,摩尔线程联合硅基流动发布技术白皮书
2026-08-27 09:04:23 来源:看点时报

日,硅基流动与摩尔线程联合发布《PD分离异构算力混部实践技术白皮书》(以下简称“《白皮书》”),为国产GPU规模化落地提供了新的技术路径,首次系统阐述基于硅基流动自研高能推理引擎、以摩尔线程MTTS5000与国际高端GPU协同工作的PD分离推理方案。

经真实生产级集群验证,该方案验证了国产GPU的实用能,在Prefill阶段以2:1部署比例实现国产GPU对国际高端GPU的算力等效替代,全链路服务质量全面对标纯国际高端GPU集群,为国产算力大规模商业化部署提供了可量化、可复制的实践。

Token需求大爆发,异构混部破解算力瓶颈

大模型行业重心正从“训练更大模型”转向“以更高价比、更高稳定生产优质Token(词元)”。据工业和信息化部数据,截至2026年6月底,我国智能算力规模已达2185EFLOPS,同比增长177%。《白皮书》指出,面对算力需求的爆发式增长与自主可控、国产GPU规模化落地的双重挑战,将计算密集型的Prefill阶段与访存密集型的Decode阶段分离,并分别调度至最适配的异构算力执行,是破解成本、效率与国产化算力瓶颈的核心思路。

基于硅基流动自研推理引擎,国产GPU与国际高端GPU 的协同方案落地,双方在由4MTTS5000与2国际高端GPU组成的“4P2D”异构集群上部署KimiK2.6,对标由4国际高端GPU组成的“2P2D”纯国际集群。

MTTS5000凭借原生FP8精度与充沛的稠密算力,成为国产GPU承担 Prefill 计算的典型代表,专门负责Prefill阶段的大规模矩阵计算;国际高端GPU则利用4.8TB/s的显存带宽高效执行Decode阶段的逐Token生成。两侧推理精度统一采用FP8,并通过MooncakeRDMA高速网络实现KVCache跨芯片零拷贝传输,确保端到端数据的一致与正确。硅基流动高能推理引擎则在整个过程中提供统一的模型加载、执行及调度接口,使同一模型服务在异构算力之间无缝流转、高效运行。

实测数据显示,国产GPU的能表现符合预期,MTTS5000单卡在Prefill阶段吞吐量达国际高端GPU的46%至54%,在128K上下文、16并发极限场景下,单卡均吞吐达2047tokens/s。通过2:1的集群部署比例,异构集群在算力量维度全面对标纯国际集群。

全链路服务质量方面,异构集群的首Token时延(TTFT)为1至6秒,每Token输出时延(TPOT)稳定在0.011至0.020秒,系统吞吐随并发增加呈线缓下降,表现与纯国际高端GPU集群一致,证明国产GPU可承载生产级业务,充分满足在线服务严苛的SLA要求。此外,依托KVCacheFP8压缩存储,方案还可有力支撑1M超长上下文推理。

能推理引擎加持,加速国产算力从“可用”迈向“好用”

这一能突破源于国产GPU硬件与软件引擎的深度适配,硅基流动自研推理引擎与摩尔线程MUSA全栈的深度协同。硅基流动推理引擎通过统一硬件抽象层(HAL)消除了异构壁垒,实现两侧模型代码与配置完全一致,并为PD阶段分别定制并行策略,最大化异构资源利用率;摩尔线程自研MATE高能算子库则深度适配硬件指令,配合自适应无损模型量化技术,使FP8精度在异构芯片上获得与原生FP16对齐的推理精度。

作为当前国产GPU的主流产品之一,MTTS5000基于第四代MUSA架构“湖”打造,完整支持FP8至FP64全精度计算。其核心芯片PH100已首批通过中国信息安全测评中心的《安全可靠测评》(2026年第2号),安全可靠等级为I级,原生适配PyTorch等主流AI框架,支持代码滑迁移。

硅基流动高能推理引擎四层联合优化框架

目前,该方案已完成RDMA通信兼容验证及极限抗压测试,为国产GPU的大规模商用扫清了部分技术障碍,具备规模化生产落地条件。以2:1比例实现MTTS5000对国际高端GPU的等效替代,显著降低了推理成本与供应风险。

《白皮书》的发布对行业发展有深远意义。具体而言,本方案依托硅基流动推理引擎的异构调度能力,为国产算力规模化部署提供了不牺牲用户体验的可行替代路径,也为国产GPU的多元落地提供了参考范式;在KVCache通信、精度对齐、仿真调度等方面形成的可复用技术规范,也推动了异构算力标准建设;而引擎多后端统一抽象能力所支撑的异构算力高效协同,则为全国一体化算力网建设与安全可控AI产业底座的构建提供了关键技术基础。

在AI基础设施的竞争中,不只是算力规模的竞争,更是Token生产效率、系统工程能力与产业协同能力的竞争。本次双方发布的PD分离异构算力混部方案,正是“Token工厂”实现优质Token大规模、高价比生产的关键支撑,同时为国产GPU的产业化应用积累了实践经验,也为国产算力从“可用”迈向“好用”树立了重要里程碑。

关键词:

责任编辑:kj005

文章投诉热线:157 3889 8464  投诉邮箱:7983347 16@qq.com

关键词:

PLC断电保持失效原因汇总:S7-1200 RETAIN与S7-200 SMART完整解析

2026-08-24 19:18:11PLC断电保持失效原因汇总:S7-1200 RETAIN与S7-200 SMART完整解析

国产化率从不足20%到近100%,安世中国把供应链握在了自己手里

2026-08-24 09:26:46国产化率从不足20%到近100%,安世中国把供应链握在了自己手里

沙利文GIL认证|闪魔荣获全球消费电子保护膜市场领导奖

2026-08-20 11:52:14沙利文GIL认证|闪魔荣获全球消费电子保护膜市场领导奖

致力于解决AI对话一键批量导出格式乱码痛点,「AI导出鸭」启动天使轮融资

2026-08-18 10:47:53致力于解决AI对话一键批量导出格式乱码痛点,「AI导出鸭」启动天使轮融资

恒生活:AI人工智能背后的技术原理与现实意义

2026-08-17 14:47:44恒生活:AI人工智能背后的技术原理与现实意义

S-FACTORY自动化展10月将在深圳举行,八展联动聚焦智能制造应用

2026-08-17 08:38:45S-FACTORY自动化展10月将在深圳举行,八展联动聚焦智能制造应用

相关资讯

最新资讯