中科曙光scaleFabric技术体系落地,为国产大模型Token效率提升注入新动能

   时间:2026-09-14 17:06 来源:互联网作者:顾青青

近日,中科曙光正式推出基于scaleFabric原生无损RDMA的Token加速技术体系,构建了“算—存—传”三级紧耦合的超级通道,并实现GPU直通网络IBGDA技术的国内首次规模化应用。这一突破标志着国产AI计算基础设施在系统级创新领域迈出关键一步,为大规模模型训练与推理提供了更高效的硬件支撑。

据技术团队介绍,scaleFabric网络架构在时延控制上达到国际领先水平:单跳转发时延仅260纳秒,网卡端到端时延低于1微秒,与英伟达NDR方案持平;在三跳基准测试中,端到端时延较主流RoCE方案降低63%。这一特性在万卡级分布式训练场景中尤为关键,网络通信耗时占比可从30%-50%显著压缩,为计算、存储、网络协同优化提供了基础保障。

中科曙光高速网络互联产品部总工程师万伟指出,当前AI大模型普遍采用Transformer架构,Token处理效率已成为衡量模型效能的核心指标。随着模型规模扩张,单GPU难以承载完整模型,必须通过模型并行方式在集群中分配计算任务。这一过程中,Token数据在GPU间的传输效率、KV Cache的存储复用能力,以及网络通信的同步性,共同构成了制约模型产出的三大瓶颈。

针对计算环节的通信延迟问题,scaleFabric原生支持GPUDirect RDMA技术,允许网卡直接读写GPU显存,绕过CPU内存中转。更进一步的IBGDA技术则将通信控制权完全交给GPU,使GPU Kernel可直接驱动网卡进行数据传输。这种设计消除了传统路径中CPU协调通信产生的延迟,在高频小包通信场景中可提升30%以上的传输效率。

存储系统的优化同样关键。技术团队构建了包含NVMe over RDMA、XDS和NFS over RDMA的存储直通技术体系:NVMe over RDMA加速远端NVMe存储访问,XDS支持GPU直接读取远端存储数据,NFS over RDMA提升传统文件存储效率。三项技术可根据场景动态组合,例如训练数据加载采用NFS over RDMA,热点数据通过NVMe over RDMA加速,KV Cache卸载则依赖XDS实现GPU直连存储。

在MoE(混合专家)架构大模型应用中,scaleFabric的IBGDA技术展现出显著优势。以DeepSeek模型为例,其通过DeepEP框架实现的专家并行通信会产生大量高频小消息,传统网络方案难以满足需求。IBGDA的规模化部署使集群推理性能提升15%-20%,首Token时延(TTFT)和输出Token时延(TPOT)等关键指标得到优化。

值得关注的是,这项突破性技术已实现软硬解耦。中科曙光北京公司scaleFabric产品经理纵瑞博透露,IBGDA作为软件技术层,已完成与国产生态和NVIDIA生态的适配。用户只需启用支持IBGDA的通信库,无需修改上层业务代码即可获得性能提升,这种“透明式”升级方案大幅降低了技术迁移成本。

从产业视角看,IBGDA的规模化落地为国产AI计算基础设施提供了新的发展路径。在单卡算力存在差距的现实条件下,通过系统级创新提升集群整体性能成为关键突破口。scaleFabric网络架构已与DeepEP等通信框架完成适配,其开放架构设计也正在与多家国产GPU、CPU厂商展开联合优化,旨在构建除RoCE和InfiniBand之外的第三条技术路线。

技术演进方面,scaleFabric下一代产品将支持800G网络带宽和更高交换容量,同时引入多平面架构、包喷洒技术和乱序重组能力。这些升级将进一步优化拥塞控制、故障自愈和负载均衡机制,为MoE等复杂模型架构提供更高效的国产高速互连方案,推动国产智算基础设施通过系统优化实现整体性能跃升。

 
 
更多>同类内容
全站最新
热门内容