您当前的位置:首页 > 文章中心 > 技术应用 > 联想 × 北大:超节点通信加速论文入选顶会
联想 × 北大:超节点通信加速论文入选顶会
作者:server2008   来源:本站   点击:3   时间:2026-9-24

近日,联想与北京大学联合团队的论文《EPIC:Abstraction and Polymorphism of In-Network Collectives on Ethernet》正式入选第40届ACM SIGCOMM 2026论文录用名单,被列为超节点网络方向重点推荐成果。 

相关设计更是进入中国电子工业标准化技术协会发布的《高通量以太网互连协议》团体标准。

ACM SIGCOMM是计算机网络领域公认的顶级会议,长期入选CCF A类推荐会议目录,论文录用率常年低于18%。在该会议2026年录用名单中,中国大陆机构主导的高分论文凤毛麟角——此次入选意味着中国研究团队在超节点互连方向的核心技术能力获得国际学界顶格认可。 

EPIC协议的核心机制,是让交换机在转发数据的同时完成集合通信的聚合操作——集合通信最高加速1.59倍、端到端AI训练速度最高提升38%。

四项技术突破,把超节点拉入“边传边算”时代

超节点正在成为AI算力的“基本单位”——单节点高密度集成数十张GPU、跨节点间高速互联,把过去需要数个机柜才能完成的工作压缩到一个机柜甚至一个机箱内。这一形态下,通信正在取代计算,成为决定大模型训练效率的核心变量——传统由服务器端CPU/GPU完成的聚合计算已难以匹配超节点对低时延、高带宽的要求。 

EPIC协议要回答的核心命题,正是如何让数据在网络传输路径上即可被计算,不必再绕回服务器。这一机制从根本上重构了超节点内部的数据流动方式:原本由服务器端CPU/GPU完成的聚合被前置到交换机层面,让每一张GPU都能“少等待”。 

围绕“让多源异构设备理解同一套规则、按自身能力灵活实现”这一工程落地难题,联想研究院ICI Lab(智能计算基础设施实验室)和北大联合团队从协议抽象、实现路径、正确性保障、资源调度四个层面构建了完整的在网计算体系。 

在协议抽象层面,团队为通信软件、网卡、交换机和控制器建立统一的协作规则,明确各自负责什么、如何配合,支持AllReduce等6种常用集合通信操作,满足多张GPU之间的数据汇总、分发与同步需求。同时,EPIC沿用现有RoCE通信体系,基础方案可继续使用已有RoCE网卡,在现有以太网上增加新能力,无需推倒重来。

EPIC系统架构:控制平面与数据平面解耦,功能边界与以太网产业分工对齐

在实现路径层面,统一规则之后,还要适配不同的硬件条件。针对交换机性能、成本和可编程能力的差异,EPIC设计了3种实现模式:有的把更多传输管理工作交给主机,让交换机实现更轻量;有的加强数据丢失后的确认与补传;有的由交换机承担更完整的连接处理。厂商可以按硬件条件选择,并复用已有功能模块,逐步增加能力。

在正确性保障层面,团队引入形式化模型检查,在设定的模型范围内,系统检查数据丢失、到达顺序被打乱和重传等情况下,协议能否正常运行。验证中,团队发现了一个常规测试难以复现的隐患:部分节点尚未完成处理,交换机就提前释放临时存储空间,可能导致数据被覆盖。团队据此修正设计,在硬件实现前排除了这一隐患。

在资源调度层面,交换机的片上内存,也就是芯片内部用于暂存数据的空间,速度快但容量有限。团队通过统一管理,按任务需要分配内存,使用结束后及时回收、供其他任务复用,为超节点集群中多个训练任务共享在网计算能力提供支持。

多个层面完成验证,EPIC走向共同接口

EPIC的工程能力已在多个层面完成验证,覆盖实测、仿真、多平台适配与产业标准化四个维度。

实测层面,在8张GPU、100GbE网络和Tofino交换机测试床上,EPIC完成验证,集合通信最高加速1.59倍、端到端训练性能最高达1.38倍、AI训练速度最高提升38%。这是当前大模型训练场景下“通信取代计算”这一关键命题的明确工程答案。

关键性能指标:左为联想×北大项目实测(Tofino测试床),右为EPIC论文多平台评测 

仿真层面,128卡集群仿真显示作业完成时间相比传统Ring‑AllReduce方案最高缩短45.8%;2048卡仿真长尾完成时间(99分位)降低30.9%。这意味着在大模型训练的实际部署规模上,EPIC不仅能加速平均性能,还能显著降低长尾时延。 

多平台适配层面,EPIC可与现有RoCE系统正常协同;相关原型已在Tofino和网络处理器交换机上完成运行验证,FPGA与芯片设计评估进一步证明EPIC具备进入硬件的可行性。这套覆盖主流可编程交换机的验证矩阵,证明EPIC不是停留在论文层面的“理论玩具”,而是可以在真实生产环境中落地的工程方案。 

产业标准化层面,EPIC协议设计已写入中国电子工业标准化技术协会团体标准《高通量以太网互连协议》(T/CESA 1502-2026)——从一篇学术论文到一部行业团标,也是大模型训练接入更广泛开放以太网生态的标准化通道。这意味着EPIC的设计思想已经走出实验室,进入产业共识的范畴。 

​此次入选是联想与北大联合科研实力的国际级彰显,更是联想核心互连能力跻身全球第一梯队的标志性事件。更加值得一提的是,联想已于今年6月正式发布联想问天超节点算力解决方案,EPIC协议有望快速应用于这一方案之中,为联想超节点带来更加强大的算力能力。 

在算力迈向“以网络为中心”的新算力新时代,EPIC协议的真正应用舞台正是大模型训练这种高密集、超大规模、超密集通信的场景。联想将持续深化产学研协同,以EPIC等核心协议为支点夯实问天超节点互连底座能力,注入持久的联想力量。


成都联想服务器总代理 - 成都强川科技有限公司,专注企业IT服务需求,产品可按需定制。主营:联想服务器、联想ThinkPad/ThinkStation工作站、企业级存储、商用电脑等产品,以专业的IT解决方案和优质的服务体验赢得企业信赖。

服务热线:028-85041466


   
 
上一篇:物理 AI 落地产业!超聚变交出边缘算力新答卷             下一篇: 全新Dell Pro Precision 7 系列笔记本电脑
友情链接: 四川服务器总代理 | 成都服务器总代理 | 成都戴尔总代理 | 成都戴尔服务器总代理 | 成都联想总代理 | 成都浪潮服务器总代理 |
成都强川科技有限公司 版权所有 Copyright 2011-2026
全国免长途热线:400-028-6620 技术支持:028-85041466 传真:028-85215166
地址:成都市武侯区新世纪电脑城东17楼B座       ICP备案编号:蜀ICP备11026978号-2