AI超节点Scale Up域总线各层优化设计
AI超节点Scale Up域总线各层优化设计
采用普遍的类PCIE三层架构模型进行分析如下,抛砖引玉,斧正为雅
一、物理层
物理层向上为数据链路层提供数据收发服务;向下通过 SerDes(Serializer/Deserializer)串行通道与对端连接。
物理编码子层(Physical Coding Sublayer,PCS)完成数据的 FEC(Forward Error Correction)编解码和扰码。在发送方向上 PCS 从数据链路层接收数据,对其进行 FEC 编码和加扰后发送给 PMA;在接收方向上 PCS 从 PMA 接收数据,完成解扰和 FEC 译码后将数据发送到数据链路层。
物理媒介适配子层(Physical Medium Attachment,PMA)从串行通道上收发比特流,完成时钟恢复、信号调制解调、格雷编码、预编码、并串转换等功能,支持物理编码子层通过介质无关方式与多种物理链路连接。
链路状态管理通过链路管理状态机实现链路训练及链路故障恢复功能,完成链路两端的速率、链路宽度、均衡参数及编码模式等的协商。成功完成链路训练后,物理层可以向数据链路层提供数据收发服务。
serdes编码方式逐步升级提升单链路速率
--NRZ~25.6Gbps PAM4~112Gbps/224Gbps
Serdes多链路绑定提升通道带宽 -x2、x4、x8
轻量级FEC降低延时-随着FEC纠错能力增强,时延数十ns级逐渐增加
二、链路层
数据链路层负责数据的可靠传输、错误控制与链路管理,采用 CRC 校验(也可以有FEC)和选择性重传机制LLR。采用 FLIT(flow control digit) 作为基本传输单元,基于信用机制CBFC (credit-based flow control)的双向流量控制,防止接收端缓冲区溢出,确保链路高效利用。
数据链路层特性参数(N系):
• 最小传输单元:128-bit Flit(16 字节)
• 数据包组成:Header Flit + Payload Flit
• 数据包长度:1∼18 Flit(16B∼288B)
• 链路层错误校验:25-bit CRC
• VC:2 个(VC0 高优 / VC1 大数据)
使用定长的FLIT的作为基本传输单元有如下几个优势:
避免使用重量级FEC纠错方式,提高带宽利用率降低传输开销
降低时延,轻量级FEC+链路级重传LLR精确重传FLIT而不是整个TLP
相比TLP调度更精细化流控和负载均衡
CBFC (credit-based flow control)和LLR(Link Level Retry)在我们常用的PCIE总线中有应用,FLIT的应用与数据通行中常见的信元交换属于同类技术。
三、事务层
事务层核心任务是将GPU或CPU要执行的操作封装成标准的数据包,通过标准链路发送出去。执行数据包的封装/拆封、数据事务类型的转化包括(内存读写、原子操作、地址翻译、一致性操作等)、为集合通信提供协议基础。
事务层优化:
统一内存方便设备间互相访问内存
内存语义简化编程模型,减少消息通信拷贝-封装-传输-解封-拷贝等,提升通信效率
集合通信使进程间的数据交换、同步或聚合更简单高效
