AI集群网络/东西向流量与DPU/2026m8研究认为,2026年AI基础设施的核心瓶颈已从GPU单卡算力实质性转移至东西向流量互联与网络无损调度。 以1.6T光互联、800G高性能DPU(如NVIDIA BlueField-4)及UEC 1.0.2协议为核心的底层网络架构,正主导千亿大模型的成本与效率。 数据显示,AI集群光通信支出占比已逼近20%,网络尾部延迟与热管理技术正深刻重塑算力利用率的物理边界,推动整个AI产业链的价值重估。m8观点:一句话先说
结论
进入2026年,AI算力网络已从简单的物理带宽堆叠全面过渡到基于系统级无损调度的第二阶段,以超以太网联盟(UEC)开放标准、1.6T硅光与CPO技术、以及具备深度软硬件卸载能力的DPU为核心的底层互联生态,正在重塑超大规模数据中心的资本支出结构与真实的算力投资回报率。
为什么这个变量在 2026 年重要2026年,全球AI基础设施的建设逻辑发生了根本性的演化,市场关注点从单纯的“获取算力”全面转向了“较大化算力利用率”。
在这一宏大叙事中,网络架构及其核心组件变量的重要性被提升到了前所未有的高度。
这种重要性的跃升并非偶然,而是由数据中心内部流量模型的重构、大模型推理架构的演变以及物理传输极限的逼近共同催生的可能结果。
数据中心流量模型的本质跃迁是驱动网络重要性提升的最核心动力。
在传统的云计算中心,网络流量主要表现为南北向(North-South),即终端用户与服务器之间的数据交互。
然而,现代AI集群的流量特征已经被较大程度改变,庞大的集群几乎完全被服务器节点间、机架间的东西向流量(East-West Traffic)所占据。
在训练千亿乃至万亿参数规模的前沿模型(如GPT-5或Gemini Ultra级别)时,成千上万张GPU必须像一个统一的计算引擎一样协同工作。
这种分布式训练高度依赖于All-Reduce和All-to-All等集合通信操作,GPU在每次迭代中都需要频繁、持续地交换梯度和参数。
据行业监测数据表明,在现代分布式训练和推理工作负载中,高达40%至75%的周期时间被消耗在等待网络通信上。
当数万个节点并发发送数据时,网络中极易产生微突发流量(Micro-bursts),进而导致严重的网络拥塞和尾部延迟(Tail Latency)。
GPU在等待数据到达的间隙处于较强的空闲状态,这种昂贵计算资源的闲置直接摧毁了AI基础设施的投资回报率。
因此,网络不再仅仅是连接设备的管道,而是决定集群算力上限的较强瓶颈。
与此同时,2026年多模态大模型和Agentic长上下文推理的爆发,对基础设施的内存调度架构提出了极端的要求。
在处理数百万Token的长上下文时,系统面临着巨大的键值缓存(KV Cache)存储压力。
NVIDIA在此阶段明确提出了系统级的架构重构,引入了G3.5层(Context Memory Tier)概念,将高速网络与存储架构深度耦合。
为了维持高并发下的生成速度(TPS),系统必须将“温数据”(即近期使用但无法全部放入GPU HBM的KV Cache)卸载到高速、共享的闪存层。
这一机制的顺畅运行高度依赖于800Gbps的高速低延迟以太网,以及能够执行复杂协议终结的DPU(数据处理器)。
例如,NVIDIA BlueField-4 DPU通过其内置的高算力ARM核心,在网卡端直接终结NVMe-oF协议,实现零延迟的内存调度与预加载。
在这种架构下,网络与DPU不再是边缘辅助部件,而是构成了分布式共享内存的直接物理基础。
底层网络协议的革命同样在2026年迎来了历史性突破。
传统的无损以太网架构主要基于RoCEv2(RDMA over Converged Ethernet)和PFC(优先流量控制)构建。
然而,在十几万张GPU同时通信的极端场景下,PFC机制极易引发拥塞扩散甚至网络死锁,其固有的“队头阻塞”问题严重限制了扩展性。
为了打破这一僵局,超以太网联盟(Ultra Ethernet Consortium, UEC)在2025年6月发布了1.0规范,并在2026年1月迅速迭代至1.0.2版本。
UEC协议从根本上重写了AI通信规则,引入了包级粒度的智能数据包喷洒(Packet Spraying)、原生支持数据包乱序传输与目标端按序交付,以及基于选择性重传(Selective Retransmission)的现代拥塞控制机制。2026年是UEC生态硬件(包括智能网卡和交换机)大规模量产并交付云厂商的元年。
实测数据显示,采用UEC协议的RDMA技术在AI集合通信中,相较于传统的RoCEv2,能够带来高达25%的整体性能提升,极大地缓解了大规模集群下的拥塞崩溃风险。
在物理传输带宽方面,AI集群的扩张也正无情地逼近硅半导体与铜介质的物理极限。
随着下一代GPU(如NVIDIA Blackwell系列)单卡网络带宽吞吐量跨越800Gbps,前端光互联网络必须进行代际跨越。2026年,博通Tomahawk 5 (51.2T) 以及支持102.4T交换容量的Tomahawk 6开始规模化主导核心交换机市场。
与之配套的1.6T光模块、OSFP224封装标准,以及单波长200G甚至400G(400G per lambda)调制技术的成熟,成为了满足算力集群数据吞吐的重要出路。
然而,极端的SerDes频率带来了功耗的失控,传统全DSP(数字信号处理器)光模块的单口功耗超过20W,对数据中心的电力分配和热管理造成了灾难性压力。
这种物理约束直接催生了无DSP架构的线性驱动可插拔光模块(LPO)以及共封装光学(CPO)技术在2026年进入实质性商用爬坡期,深刻改变了网络设备的硬件形态与产业链价值分布。
产业链和
公司映射在全球化技术分工与海量AI资本支出(CapEx)的双重驱动下,2026年AI网络产业链呈现出算力寡头、传统网络巨头与光通信核心供应商三足鼎立的激烈竞争格局。
这种格局的演化速度远超传统电信时代,资本正以前所未有的速度向能够解决“东西向流量互联”的头部企业集中。
在以太网交换芯片与系统级设备领域,博通(Broadcom)稳坐商用交换机硅芯片的较强霸主地位。
其Tomahawk 5芯片通过5纳米制程在单片硅晶圆上实现了51.2Tbps的惊人交换容量,单芯片即可支持64个800G端口,其共享缓存架构有效抵御了AI微突发流量的冲击,且在一台设备中替换了多达48台第一代Tomahawk交换机的吞吐量,极大削减了功耗。
面向超大规模部署,博通更进一步推出了Tomahawk 6(102.4T),剑指支持超过一百万个加速器节点的互联需求。
传统的企业网络霸主思科(Cisco)与Arista Networks也在加速向AI网络腹地渗透。
思科推出了集成Silicon One G200芯片的Nexus系列设备,并与AMD深度合作,在交换机层面引入智能可编程数据面功能;而Arista则凭借其高可靠的EOS操作系统及基于Tomahawk 5的7060X6 AI Leaf交换机系列,主打极低延时与自动化运维,帮助客户将故障解决时间从数小时压缩至微秒级。
同时,新兴厂商如Micas Networks在OFC 2026展会上通过联合博通推出业界首款51.2T的CPO交换机系统,试图在解决功耗瓶颈的维度上弯道超车,该系统通过消除插拔模块的DSP功耗,实现了超过40%的能耗节省。
在DPU与SmartNIC(数据处理器与智能网卡)赛道,DPU已经从早期单纯的网络协议卸载工具,全面进化为整个AI工厂的分布式“操作系统”底座。
市场预测DPU市场规模在2034年将达到44.4亿美元,复合年增长率逼近15%,近半数的云服务商已将核心训练任务的调度交给DPU处理。
NVIDIA无疑是该领域的标杆,其第三代BlueField-3已经能提供相当于300个通用CPU核心的卸载算力。
而在2026年随Vera Rubin平台交付的第四代BlueField-4,更是集成了1260亿个晶体管与64个Grace架构的ARM核心,支持PCIe Gen6及高达800Gbps的网络吞吐量。
BlueField-4不仅用于网络加速,更被大量存储软件服务商(如VAST Data)用于在硬件底层直接接管零信任安全与NVMe-oF存储编排。
作为最强有力的挑战者,AMD通过整合Pensando团队,推出了业界首款原生支持UEC标准协议的AI网卡——Pensando Pollara 400。
该网卡支持400G吞吐量,内置P4全硬件可编程引擎,官方宣称在集合通信性能上相较于竞争对手的RCCL方案有10%的提升,并且通过UEC协议使网络资本支出降低多达58%。
此外,AMD还提供Giglio DPU,凭借144个P4匹配处理单元及双200G接口,深耕数据中心安全防火墙与存储卸载市场。
博通亦不甘示弱,发布了Thor Ultra 800G AI以太网网卡,全面兼容UEC协议,与Arrcus、DriveNets等软件厂商合作,构建完全开放的端到端AI以太网生态。
在国内市场,A股映射同样活跃。
被称为“国产DPU第一股”的云豹智能(Yunbao Intelligence)已向深交所提交创业板IPO申请,这家拥有腾讯作为重要股东的初创企业,主要为国内大型电信运营商及云厂商提供自主可控的DPU解决方案,展现了底层算力网络国产化的强烈诉求。
高速光模块与光互联组件(Optical Transceivers)则是整个AI网络产业链中资本支出弹性较大、价值捕获最显著的环节。
据多家权威机构综合评估,2026年全球光模块市场规模预计在154.2亿美元至171.5亿美元之间,其中专为AI集群服务的光学互联市场规模更是较两年前翻番,突破100亿美元大关。
中际旭创(Zhongji Innolight)作为全球高端光模块的较强龙头,据彭博社及行业研报数据显示,其在全球1.6T光模块细分市场中已占据约50%至70%的惊人份额。2026年,中际旭创启动了规模高达80亿美元的香港二次上市,拟将募集资金直接用于1.6T与3.2T光学模块的深水区研发及全球产能的疯狂扩张。
面对市场关于需求波动的杂音,公司明确指出,不仅1.6T需求维持强劲,由于传统云厂商与新兴大模型初创企业(Neoclouds)的结构性叠加,800G模块的需求实际上远超预期。
另一家行业巨头新易盛(Eoptolink)同样在2026年启动了约50亿美元的赴港上市申请。
在OFC 2026展会上,新易盛展示了基于单波400G(IMDD)的1.6T DR4 OSFP光模块,该架构通过极高的通道速率将传统1.6T DR8的光纤连接数量硬生生削减了50%,并在针对高密散热场景推出了高达12.8T吞吐量的XPO液冷插拔光模块解决方案。
北美巨头Coherent(高意)则凭借从芯片外延生长到模块封装的全产业链整合能力,在800G及1.6T领域展示了极宽的产品线。
其不仅推进传统的磷化铟(InP)与EML技术,更在硅光(SiPh)及多模VCSEL激光源技术路线上拥有深厚储备,持续巩固其作为北美顶级云服务商核心供货商的地位。
关键数据与对比表为了深度透视2026年AI网络链路中复杂的技术演变与规格跃升,我们通过梳理公开来源的技术白皮书与产品参数,构建了以下核心维度的技术比对。
这些数据不仅揭示了硬件形态的更迭,更反映了底层逻辑由“通用性”向“AI专用明显性能”的妥协与进化。
表 1: 2026年新一代主流 DPU / SmartNIC 技术规格对比在AI集群中,DPU的价值已不仅由网络端口速率决定,其内部集成的通用计算核心(如ARM)数量、硬件卸载流水线的设计思路,决定了其能接管多大程度的CPU工作负载。
设备型号 / 厂商最高网络吞吐量核心计算与处理架构关键网络协议与针对性优化核心制程与发布/量产节点BlueField-4 (NVIDIA)800 Gbps (双端口)64核 Grace ARM 架构 CPUNVMe-oF完全终结,G3.5 KV Cache调度,MACsec/IPsec线速加密,PCIe Gen6 支持1260亿晶体管,2025发布,2026年随Vera Rubin平台全面量产交付Pensando Pollara 400 (AMD)400 Gbps全硬件可编程 P4 引擎业界首款全面支持 UEC Ready,智能数据包喷洒,乱序交付机制,集合通信性能提升+25%HHHL及OCP-3.0封装,兼容现有服务器,2025/2026年部署爬坡Giglio DPU (AMD Pensando)400 Gbps (2x 200G)16核 Arm A72 + 144个 P4 MPU面向数据中心安全防火墙、状态包检测及SDS存储虚拟化卸载,支持双DDR5-5600深度聚焦企业级与存储互联,提供强健的遥测与故障隔离能力Thor Ultra (Broadcom)800 Gbps专用网络优化 ASIC 芯片全面实现 UEC 规范合规,端到端路径感知拥塞控制,支持 RDMA 与 PCIe Gen6协同 Tomahawk 6 交换机,2025发布,2026年向大型CSP规模出货表 2: 1.6T 光互联技术路径演进 (2026 市场结构性拐点)在1.6T时代,光互联技术被迫在信号完整性与功耗灾难之间做出抉择。
由于200G/Lane PAM4超高频电信号在PCB板上仅能传输极短距离,传统的全数字信号处理(DSP)架构遭遇了严重的热力学瓶颈,促使产业向线性驱动与共封装架构分裂。
技术演进路径英文简称架构原理与核心特点核心优势劣势与工程挑战2026年市场所处阶段传统全DSP重定时光模块Retimed Pluggable模块内部集成高算力、高功耗的DSP芯片进行信号均衡、时钟恢复与误码纠错信号还原能力极强,与现有各种品牌交换机兼容性极佳,产业链生态最成熟单模块功耗极高(通常>20W),在1U设备内密集插满时带来极大的热管理与供电压力依然是市场主流与大规模出货基石,但受限于机架散热墙的严格物理约束线性驱动可插拔光模块LPO (Linear Pluggable)完全移除DSP芯片,仅保留线性驱动器(Driver)和跨阻放大器(TIA),依赖交换机侧ASIC进行信号均衡直接将模块功耗降低约50%,消除DSP处理导致的数据延迟,并显著降低BOM成本对交换机SerDes信号质量要求极其苛刻,电链路传输距离大幅受限,跨厂商互操作性较弱已作为高能效替代方案进入商用爬坡期,受追求明显PUE的算力中心青睐共封装光学 / 近封装光学CPO (Co-Packaged) / NPO改变物理形态,将光学引擎与交换机ASIC直接封装在同一块基板上(CPO)或极近距离放置(NPO)较大程度消除前面板到交换芯片的PCB电信号损耗,降低系统总功耗30%-40%,极大地提升端口密度系统架构被较大程度推翻,光纤管理极其复杂,若激光器发生故障,后期维护与更换整板的成本极高处于技术验证与头部云厂商的小批量导入部署阶段,被视为面向未来的终极方案表 3: AI集群底层网络协议代际特征从RoCEv2向超以太网(UEC)的跃迁,是2026年解决网络尾部延迟的软件层核心叙事。
传统以太网为“尽力而为”的容忍丢包网络,而AI则需要明显的无损和微秒级延迟。
关键网络特性维度传统数据中心以太网协议RoCEv2 (当前 AI 互联主流标准)UEC 1.0 / 1.0.2 (新一代 AI 专用开放标准)多路径调度与负载均衡ECMP(基于五元组的流粒度散列)ECMP(依然依赖数据流的哈希熵,在“大象流”下极易产生路径拥挤与哈希极化)Packet Spraying(智能包级喷洒,将同一数据流拆分为独立数据包通过所有可用物理路径并发传输,完美利用每一兆带宽)数据到达顺序管理要求严格按序到达严格按序到达,一旦某个数据包延迟或丢失,将导致后续所有数据包被阻塞(队头阻塞)原生支持乱序到达,通过目标端网卡的智能硬件引擎进行高速重组并直接按序写入GPU内存,无需中间缓冲拥塞控制机制与防御反应式检测,丢包后减速重传基于 PFC(优先流量控制),通过发送暂停帧控制流量。
极端拥塞下会引发“拥塞树”甚至全网死锁路径感知拥塞控制,结合遥测信息进行前馈预判;具备快速故障检测机制,避免使用PFC带来的灾难性级联阻塞错误恢复与重传策略Go-Back-N (退回 N 重新传输)Go-Back-N (从丢失的数据包开始,将后续所有已发送的数据包重新传输一遍,极度浪费带宽)选择性重传 (Selective Retransmission),精准定位丢失的个别数据包,仅重传缺失部分,极大地提升了网络有效吞吐量宏观、资金或技术约束在向更高维度、更大规模扩展的过程中,AI网络架构的走强突进正面临着一系列深刻的资本分布、物理定律以及技术标准协议壁垒的严格约束。
这些宏观层面的制约因素,决定了技术路线落地的真实节奏。
首先是不可逾越的物理电信号损耗与散热墙(Thermal Constraints)。
在向1.6T单端口演进的过程中,行业普遍采用8通道的200G PAM4信号体制。
在这个极高的频率下,电信号在传统PCB覆铜板上的传输变得极其脆弱,其插入损耗和信号失真呈指数级上升。
为了对抗这种物理衰减,传统的插拔式光模块被迫引入庞大且算力密集的DSP芯片进行数字均衡。
然而,这导致1.6T全DSP模块的功耗直接突破20W以上。
当一台高密度交换机面板插满这种模块时,其前端将聚集数千瓦的极端热量,这不仅远超传统风冷的散热极限,其消耗的庞大电能也直接挤占了机柜分配给GPU计算核心的有效供电空间。
这种物理约束迫使整个基础设施建设方加速向液冷专题演进,并倒逼产业界以前所未有的紧迫感去推进LPO(线性驱动)和CPO(共封装光学)等“去DSP化”技术的商业化落地。
散热与信号完整性已经成为限制网络平滑升级的最直接物理阻碍。
其次,资本支出结构的剧烈漂移构筑了设备供应商的深厚护城河。
根据Dell'Oro Group和LightCounting的研究数据,AI基础设施中的网络部分开销占比正处于快速攀升的通道中。
在传统企业级数据中心,网络投入占整体算力设备的比例极低;但如今,为了保障十万张级别加速卡的无缝运转,系统规划者每在GPU计算上投入1美元,就应对应投入高达0.15至0.20美元于网络设备、光互联和交换矩阵上,这一比例相较于2023年几乎翻了一倍。
这种宏观资金的较强数额极其庞大,导致大型云服务提供商(CSP)在供应链选择上面临极高的试错成本,对设备良率和准时交付的容错率降至冰点。
中际旭创、新易盛等头部企业之所以能够形成寡头垄断的市场份额,正是因为大批量、高良率地交付基于复杂工艺(如硅光、柔性板贴片等)的1.6T和800G模块,其门槛已经极其高昂。
后发厂商很难在短期内逾越“高规格资格认证与大规模产能交付”的资金与技术鸿沟,马太效应在光通信领域被无限放大。
最后,UEC专利池的组建与多源协议融合的阵痛,是开放标准取代封闭生态必须经历的考验。
网络协议的整体切换需要极其庞大且漫长的产业协同。
虽然UEC 1.0/1.0.2旨在构建一个反供应商锁定(Vendor Lock-in)的开放架构,让不同品牌的网卡、交换机和光缆能够即插即用,但其底层技术的重构伴随着错综复杂的知识产权(IP)问题。
为此,全球领先的技术许可机构Sisvel在2026年初特别组建了UEC专利池,覆盖了物理层技术、拥塞控制、多路径并发、端到端遥测等所有核心专利,以降低成员企业间的授权摩擦和潜在的法律诉讼风险。
但在实际数据中心的工程应用中,云厂商不仅要解决不同网卡、交换机品牌之间微代码级别的互操作性问题,还需要应对加密技术在超高带宽下的适配挑战。
例如,如何在1.6T速率下线速执行MACsec或IPsec加密,同时不牺牲宝贵的端到端延迟,是对DPU架构设计的一大考验。
如果开放协议在多厂商异构组网时暴露出过多的磨合成本,所谓“开放的以太网生态”反而会增加系统的综合持有和调试成本。
风险与证伪本项研究的核心推演,是建立在充分假定当前公开技术发展路线与资本开支趋势持续合理的基础之上。
然而,在产业的实际演进与周期波动中,存在以下几个需要高度警惕的核心证伪风险:第一,1.6T 需求结构性波动带来的阶段性预期落空风险。
在2026年中期,资本市场曾一度传出“因良率不佳或核心云厂商资本支出缩减,导致1.6T光模块需求大幅推迟”的流言,引发了光通信板块的剧烈震荡。
中际旭创等核心供应链企业对此做出了明确澄清:整体1.6T的产业总盘子并没有缩小,但内部买家结构发生了剧烈的转移。
部分传统头部客户的短期预期确实有所调降,但新兴算力中心(Neoclouds)、主权AI基础设施以及大模型初创企业对1.6T和800G产品的补足需求,甚至远远超出了此前的悲观预期。
这意味着,当前的强劲增长在一定程度上依赖于这种“结构性对冲”。
如果终端AI应用的商业变现通道迟迟无法走通,或者北美宏观经济出现实质性衰退导致初创企业融资枯竭,这种增量对冲将不复存在。
一旦总需求崩塌,1.6T的规模化放量时间节点将面临强力推迟,相关企业的估值溢价将被迅速证伪。
第二,开放互联协议(UEC)被寡头闭源生态反噬的风险。
UEC联盟的迅速壮大,建立在广大硬件厂商和云服务商“打破NVIDIA网络生态锁定”的共同利益诉求之上。
然而,NVIDIA等寡头并不会坐视巨额利润流失。
以NVIDIA NVLink协议与Quantum InfiniBand紧密耦合的网络架构,甚至是其专属的高性能以太网方案Spectrum-X(通过定制的Spectrum-4交换机加BlueField-3超级网卡紧密耦合),由于实现了系统层面的明显软硬件协同,依然在最顶级的头部模型训练集群中保持着较强统治力。
例如,xAI构建的十万张H100架构的Colossus超级计算机,通过部署Spectrum-X实现了高达95%的极高数据吞吐利用率,远超传统以太网60%的行业平均水平。
如果UEC开放标准在多厂商异构组网中迟迟无法匹敌这种闭源方案的明显性能,或者暴露出难以调和的系统级故障排查(Troubleshooting)难题,超大型客户在追求较强训练效率的驱动下,可能随时重新倒向寡头的一体化交付方案。
第三,上游核心光电芯片产能“卡脖子”与良率爬坡失败的风险。1.6T模块的大规模量产高度依赖上游极其精密的半导体基础组件。
当前的产业调研反馈显示,虽然最终模块组装厂的扩产设备交期正常,但上游关键元器件的供给依然是不可控的真正瓶颈。
特别是用于长距离和高频调制的EML(电吸收调制激光器)、支持高功率输出的CW(连续波)激光芯片,以及核心DSP处理芯片和高频多层PCB基材,仍然处于极度供给紧张状态。
如果在向单波200G或400G演进的硅光芯片制造中,基础晶圆产能遇到重大的工艺良率瓶颈,或者受到宏观地缘政治风险的突然干扰,中游组件厂商账面上庞大的规划产能将无法转化为实际的高效交付。
这不仅会推动整个大模型算力网络建设的延期危机,更会直接拖垮产业链相关企业的利润率预期。
后续观察变量为持续验证以上逻辑框架与产业趋势,我们建议在2026年下半年至2027年期间,紧密追踪以下公开验证线索,或通过站点内部的研究归档系统跟踪关键季度指
标的异动:单波400G(400G per lambda)DSP及硅光引擎的量产与认证节点:在各大展会上(如OFC 2026),新易盛等企业已经展示了基于单波400G技术的1.6T光模块(如1.6T DR4 OSFP),该技术能将光纤资源占用减半。
后续需重点观察这类前沿芯片方案能否在2026年底前顺利通过北美头部云厂商的严苛认证,并形成实质性的规模出货。
若能突破,将是降低网络光纤布线成本和提升密度的重大催化剂。
CPO / NPO 高级交换机形态的渗透率拐点:密切关注博通与Micas Networks等推出的51.2T及规划中的更高容量CPO架构交换机在Tier-1云厂商中的实际导入测试进度与采购比例。
如果CPO解决方案在极高密度的AI算力节点中开始大规模挤占传统插拔式模块的市场份额,整个光通信行业的估值模型和生态链格局将面临较大程度的底层重构。
以BlueField-4为代表的64核重型DPU的实际出货量与装机应用:NVIDIA已计划于2026年早期随其Vera Rubin加速平台全面交付BlueField-4。
需深入跟踪这类集成了海量计算核心的DPU能否按预期设计,在实际应用场景中完全实现G3.5层KV Cache的存储网络无缝卸载与高速检索。
这将直接决定未来Agentic架构数据中心的存储与内存网络融合形态。
云服务商(CSP)季度财报中CapEx的网络支出占比变化:深入剖析核心科技巨头(如微软、谷歌、Meta、亚马逊)每季度财报中披露的数据中心资本支出细节,分离出专门用于网络交换设备、DPU及光互联支出的具体增速和较强金额。
如果该比例稳定越过15%-20%的阈值并继续保持攀升态势,则本文关于“网络互联已成为AI算力核心瓶颈与最高优投资重心”的核心假说将得到最强有力的财务数据支撑。
企业级边缘 AI 网络的渗透进度:观察传统园区局域网(Enterprise LAN)为应对AI化变革的升级步伐。
根据OPELINK的技术指南,2026年企业级核心园区网络正在从40G/100G向400G/800G底座升级,以支撑边缘专属的AI Cluster Zone。
边缘侧下沉网络的带宽倍增(2x-3x规则),将构筑光通信与以太网设备市场的长尾增长底座。 FAQQ1:为什么当前AI数据中心的基础设施重点,从单纯购买GPU转向了巨资升级DPU和1.6T网络互联? A:当AI计算集群的规模从千卡级别向十万卡级别乃至百万卡级别演进时,模型在训练和推理过程中产生的参数与梯度数据,需要在海量GPU之间进行极其频繁且密集的同步通信(即东西向流量激增)。
如果底层的网络物理带宽不足,或者因为拥塞导致数据延迟波动(尾部延迟)极大,那么极其昂贵的GPU核心将陷入漫长的“数据等待”状态,导致整体集群的算力严重闲置。
升级1.6T超高速光网络与高性能DPU,本质上是为了消除这种木桶效应的短板,确保数据投喂跟得上计算速度,从而较大化昂贵计算资源的真实产出利用率与投资回报。
Q2:以NVIDIA BlueField-4为代表的新一代DPU,在当前的“长文本AI推理”中究竟扮演了什么不可替代的角色? A:在大模型推理尤其是多轮复杂对话或Agentic应用中,系统需要存储庞大的历史上下文记忆(KV Cache)。
GPU自身配备的高带宽内存(HBM,即G1层)虽然速度极快,但容量极其有限且成本高昂,成为了严重掣肘并发推理数量的瓶颈。
BlueField-4等拥有强大计算能力的重型DPU,不仅作为高速网卡处理数据包,更作为核心的I/O调度中枢,在硬件层直接终止复杂的NVMe-oF存储协议,利用低成本的闪存构建了一个跨节点的“G3.5层”高速共享缓存池。
这使得多台物理服务器之间的推理上下文可以微秒级低延迟共享和预加载,不仅释放了大量主机CPU的算力,更极大提升了整个模型推理系统的吞吐量(Tokens-Per-Second)和能效表现。
Q3:超以太网联盟(UEC)发布的1.0及1.0.2规范,相比现有的RoCEv2架构,解决了什么最致命的痛点? A:现有的RoCEv2协议严重依赖于无损以太网的优先流量控制(PFC)机制来防止丢包。
然而,在AI网络中极其容易出现的微突发和负载不均状态下,PFC会导致拥塞反向传播,极易引发“队头阻塞”甚至灾难性的全网死锁;并且它难以通过传统的哈希算法充分利用多条平行链路。
UEC规范从协议底层进行了较大程度创新,实现了“数据包级智能喷洒(Packet Spraying)”——允许属于同一个数据流的数据包打散,通过所有可用路径并发且乱序地穿越网络,并在目标端网卡的硬件引擎中智能重组、按序送入内存。
配合其独有的路径感知拥塞控制与选择性重传机制,UEC能够大幅压低尾部延迟,将端到端网络传输的效率、鲁棒性和容错性拉升至全新的技术高度。
Q4:在1.6T光互联的发展趋势中,传统DSP模块、LPO与CPO的核心区别是什么,它们会立刻发生相互替代吗? A:这三者的演进核心都在于解决1.6T超高频电信号传输所带来的巨大功耗与散热灾难。
传统模块内嵌高功耗DSP芯片来修复衰减的电信号,兼容性最强但热量极大;LPO(线性驱动插拔模块)去掉了高功耗的DSP芯片,将信号均衡的压力全部推给交换机侧的主芯片,同时保留了前面板可插拔的运维便利性,但限制了传输的物理距离和互操作性;CPO(共封装光学)则更加激进,直接将光引擎封装在交换机核心ASIC基板旁边,较大幅度缩短了电学链路,能耗降低最为显著,但较大程度改变了设备的物理形态,一旦光器件损坏,维修和生态替换成本极高。
目前,全DSP插拔模块凭借极高的可靠性仍是较强主力,LPO正快速商用以满足部分客户追求明显能效(PUE)的需求,而CPO则主要在实验室验证及头部大厂的超前小规模部署中进行探索。
短期内,三者不会发生立刻的较强替代,而是将共存并基于不同的应用场景形成差异化的分层市场。
参考来源
常见问题
以NVIDIA BlueField-4为代表的新一代DPU,在当前的“长文本AI推理”中究竟扮演了什么不可替代的角色?
在大模型推理尤其是多轮复杂对话或Agentic应用中,系统需要存储庞大的历史上下文记忆(KV Cache)。 GPU自身配备的高带宽内存(HBM,即G1层)虽然速度极快,但容量极其有限且成本高昂,成为了严重掣肘并发推理数量的瓶颈。 BlueField-4等拥有强大计算能力的重型DPU,不仅作为高速网卡处理数据包,更作为核心的I/O调度中枢,在硬件层直接终止复杂的NVMe-oF存储协议,利用低成本的闪存构建了一个跨节点的“G3.5层”高速共享缓存池。 这使得多台物理服务器之间的推理上下文可以微秒级低延迟共享和预加载,不仅释放了大量主机CPU的算力,更极大…
超以太网联盟(UEC)发布的1.0及1.0.2规范,相比现有的RoCEv2架构,解决了什么最致命的痛点?
现有的RoCEv2协议严重依赖于无损以太网的优先流量控制(PFC)机制来防止丢包。 然而,在AI网络中极其容易出现的微突发和负载不均状态下,PFC会导致拥塞反向传播,极易引发“队头阻塞”甚至灾难性的全网死锁;并且它难以通过传统的哈希算法充分利用多条平行链路。 UEC规范从协议底层进行了较大程度创新,实现了“数据包级智能喷洒(Packet Spraying)”——允许属于同一个数据流的数据包打散,通过所有可用路径并发且乱序地穿越网络,并在目标端网卡的硬件引擎中智能重组、按序送入内存。 配合其独有的路径感知拥塞控制与选择性重传机制,UEC能够大幅压低尾部延迟,…
在1.6T光互联的发展趋势中,传统DSP模块、LPO与CPO的核心区别是什么,它们会立刻发生相互替代吗?
这三者的演进核心都在于解决1.6T超高频电信号传输所带来的巨大功耗与散热灾难。 传统模块内嵌高功耗DSP芯片来修复衰减的电信号,兼容性最强但热量极大;LPO(线性驱动插拔模块)去掉了高功耗的DSP芯片,将信号均衡的压力全部推给交换机侧的主芯片,同时保留了前面板可插拔的运维便利性,但限制了传输的物理距离和互操作性;CPO(共封装光学)则更加激进,直接将光引擎封装在交换机核心ASIC基板旁边,较大幅度缩短了电学链路,能耗降低最为显著,但较大程度改变了设备的物理形态,一旦光器件损坏,维修和生态替换成本极高。 目前,全DSP插拔模块凭借极高的可靠性仍是较强主力,L…