CXL内存扩展/公开来源核验/2026本文系m8针对CXL内存扩展的核验。2026年,CXL内存扩展正演变为缓解AI推理KV缓存墙的关键技术。

我们认为,受制于PCIe 6.0下一代CPU延期,年内出货主要依赖CXL 2.0,且面临英伟达CMX封闭架构的强力狙击。m8观点:一句话研究结论2026年CXL内存扩展的商业逻辑已从解决云计算内存搁浅转向化解大模型推理的存储成本墙,但受制于通用服务器CPU迭代跳票与GPU计算平台巨头基于网络级专有架构的降维竞争,年内产业链的大规模商业化放量仍面临极高的系统级验证壁垒。

为什么这个变量在 2026 年重要进入2026年,Compute Express Link (CXL) 内存扩展技术之所以成为半导体产业链中最受瞩目的硬件变量,本质上是由物理定律的极限、数据中心经济学以及大模型算法演进的迫切需求共同决定的。

传统的冯·诺依曼架构在长上下文(Long-context)和智能体(Agentic AI)应用爆发的背景下,正在遭遇极其尖锐的成本与性能矛盾。

大模型推理场景下的大规模键值缓存(KV Cache)成本墙是当前最核心的驱动力。

在大语言模型(LLM)的推理过程中,为了避免重复计算,系统需要将历史上下文的状态保存在内存中。

随着模型上下文窗口从128K向百万级别扩展,KV缓存的容量需求呈指数级爆发。

根据行业测算,一个70B参数的模型在128K上下文和批量大小为32的情况下,仅KV缓存就需要超过150GB的内存空间。

这远远超出了单张H100或甚至最新一代AI加速器的板载内存容量。

如果强行使用HBM来存储所有KV缓存,在经济上是完全不可行的。

相比之下,标准DDR5 RDIMM的成本约为3-5美元/GB,而基于CXL附加的DDR5内存成本约为4-6美元/GB。

CXL通过在系统中提供一个容量巨大、成本低廉且延迟在可接受范围内的“温数据层”,使得AI计算节点能够以五分之一甚至七分之一的成本实现等效的容量扩展,从而在不增加昂贵GPU采购的情况下大幅提升大模型的吞吐量。

解决超大规模数据中心的“内存搁浅”(Stranded Memory)问题构成了CXL普及的第二重底层逻辑。

在头部云服务提供商(CSP)的基础设施中,内存利用率低下是一个长期存在的顽疾。

来自微软Azure等机构的遥测数据显示,在没有实施内存池化(Memory Pooling)的情况下,生产集群中约有25%到35%的已安装内存处于搁浅状态。

这意味着即使CPU核心已经满载,节点上剩余的内存也无法被其他急需内存的节点调用,造成了巨大的资本浪费。

通过CXL 2.0及以上版本的交换(Switching)和池化功能,数据中心架构师能够将内存资源与计算节点在物理上解耦,使得内存利用率能够从传统的40-60%提升至80%以上。

对于每年在服务器硬件上投入数百亿美元的头部云厂商而言,这种利用率的提升直接等同于数亿美元的资本支出(CapEx)节省,这也是超大规模数据中心强力推动CXL生态的财务动机。

技术标准向Fabric网络与跨机架池化演进的临界点在2026年正式到来。

早期的CXL 1.1和2.0标准主要基于PCIe 5.0物理层(32 GT/s),其核心局限在于主要解决单节点的内存扩展问题。

而基于PCIe 6.0(64 GT/s)的CXL 3.0和3.1标准引入了Fabric互联支持、多级交换、点对点(P2P)直接内存访问以及多达4096个节点的复杂路由能力。

到了2025年底发布的CXL 4.0标准,更是将带宽翻倍至128 GT/s(基于PCIe 7.0),并引入了可提供1.5 TB/s连接的捆绑端口技术。

这种从单一扩展到池化,再到解构组合(Composable)架构的演进,使得CXL从一个简单的内存接口蜕变为重塑整个数据中心拓扑结构的关键中枢。

产业链和

公司映射CXL内存扩展产业链是一个高度跨界融合的生态系统,涵盖了从底层内存颗粒制造、核心控制芯片设计、网络交换硅片,一直到顶层服务器CPU底座的多个维度。2026年,该产业链的核心价值捕获和公司动态呈现出高度集中的特征。

为了清晰展现产业链各环节的核心玩家及其在2026年的产品状态,下表对CXL生态系统的关键节点进行了结构化梳理。

产业链环节核心企业2026年代表性产品与商业进展市场定位与战略动向内存模块 (Type 3)三星电子 (Samsung)CMM-D 2.0 (128GB/256GB)原计划2026年下半年量产支持CXL 3.1的CMM-D 3.0模块,因CPU平台延期而推迟至2027年。

内存模块 (Type 3)SK海力士 (SK Hynix)第一代128GB (CXL 2.0+) 与第二代256GB (CXL 3.2) CMM-DDR5在HPE Discover 2026展出池化方案,大力推广其异构内存软件开发套件(HMSDK)以解决页面迁移问题。

内存模块 (Type 3)美光科技 (Micron)CZ120系列内存扩展模块聚焦于大容量与高带宽的补充,与Astera Labs等控制器厂商进行底层兼容性验证。

控制器与重定时器Astera LabsLeo CXL智能内存控制器,Scorpio智能交换机2026年第一季度营收达3.084亿美元,同比增长93%,AI服务器内存扩展是其企业客户的核心部署用例。

控制器与重定时器澜起科技 (Montage)M88MX6852 (CXL 3.1 MXC控制器)该芯片基于PCIe 6.2物理层,支持最高64 GT/s,集成双RISC-V处理器,已进入客户送样阶段。

交换芯片 (Switches)MarvellStructera S 30260 CXL交换芯片具备260个通道,支持PCIe 6.0,支持最高48TB共享内存池与4TB/s聚合带宽,2026年Q3送样。

宿主计算平台 (CPU)Intel (英特尔)Xeon 6+ (Clearwater Forest)采用Intel 18A工艺,支持PCIe 5.0和CXL 2.0;但原生支持PCIe 6.0/CXL 3.1的Diamond Rapids平台遭遇延期。

宿主计算平台 (CPU)AMD (超威半导体)EPYC 9005系列 (Turin)EPYC 9005已广泛部署,但支持PCIe 6.0的下一代EPYC Venice处理器放量推迟,阻碍了CXL 3.1生态的爆发。

在内存模块与终端产品环节,全球三大存储巨头占据了绝对主导地位。

它们将自家的DDR5颗粒与第三方或自研的CXL控制器封装成EDSFF E3.S或PCIe附加卡形态的扩展模块。

三星电子主推其CMM-D品牌系列,尽管其CXL 2.0产品已在市场上流通,但整个行业都在等待其下一代基于CXL 3.1的模块。

然而,公开信息显示,由于前端服务器CPU平台的推迟,三星被迫将CMM-D 3.0的规模量产时间表从2026年推迟到了明年,这也反映了硬件生态相互依存的脆弱性。

SK海力士则在展会上通过搭载Liqid池化服务器的方式展示了其CMM-DDR5模块,并试图通过HMSDK软件来构建自身的生态护城河,解决硬件之外的内存层级调度痛点。

在CXL控制器与交换芯片环节,由于CXL协议运行在PCIe物理层之上,保持缓存一致性并进行复杂的协议转换需要极高的芯片设计能力。

Astera Labs在这一领域表现出了强劲的财务增长,其Leo系列控制器和Scorpio交换机深度绑定了超大规模云计算客户的AI扩张红利。

澜起科技作为A股在内存接口芯片领域的龙头,其技术迭代速度同样引人注目。2026年初,澜起宣布其符合CXL 3.1标准的M88MX6852内存扩展控制器进入送样阶段,该芯片不仅支持PCIe 6.2物理层,还创新性地集成了双RISC-V微处理器以处理动态资源配置和硬件级安全管理。

此外,Marvell通过收购XConn Technologies迅速补齐了CXL交换芯片的短板,其在OFC 2026上发布的Structera S 30260交换机被视为打破“AI内存墙”的关键基础设施,官方测试宣称其相比RDMA内存池化方案能够降低72%的延迟。

宿主计算平台作为整个CXL生态的底座,决定了下游硬件的商用节奏。

Intel和AMD在2026年的产品线虽然强化了高密度计算能力,但在下一代总线标准的跟进上出现了实质性的滞后。

Intel的Xeon 6+处理器虽然将单机架核心密度推向了新高,但其外部接口仍停留在PCIe 5.0和CXL 2.0层面。

这种底层CPU对PCIe 6.0支持的缺位,是限制2026年CXL市场向3.x标准跃升的直接原因。

关键数据与对比表为了清晰量化CXL在现代数据中心存储层级(Memory Hierarchy)中的精准定位,以及其未来几年的市场增长潜力,公开资料提供了一系列多维度的核心数据。

下表详细对比了2026年AI数据中心内不同存储层级的带宽、延迟与成本经济学,揭示了CXL切入市场的物理基础。

存储层级 (Tier)核心技术代表典型带宽水平典型访问延迟估算单位成本 ($/GB)在大模型中的主要用例与定位Tier 1: 极致带宽HBM3E / HBM4>1.2 TB/s (单堆叠)极低 (芯片封装内)$25 - $35模型权重加载、高频工作态KV缓存、极高频激活数据Tier 2: 本地主存DDR5 RDIMM38 - 51 GB/s (单通道)~75 ns$3 - $5CPU主存、常规应用程序运行数据、操作系统空间Tier 3: 扩展内存CXL 2.0 (基于DDR5)64 GB/s (PCIe 5.0 x16)150 - 350 ns$4 - $6温数据层、LLM大容量KV缓存溢出卸载、内存数据库池化Tier 4: 极速网络存储NVMe / RDMA12 GB/s (PCIe 5.0 SSD)微秒级 (网络与协议开销)< $1持久化存储、冷数据归档、跨集群的异步分布式上下文存储从上述物理指标可以看出,CXL 2.0扩展模块在访问延迟上虽然增加了约70至100纳秒的Pin-to-Pin协议开销(约为本地DDR5延迟的两到三倍),但其通过PCIe x16链路提供的带宽已经与本地DDR5通道相当。

最关键的是,其单位成本仅为HBM的约六分之一。

这种在带宽、容量与成本之间取得的精妙平衡,使其成为存储大规模推理所需长上下文数据的完美介质。

关于CXL市场的财务规模预测,多家国际研究机构在2026年给出了高度一致的爆发式增长预期。

研究机构/数据来源基准年份基准年规模预测目标年份预测期末规模复合年增长率 (CAGR)核心增长驱动力判定MarketIntelo[cite: 25]202513.0 亿美元2034118 亿美元28.7%大语言模型工作负载暴增,数据中心机架级可组合性需求上升Dataintelo[cite: 5]202528.0 亿美元2034286 亿美元29.4%三大存储厂超过120亿美元的产能资本承诺,服务器主板换代Fortune Business[cite: 26]20251.38 亿美元203472.2 亿美元55.3%生成式AI集群扩张,软件编排与异构内存层级管理逐步成熟MobilityForesights[cite: 3]202528.0 亿美元2031149 亿美元32.0%HBM产能短缺与昂贵定价倒逼架构分层,微软等超算参考设计落地尽管不同机构对“CXL市场”的核算边界存在差异(例如Fortune Business主要聚焦于专用的内存池化设备硬件,而Dataintelo包含了底层的内存颗粒价值),但长期的复合年增长率普遍锁定在28%至55%的极高区间。

这种确定性的增长曲线反映了整个半导体行业对于内存墙问题必须通过架构解耦来解决的共识。

宏观、资金或技术约束尽管CXL技术在理论架构和经济模型上具备压倒性的优势,但在2026年的实际商业化推进过程中,依然遭遇了宏观层面的技术瓶颈与生态制约,这些约束条件决定了技术落地不会是一蹴而就的坦途。

宿主CPU平台支持的实质性滞后与脱节是2026年CXL产业链面临的最大物理约束。

CXL 3.0及3.1标准的全部潜力(如复杂的Fabric网络和极高的带宽)深度依赖于底层PCIe 6.0物理层(64 GT/s,采用复杂的PAM4信令)。

然而,由于先进制程工艺与庞大微架构的复杂性,服务器CPU双雄Intel和AMD均未能按期在2026年规模化交付支持PCIe 6.0的处理器平台。

根据产业链的交叉验证,被寄予厚望、原生支持PCIe 6.0的Intel Diamond Rapids平台,其发布时间已从2026年下半年推迟至2027年;

设备制造商(如三星电子)虽然在实验室中已备齐了CMM-D 3.1的原型,但由于缺乏大规模的客户系统来进行主机级的兼容性资格认证,被迫将量产节点顺延。

这种上下游节奏的错配,使得2026年的市场增量仍被死死锁定在基于PCIe 5.0的CXL 2.0技术框架内。

软件生态与异构内存调度(Tiering)的成熟度不足构成了另一个严峻挑战。

硬件的物理连接只是资源共享的第一步,如何让操作系统内核智能、透明地管理多层异构内存才是真正的深水区。

CXL为系统引入了一个新的NUMA(非统一内存访问)节点,其访问延迟介于本地快速DRAM与外部慢速SSD之间。

如果在超大规模的多租户环境中,操作系统无法准确、实时地识别“热数据”和“冷数据”,极易导致频繁的页面迁移(Page Migration)。

这种被称为“内存颠簸(Thrashing)”的现象会消耗大量的内存带宽和CPU周期,反而严重拖累系统性能。

尽管Linux社区近年来引入了透明页面放置(TPP)等机制,诸如SK海力士和MemVerge等厂商也相继推出了HMSDK和Memory Machine等商业化软件工具来监控访问频率并管理层级,但在极端高并发的生产环境中,这些软硬件协同的页面调度算法仍缺乏足够长时间的大规模压力测试。

软件生态的脆弱性,增加了云厂商早期采纳的运维风险。

此外,信号完整性(Signal Integrity)与硬件BOM成本的博弈也对机架级部署提出了考验。

随着PCIe总线从5.0向6.0演进,信号的传输频率翻倍,物理链路的插入损耗急剧增加。

为了维持极高频信号的完整性并实现跨机架(Cross-rack)的物理连接,系统主板和机柜拓扑中必须大量引入昂贵的PCIe Retimer(重定时器)芯片和AEC(有源电缆)。

澜起科技等厂商推出的PCIe 6.x/CXL 3.x AEC解决方案虽然在技术上解决了传输距离问题,但这不可避免地大幅推高了服务器节点的物料清单(BOM)成本,同时额外增加了数据中心的功耗基数。

这些隐形成本使得CXL在总拥有成本(TCO)上的经济优势,需要在具体的集群规模下进行重新测算和权衡。

风险与证伪在行业普遍遵循开放标准、看好CXL技术路线的同时,必须高度警惕替代性技术的突围。

对于CXL在2026年的投资逻辑而言,最大的“证伪”风险并非来自技术本身的失效,而是来自于芯片巨头英伟达(NVIDIA)利用其绝对市场主导地位所进行的封闭生态重塑。

英伟达推出的CMX (Context Memory eXtension) 平台,正在对CXL的开放生态形成实质性的降维打击。

面对长文本推理和Agentic AI带来的KV Cache显存瓶颈,英伟达并未被动等待CXL标准生态的成熟,而是在2026年推出了基于其专有技术的网络级上下文存储架构。

CMX平台在设计理念上彻底绕过了传统的PCIe/CXL内存语义协议:它将高密度的NVMe SSD阵列直接与BlueField-4 DPU(数据处理单元)相连接,并通过Spectrum-X以太网交换机实现跨计算Pod(机群)的RDMA高速互联。

在这个被称为“Tier G3.5”的创新架构中,BlueField-4 DPU作为强大的硬件卸载引擎,运行专门的DOCA Memos和NVIDIA Dynamo软件栈,直接负责KV Cache的精细化放置、硬件级加密、完整性校验和跨节点路由提取,完全将主机的通用CPU排除在关键数据路径之外。

英伟达官方宣称,CMX架构通过软硬件的极致协同设计(Extreme Co-design),彻底消除了GPU等待上下文数据重新计算的停机时间;与传统的基于CPU控制的存储方案相比,其Token生成吞吐量提高了惊人的5倍,同时电源效率也提高了5倍。

这种专有架构对CXL商业逻辑的颠覆是深刻的。

CXL的核心叙事是“将廉价的高速内存挂在通用CPU总线上,供异构计算的GPU透明共享”;而英伟达CMX的强权逻辑则是“用自家的网络DPU直接管理低成本闪存阵列,彻底绕开通用CPU主机,将上下文数据封闭在GPU的直连网络内”。

如果头部AI基础设施提供商(如目前已开始采用STX参考架构的CoreWeave、Mistral AI等)认定英伟达的CMX方案在性能和生态整合上足以满足Agentic AI的需求,那么CXL作为“推理KV缓存池标准答案”的市场共识将被大幅削弱。

这种专有系统(Proprietary system)凭借极高的工程执行力对开放标准(Open standard)形成的路线挤压,是CXL产业链在2026年面临的最核心、最难量化的下行风险。

后续观察变量对于研究归档以及更广泛的半导体基础设施追踪而言,研判CXL生态在经历2026年的阵痛后能否真正爆发,需要紧盯以下几个具有决定性风向标意义的前瞻性指标:首先,密切跟踪下一代通用服务器CPU的正式交付时间线。

特别是Intel Diamond Rapids和AMD EPYC Venice在2026年底至2027年第一季度的最终流片质量与批量出货公告。

这是解除产业链上游封印、解锁CXL 3.1硬件周期的绝对前置条件。

其次,关注核心交换芯片在客户实验室中的真实表现。

预计于2026年第三季度开始向客户送样的Marvell Structera S 30260 CXL 3.x交换芯片,其在云服务商系统级测试中的互操作性(Interoperability)、端到端延迟表现以及功耗指标,将直接验证跨机架内存池化(Rack-level pooling)在工程浩劫中是否真正具备可行性。

再次,捕捉超大规模云厂商(Hyperscalers)的生产环境参考架构。

关注微软Azure、AWS或Google Cloud在技术峰会(如Microsoft Ignite, AWS re:Invent)上是否正式公布基于CXL 2.0/3.0的生产级部署案例。

尤其是微软Azure M系列虚拟机的商用反馈,其异构内存调度(Tiering)策略在降低总体拥有成本(TCO)方面的实际财务数据,将成为其他二线厂商跟进的核心依据。

最后,紧盯存储现货市场的价格剪刀差。

AI产业链对成本的敏感度始终是技术路线切换的催化剂。

FAQCXL与英伟达的NVLink在技术定位上有什么本质区别?

协议层级与生态开放性完全不同。

NVLink是英伟达独家掌控的专有互联技术,其核心诉求是提供极高的点对点带宽(高达每秒数TB级),主要用于连接同一集群内高度同质化的GPU节点,解决模型训练中极高频度的张量数据交互;CXL则是基于标准化PCIe物理层构建的开放行业协议,其绝对带宽低于NVLink,但其核心优势在于广泛的兼容性、支持“缓存一致性”(Cache Coherency),并允许不同厂商的CPU、GPU与存储资源进行跨界池化,是下一代异构计算和可组合基础设施的通用底座。

既然数据中心已经有了高度成熟的RDMA(如RoCE)网络,为什么还需要引入CXL来实现内存池化? 核心在于访问语义和底层延迟的巨大差异。

RDMA(远程直接内存访问)通过网络协议栈进行数据传输,本质上仍属于I/O语义(以数据块或消息为单位进行传输)。

虽然它绕过了CPU内核的干预,但在集群内的访问延迟依然处于微秒(Microsecond)级别,并且需要软件层面的显式调用。

CXL则支持原生的内存语义(CXL.mem),采用标准的Load/Store(加载/存储)指令。

对操作系统和应用程序而言,远端CXL内存就像是一个直接插在主板上的慢速本地内存节点。

CXL 2.0的访问延迟被严格控制在纳秒(Nanosecond)级别(通常低于300ns)。

这种微秒与纳秒的区别,以及对软件的完全透明性,决定了CXL适合直接作为系统的温数据主存,而RDMA更适合作为冷数据的高速后备传输通道。

在AI大模型的实际运行中,CXL具体能用来做什么? 在AI大模型训练阶段,模型的参数量极其庞大,CXL内存池可用于存放极其占用空间的嵌入表(Embedding Tables)或优化器状态(Optimizer States),从而释放出宝贵且昂贵的GPU HBM显存,让GPU专注于核心张量计算。

在AI推理阶段(特别是当前火热的长文本处理和多轮对话智能体Agentic AI),CXL被大量确立为KV缓存(Key-Value Cache)的最佳卸载目的地。

将需要频繁、重复调用的历史对话状态暂存在低成本的CXL内存中,既避免了GPU显存溢出导致的崩溃,又比从传统的SSD存储中读取快了几个数量级,从而以极低的硬件代价,极大提升了模型推理的并发吞吐率。

参考来源

常见问题

既然数据中心已经有了高度成熟的RDMA(如RoCE)网络,为什么还需要引入CXL来实现内存池化?

核心在于访问语义和底层延迟的巨大差异。 RDMA(远程直接内存访问)通过网络协议栈进行数据传输,本质上仍属于I/O语义(以数据块或消息为单位进行传输)。 虽然它绕过了CPU内核的干预,但在集群内的访问延迟依然处于微秒(Microsecond)级别,并且需要软件层面的显式调用。 CXL则支持原生的内存语义(CXL.mem),采用标准的Load/Store(加载/存储)指令。 对操作系统和应用程序而言,远端CXL内存就像是一个直接插在主板上的慢速本地内存节点。 CXL 2.0的访问延迟被严格控制在纳秒(Nanosecond)级别(通常低于300ns)。 这…

在AI大模型的实际运行中,CXL具体能用来做什么?

在AI大模型训练阶段,模型的参数量极其庞大,CXL内存池可用于存放极其占用空间的嵌入表(Embedding Tables)或优化器状态(Optimizer States),从而释放出宝贵且昂贵的GPU HBM显存,让GPU专注于核心张量计算。 在AI推理阶段(特别是当前火热的长文本处理和多轮对话智能体Agentic AI),CXL被大量确立为KV缓存(Key-Value Cache)的最佳卸载目的地。 将需要频繁、重复调用的历史对话状态暂存在低成本的CXL内存中,既避免了GPU显存溢出导致的崩溃,又比从传统的SSD存储中读取快了几个数量级,从而以极低的…