AI算力/训练与推理Capex分化/2026m8认为,2026年是AI算力投资的绝对分水岭,模型“推理”正在取代“训练”成为资本支出(Capex)的核心驱动力。2026年北美超大规模云厂商的总Capex预计将突破6600亿至6900亿美元。 然而,在巨额支出的表象下,增量资金正剧烈分化:标准训练需求继续支撑通用GPU体系,而占比跃升至近65%的推理需求,正推动定制化ASIC(出货量年增44.6%)及高频宽内存的爆发。 这种分化不仅重塑了硬件供应链,更将液冷散热与电网物理互联确立为2026年最硬性的扩张约束。m8观点:一句话先说

结论

大模型训练是具备明确资金与时间边界的“一次性资本支出”,而推理则是伴随用户规模无限膨胀的“经常性运营开支”;2026年算力产业链的最大变量不再是单纯的GPU规模堆叠,而是围绕“系统2(System 2)”推理需求引发的定制化ASIC市占率跃升、HBM4产能抢夺,以及物理电网与液冷基础设施的极限破局。

为什么这个变量在 2026 年重要自生成式人工智能进入大众视野以来,整个行业的基础设施投资几乎全部围绕大模型的预训练展开。

但在2026年,资本市场的底层逻辑与科技巨头的技术路线图正在发生根本性的偏移。

这种结构性分化并非偶然,而是由核心技术范式的演进与企业微观财务周期的共振所共同决定的。

首先,推理工作负载在全生命周期成本中的占比实现了绝对反超。

根据最新的产业数据,推理算力在2023年仅占全行业AI总算力的三分之一,但到2026年这一比例预计将飙升至近65%,并在未来几年内主导80%至90%的AI系统生命周期总成本。

这标志着行业正从“构建人工智能能力”向“规模化部署人工智能”过渡。

当模型进入生产环境后,每一次API调用、每一次终端交互都会产生持续的计算消耗,这种随使用量线性甚至指数级增长的运营费用(OPEX)属性,彻底改变了数据中心的采购逻辑。

基础设施架构师开始将核心诉求从训练阶段的吞吐量最大化,转向推理阶段的低延迟与百万Token成本(CPM)的极致压缩。

其次,“测试时计算(Test-Time Compute)”与系统2(System 2)人工智能的崛起,重塑了算力消耗的微观结构。

以OpenAI的o系列(o1, o3, o4-mini)和DeepSeek-R1为代表的推理模型(Reasoning Models)在2026年确立了行业的新标准。

传统的大语言模型采用基于“下一个Token预测”的直觉式响应模式,而推理模型通过强化学习被训练为在给出最终答案前进行深度的内部计算。

这意味着模型在推理阶段会生成大量的、用户不可见的“思考Token”,用于自我反思、多步逻辑规划与错误纠正。

这种技术路线的转换带来了双刃剑效应:一方面,它极大提升了模型在复杂数学、编程与代理任务中的准确率,使小参数模型能在特定领域媲美甚至超越更大规模的前沿模型;另一方面,它打破了传统推理的线性定价模式。

一个标准模型可能在一秒内完成预测,而推理模型可能占用GPU显存长达三十秒,这种延长的占用时间导致硬件的并发处理能力断崖式下跌,迫使云厂商必须采买海量针对推理优化的底层硬件,以维持业务的正常运转。

最为关键的是,2026年科技巨头的基础设施投资即将触及自由现金流(Free Cash Flow)的临界点。

全球最大的五家超大规模云厂商(微软、亚马逊、Alphabet、Meta和Oracle)正在以远超其经营现金流入的速度增加资本支出。

宏观层面的测算显示,这些

公司的经营现金流正以每年约23%的速度增长,而现金资本支出的年增速则高达约70%。

按照当前的指数增长轨迹,全行业的总现金资本支出将在2026年第三季度历史性地超过经营现金流,导致整体自由现金流归零并转负。

虽然各家公司越过这一交叉点的具体时间有所不同(例如亚马逊和甲骨文已经或即将越过,而微软可能在2028年),但整体趋势无可避免。

当企业必须通过消耗现金储备、增加外部举债或发行新股来维持高达6600亿至6900亿美元的年度算力军备竞赛时,资本市场对投入产出比的容忍度将大幅降低。

在此背景下,能够大幅降低总体拥有成本(TCO)并提升每瓦性能的定制化推理芯片(ASIC)以及降低系统功耗的物理基础设施,成为了巨头们不可妥协的生存级必选项。

产业链和公司映射通过gpu-compute-platforms的上下游追踪,资金与技术的双重挤压正在重塑核心硬件提供商的竞争格局。

传统意义上以GPU为单一核心的算力网络,正在裂变为多元化、高度定制化的复合型基础设施。

在核心算力加速器层面,Nvidia的通用GPU与云厂商的定制ASIC正在形成明确的双轨制。

Blackwell及后续的Rubin架构通过不断推高片上内存与NVLink互联带宽,巩固了其在万亿参数模型预训练中不可替代的地位。

为了应对基础设施建设极高的前期资本门槛,Nvidia在2026年甚至创新性地推出了“收入分成模式”,允许区域性云平台(如Sharon AI、Firmus)在前期以较低的资本部署海量GPU,Nvidia则从这些集群未来产生的云服务收入中抽取分成。

这一金融层面的创新旨在扶持原生AI初创企业,同时构建护城河以防御定制化芯片的渗透。

然而在推理端,超大规模云厂商加速了自研ASIC(专用集成电路)的部署步伐。

ASIC为了特定的模型架构(如Transformer网络)牺牲了通用性,但换取了高达3至5倍的能效比提升。2026年,全球定制AI ASIC出货量预计将实现44.6%的同比增长,远超商用GPU 16.1%的增速,这标志着数据中心底层逻辑的实质性转变。

作为定制硅片设计服务龙头,Broadcom(博通)深度绑定了这一趋势,其在2026财年第一季度录得了84亿美元的AI半导体收入,同比增长达106%,并指引随后季度的AI收入将进一步飙升至107亿美元以上。

Broadcom不仅与苹果公司签署了延续至2031年的数十亿美元定制芯片长期供应协议,更是Google TPU与Meta MTIA平台不可或缺的技术基石。

与此同时,Marvell Technology作为亚马逊AWS Trainium芯片的主要设计与网络互联伙伴,正迎来其发展的高光时刻。2026年中期的产业动向表明,亚马逊正计划打破其定制芯片“仅供AWS云内使用”的历史惯例,寻求将Trainium AI芯片直接对外出售给第三方数据中心。

这一战略突破不仅印证了云厂商希望在底层算力上进一步摆脱对Nvidia的绝对依赖,也为Marvell打开了通向更广阔商用芯片市场的巨大增量空间。

在中国市场,模型厂商DeepSeek展现了另一种极其硬核的垂直整合路径。

由于面临美国高端芯片的出口管制,DeepSeek在算法层面倒逼出了极致的效率。

其不仅通过多头潜在注意力(MLA)机制将内存开销降低了93%,更是通过群组相对策略优化(GRPO)实现了无需庞大奖励模型的高效强化学习。2026年,业界广泛传出DeepSeek正投入巨资秘密研发专用的AI推理芯片。

这款芯片完全专注于推理工作负载,旨在摆脱对Nvidia H800等降级芯片以及华为Ascend生态的依赖。

DeepSeek从纯粹的软件模型实验室向底层硬件芯片设计的跨越,表明全球顶尖的AI玩家已经意识到,在推理成本主导的时代,掌控自身硬件栈是维持长期商业竞争力的唯一出路。

内存墙的突破则深度依赖于hbm-advanced-packaging产业链的代际跃升。2026年,AI与机器学习对高频宽内存(HBM)的需求占比已超过总需求的55%。

SK Hynix、Samsung与Micron构成了极高壁垒的寡头垄断格局,其中SK Hynix凭借在HBM3E世代积累的良率优势,占据了约62%的市场份额,并被预测将在Nvidia下一代Rubin平台的HBM4供应中拿下约70%的初始份额。2026年不仅是HBM3E全面铺开的一年,更是HBM4进入规模量产的分水岭。

HBM4采用了具有革命性的2048位接口设计,单堆栈带宽飙升至1.5至2 TB/s,能够直接化解当前推理模型在处理海量并发请求时遇到的I/O瓶颈。

内存成本在AI服务器物料清单(BOM)中的占比急剧上升,迫使三星等厂商大幅度扩张产能,将每月晶圆产量从约17万片提升至25万片以上,以应对几乎已全部被提前锁定的2026年订单。

在数据中心光通信网络领域,随着AI集群规模从千卡向数万卡级别扩张,用于服务器、GPU和存储系统之间数据交换的“东西向流量”呈指数级增长。

为了防止网络延迟拖垮整个算力集群的训练与推理效率,1.6T光收发器(如1.6T OSFP224规格)在2026年进入了实质性的商用部署阶段。

相较于上一代的400G和800G模块,1.6T光模块通过采用8通道200G PAM4信号技术和先进的数字信号处理(DSP)芯片,在使得物理网络连接数量减半的同时,实现了带宽密度的翻倍。

硅光子技术的成熟不仅降低了极高频宽下的系统功耗,还为未来光电共封装(CPO)技术的应用铺平了道路。

关键数据与对比表深入拆解2026年各大厂的资本支出计划与技术指标,能够清晰呈现出行业资金流向的底层逻辑:表1:超大规模云厂商 AI 资本支出预期与核心推理芯片布局本表梳理了主导美国市场的超大云厂商在2025至2026年的资本支出规模,及其用于替代部分商业GPU的自研ASIC生态布局。

厂商2025年预计Capex (亿美元)2026年预计Capex (亿美元)2026年主力自研AI芯片架构核心设计/制造合作伙伴Amazon$125.0$200.0Trainium 3, GravitonMarvellMicrosoft$117.5$120.0 - $190.0*Maia 100/后续演进内部研发及未公开外部合作Alphabet$91.0$175.0 - $185.0TPU v6BroadcomMeta$72.0$115.0 - $135.0MTIA (第四代及后续)Broadcom总计估算~$405.5~$610.0 - $710.0--(注:资本支出总额包含部分传统IT及物理设施建设,但激增部分几乎全部归因于AI。

微软的2026年支出预测在不同统计口径下存在较大差异,部分机构看至1900亿美元。)表2:商用GPU与定制化ASIC在超大规模AI系统中的经济模型对比推理算力的迁移本质上是一场经济账,定制硅片在特定环境下的总体拥有成本优势已无法被忽视。

经济与技术维度Nvidia 商用大模型 GPU (如 Blackwell)超大规模云厂商定制 ASIC (如 TPU, Trainium)单芯片物理与采购成本$25,000 - $40,000+ (维持了极高的产品毛利率)大规模部署下硬件成本大幅摊薄 (内部转移定价)核心优化目标与工作负载优化吞吐量,支持任意不断演进的网络架构训练优化低延迟,针对高度固化、超高并发的专用推理软件栈重构成本极低(CUDA生态极其成熟,开箱即用)极高(需耗资数亿美元重写全栈软件,仅巨头可承担)特定任务能效比 (Perf/W)作为行业基础基准线针对特定模型架构可实现3至5倍的能效比提升表3:系统1 (标准模型) 与 系统2 (推理模型) 的基础设施消耗对比“测试时计算”机制使得推理阶段的硬件占用和消耗模式发生了根本改变,进一步推高了对低延迟内存与专属硬件的需求。

运作机制维度标准大型语言模型 (System 1 AI)深度推理模型 (System 2 AI, 如 o3, R1)计算资源分配重点极高昂的预训练成本,极低的单次推理计算量预训练相对可控,但在每次推理时消耗大量计算资源单次响应底层逻辑单次前向传播,即时预测下一个Token内部多步循环:生成推理路径、逻辑校验、回溯修正硬件系统并发能力极高(预测在一秒或几秒内迅速完成并释放显存)极低(复杂问题可能持续占用GPU显存长达几十秒)适用任务边界知识检索、文本摘要、高并发对话、基础分类复杂数学定理证明、大规模代码生成、多步自主代理规划宏观、资金或技术约束在算力向推理端剧烈倾斜的进程中,2026年的主要约束条件已经超越了硅晶圆的制造产能,蔓延至更加庞大且难以撼动的物理世界。

资金流的持续性、电网基础设施的极限,以及液冷散热工艺的普及,构成了木桶中最短的三块木板。

首当其冲的是面临崩溃边缘的公用电力网络。

AI技术的繁荣正在让全球电力基础设施经历前所未有的压力测试。2026年,美国活跃的数据中心数量已超过4500个,年电力消耗达到176太瓦时(TWh),占全国总电力的4.4%。

随着越来越多专为AI打造的大型集群上线,这一比例预计将在2028年飙升至6.7%到12%之间。

新建AI数据中心的单体规模已经从几十兆瓦膨胀到惊人的1GW至4GW级别,这相当于一座中型工业城市的总体用电量。

由于电网的输配电网络升级需要经历漫长的政治博弈、环保审批与社区听证,加之高压变压器和开关设备的供应链出现严重短缺,并网排队(Interconnection Queues)的等待时间被无限拉长。

这种“电网饱和”现象迫使科技巨头不得不绕开公共电网,投入重金开发离网微电网(Microgrids)、部署现场天然气燃料电池,甚至投资小型模块化核反应堆(SMRs)以获取独立电源。

其次是随着功率密度飙升而面临的物理散热极限。

AI加速器芯片的持续演进使得单颗GPU的热设计功耗(TDP)逼近1000W大关,导致2026年数据中心内单机柜的功率密度普遍从传统的10kW-15kW向60kW乃至100kW+跃升。

在这样的热流密度下,传统的空气冷却技术(哪怕是优化过的冷热通道隔离)已经彻底失效,强行使用风冷不仅会导致局部热点烧毁昂贵的硬件,还会使得电力使用效率(PUE)恶化至1.50以上。

这倒逼了liquid-cooling-power产业在2026年的全面爆发。

直接冷板液冷(DLC)成为新一代GPU服务器的标准出厂配置,占据了约42%至47%的市场份额。

而对于200kW以上密度的极端算力集群,两相浸没式液冷(Two-phase immersion cooling)正在崛起,这种技术将服务器完全浸泡在低沸点的介电冷却液中,通过相变吸热,能够将系统PUE压缩至惊人的1.03-1.08,同时节约了95%以上的冷却水资源消耗。

最后,自由现金流的收敛构成了最冷酷的金融约束。

正如前文数据所示,科技巨头正在依靠庞大但增速有限的经营现金流来填补以70%速度狂飙的资本支出黑洞。

当整体自由现金流在2026年下半年逼近零点时,企业将不可避免地转向债务市场或通过股权稀释来筹集维持AI基础设施扩张所需的资金。

信贷市场对于发债方AI项目的真实回报率(ROI)审查将变得无比严苛。

如果大模型无法在B端企业应用或C端智能体服务中展示出与万亿美元投资相匹配的盈利能力,资本市场将迅速掐断资金供给通道。

风险与证伪构建于公开资料之上的AI基础设施繁荣逻辑,在2026年仍需面对严峻的商业与技术证伪风险。

研究人员需警惕以下破坏性场景的出现:第一重风险在于“推理过度杀伤(Operational Overkill)”导致的算力浪费与盈利模型崩塌。

测试时计算模型(System 2 AI)虽然能力强大,但其昂贵的计算成本并不适用于所有任务。

如果在实际的商业部署中,大量算力被滥用于基础的文本摘要、简单的客户客服或低智力要求的知识检索中,不仅无法带来相匹配的用户价值,反而会导致巨大的云端计算亏损。

如果基于推理模型的企业级订阅收入未能在2026至2027年实现跃升,巨头们堆积在数据中心里的天量硬件将面临巨额减值拨备,继而引发整条硅片供应链的断崖式砍单。

第二重风险涉及底层网络架构的演进对硬件形态的颠覆。

当前ASIC推理芯片能够实现极高能效比的前提,是深度绑定并硬化了针对Transformer网络架构优化的计算逻辑。

然而,人工智能算法领域的创新速度极快,如果Mamba(状态空间模型)或其他非Transformer架构在2026年底取得了突破性进展并在大模型上证明了可行性,那么耗资数亿、历时数年研发的定制化ASIC可能在瞬间沦为技术孤岛。

这种技术变轨风险将迫使云厂商重新拥抱具有通用编程生态(如CUDA)的商业GPU。

第三重风险是物理交付链条的断裂导致“被困资本(Stranded Capital)”的产生。

资金可以迅速划拨至芯片制造商的账户,但现实世界中的土地平整、环保许可发放、输电线路架设以及变电站的建设却遵循着漫长且死板的周期。

如果电网侧的扩容进度远远落后于算力芯片的交付速度,数以十万计的高昂GPU和光模块将被迫闲置在没有电力供应的空壳数据中心内。

这种因基础设施脱节而导致的资本沉淀,将直接拖垮企业的资产周转效率。

后续观察变量作为研究归档框架的核心部分,为了验证训练与推理Capex分化趋势的演进,投资者与产业界应当密切跟踪以下先行及同步指标:超大规模云厂商的自由现金流轨迹: 重点拆解微软、亚马逊、Alphabet和Meta在2026年第三及第四季度的财报。

关注其经营活动现金流(OCF)与资本支出(Capex)的收敛速度,特别是管理层在电话会议中关于为支撑AI发展而计划进行的外部债务融资(Debt Issuance)的指引。

Broadcom与Marvell的数据中心半导体营收拆分: 作为定制ASIC和底层通信网络的晴雨表,如果这两家公司在2026年下半年的财季中,定制化芯片与AI网络互联营收实现超预期的环比跃升,将从根本上证实算力正在加速向推理ASIC倾斜的产业叙事。

HBM4 的产能爬坡曲线与良率通报: 紧盯SK Hynix、Samsung与Micron关于2048位接口HBM4内存的量产进度。

由于HBM4是解决推理算力内存墙的关键,其大规模交付的良率表现将直接影响下一代GPU与高端ASIC的实际出货时间表。

电网并网队列(Interconnection Queue)与电力设备交货周期: 定期审查北美主要公用事业公司及联邦能源监管委员会(FERC)的并网数据,观察大型数据中心获取稳定电力供应的平均耗时,以及高压变压器等重型电气设备的供应链缓解情况。 FAQ深度推理模型(Reasoning Models)与过去的大模型究竟有何不同?

为何它会引发算力消耗的飙升? 过去几年的标准模型(如GPT-4早期版本)主要基于“系统1”运作模式,即接收提示词后,依靠庞大的神经网络权重以单一前向传播的方式逐字预测输出。

这种模式下,虽然前期的预训练消耗了数亿美元的算力,但用户单次提问的推理消耗极低,响应仅需一两秒。

而2026年普及的深度推理模型(如o3、DeepSeek R1)引入了“测试时计算”机制。

当用户提出复杂问题时,模型不会立刻回答,而是进入“系统2”的思考状态,在底层生成成百上千个用户不可见的“思考Token”。

在这个过程中,模型会自我构建逻辑树、反复校验步骤并纠正错误。

这意味着它虽然极大地提升了解决复杂数学或编程问题的准确率,但也导致每次推理的GPU运算时间被拉长至数十秒。

当这种模型被数千万级用户并发调用时,其引发的底层算力与电力消耗将呈现指数级爆炸,使得整个数据中心的成本结构彻底倒向推理端。

既然定制ASIC(如TPU、Trainium)不仅便宜且能效比高,为何科技巨头不彻底淘汰通用的商用GPU? 尽管定制ASIC在针对特定、固化的大规模推理任务时,能够提供比通用GPU高出3至5倍的能效比,且规模化部署成本更低,但商用GPU(以Nvidia体系为代表)拥有两项不可替代的护城河。

首先是处理极具探索性的“模型预训练”与“微调”任务时所需的极致灵活性。

科学研究充满了对网络架构的试错与底层数学机制的调整,而在这一点上,拥有深厚积累且开箱即用的CUDA软件生态依然是唯一解;重写适配ASIC的底层算子对于科研团队而言成本过高且极其痛苦。

其次是对冲底层算法架构突变的风险。

ASIC的硅片逻辑通常是为当前主流架构(如Transformer)量身定制的,一旦学术界爆发出颠覆性的新基础架构,现有的ASIC可能无法高效运行甚至直接报废。

因此,为了兼顾降本增效与防御技术路径变轨,科技巨头必须维持“通用GPU负责探索与训练,定制ASIC负责海量标准推理”的双轨制基础设施战略。

为什么数据中心必须全面转向液冷,传统的空调风冷真的无能为力了吗? 这完全由物理学中的热力学基本定律所决定。

随着芯片制程工艺的极限演进,新一代AI加速器的运算密度达到了前所未有的高度。

单颗高端GPU的热设计功耗(TDP)正逼近甚至跨越1000W的大关,当几十上百颗这样的芯片被密集排列在标准机柜(Rack)中时,单机柜的整体功耗将从传统的10kW左右跃升至60kW、80kW甚至100kW以上。

空气作为一种导热介质,其比热容和密度极低;在这样的高热流密度下,无论怎样增加风扇转速或降低冷通道温度,空气都无法在有效时间内将芯片表面的巨量热量带走。

强行使用风冷不仅会导致风扇耗电量暴增(推高PUE),还会因排热不及引发芯片降频甚至烧毁。

相比之下,液体的导热系数远高于空气,直接冷板液冷(DLC)或将设备直接泡入介电液体的浸没式液冷,能够以极高的效率精准带走发热源的热量,不仅保障了设备的稳定运行,还将冷却能耗降低了大幅度,这也是为何2026年新建的AI算力集群毫无例外地全面拥抱了液冷技术。

参考来源

常见问题

为何它会引发算力消耗的飙升?

过去几年的标准模型(如GPT-4早期版本)主要基于“系统1”运作模式,即接收提示词后,依靠庞大的神经网络权重以单一前向传播的方式逐字预测输出。 这种模式下,虽然前期的预训练消耗了数亿美元的算力,但用户单次提问的推理消耗极低,响应仅需一两秒。 而2026年普及的深度推理模型(如o3、DeepSeek R1)引入了“测试时计算”机制。 当用户提出复杂问题时,模型不会立刻回答,而是进入“系统2”的思考状态,在底层生成成百上千个用户不可见的“思考Token”。 在这个过程中,模型会自我构建逻辑树、反复校验步骤并纠正错误。 这意味着它虽然极大地提升了解决复杂数学…

既然定制ASIC(如TPU、Trainium)不仅便宜且能效比高,为何科技巨头不彻底淘汰通用的商用GPU?

尽管定制ASIC在针对特定、固化的大规模推理任务时,能够提供比通用GPU高出3至5倍的能效比,且规模化部署成本更低,但商用GPU(以Nvidia体系为代表)拥有两项不可替代的护城河。 首先是处理极具探索性的“模型预训练”与“微调”任务时所需的极致灵活性。 科学研究充满了对网络架构的试错与底层数学机制的调整,而在这一点上,拥有深厚积累且开箱即用的CUDA软件生态依然是唯一解;重写适配ASIC的底层算子对于科研团队而言成本过高且极其痛苦。 其次是对冲底层算法架构突变的风险。 ASIC的硅片逻辑通常是为当前主流架构(如Transformer)量身定制的,一旦…

为什么数据中心必须全面转向液冷,传统的空调风冷真的无能为力了吗?

这完全由物理学中的热力学基本定律所决定。 随着芯片制程工艺的极限演进,新一代AI加速器的运算密度达到了前所未有的高度。 单颗高端GPU的热设计功耗(TDP)正逼近甚至跨越1000W的大关,当几十上百颗这样的芯片被密集排列在标准机柜(Rack)中时,单机柜的整体功耗将从传统的10kW左右跃升至60kW、80kW甚至100kW以上。 空气作为一种导热介质,其比热容和密度极低;在这样的高热流密度下,无论怎样增加风扇转速或降低冷通道温度,空气都无法在有效时间内将芯片表面的巨量热量带走。 强行使用风冷不仅会导致风扇耗电量暴增(推高PUE),还会因排热不及引发芯片…