伯恩斯坦拆解AI基建成本:每GW投资最高395亿美元,Rubin机柜成本下调17%

财联社2026-10-10 19:34

摘要

1伯恩斯坦研报显示,建设1GW AI数据中心资本开支约346亿至395亿美元。
2英伟达Rubin架构成本最高(395亿美元),但因HBM4价格预期下调36%及存储配置调整,单机柜成本下调17%至752万美元。
3AMD、谷歌TPU及OpenAI自研架构虽单价较低,但受功率密度和网络配置影响,同等供电规模下总建设成本差距缩小。
4报告强调折旧是主要经济负担,预计2026年全球AI设备出货对应功率达35.5GW,利好中际旭创等光模块厂商。

①英伟达Rubin机柜成本预期下调17%至752万美元,主要受HBM和NAND估算调整影响; ②AMD GPU价格更低,但内存和网络成本较高,机柜总价接近Rubin; ③谷歌TPU单套系统价格远低于Rubin,但同等供电规模下建设成本接近。

财联社10月10日讯(编辑 夏军雄)伯恩斯坦10月5日发布的研报显示,采用不同AI加速器架构,建设1GW数据中心所需的资本开支约为346亿至395亿美元。其中,英伟达Vera Rubin架构的建设成本最高,OpenAI自研ASIC架构Jalapeno则相对较低。

尽管不同AI芯片和服务器系统的价格差异显著,但换算至相同供电规模后,数据中心整体建设成本的差距明显缩小。

伯恩斯坦将英伟达Rubin NVL72单机柜成本预期从此前的910万美元大幅下调至752万美元,降幅约17%,主要反映了对HBM价格和NAND存储容量预期的调整。

研报还指出,AI数据中心的主要经济负担并非电费,而是巨额资本开支及其产生的折旧。随着英伟达Rubin和定制ASIC推动算力供应增长,AI基础设施的成本结构及投资回报正成为行业关注的核心问题。

1GW数据中心投资最高接近400亿美元

伯恩斯坦根据行业专家访谈、供应链调查、企业披露及第三方数据,对英伟达、AMD、谷歌和OpenAI的主要AI加速器架构进行了成本比较。

研究团队估计,英伟达GB200 NVL72单机柜成本约413万美元,新一代Vera Rubin NVL72则达到752万美元。AMD MI455X Helios机柜成本约733万美元,与Rubin接近。

相比之下,谷歌TPU v7 Ironwood单套系统成本约269万美元,而采用双机柜设计的OpenAI Jalapeno系统成本约503万美元。

不过,单套系统的价格并不能直接反映数据中心整体建设成本,因为不同架构的功耗和硬件配置存在显著差异。

按照伯恩斯坦的模型,建设1GW数据中心,采用英伟达Rubin架构需要约395亿美元,AMD Helios约357亿美元,谷歌TPU v7约390亿美元,OpenAI Jalapeno约346亿美元,英伟达GB200则约365亿美元。

一个值得关注的现象是,谷歌TPU单套系统成本不足Rubin的40%,但两者每GW数据中心的总投资仅相差约5亿美元。原因在于不同系统的功率密度存在较大差异。

伯恩斯坦估计,Rubin NVL72单机柜功耗约220千瓦,TPU v7单套系统约80千瓦。计入配套基础设施的用电需求后,每GW数据中心需要约3557套Rubin系统,却需要约9783套TPU系统。

最终,两种架构每GW对应的计算系统硬件投资分别约为268亿美元和263亿美元,差距相当有限。

此外,数据中心还需要投入大量资金建设冷却、电力及其他基础设施。

伯恩斯坦估计,对于英伟达Rubin、AMD、谷歌TPU和OpenAI架构,每GW数据中心的机柜外基础设施成本约127亿美元,其中土地及建筑约45亿美元,电力设施约32亿美元,冷却设施约18亿美元,其他机电设施约32亿美元。

这一估算假设,AI计算机柜用电约占数据中心总负荷的78%,对应1.15的电能使用效率(PUE)以及服务器机柜占全部IT设备功耗90%的假设。

上述结果意味着,虽然自研ASIC可能降低芯片和单套服务器的价格,但能否显著降低整个数据中心的建设成本,还取决于功率密度、网络架构和所需硬件数量。

需要说明的是,这些数据衡量的是相同供电规模下的资本开支,并不代表不同架构能够提供相同的AI计算性能。

Rubin成本预期下调17%

伯恩斯坦最新估算显示,Rubin NVL72单机柜成本约752万美元,低于此前预测的910万美元,也与供应链流传的700万至800万美元价格区间基本一致。

调整主要来自五个方面:下调NAND存储容量假设、降低HBM4价格预期、修正网络设备成本、调整冷却和供电系统成本,以及更新DRAM和NAND价格。

其中,HBM价格预期的变化尤其显著。伯恩斯坦将HBM4价格假设从此前的每GB 48美元下调至30.6美元,降幅约36%。

分析师认为,供应链反馈弱于此前预期,同时对HBM利润率最终与传统DRAM趋同的判断信心有所下降。

不过,伯恩斯坦仍预计英伟达能够向终端客户转嫁部分内存成本,并对HBM加收约10%的溢价。

按照每机柜20.7TB HBM4容量计算,Rubin的HBM成本约69.7万美元。

GPU本身仍是最大的成本来源。伯恩斯坦估计,Rubin GPU单价约5.5万美元,72颗GPU合计396万美元,占整套机柜成本的约53%。

此外,伯恩斯坦大幅降低了对Rubin内部NAND存储容量的估算。

此前模型假设,机柜内部NAND容量可能达到约2.2PB,并计入约1.2PB外部ICMS存储。最新模型则将内部NAND容量下调至576TB,同时将外部ICMS以及未来的CMX存储排除在机柜物料成本之外。

这一变化表明,Rubin成本预测下降不仅反映硬件价格变化,也与存储配置及成本统计范围调整有关。

值得注意的是,传统内存价格反而有所上涨。伯恩斯坦将DRAM价格假设从每GB 14.85美元上调至16.45美元,TLC NAND价格从0.37美元上调至0.38美元。

由此估算,Rubin每机柜CPU侧DRAM成本约88.8万美元,直接连接NAND存储约22.2万美元。

伯恩斯坦提醒,当前内存价格波动较大,相关成本模型可能很快需要重新调整。

除计算和存储外,Rubin网络设备成本约117万美元,其中Scale-up网络约59万美元,Scale-out网络约50万美元,前端网络约8万美元。

随着系统功率密度提高,冷却系统成本也明显增加。伯恩斯坦估计,Rubin单机柜冷却成本约10.2万美元,较GB200的5.1万美元翻倍。

AMD GPU价格更低,但机柜总成本与Rubin接近

相比之下,AMD Helios虽然单机柜成本与Rubin接近,但内部结构存在明显不同。

伯恩斯坦估计,AMD MI455X GPU不含HBM的单价约3.5万美元,低于Rubin的5.5万美元。72颗GPU合计约252万美元,比Rubin低144万美元。

分析师认为,部分差异可能来自AMD较低的GPU利润率。

但AMD在其他硬件上的投入更高。

Helios每机柜配置约31.1TB HBM,高于Rubin的20.7TB,对应HBM成本约95万美元。

其CPU侧DRAM容量估计达到74TB,成本约121万美元,也明显高于Rubin。

网络部分差异同样突出。AMD Helios每机柜网络设备成本约147万美元,高于Rubin的117万美元。

伯恩斯坦指出,AMD采用基于以太网的UALink互联方案,部分Scale-up交换设备由Celestica提供,相关交换机成本可能低于英伟达的专有方案。

但AMD每颗GPU最多配置三个网络接口控制器,增加了Scale-out交换机、网络接口及光收发器需求,抵消了部分成本优势。

尽管AMD的GPU成本比Rubin低约144万美元,但其CPU、DRAM、HBM、网络设备及NAND存储成本更高,抵消了大部分价格优势。最终,AMD Helios单机柜总成本约733万美元,仅比Rubin低约19万美元。

需要注意的是,伯恩斯坦对AMD的NAND容量采用了较为激进的最大配置假设,实际存储需求可能低于估算。

OpenAI与谷歌尝试重构AI计算架构

报告还重点分析了OpenAI和谷歌的自研AI芯片架构。

伯恩斯坦认为,OpenAI的Jalapeno并非简单地将英伟达GPU替换为价格更低的ASIC,而是在网络和内存配置上采取了不同的设计思路。

Jalapeno是一套针对AI推理优化的双机柜系统。

其中,主机机柜包含16个Katsu托盘,共32颗Turin级别CPU;另一个机柜包含16个Vindaloo ASIC托盘,合计128颗ASIC,并配置Chana交换机托盘。

伯恩斯坦估计,每颗ASIC连同HBM的价格约2.25万美元,128颗合计288万美元。

其中,HBM容量约27.6TB,对应成本约84.6万美元,剔除HBM后的ASIC平均价值约1.6万美元。

整套Jalapeno系统成本约503万美元。

更重要的区别在于网络设计。

伯恩斯坦指出,OpenAI试图扩大Scale-up互联范围,将更多数据保存在本地HBM和DRAM中,从而减少对传统Scale-out网络及NAND存储的依赖。

Jalapeno的Scale-up网络采用博通Tomahawk 6交换芯片,并引入光电路交换(OCS)技术。

按照伯恩斯坦估算,该系统采用约10颗交换ASIC,相关交换设备成本约30万美元。

此外,OCS设备约7.7万美元,铜缆约19.4万美元,光收发器约10.9万美元,网络设备整体成本约81万美元。

分析师认为,虽然Jalapeno并未完全取消跨系统网络连接,但通过改变互联方式,可以减少对传统Scale-out交换设备的需求。

这种设计可能改变AI基础设施中不同网络设备的需求结构。

谷歌TPU v7 Ironwood则采取另一条技术路线。

伯恩斯坦估计,其单套系统成本约269万美元,包括64颗ASIC、16颗Axion CPU以及配套存储和网络设备。

按照模型,TPU ASIC不含HBM价格约2.2万美元,低于英伟达GB200 GPU接近3万美元的估算价格。

研究团队认为,这与博通和英伟达的利润率差异有关,其模型分别采用约55%和70%的利润率假设。

谷歌TPU采用HBM3E,每颗ASIC配置192GB,总容量约12.3TB,成本约27.5万美元。

相比Rubin采用的HBM4,较低的内存价格也有助于控制整体硬件成本。

网络方面,谷歌同样使用OCS,但与OpenAI主要尝试减少传统Scale-out依赖不同,谷歌更多将其用于Scale-up互联。

伯恩斯坦估计,TPU v7每套系统的OCS成本约15.4万美元,网络设备总成本约54万美元。

不过,分析师强调,谷歌和OpenAI的公开技术披露均不如英伟达完整,尤其是NAND配置及部分网络组件价格,仍主要依靠行业消息和模型推算。

因此,当前ASIC成本估算存在较大不确定性,随着更多技术信息披露,相关预测可能需要明显调整。

AI数据中心最沉重的负担是折旧

在比较硬件投资之后,伯恩斯坦进一步测算了AI数据中心的运营经济性。

报告指出,即使采用相对较高的每千瓦时0.15美元电价,1GW数据中心每年电力支出约为13亿美元。

相比之下,一座采用Rubin架构、总投资约395亿美元的数据中心,若将全部资本开支简单按照六年平均折旧,每年对应的折旧费用将达到约66亿美元。

这意味着,资本开支形成的折旧负担远高于电力成本。

伯恩斯坦认为,由于服务器、存储及网络硬件的使用寿命通常短于土地、建筑等基础设施,在分析AI算力的长期经济性时,IT硬件的重要性甚至高于其在初始投资中的占比。

不同企业的折旧政策也存在差异。

据报告整理的数据,谷歌服务器和网络设备的折旧年限为六年,亚马逊为五年,Meta为四至五年,微软相关计算设备为两至六年,CoreWeave技术设备为六年。

伯恩斯坦进一步假设加速器使用寿命为五年、电价为每千瓦时0.15美元,并采用40%的利用率进行调整。

在该模型口径下,Rubin每颗加速器的小时成本约3.18美元,AMD Helios约3.23美元,谷歌TPU v7约1.29美元,OpenAI Jalapeno约1.27美元,英伟达GB200约1.77美元。

不过,这些数字并非云服务商对外收取的GPU租赁价格,也不能直接等同于完成相同AI任务的成本。

由于不同架构的性能、实际利用率和适用工作负载存在差异,单纯比较每颗加速器的小时成本,并不足以判断其最终推理或训练经济性。

全球AI算力供给继续扩张

尽管建设成本高昂,伯恩斯坦仍预计全球AI算力设备出货规模将继续增长。

根据各类加速器出货量及其功率消耗估算,全球AI设备出货对应的数据中心功率规模预计从2025年的27GW增加至2026年的35.5GW,并于2027年进一步升至43.3GW。

其中,英伟达Rubin将逐步成为重要增长来源。

伯恩斯坦预计,Rubin相关设备2026年出货对应功率约8.3GW,2027年进一步增加至12.1GW。

与此同时,英伟达B200的对应出货规模预计从2025年的9.9GW下降至2026年的5.4GW,2027年进一步降至0.2GW。

其他GPU和ASIC架构的合计出货规模则有望继续扩大。

不过,全球AI设备出货对应的功率规模,明显高于伯恩斯坦对美国本土数据中心新增容量的预测。

该机构预计,美国2026年新增数据中心容量约18GW,2027年约26GW。

研究团队认为,这种差异一方面来自设备出货和实际部署之间的时间差,另一方面也可能反映AI基础设施建设正在更多转向海外。

美国数据中心项目面临电力供应、运营条件及政策限制等挑战,可能推迟部分新增容量投入使用。

伯恩斯坦提到,OpenAI与Firmus围绕澳大利亚、新加坡、印度尼西亚和马来西亚AI数据中心容量展开的合作,体现了海外基础设施建设的重要性。

分析师预计,未来全球数据中心容量中,美国所占比例可能低于历史水平。

与此同时,基础设施投资增加也将影响硬件产业链内部的增长格局。

伯恩斯坦预计,2025年至2027年,中际旭创和新易盛的营收复合年增长率分别可能达到92%和78%;台达电子及Vertiv同期预计分别增长38%和32%。

但并非所有硬件供应商都能同步改善盈利能力。报告预计,部分服务器制造商虽然收入增长较快,毛利率却可能承压。

总体而言,伯恩斯坦认为,2026年AI终端应用采用速度已有加快迹象,推动AI实验室快速增长。

随着英伟达Rubin进入新的产品周期,以及定制ASIC得到更广泛应用,伯恩斯坦预计,可用算力将进一步增加,为AI应用普及创造更多条件。

不过,报告同时表明,AI基础设施的经济性不仅取决于芯片价格,还受到内存、网络、供电及折旧成本等多重因素影响。对于持续投入巨额资本开支的科技企业而言,如何提高硬件利用效率、控制整体建设成本,将成为影响长期投资回报的重要因素。

本站所有资讯是用户利用其本地Agent获取并分享,均为公开信息,如需删除请联系我们。