华为的芯片与AI牌局
来源:36kr 1 小时前

近期,华为密集对外释放徐直军和余承东的观点。徐直军强调,华为在多芯片互联和系统架构上已经形成自己的技术路线。同时,余承东也强调华为获得先进半导体工艺的渠道受限,但昇腾、麒麟等芯片在能效与整体系统级性能上均有显著提升。两人的观点,都代表着当前AI竞争的基本单位正在从单点技术向系统、生态和基础设施体系扩展。

过去几年,人工智能竞争最引人注目的始终是模型。从GPT到DeepSeek,从参数规模、基准测试到推理能力,模型的每一次跃迁都牵动着人们对AI竞争格局的判断。但当模型规模持续扩大、推理复杂度不断提高,制约AI进一步扩张的因素正在向底层基础设施延伸:算力可得性、芯片互联、数据传输、大规模集群协同,以及数据中心的能源供给,都开始直接影响模型能力能够以多大规模、多高效率进入现实。

国际能源署(IEA)2026年的数据提供了一个直观尺度:五家大型科技公司2025年的资本支出已经超过4000亿美元,2026年预计再增长约75%;专门面向AI建设的前沿数据中心容量在过去18个月增长到原来的三倍以上。AI越来越表现出一种资本密集、能源密集和长周期基础设施密集的产业特征。它仍然由算法创新推动,却已经无法仅仅依靠算法扩张。这一变化带来了一个更重要的后果:AI竞争的基本单位正在改变。

01 从芯片到系统:AI竞争的基本单位在上移

过去,AI硬件竞争主要围绕单颗GPU展开,制程、单卡算力、内存容量与带宽构成了核心指标。这些指标至今仍然重要,但随着计算规模不断扩大,单颗芯片的性能已经越来越难以代表大规模AI系统的实际计算能力。当几千、几万乃至更多加速器共同执行训练和推理任务时,模型最终获得的并不是某颗芯片标称的峰值算力,而是整个系统能够持续交付的有效算力。芯片之间的数据交换、内存访问、网络拓扑、任务调度、故障恢复以及供电和散热,都开始影响理论算力向有效算力的转化效率。AI竞争的基本单位也由此逐级扩展:从芯片、计算节点和超节点,进一步延伸至计算集群、数据中心乃至人工智能基础设施。芯片仍然决定计算能力的物理起点,但随着越来越多的计算单元被纳入同一系统,最终性能越来越取决于芯片性能与系统效率的共同作用。

赫伯特·西蒙(Herbert Simon)在讨论复杂系统时指出,这样的系统通常是层级化的,一个复杂系统由不同层级的子系统构成,其整体行为既取决于组成部分的属性,也受到这些部分之间的组织方式与相互作用的影响。当AI计算进入大规模系统阶段,竞争优势必然会从单一器件的性能扩展到不同计算层级之间的协同能力。

正是在这一变化中,华为原有的技术积累获得了新的战略意义。如果竞争主要停留在单颗芯片层面,华为面对的仍是一场艰难的追赶:先进制程、高带宽内存、制造能力和产能等因素,都会直接限制其单颗芯片性能的提升空间。但随着竞争尺度从单颗芯片向大规模计算系统扩展,华为获得了另一种提升整体计算能力的空间:通过高速互联和系统架构创新,提高大量芯片协同工作的效率。

2026年华为全联接大会上,华为明确将战略重点转向AI基础设施,提出以 “超节点+集群”为核心的大规模计算路线。看似华为关注“连接多少张卡”,实则试图重新定义计算竞争的问题:除了继续提升单颗芯片性能,可否通过系统架构创新,将大量计算单元组织成更高效的整体?所谓系统架构创新,包括几个层面:超节点架构,把大量昇腾芯片组织成更大的计算单元;高速互联,通过灵衢(UnifiedBus)、全光互联等降低芯片之间的数据交换瓶颈;集群架构,把多个超节点进一步组织成大规模计算集群;加上与之配套的软件调度、存储、容错和能源管理。也就是说,这里的“系统架构”涵盖的是芯片之上的整个计算组织方式。

02 系统优势如何转化为生态优势:华为的下一个门槛

如果只把华为理解成一家追赶英伟达的AI芯片公司,会低估它在这场竞争中的特殊位置。华为手中的并不是一项孤立的芯片技术,而是一组过去分布在不同产业、现在被AI重新组合起来的能力:昇腾计算、鲲鹏通算、通信网络、光互联、存储、服务器、数据中心、数字能源以及长期积累的系统工程能力。AI正在把这些技术拉进同一个系统:大模型需要加速器,加速器需要高速互联,大规模集群需要存储、调度和容错,而当数据中心的电力需求不断上升以后,供配电和冷却也开始直接影响算力的成本与扩张速度。华为过去横跨ICT产业形成的技术组合,获得了新的战略价值,开始成为同一个AI基础设施的不同部分。

华为以“黑土地”比喻基础技术平台,希望由鲲鹏、昇腾、基础软件和云基础设施提供底层环境,让合作伙伴在其上发展模型和行业应用。这个比喻真正重要之处在于,它揭示了一种更深层的基础设施逻辑:基础设施的价值不仅体现于自身性能,也要看它能够承载多大规模的外部创新,以及这些创新是否可以反过来增强整个技术体系。生态系统理论将这种关系概括为“互补性”:平台与建立其上的产品、服务和创新相互依赖,参与者的扩展可能进一步提高整个生态系统的价值。从这个意义上说,华为所谓“黑土地”的真正考验,并不只是昇腾本身能够达到怎样的性能,还在于能否形成足以吸引模型公司、开发者和应用企业持续参与的技术基础。

这就触及华为最具挑战性的一张牌——软件与开发者生态。英伟达最难复制的优势从来不只是一颗GPU,CUDA经过长期积累,已经把开发工具、计算库、性能优化、工程经验、人才培养和既有代码连接成一个相互依赖的技术生态,由此形成显著的迁移成本。

这种优势具有典型的递增收益和路径依赖特征。布莱恩·阿瑟(Brian Arthur)对竞争性技术的研究指出,当一种技术随着用户增加、经验积累以及互补资源扩张而变得更有价值时,早期形成的优势可能通过正反馈不断自我强化,并形成明显的路径依赖。CUDA的发展呈现出类似机制:生态规模的扩大不断增强平台价值,而平台价值的提高又进一步吸引开发者和互补资源进入。因此,华为面对的不只是CANN与CUDA之间的软件功能差距,还包括一个经过长期积累并具有自我强化效应的技术生态。

相比之下,昇腾/CANN仍处于快速完善过程中,在部分场景下,CUDA模型迁移至昇腾平台,仍需要第三方库适配、算子调整或开发,以及人工调试与性能优化等工作。华为正在通过CANN开源、兼容主流框架和扩大开发者社区来降低门槛,并把目标从“可用”进一步推进到“易用”,但其实际成熟度最终仍需结合第三方开发者数量、迁移成本、原生开发规模、开发工具完备程度以及真实工作负载下的长期表现来检验。

成熟基础设施的一个重要特征,是能够将复杂性从使用者面前隐藏起来:把工程师解决过的问题变成软件,把专家经验沉淀为工具,把一次性的优化变成可以重复调用的公共能力。也正是在这个节点上,DeepSeek进入了华为的牌局。

03 DeepSeek向下:模型开始参与定义基础设施

2026年9月底,DeepSeek与华为的合作从模型运行进一步进入底层编程基础设施。据报道,DeepSeek正在与华为合作开发并开源一系列面向昇腾的底层软件工具,目的在于降低开发者使用和优化昇腾芯片的技术门槛。这意味着双方的合作已经不再停留于让DeepSeek模型能够在昇腾上运行,而开始进入支撑整个开发者生态的软件基础设施。

如果仅将此理解为“国产模型适配国产芯片”,会低估它的产业意义。传统适配仍然是一种单向关系:硬件平台已经存在,模型厂商通过代码修改和性能优化,使模型能够在特定平台上运行。现在出现的变化是,模型厂商开始参与计算库、通信库和编程工具这些更接近底层的环节,从基础设施的使用者向共同建设者移动。

这种合作可以从蒂莫西·布雷斯纳汉(Timothy Bresnahan)和曼纽尔·特拉伊滕贝格(Manuel Trajtenberg)1995年提出的“创新互补性”(innovational complementarities)得到进一步理解。他们在研究通用目的技术时指出,基础技术与下游应用之间可能形成双向的创新反馈:基础技术的改进为应用创新创造新的可能,而下游应用的发展又会产生新的技术需求,提高进一步改进基础技术的收益。DeepSeek与华为的合作呈现出类似的互动关系:模型的发展不断提出新的计算、通信和软件需求,这些需求推动昇腾及其软件工具进一步优化;底层计算能力的改善,又反过来拓展模型训练和推理的技术空间。

这种创新互补性在AI领域尤其重要,因为AI芯片最终处理的并不是抽象的“人工智能”,而是不断变化的具体工作负载。模型架构、算子结构、训练中的计算—通信比例、推理中的内存访问方式,都会对软件和硬件提出不同要求,而模型公司恰恰最接近这些需求的变化。因此,DeepSeek参与底层软件工具建设的意义,在于缩短模型创新与计算基础设施之间的反馈距离,使模型端不断变化的需求能够更快进入软件、芯片、互联和系统的优化过程。

对华为而言,DeepSeek提供的是来自前沿模型端的工作负载知识;对DeepSeek而言,深入底层工具意味着它有机会参与塑造模型赖以运行的计算环境。双方能否真正形成长期共同演化的生态仍需观察,但这种合作已经说明,“全栈”的含义正在发生变化:它未必要求一家公司拥有芯片、云、模型和应用的全部所有权,更关键的是技术栈不同层级之间能否形成快速而持续的反馈。

几乎与此同时,AMD从相反方向给出了一个有趣的参照。2026年9月28日,AMD宣布以约82亿美元的全股票交易收购李飞飞领导的World Labs。AMD在官方公告中明确表示,随着AI扩展到推理、机器人、仿真和物理AI,计算基础设施面对的工作负载将更加多样,而World Labs的模型研究能力可以帮助AMD理解这些工作负载如何演化,并据此塑造未来硬件、软件和系统路线。苏姿丰将这种能力概括为:建设下一代AI计算平台,需要深入理解模型如何演进。

DeepSeek在向下进入计算基础设施,AMD则向上进入模型研究,方向相反,却揭示了同一个结构性变化:模型与计算基础设施之间的距离正在缩短。过去相对清晰的“芯片—服务器—云—模型—应用”线性产业链,正在逐渐变成反馈系统:模型定义工作负载,工作负载影响软件和硬件,而新的硬件能力又改变哪些模型在工程上和经济上成为可能。

04 AI竞争的基础设施化与另一套计算体系的可能

这种反馈系统还在继续向下延伸。随着计算基础设施不断扩张,AI竞争进一步触及能源层面。大规模数据中心对电力的需求持续增长,能源正在从支撑计算运行的后台条件,逐渐成为制约AI基础设施建设规模和扩张速度的前置因素。当AI数据中心规模不断扩大,电力逐渐从后台投入变成前置约束。IEA数据显示,2025年全球数据中心用电增长17%,其中AI专用数据中心增长更为迅速;与此同时,少数大型科技公司的资本支出已经达到与传统能源投资相比较的量级。“AI正在成为重工业”形象地概括了这一趋势。更准确地说,前沿AI正在呈现日益明显的基础设施密集型特征,其发展越来越依赖大规模、长周期的资本与能源投入。模型可以在数月内迭代,芯片设计与制造以年计,数据中心建设更长,而新增发电、电网扩容和输电设施受到更长的投资与审批周期约束。不同技术层级由此呈现出显著的时间尺度差异:上层模型快速演进,底层基础设施却难以同步扩张,二者之间正在形成新的结构性张力。

随着土地、电网接入、能源供应、半导体供应链、数据治理和长期资本越来越直接影响到AI能力的建设与扩张,基础设施竞争也不可避免地成为国家产业能力和地缘政治竞争的重要组成部分。这也是“主权AI”概念兴起的现实背景。但主权AI并不等同于技术上的自给自足。对于绝大多数经济体而言,从半导体设备、先进芯片到云、模型和应用实现全链条自主既不现实,也未必经济。更准确的理解是降低关键环节的单点依赖,并保留必要的战略选择权:一个国家仍然参与全球技术分工,同时希望关键算力、数据和模型能力不会因为单一供应商或外部政策变化而完全中断。未来AI基础设施未必演化为彼此完全隔绝的若干技术世界,更可能形成不同程度、不同结构的相互依赖。在这个意义上,竞争单位迎来了又一次扩大:从企业竞争进入生态竞争,并进一步进入由企业、供应链、能源系统、资本和国家政策共同塑造的基础设施体系竞争。

竞争尺度的变化也使华为的意义超出单一企业之间的技术竞争。华为推进的不只是国产芯片的研发,也在测试另一套计算体系能否在外部技术约束下形成。这一路线具有双重意义:一方面,华为试图利用通信、光网络和系统工程等既有优势,在系统层面开辟新的性能提升空间;另一方面,它也为降低关键AI基础设施对特定外部技术和供应商的单点依赖提供了替代路径。但这种战略价值并不等同于技术领先,也不能据此推导出,围绕芯片、互联、软件和数据中心而构建的一套相对完整的计算体系必然会形成。它最终仍要接受性能、成本、可靠性以及开发者生态的市场检验。

05 华为的牌,也包括它缺少的牌

由此再看“华为的牌局”,它手中的优势和约束都相当清楚。第一张牌仍然是昇腾,没有自己的AI加速器,其余系统能力就缺少计算核心;第二张是互联和系统工程,华为正在把通信和光网络积累从“连接设备”推进到“组织计算”,UnifiedBus、NPO和超节点都服务于提高大规模计算单元协同效率;第三张是较完整的ICT基础设施组合,鲲鹏、存储、网络、数据中心和数字能源使华为能够在比单颗芯片更大的尺度上设计AI系统;第四张则是正在形成的软件和模型生态,包括CANN开放以及DeepSeek等模型开发者开始参与底层工具建设。第四张牌目前相对薄弱,却可能决定前三张最终能够发挥多少价值,因为前三者固然可以依靠华为自己的研发投入推进,而生态无法由一家企业单独创造。生态是否成立,最终取决于足够多的外部开发者和企业是否愿意进入,并且能够自主地留下来。

华为缺少的牌同样明显。首先是先进制造能力与稳定产能。系统架构可以提高已有芯片的利用效率,却无法取消制造约束,华为AI计算设备仍面对需求超过供应能力的问题。其次是软件生态的时间积累,CUDA多年形成的库、工具、人才和代码资产具有明显路径依赖,很难通过短期投入复制。第三是大规模系统自身的工程代价:用更多芯片弥补单芯片差距意味着更高的通信、供电、散热、故障和运维压力,因此“规模”并不是先进芯片的免费替代,而是一种工程交换。最后,华为的竞争对手也在向同一方向移动。英伟达、AMD以及大型云厂商都在从单一器件或云服务向更完整的AI基础设施扩张。因此,系统竞争并不是华为独有的路线,它更像是整个AI产业正在发生的共同转向。

这也使判断华为路线的标准变得更加严格。系统创新确实可以改变各项技术能力在竞争中的权重,却不能消除物理约束;它更接近一个“乘数”:芯片、互联、软件、存储和能源提供基础能力,系统工程决定这些能力最终能够以多高的效率组合起来。因此,华为的机会并不来自芯片差距已经消失,而来自当竞争尺度从单颗芯片扩大到整个系统以后,原来分散在通信、光网络、存储和能源中的技术资产获得了新的组合价值。

06 基础设施时代真正竞争什么

如果把这些变化放在一起,下一阶段AI竞争至少可以在四个尺度上观察:器件效率决定单位能耗能够提供多少基础计算;系统效率决定理论算力有多少能够转化为模型真正使用的有效算力;生态效率决定开发者需要付出多大成本才能迁移、开发和持续优化;基础设施效率则进一步涉及资本、电力、建设周期、可靠性和总体拥有成本。过去习惯用单卡峰值性能衡量AI计算平台,未来评价体系很可能需要越来越多地纳入真实工作负载下的有效算力、能效、利用率、可靠性、开发成本和总体拥有成本(TCO)。至于“单位资本、单位能源能够产生多少有效Token”,可以作为理解这一趋势的分析性指标,但它目前还不是行业通行的统一衡量标准,更不能脱离模型质量、任务类型和Token经济价值单独比较。

这也说明,算力并不是AI基础设施的最终产出。产业真正关心的是一套系统能否以可接受的资本和能源成本,持续、可靠地支持有价值的训练、推理和应用。华为能否在AI基础设施时代获得真正的竞争地位,不能由“百万卡集群”这样的规模数字证明,而需要回答一些更朴素的问题:大规模集群能否稳定运行?理论峰值能够转化成多少有效算力?相同工作负载下的能效和总体拥有成本如何?开发者迁移是否足够容易?DeepSeek这样的模型公司是否愿意持续进行原生优化?越来越多第三方能否减少对华为工程团队的直接依赖,自主开发、调试和改进这套体系?如果这些指标逐步得到真实部署的验证,昇腾才可能从一种AI芯片平台进一步成长为具有生态意义的基础设施;如果不能,再庞大的硬件规模也不足以建立持续的竞争优势。

因此,AI进入基础设施时代,并不意味着模型竞争结束,也不意味着芯片不再重要。真正发生的变化,是任何一个单独层级都越来越难以解释最终竞争结果。模型需要算力,算力依赖芯片和互联,集群依赖软件和存储,数据中心依赖能源和资本;与此同时,模型又开始反过来影响软件、芯片和系统的设计。AI技术栈正在从一条相对线性的产业链,逐渐变成一个相互反馈的复杂系统。

华为的战略位置也应当在这个变化中理解。它手里并没有所有最好的牌,先进制造、产能、软件生态和全球开发者基础仍然构成真实约束;但当竞争从单颗芯片扩大到系统、生态和基础设施以后,华为过去在通信、光网络、计算、存储、数据中心和能源领域积累的能力被重新赋予了价值。芯片决定计算能力的物理起点,系统决定这些能力能够释放多少,生态决定有多少创新者愿意在其上生长,而能源、资本与供应链则决定这一体系能够扩张多远。

华为真正下注的,是从系统工程到技术基础设施的转换。前者意味着华为能够依靠自身能力,把芯片、互联、软件、模型和数据中心组织成具有性能、可靠性与经济性的计算系统;后者则意味着这套系统能够超越企业自身的工程能力,成为其他模型公司、开发者和应用企业可以共同使用、持续建设并不断改进的技术基础。只有完成这一转换,系统能力才可能进一步转化为生态能力。

如果说过去AI竞争首先比的是谁能造出更强的模型,随后比的是谁能提供更多算力,那么下一阶段真正拉开差距的,可能是把模型、计算、能源、资本和生态组织成一个持续演化系统的能力。

这才是华为真正的牌局。

文|北京大学新闻与传播学院教授胡泳、北京信息社会研究所研究助理 胡知微

简体中文 English