1. 华为徐直军:昇腾国内市场份额已超英伟达,优先保障国内算力供给
2. 字节、腾讯、阿里抢人,AI高端人才薪酬持续走高
3. 智谱 GLM-5.3 牵手亚马逊云科技,国内外分成体系贯通
4. 余承东:存储涨价让每部手机成本增加超200美元,华为未来或将涨价
1. 华为徐直军:昇腾国内市场份额已超英伟达,优先保障国内算力供给
日前在上海举行的华为全联接(HC)大会期间,华为轮值董事长徐直军与海思首席科学家廖恒博士,就华为新发布的AI时代的Peerium计算架构和灵衢总线(UnifiedBus),与部分媒体记者进行了问答交流。如下为摘要:

徐直军:非常感谢大家来参加媒体沟通会,我有很长一段时间没有跟媒体朋友们沟通了,今天很高兴和大家相聚交流,主要聚焦在我们开创AI时代的计算架构和灵衢协议。
去年 HC 大会上,我在主题演讲中发布了昇腾芯片及其路标(950、960、970、超节点与集群解决方案),并宣布开放灵衢协议。
今年 HC 大会上,华为展出了昇腾 950 和 Atlas 950 超节点。"超节点" 如今人人都在讲,但不同厂商实现的差异很大。去年我曾一再强调,超节点的真正挑战,是让数千、数万颗处理器组成一台计算机。
今天展出的基于 950 芯片的超节点,背后正是我们开创的全新计算架构。它能让百万颗处理器成为一台计算机。我们将这一架构命名为 Peerium,它是基于嵌套并行、统一内存寻址、平等互联实现百万级处理器强扩展的计算架构,突破了图灵范式的串行,提出了Nested BSP。
同时,它也突破了冯・诺依曼单机架构,颠覆了长久以来的主从架构。但现有技术无法支撑这一架构的实现,为此我们发明了关键互联技术 —— 灵衢,最终实现让百万级处理器真正成为一台更大的计算机。
灵衢是基于一个开放协议、可无限扩展地联接 CPU、NPU、内存、SSD、网卡和交换机的高速总线。有了灵衢,计算、存储、网络得以平等互联,从而彻底颠覆原有的主从架构。
Atlas 950超节点就是华为采用Peerium计算架构的产品,目前25.6万卡规模的集群已经在部署和测试中。
问:廖博论文里面写的25.6万张卡组成一个超节点,这是该技术的上限吗?目前整体市场需求情况如何?
廖恒:25.6万或约20万这个数字,并不是随便定的。
首先,这类大型集群用于训练,硬件基础设施需要支撑基础模型训练,而目前模型参数规模已达到 5 万亿级别。
未来两年内,预计中国将出现约 6 至 7 个前沿 AI 实验室,目标都是训练参数规模在 10 万亿到 40 万亿之间的基础语言模型。这些数字与超节点的内存容量和规模大致匹配,因此需要如此规模的基础设施来做训练。
第二,在中国,大多数数据中心都接入了国家电网。考虑到单个区域、单个数据中心园区的电力输送系统设计,20万是一个相对保守的数字。
正如我所说,大家一定对全球范围内正在发生的AI模型竞赛非常熟悉。在中国,至少有3到4家一线参与者已获得广泛认可,并达到了一线地位。
问:华为接下来将如何推动中国的模型厂商将昇腾系列芯片用于训练?
徐直军:950 率先推出的是 PR 版,主要面向推理,目前上市量不算大。基于 950DT 的超节点则主要用于训练,目前还在测试中,规模供货应该在今年年底或明年初。我们和各家模型厂商做了很多沟通交流,从目前测试结果来看,950DT 的训练表现非常不错,我相信从明年开始,大量模型的训练会构筑在 950DT 超节点上。未来关键可能不在于我们推动的力度有多大,而在于我们的供货能力有多大。现在能产多少就供多少,我们希望产业链加快扩产,快一点、多产一点。
问:现在美国部分领先模型厂商呼吁放缓AI产业的发展,对此华为怎么看?
徐直军:从中美 AI 发展的水平和节奏来看,中国的模型基本都是开源的,相对而言,发展到哪一步也是透明的;而美国几家主流模型厂商由于拥有更强大的算力,到底发展到了哪一步,目前可能只有他们自己知道。他们感受到的 AI 风险,在中国可能感受并不强烈。中国现在还是要加快自己的节奏,等真正能够感受到这种风险时,或许会与美国头部模型厂商有同样的感觉。但我一直认为,AI 既要发展又要管控风险,要让 AI“向善”,而不是“向恶”。

问:950 超节点目前有没有在海外扩展的计划?如果有的话,会在哪些市场上开展?国内市场份额情况如何?如何看待芯片自主化率的问题?
徐直军:目前昇腾满足国内市场需求还远远不足,所以没有全面拓展海外市场的计划。但确有少数国家非常需要,我们做了测试和供给,但量非常少。
在中国市场要统计英伟达的市场占有率很难,但如果从我们能够统计到的数据看,昇腾应该已经超过了英伟达。
中国推进芯片自主化是一条必然之路。中国有 14 亿人口,又是一个工业化大国,所有的生活、工作都与芯片相关。中华民族又是一个忧患意识很强的民族,不能一直受制于人,不能今天被说卖一颗给你,明天又说不卖给你。尽管水平差一点、先进性差一点,但解决 "有无" 问题,不要天天提心吊胆,应该是必然之路。相信无论是中国政府还是中国产业界,包括华为在内,推动芯片的全面自主化、推动半导体产业整个链条的全面自主化,肯定是一条必由之路,而且我也相信总有一天会变为现实。
问:华为推出了灵衢互联技术,是基于在计算和通信领域的长期积累,其中有多少是来自华为网络部门的贡献?
徐直军:UB不仅仅是华为网络部门的贡献,我们在各种各样的互联协议基础上,最终将其做成一个统一协议。网络领域一般是IP协议,时延都很高。计算互联和传统网络不一样,我们提的是总线,需要低时延、超高速。当时在决策做这个产品时,我们将其放在计算部门而不是传统的网络部门,这样才能真正做出一个高速、低时延、又统一协议的UB出来。
廖恒:如果把UB看作一群人的智慧结晶,它是由计算机架构师孕育,但是由网络技术抚养长大。
问:UB是一个同时兼顾Scale-out和Scale-up的技术。英伟达分别做了NVLink和InfiniBand。为什么华为把Scale-up和Scale-out做成一个技术?这和现在其他方案相比有什么优势?
徐直军:首先,不是他们不做,而是能不能做出来的问题。当前最新的NVL72柜内带宽很宽,达到 1.8 TB/s,但一出柜就降到 0.2 TB/s。要把百万台处理器变成一台计算机,柜间如此低的带宽根本不可能。大家都希望柜内、柜间、数据中心之间乃至跨区,速度最好都一样,那才能让一个巨大的物理空间成为一台计算机。这正是 UB 的价值,它基于一个统一协议,做到全程高速互联。因此 UB 技术路线上做的是总线,就像计算机内部的总线一样,而不只是 Link。基于 UB,我们的柜间带宽最高可达 800 GB/s。
去年我们开放 UB 协议后,最大的下载量其实来自硅谷。英伟达最早的目标可能不是做NV72,而是NV256,但最终它的256变成了72;而华为的910C 超节点做到了384,还交付了一千多套。最主要的差别在于,我们在910C超节点上采用了UB,而当时英伟达的NVLink主要局限于柜内,柜间网络速度太慢,不可能扩展太多。
廖恒:我补充一下为何采用单一协议。英伟达及大多数其他厂商至少使用了两种协议,分别应对不同的场景,就像一次旅行往往要同时选择飞机、高铁、汽车等多种交通工具,转换过程相当麻烦费时。而在这些超节点中,大量流量需要中转,如果从 NVLink 切换到 InfiniBand,至少涉及微秒级的转换时间,即从一个协议到另一个协议的中转时间,时延很难满足。
UB 采用统一协议,将数据包从 scale-up 网络传输到 scale-out 网络,可能只需要大约 150 纳秒。相比而言,与这些协议转换开销至少可节省一个数量级。
问:在采用灵衢总线(UB)的Atlas 950中,Scale-up场景下光互联和电互联分别占多少?未来柜内有没有可能全部实现光互联,主要障碍是什么?
徐直军:华为刚刚发布了基于 NPO 的 Hi-ONE 模组,支持 7.2T 高带宽,光引擎距离主芯片仅约 5 厘米,只有这部分还需要铜线做电连接,基本可以说是全光的超节点。同时,Hi-ONE 模组把光源直接封装进模组内部,实现内置光源。我们预计,未来两到三年内都很难有其他厂商能做出来。这是华为多年来在光电相关领域的积累,才得以实现和量产。
廖恒:在我职业生涯初期,20年多前我们就已经在讨论让芯片连接走向光学化。因为光的传输距离和衰减非常小,信号可以高速传输更远。
从电路角度看 Hi-ONE 内部其实非常简单,器件并不多。但走向量产这条路,我们走得非常艰难:光学技术涉及大量物理原理,温度稍微变化,就会影响二极管的物理特性,改变折射率,影响波导性能,导致无法正常工作。
我认为全光互联最大的障碍是对可靠性的担忧,因为器件会发生故障。目前大多数厂商选择外置光源路线,用单个光源馈送 32 路信号,功率就必须放大 32 倍。如此巨大的功率很容易引发许多问题,在耦合接口及其他各个环节都会出问题。我们选择内置光源方案,是出于工程上的务实选择,Hi-ONE 正是经过多次权衡后达成的出色折中方案,很快将进入量产阶段。
问:关于昇腾芯片的工艺和产能问题,目前限制产能进一步释放的主要瓶颈是哪些环节?华为预计还需多久可以实现大规模稳定的算力芯片供应?
徐直军:中国的瓶颈问题与全球瓶颈问题基本一致。全球产业界都没有为 AI 如此浪涌式的发展做好准备。现在所有光模块公司、存储公司之所以能卖高价,并不是因为产品有多好,而是严重供不应求所致。因此,只有全球和中国同时达到供需平衡,瓶颈问题才能彻底结束。我预计全球的供需平衡差不多在 2029 年能得到解决,中国可能还要慢一点。这里的供需平衡,还要考虑 AI 发展过程中不断发生的技术变化,包括 CPO、NPO 等。
从华为的角度讲,相比过去的通信、IT 产业,现在我们的供应量已具备相当规模;但如果和当前产业对 AI 基础设施的需求相比,规模确实又远远不够。要实现客户要多少就能供多少,华为要达成这个平衡,取决于整个中国产业界的平衡。
问:有报道说马来西亚正在考虑基于华为昇腾910C来部署主权AI,华为如何来平衡国内客户和海外客户的需求?
徐直军:从客户部署华为解决方案的选择来看,肯定是基于地缘政治和多供应商的考量。每个企业都要为其长远发展消除安全风险,因此昇腾必然是所有客户的一个选项,尽管相比竞争对手它还有差距。至于平衡国内与海外,我们的原则很简单:国内为主,优先供应急需算力的中国客户;海外则服务于少数买不到的客户,或一定要另一个选择的客户。
问:华为在NPO、CPO这两个技术路线上,当时内部选择或者博弈是什么?
徐直军:这个问题在华为好像没有过争论。因为华为既做光器件,又做光模块和昇腾芯片,清楚哪种情况才是最佳选择,所以我们很早就达成共识做 NPO,没做 CPO。而且我认为,在相当长时间里,从工程实现、成本、维护、良率等角度讲,NPO 都是最佳选择。
经过产业界这几年关于 NPO、CPO 的辩论,从两次 OIF 的讨论来看,产业认知也在进一步清晰。OIF 第一次讨论时,有一部分厂家不支持 NPO,一心要搞 CPO;而最近一次 NPO 立项时,反对的已经寥寥无几。相比 CPO 方案,NPO 的铜线连接有 5 厘米左右,比 CPO 的 5 毫米左右要长一点,但带来了成本接近 40% 的下降,同时还带来另一个好处,即一旦光引擎出问题,不会把整个 AI 芯片一起报废。当然,CPO 和 NPO 并不是谁消灭谁的问题,而是工程、成本、产业链、维护等各个方向上平衡的选择,没有对错。
所以,我们坚定不移走 NPO 的道路,推动产业界形成标准,全产业链共同把 NPO 发展好,但也不是说 CPO 不行。在OIF上NPO得到了 40 家产业链厂商的支持,应该来讲,大家也看到了 NPO 的好处。
问:模型厂商对于950DT用在模型训练上,给华为反馈了哪些需要改进的领域和问题?华为对大模型的预训练做了哪些芯片和底层方面的调整和优化?
廖恒:此前昇腾芯片遇到的第一个障碍其实并非硬件本身,而主要是生态壁垒。就在两年前,昇腾软件层面仍存在巨大障碍,而 CUDA 在这方面显然具有压倒性优势,因为整个学术界都是伴随 CUDA 成长起来的,所有算法开发者都已习惯了 PyTorch 加 CUDA 的便利。
过去 18 个月发生了巨大变化。首先,模型的数学复杂程度发生了巨大变化,编程复杂度也随之增加。其次,模型正变得非常细粒度,这意味着无法再仅用 PyTorch 编写程序并保持效率。因此,即便是算法开发者,也必须转向超大规模内核的编程风格,需要新的编程语言,这已经是前沿实验室的发展方向。
如今,随着新的编译器语言出现,它们正在逐步取代并平衡 CUDA 的壁垒,前沿实验室已不再像两年前那样重视 CUDA。这是软件层面的壁垒消解。我认为我们正在接近甚至达到平衡,差距已大幅缩小。
其次,关于芯片本身,我们拥有自身优势,正如我讲到的UB和 Nested BSP 模型。这不仅是对单个芯片编程,更是以便捷的方式对大量芯片编程,我们正在提供这些能力。而在芯片内部,我们也吸取了此前的教训,做出了大量改进。
整体上,我们正在缩小英伟达与昇腾之间的差距。我认为如今主要差异已大幅缩小,当人们使用这些处理器开发时,不再感到陌生。
问:下周有可能中国和美国的元首会面会谈,有人说在 AI 人工智能方面两位国家元首也会谈一谈。作为中国的企业家,你期待两个国家达成什么样的合作?
徐直军:所有中国企业家都有一个共同心声 —— 和平相处,不应以政府行为干扰市场竞争。我们都经历过全球化充分竞争的时代,企业靠创新、靠自己的产品赢得客户。但随着地缘政治影响急剧上升,全球化在慢慢远离。对企业而言,都希望做全球市场,都期望靠自己的创新和产品去赢得市场,而不是想买买不到、想卖卖不过去。
华为这三十多年来一直强调靠创新赢得市场,靠持续的压强式研发投入构筑产品竞争力、赢得客户。从 2007 年到 2025 年,累计研发投入超过 1.8 万亿人民币,其中还有 10% 持续投入基础研究。正是过去这种高强度研发投入、强调创新去构筑有竞争力的产品,从竞争中赢得市场,才走到今天。
关注通信业的媒体可能清楚华为过去几十年走过的路。今天的 AI,我们也在走一条自己擅长、又能面向未来真正构筑竞争力的路。
问:关于 UnifiedBus 技术,这是国内在先进制程受限情况下走出的中国特色路线,还是未来全行业都可能的方向,英伟达也有可能往这个方向走吗?
徐直军:UB是一条创新之路,我认为也是未来AI计算的必由之路。
因为只有 UB 这种互联技术,才能实现百万级处理器的巨大计算机。而上百万的处理器像一台计算机一样工作,才能真正实现更好、更高效率的训练和推理,所以它是必由之路。相信过不了几年,大家都会朝着这条路走。
为什么开放 UB 协议?就是因为相信整个产业界会朝着这条路线走。这样,为 AI 走向 AGI,需整个产业界共同努力。廖博为什么以论文形式公布 Peerium计算架构,也是因为这一创新架构就是 AI 时代的计算架构。960 只是节奏变快了,规格和我去年讲的一样;HBM 是在 960 里面的,没有 HBM 的进步,也没有 960 的进步。
今天 UB 互联技术是整个 Peerium 计算架构实现的基础。无论是 UB 互联技术还是 Peerium 计算架构,我们都认为是 AI 时代的未来之路。
我多次讲过,在单芯片上,我们的设计没有任何问题,只是仍受制于国内的工艺。但将多芯片互联起来成为一台计算机,我们已经处于全球领先的地位。这是基于架构的创新和互联技术的创新,而且这些研究工作不是在制裁后才开始的,而是在制裁之前就开始了。第一颗 AI 芯片以及华为的整个 AI 战略,是我在 2018 年 HC 大会上发布的;2019 年,我们发布了超节点和集群。自那以后我们就认为,AI 要支撑大规模的训练和推理,需要新的架构、新的互联技术,也是从那时开始不断投入研究、不断创新,才有了今天讲的创新计算架构和 UB 互联技术。
我相信现在产业界面临的问题都是一样的。在多卡计算系统中,MFU(模型浮点算力利用率)是很关键的指标。大模型训练过程中,突然一个卡故障,或一个卡性能忽然下降,都会对训练造成巨大损失。
基于 UB 互联技术、基于 Peerium 计算架构做出的超节点和集群,可以大幅提升 MFU,这已经被验证了。这也是头部模型厂商采用昇腾 950 训练最喜欢的一点。我们还能提供原厂服务,让提升 MFU 更有保障,训练成本反而降低,训练迭代速度加快。
2. 字节、腾讯、阿里抢人,AI高端人才薪酬持续走高
人工智能热潮正在推高顶尖高校相关专业毕业生的薪酬。多位熟悉北京大学博士就业情况的人士透露,AI相关方向博士毕业后的第一年,总包达到数百万元人民币已不罕见,个别毕业生的打包薪资还可能更高。与此同时,AI也在高校毕业生之间制造分化,非顶尖高校毕业生在这轮技术变革中承受更大压力。
目前,争夺高端AI人才的主力是阿里、字节跳动、腾讯等科技大厂。字节跳动因总部距离北京大学较近,成为北大毕业生的重要去向之一。据北京大学国际机器学习研究中心助理教授杨灵介绍,不少北大学生在读期间就已在字节实习。字节跳动2026届“Top Seed”大模型顶尖人才校招计划,计划招募约30位优秀博士生,聚焦大语言模型、机器学习算法与系统等前沿方向,目标是找到大模型领域前5%的人。
腾讯面向全球顶尖技术学子推出“青云计划”,称将提供定制化培养方案、核心业务机会和“极具竞争力的薪酬”。网络流传的薪资标准为“100万—300万+,上不封顶”。阿里巴巴则在推进千问大模型项目。2025年年中,阿里宣布未来三年在AI及相关云计算领域投入3800亿元,CEO吴泳铭随后表示将追加资本开支。市场还流传,字节跳动2026年AI投资预算接近1600亿元。
大厂为何愿意开出高薪?AI初创公司创始人王浩表示,千问所持有的几十万张算力卡意味着近100亿美元投入。如果一名博士能帮助项目优化芯片使用效率,几百万元年薪在如此庞大的算力投入面前并不算贵。杨灵也认为,字节一年开几百万元并不亏,甚至给核心研究人员开两千万元也不亏。因为一次实验可能动用几百到几千张卡,成本从几百万元到几千万元不等,错一次代价很高,而顶尖研究员能减少无效训练。
不过,拿到高薪的博士并非高枕无忧。杨灵提到,不少北大、清华博士生会直接进入大厂承担核心任务,甚至替代上一代技术人才,但这也意味着过两年可能被更聪明的人替代。这也是他选择先去普林斯顿大学做博士后、再回到北京大学的原因之一。现在他既在北大带博士生,也在推动创业项目。
杨灵判断,五年后AI人才不会像今天这样紧缺。一方面,高校人才供给会增加,模型厂商也会培养自己的人才;另一方面,产业发展可能遇到天花板,对人才的需求不会一直膨胀。AI还在拉大高校毕业生之间的薪资差距。杨灵认为,未来AI领域可能不再只是Top20或Top15高校毕业生的事情,一些工作可能被Codex等AI编程平台替代。Codex是OpenAI推出的AI编程平台,其强劲对手是Anthropic的Claude编程工具。AI编程业务支撑了Anthropic收入高速增长和超高估值,也让初级编程人员的工作变得可有可无。
杨灵认为,AI对人才的分化会越来越极端,最终压缩到最顶尖的一批人,只有他们能真正做出高价值成果。王浩则表示,高校也需要变化,实验室必须与产业结合,否则缺少科研费用,学生也更难做事、学不到东西。普通学校则不得不面对并积极应对可能出现的螺旋式下降挑战。
3. 智谱 GLM-5.3 牵手亚马逊云科技,国内外分成体系贯通
10 月 6 日,亚马逊云科技(AWS)旗下大模型服务平台 Amazon Bedrock 官宣接入智谱 GLM-5.3,AWS 将基于模型调用量与智谱进行收入分成。
据了解,除了 AWS 外,智谱近期还与多家海外云厂商落地了收入分成模式。此前智谱透露,计划通过海外云平台收入分成增加一条具有规模潜力的商业路径。在国内,智谱也已与阿里云百炼平台等头部云厂商签署类似分成协议,华为云已上架 GLM-5.3,并就类似合作达成意向,形成了贯通国内外的分成体系。
4. 余承东:存储涨价让每部手机成本增加超200美元,华为未来或将涨价
10月6日,华为方面披露9月29日国际媒体圆桌会议纪要。华为常务董事、终端BG董事长余承东在交流中谈及当前手机行业面临的存储成本上涨压力,并透露华为手机业务未来可能进一步调整价格。
余承东表示,近期存储元器件价格大幅上涨,使每部手机增加的成本已经超过200美元。由于华为手机采用的存储规格相对较高,因此受到的成本冲击也更加明显。
面对持续上涨的零部件成本,华为此前一直在尽可能自行消化压力,希望减少成本上涨向消费者的传导。但余承东坦言,这一做法也使公司的整体利润率明显下降。
“未来我们也不得不提高价格。”余承东表示,如果持续亏损,业务将难以长期维持,企业首先需要保证自身能够生存。
从行业层面来看,存储价格上涨正在成为手机厂商共同面对的成本压力。余承东指出,目前已有不少手机厂商开始提高产品售价,而华为的价格调整相对缓慢,希望尽可能降低消费者需要承担的成本。
他同时认为,手机价格持续上涨后,低端市场的压力将进一步加大,部分厂商可能因此向中高端市场转移。对于长期布局高端市场的华为而言,这一趋势也意味着新的竞争机会。
Mate 90系列起售价5999元
10月1日,华为正式发布Mate 90系列,并于当天同步开售。其中,Mate 90售价5999元起,Mate 90 Pro售价6999元起,Mate 90 Pro Max售价9499元起,Mate 90 Pro Max典藏版售价10999元起,Mate 90 RS非凡大师版售价12999元起。
在发布会上谈及当前存储价格上涨背景时,余承东表示:“在内存大涨价的今天,我们的价格还是非常有诚意的。”
从产品来看,Mate 90系列全系搭载华为旗舰τ芯片,并运行HarmonyOS 7。其中,Mate 90搭载麒麟9030,Mate 90 Pro搭载麒麟9035,Mate 90 Pro Max搭载麒麟9050 Pro。
与此同时,鸿蒙生态仍在快速扩大。华为公布的数据显示,目前运行HarmonyOS 6和HarmonyOS 7的终端设备数量已经突破9000万台,可获取的应用和服务超过45万。余承东此前还表示,预计到今年年底,鸿蒙相关终端设备数量将达到1亿台。
在生态建设方面,华为目前拥有超过1100万注册开发者和超过2.3万家应用创新合作伙伴。余承东表示,操作系统开发中最困难的部分之一就是应用和生态建设,华为能够持续推进鸿蒙生态,也离不开开发者及合作伙伴的支持。
鸿蒙或逐步走向海外
除了存储成本和鸿蒙生态,海外市场也是此次交流的重点之一。
余承东透露,华为正在考虑未来逐步将鸿蒙操作系统推向全球市场。不过,目前这一计划仍处于早期阶段,具体推进将采取循序渐进的方式。
在手机业务方面,华为目前每年仍在中国以外市场销售数百万部智能手机,并正在探索进一步扩大海外业务。
余承东提到,在欧洲等成熟市场,手机销售很大程度上依赖运营商渠道。如果华为希望在更多发达国家扩大手机业务,就需要重新进入当地运营商销售体系。目前,华为正在研究重新进入欧洲等市场运营商渠道的可能性,但尚未公布具体时间表。
从存储成本上涨,到手机价格调整,再到鸿蒙生态扩张和海外市场重新布局,华为手机业务正处于新的调整阶段。随着上游存储成本压力继续传导,手机行业的价格体系以及厂商之间的竞争格局或将进一步发生变化。

