C114讯 9月16日消息 上周,第二十七届中国国际光电博览会(CIOE中国光博会)在深圳国际会展中心成功举办。
在同期召开的“AI算力集群光互连技术发展论坛”上,腾讯网络及数据中心负责人邹贤能在开场致辞中表示,当前AI产业迎来交付为王的阶段,行业供需关系发生反转:过去厂商问腾讯算力需求,如今腾讯向产业链追问交付能力,这是AI算力爆发带来的 “幸福的烦恼”。
邹贤能指出,伴随MOE大模型、Agent智能体爆发,网络通信开销占训练时长最高可达40%,智算网络瓶颈凸显。腾讯正在从Scale-out横向二层大集群、Scale-up超节点纵向扩容两条路线突破,同时探索OCS光交换、IPOC轻量相干等技术,支撑GW级跨机房智算集群建设。
MOE 大模型 + Agent 推理:网络开销大幅抬升
邹贤能认为,两大趋势正在重塑智算网络需求。 其一,大模型参数持续膨胀,万亿、数万亿参数模型逐步落地,MOE混合专家架构成为主流。专家数量不断增加,网络通信耗时占到模型训练总时长30%~40%,网络不再是算力集群配套,而是核心性能瓶颈。
其二,Agent推理业务高速增长。腾讯WorkBuddy达到数千万日活,单用户三个月Token调用量增长十倍。Agent依靠多轮会话,单次任务消耗海量Token。用户规模、单用户Token消耗量、单Token通信开销三者叠加,带来网络需求的数量级增长。
据邹贤能介绍,10万卡Scale-out集群已经成为腾讯常态。训练流程新增后训练、强化学习环节,训练后期兼具推理特征,对时延、带宽提出严苛要求。传统三层网络架构在超大算力集群里面临明显时延瓶颈,腾讯当前核心攻关方向:基于二层网络搭建数十万卡规模算力集群。依托100G交换机、800G光模块,同时引入无源技术,扩充端口规模,支撑超大集群二层组网。
Scale-up超节点:故障隔离是痛点,OCS成破局方案
邹贤能指出,Scale-up纵向超节点路线,带来显著性能增益。128卡超节点对比传统8卡GPU服务器,单卡推理性能提升40%以上。但超节点有互连距离限制:AEC铜线 + DSP方案仅支持5~7米,只能覆盖64卡、128卡,4柜以上场景无法使用,行业普遍看好NPO技术,预计未来大规模上量。
更大的难题来自故障隔离。传统8卡服务器,单块GPU故障可以单独隔离,不影响其余卡继续训练;但256 卡、512卡超大超节点,如果单卡失效,若没有冗余机制,整组集群都要下线,经济性很差。
对此,腾讯的解法是OCS光交换。邹贤能提到,腾讯早在十年前就开始测试OCS。OCS最大优势是拓扑动态重构。可以利用交换芯片预留端口,接入OCS交换机与备用GPU。一旦超节点内GPU故障,OCS快速切换拓扑,接入备用卡,完成故障替换,保障集群持续运行,OCS有望在智算数据中心迎来规模化落地。

