1. 为什么NPO是算力时代的必然选择1.1 老方案的尽头与带宽困局这两年做AI基础设施的都知道一个痛点算力芯片的性能上去了但数据进出的速度没跟上。GPU、NPU、AI加速卡的计算密度在快速爬升可传统可插拔光模块的方案却卡在了一个尴尬的位置——前面板空间就那么大光模块体积压不下来单端口速率再往上提功耗和散热就开始失控。800G光模块在机柜里的功耗动不动就奔着20瓦甚至更高去一个64口的交换机光模块总功耗轻松超过一匹小型空调。机房运维的人看到这种功耗密度头皮都发麻。可插拔方案另一个问题是信号完整性。交换芯片和光模块之间隔着PCB走线速率一高走线损耗就像水管里的水垢距离越长损失越大。业界试过各种补偿手段DSP芯片加了一代又一代功耗却跟着一起涨。这其实就是物理规律在逼你改变架构光模块不能再离芯片那么远了必须把它搬到芯片脚边来。昇腾960把NPONear Package Optics近封装光学方案推到量产等于正式向业界宣布了一条路线光引擎和交换芯片一起封装在基板上把芯片到光的距离从几十厘米缩短到几毫米以内。这个架构上的选择不是炫技是被带宽密度和功耗逼出来的必然结果。1.2 从可插拔到近封装NPO的技术进阶逻辑理解NPO之前得先把几种光互连形态的区别搞清楚。传统可插拔光模块是独立封装的盒子插在交换机面板上通过连接器和主机通信好处是标准成熟、维护方便、随时可以更换代价是体积大、功耗高、走线长。CPOCo-Packaged Optics共封装光学更激进直接把光引擎和交换芯片封装在同一基板上就像一个屋檐下住了两家人互连距离最短但其中一个出了问题整个模组都得一起换维护难度和成本都很高。NPO则站在了中间地带。光引擎和交换芯片一起封装在基板上但彼此之间是可分离的光引擎坏了可以单独更换不像CPO那样动辄整体报废。更关键的是NPO还保留了“可测试”的窗口光引擎在封装前可以先独立测试、筛选良品率更容易控制。昇腾960选择NPO而不是直接上CPO我猜测就是看中了这种工程上的折中——既把电气走线大幅缩短又把可维护性和良率风险控制在可接受范围内。用大白话讲可插拔是外卖送餐食物从餐厅送到你家门口路途远、盒子大、保温难CPO是请厨师住进你家体验最好但出了事很难处理NPO是家里设个专用厨房窗口厨师在窗外现做现递距离近、效率高、换人还方便。这个类比虽然粗糙但方向是对的。2. 昇腾960的架构硬功夫NPO到底是怎么落地的2.1 核心架构OIO光互连芯片是关键昇腾960里真正值得仔细看的不只是“封装了光引擎”这句话而是OIOOptical I/O光输入输出光互连芯片这个角色。它相当于整个NPO方案的神经中枢。传统方案里交换芯片发出的电信号要先经过SerDes串行器/解串器转成高速电信号再驱动光模块里的激光器发光。这中间每一道转换都在消耗功耗、引入延时。昇腾960的做法是把光引擎和交换芯片的距离缩到极短让信号的电气路径短到可以忽略不计然后用OIO芯片直接完成光电转换节省了大量PCB走线损耗和信号补偿开销。我实际算了一笔账。常规可插拔方案的光模块DSP功耗大约占光模块总功耗的40%到50%这部分功耗在NPO架构里被大幅削减。NPO方案相比传统可插拔整体能耗大约可以下降50%甚至更多网络延时也会降低一个数量级。对于大规模AI训练集群来说这个时延和功耗优势会被集群规模不断放大——千卡集群里省下的每一瓦、每一纳秒到最后都是能直接兑换成训练效率的。昇腾960在整机上采用了全液冷散热方案底部进冷水、上部出热水冷板贴合在交换芯片、光引擎和电源模块上。NPO光引擎本来就是发热大头液冷直接解决了高功耗下的散热问题。如果还用风冷光引擎贴着芯片封装中间连散热风道都很难设计更别提把设备塞进标准机架了。昇腾960选液冷本质上也是被NPO的功耗密度倒逼出来的正确选择。2.2 关键参数与性能对照单纯说“更快更强”没有说服力我整理了昇腾960在NPO架构下几个核心维度的变化。单端口速率和单机交换容量的具体数值以华为官方发布为准但架构带来的系统性提升是可以讲清楚的维度传统可插拔方案昇腾960 NPO方案收益芯片到光模块的走线距离30-50厘米级别毫米级信号完整性大幅提升单端口功耗高需DSP补偿显著降低整机功耗下降散热方式风冷为主全液冷冷板支撑更高功耗密度光引擎可维护性面板可插拔基板级可更换兼顾密度与维护单机架带宽密度受限于面板空间大幅提升相同机柜空间获得更大吞吐这张表里的本质逻辑是NPO把“面板空间”这个物理瓶颈直接移除了。传统交换机前面板能插多少个光模块基本就决定了这台设备的总带宽上限。昇腾960既然采用了近封装方案光引擎不再占用面板面积那同样高度的机箱就能塞进更多交换芯片和光引擎带宽密度自然就上去了。这也是为什么昇腾960能成为首个量产NPO产品在AI集群场景里有那么大的吸引力。不过要强调一点NPO不是说把光模块“塞进”设备里就完事了。光引擎和交换芯片之间的位置关系、基板的材料、供电网络的设计、光纤的管理方式……每一样都需要配套的工程调整。华为把NPO产品做到量产交付意味着背后这些配套系统都已经经过了完整的工程验证这才是“量产”两个字真正的含金量。2.3 为什么放弃可插拔还要保留外部光口昇腾960不是完全取消了外部的光连接而是主要光互连走NPO但设备形态上仍然需要和外部网络打交道。在实际部署里核心交换机用NPO做高速互连外部光口用于上联下行——这个双轨设计值得点赞。如果全部采用CPO那种深度集成方案那么外部接口的灵活性就会大打折扣日常运维里想临时调整链路、增加带宽都非常痛苦。这种设计让我想到一个词工程抠门。真正的量产设备不会为了一个技术的“纯粹性”牺牲现场运维的灵活性。昇腾960在架构上大胆采用NPO在外围又保留了传统兼容能力是一个相当务实的取舍。3. 发布之后的变化产业链和部署模式3.1 NPO对光模块产业链的连锁冲击昇腾960正式发布NPO量产产品要重新洗牌的不是某一家厂商的路线图而是整个光互连产业链的分工格局。以前光模块行业的核心产品形态是“可插拔模块”厂商比拼的是模块化封装能力、DSP芯片集成能力和连接器兼容性。到了NPO时代光模块变成了“光引擎”形态从独立的金属外壳模块蜕变成芯片级的器件封装方式从气密封装走向板上封装对精密耦合、硅光工艺、晶圆级测试的要求完全不同。国内光模块厂商如果还守着老一套的可插拔产线很容易在NPO浪潮里被边缘化。硅光技术的重要性也在NPO背景下被进一步放大。NPO光引擎的核心器件和制造工艺都建立在硅光平台上硅光晶圆代工、InP激光器、光纤阵列耦合、CW光源这些环节就变成了和芯片制造一样关键的供应链节点。昇腾960的量产本质上是在验证这一整条硅光产业链的成熟度一旦跑通后续的产品迭代节奏会加快很多。3.2 数据中心网络架构的部署启示从实际运维视角看昇腾960这种NPO设备的部署模式和传统交换机有显著差异。传统可插拔设备运到机房插上光模块、跳好线缆、启动配置就能跑。NPO交换机到了现场之后光引擎已经预装在设备内部运维人员不再需要面对几十上百个光纤接口进行精密插拔但液冷管路必须先布置到位才能上电。液冷部署带来的变化是网络设备不再像以前那样“独立运行”它的散热系统和整个机房的CDU冷量分配单元系统强耦合。这对现网运维团队提出了新技能要求——以前可能是学网络的专业人士管理交换机现在还得懂管道、流速、温差和压降。我接触过的一些大型数据中心团队已经专门设置了“液体冷却运维工程师”这样的岗位这确实是NPO和AI高功耗设备带来的新分工。另外高带宽密度对上层业务的直接影响也很明显。以前跑千卡级别的AI大模型训练网络瓶颈常常出现在多机通信的环节梯度同步和模型参数传输动辄卡住现在昇腾960在单一机架内就能提供远超以往的交换容量集群规模越大这个收益越显著。这也是为什么我认为NPO并不是某个小众技术点的炫技而是真正意义上支撑下一代AI基础大模型训练的基础设施级创新。3.3 华为生态里的位置昇腾960的定位与协同昇腾960发布之后不光是网络设备这一个节点在变化。华为昇腾体系本身是围绕AI训练和推理做全栈协同的昇腾NPU负责算力、昇腾CANN软件栈负责开发、CloudMatrix架构负责集群调度而昇腾960扮演的是数据中心和集群节点之间的“骨架”角色。训练集群里最怕的是节点越加越多网络性能反而拖后腿。昇腾960把机架内的互连带宽大幅拉高意味着相同规模的训练任务可以用更少的交换机、更短的网络层级来完成。集群通信路径缩短了不仅延迟下降故障点也少了。我在实际部署中遇到的很多出现在通道路由上的隐患本质上都是网络层级太多带来的减小网络深度对提升训练稳定性是立竿见影的。4. 别被“首个量产”冲昏头NPO的坑与真问题4.1 良率与可维护性的现实说完了优点再讲讲我必须坦诚指出的现实问题。NPO刚量产不等于已经完美。第一个难关是良率。光引擎和交换芯片封装到同一基板上任何一个环节有缺陷都会降低整体良率。传统可插拔光模块可以在封装前独立测试淘汰掉不良品NPO不行它的物理形态决定了部分测试必须整体完成后才能进行。昇腾960能做到量产说明良率已经越过了一个商业化的门槛但成本肯定不低这个成本最终会反映在整机价格上。第二个难关是可维护性。虽然NPO比CPO更容易更换光引擎但比起“面板抽插”的传统可插拔修复的复杂度还是高了一个级别。现场工程师需要专业工具、受控环境、更长的维修窗口。万一核心光引擎出问题宕机时间会比换一个可插拔模块长很多。这对企业运维团队的备件策略和故障预案都提出了新要求。4.2 可测试性与失败模式的挑战我在和几位做封装测试的朋友交流时了解到NPO器件的光引擎在测试环节上还有一个隐性挑战——它对环境颗粒度极其敏感。传统可插拔模块自带密封外壳现场更换时对外界环境不太挑剔。而NPO光引擎处于开放封装状态光学耦合面一旦进灰或者受潮直接影响光功率。量产阶段控制车间净化级别容易做到但到了客户现场未来维护和升级过程中如何保证耦合面的洁净度依然是工作上的难点。可以预见的是首批采购昇腾960的用户大概率是技术能力较强、运维体系完善的头部云厂商和超大规模算力中心。普通企业想上NPO不但要过技术选型关还得先过现场运维能力的评估关。4.3 标准之争与生态卡位NPO虽然由华为昇腾960率先做到量产但整个行业的标准还没有完全定型。光引擎与交换芯片之间的接口定义、电气信号速率规范、可维护性接口的标准化程度这些都还在动态演进中。先行者的话语权很大但后续配套生态能不能跟上是NPO能否从小规模走向全面普及的关键。对于同行来说早入局的好处是能抢先卡位NPO时代的供应链和人才储备风险则是标准变动带来的资产折旧。我的建议是无论现阶段上不上车技术团队都应该把NPO列入中期技术雷达开始储备硅光模块知识和光引擎测试技能Apple时代留下的可插拔思维在两三年后会明显不够用。4.4 实操建议小步快跑先验证再上量如果我的客户现在考虑部署昇腾960我会给三条实操建议第一先选一小块业务场景做试点不要一上来就替换核心网络。NPO设备在实验室环境验证和真实生产环境的长期表现之间存在落差用一小段非关键流量跑上至少一个季度观察光引擎的长期稳定性、液冷系统的压力波动以及运维人员上手熟练度。第二把网络异常响应预案从“换模块”升级为“整体设备级故障处理”。原来网管系统对光模块参数监测很细发射功率、接收光功率、温度一目了然。NPO设备要提前确认监控系统能不能读到这些指标不然故障定位就像盲人摸象。第三提前和供应商确认备件和维修SLA。NPO光引擎不是标准备件不会像普通光模块一样在备件库里有大量库存。要把维修窗口、备件价格、现场支持等级在合同层面谈清楚避免真出事的时候陷入被动。这里也多说一句我的个人体会华为选择公开把“量产NPO”这个概念打出来对整个产业链反而是好事情。它把一个还在PPT阶段的技术拉到了工程验证和真实部署的层面逼着光器件厂商、液冷设备商、测试仪器供应商全部对表对齐行业的整体进步速度会被大大加快。最后就分享一个我试过的小技巧。新引入NPO设备的时候第一时间把机房里的光纤标签体系重新梳理一遍。因为NPO后接口密度更高、端口数量更大原先那种沿用多年的中文拼音缩写命名法在排障时会让你翻车翻到怀疑人生。提前用统一的端口命名规则和颜色管理把机架内外的链路关系理清楚后期能省下大量时间。这一条是我自己踩了不少坑之后想说的话。