news 2026/9/27 20:33:01

光模块从400G到1.6T:垂直整合、LPO与硅光的技术博弈

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
光模块从400G到1.6T:垂直整合、LPO与硅光的技术博弈

1. 光模块行业为什么突然成了“硬科技”赛道里的顶流

过去几年,只要聊到算力、AI大模型、数据中心,光模块这三个字就绕不开。作为连接服务器和交换机之间的核心部件,光模块的速率每提升一代,整个数据中心网络的带宽能力就往上跳一个大台阶。从主流的400G到正在铺开的1.6T,再到更远期的3.2T甚至线性驱动可插拔光学(LPO)方案,这条赛道表面上拼的是速率迭代,实际上拼的是光电芯片、封装工艺、测试设备和下游客户认证的综合体系。

这个行业有意思的地方在于:它既有通信设备的“重资产”属性,又有消费电子级别的“快速迭代”节奏。一个400G光模块的出货峰值还没过去,1.6T的方案就已经在各大展会上刷屏,头部厂商的研发投入几乎全部押在下一代速率上。而AOI(美国AOI公司,Applied Optoelectronics Inc.)这类公司之所以被市场重新关注,核心逻辑在于:当行业从400G向1.6T切换时,垂直整合能力和自研光芯片的比例,直接决定了毛利率和交付能力。AOI代表的正是“自己有激光器、自己有探测器、自己有封装产线”的IDM模式,这种模式在速率迭代的窗口期,往往比纯组装厂拥有更多定价权和供应链韧性。

这篇文章我想从行业演进规律、速率代际切换的关键技术、AOI这类厂商的商业模式,以及1.6T时代真正值得关注的技术细节几个角度,把这个行业从“热闹的新闻”拆成“可理解的逻辑”。如果你是在数据中心做网络运维、在光通信公司做产品规划,或者单纯想搞明白为什么光模块能成为资本市场的热点,这篇文章应该能给你一个比较完整的视角。

2. 从400G到1.6T:光模块速率升级背后的物理与工程逻辑

2.1 为什么速率提升不能只靠“跑得更快”

很多人以为光模块从400G升到1.6T,就是把激光器开得快一点就行,实际上远没有那么简单。光模块的速率提升,本质上是三个维度的同时升级:单通道速率、通道数量、调制格式。

400G时代最主流的方案是QSFP-DD封装,8个通道,每个通道50G,采用PAM4调制。这里的50G并不是简单的“比特率”,在PAM4下,每个符号携带2比特信息,所以实际波特率是25GBaud。这个设计的巧妙之处在于:在现有激光器和探测器的带宽范围内,通过换调制格式就把速率翻倍,而不是非要挑战更高的模拟带宽。

到了800G,方案基本就是两个方向:一是把8个通道的每通道速率从50G提升到100G,仍然用PAM4,波特率变成50GBaud;二是直接上2×400G的方案,用两个光引擎配合CW(连续波)激光器。而1.6T就更复杂了,目前的主流路线是16个通道,每通道100G,相当于在800G的基础上把通道数翻倍。也就是说,从400G到1.6T,光模块走的是“通道数×单通道速率”双轨提升的路线,而不是单纯把某一项做到极致。

速率封装通道数单通道速率调制方式典型应用
400GQSFP-DD / OSFP850GPAM4数据中心骨干、AI训练网络
800GOSFP / QSFP-DD8100GPAM4大规模GPU集群、HPC
1.6T新型OSFP-XD16100GPAM4下一代AI集群、超大规模数据中心

通道数翻倍带来的直接问题就是封装尺寸和散热。16个光通道塞进一个可插拔模块里,光学组件的排列密度、PCB布线的串扰控制、热设计的冗余能力,每一环都是新的工程挑战。所以1.6T的模块外形尺寸大概率会在OSFP的基础上做加宽处理,这也是为什么很多厂商在推“OSFP-XD”这类新封装的原因。

2.2 单模与多模:1.6T时代怎么选

光模块的另一个重要分水岭是单模还是多模。400G以前,数据中心内部短距离互联(几十米到几百米)基本都是多模方案的天下,VCSEL激光器加OM4/OM5光纤,成本低、功耗低、技术成熟。但到了400G时代,多模的速率上限开始吃紧——100G每通道的多模方案在传输距离和链路预算上都很勉强,更别说1.6T了。

1.6T时代,单模方案会成为绝对主流。原因很简单:PAM4 100G每通道速率下,多模光纤的模式色散会严重限制传输距离,哪怕是在机柜内的极短互联,链路余量也很紧张。而单模方案配上EML(电吸收调制激光器)或硅光技术,传输距离可以轻松覆盖2km甚至10km,给数据中心的布线架构留出了充足的设计空间。

这里顺便说一下AOI这类厂商的机会:单模方案需要高质量的DFB(分布式反馈)激光器和EML激光器,而这些恰恰是AOI自研的核心产品。你去看AOI的年报,它最大的亮点从来不是说“我们能组装光模块”,而是“我们有自己的外延生长和晶圆制造能力”。这就像做餐馆的能自己种菜、自己养猪、自己磨调料,供应链的每一环都攥在自己手里,成本结构和供应稳定性自然不一样。

2.3 PAM4调制与光模块驱动电路:信号完整性才是隐形战场

聊到光模块原理,很多人会下意识去看激光器和探测器,但我个人觉得真正决定一个模块能不能批量稳定出货的,往往是驱动电路和信号完整性设计。PAM4的四个电平之间,电压间距只有传统NRZ的三分之一,这意味着一丁点噪声都可能把信号误判成另一个电平。

光模块的驱动电路通常包含以下几个核心环节:

  • DSP(数字信号处理器):负责PAM4信号的编解码、均衡、时钟恢复。400G时代的DSP功耗基本在10W~15W,到了1.6T,DSP的功耗压力更大,所以行业里才会出现“去DSP化”的LPO方案讨论。
  • TIA(跨阻放大器):把探测器输出的微弱光电流转成电压信号。光电转换后的信号极小,TIA的噪声性能直接决定接收灵敏度。
  • Driver(激光器驱动电路):把DSP输出的电信号放大到足以驱动激光器的电平,同时要保证偏置电流的稳定,防止激光器的波长漂移和功率波动。

这三个环节里,任何一环的匹配出了问题,光模块的误码率(BER)就会飙升。我实测过一些早期1.6T样品,表现不稳定的原因往往不是光路,而是驱动电路在高温下的眼图塌陷。所以在评估光模块样品时,千万别只看实验室常温数据,一定要拿到高温(70℃甚至85℃)下的眼图和误码率测试报告,那才是量产可靠性的关键指标。

3. 拆解AOI的垂直整合模式:为什么自研光芯片是1.6T时代的胜负手

3.1 AOI的核心资产:外延生长、晶圆制造、封装测试全链条

在光模块行业,大部分公司走的路线是“外购光芯片+自行封装+系统集成”,这样的好处是轻资产、起量快,坏处是毛利被上游芯片厂卡脖子。而AOI走的是另一条路:从砷化镓(GaAs)和磷化铟(InP)外延片开始,自己做激光器的晶圆制造,再自己封装成TO-CAN或COS(芯片on载体),最后才组装成光模块。

这套模式的第一个优势是成本结构。光模块的成本构成里,光芯片通常占比30%~40%,如果自研自产,这部分成本能比外购低20%~30%。在400G价格战打得最凶的时期,很多纯组装厂毛利率掉到15%以下,而具备自研能力的厂商依然能维持20%以上的毛利,差距就是这么来的。

第二个优势是供应链韧性。2022年到2023年那波光芯片缺货潮,很多人应该还有印象:EML激光器交期一度拉到30周以上。那些依赖外购芯片的模块厂,手里攥着订单却交不出货;而AOI这种有自己的InP产线的厂商,至少可以在排产上保自己产品的优先级。虽然它的产能规模跟国际大厂比不算大,但在“保供”这件事上,自研自产带来的确定性是纯贸易属性厂商完全无法比拟的。

第三个优势是定制化能力。数据中心客户的要求五花八门,有的要特定波长,有的要放宽温度范围,有的要求特殊的链路预算余量。如果是外购芯片,想改个参数得等芯片厂家排期;但自研芯片的厂商可以针对客户需求直接调整外延结构和芯片设计。这种“贴身定制”的能力,在大客户验证阶段非常加分。

3.2 从400G到1.6T,AOI看中的增量市场在哪里

AOI的核心市场过去偏重于有线电视(CATV)和光纤到户(FTTH),但这两年它的业务重心明显在往数据中心光模块转移。从400G开始,AOI在数据中心市场拿到了不少设计导入(Design Win),到了1.6T时代,它的机会点主要体现在三个方面。

第一,EML激光器的放量需求。1.6T单模方案对EML激光器的需求量是800G的接近两倍(通道数翻倍),而EML恰恰是高门槛、高价值的核心光芯片。AOI在InP基EML上的积累,让它有机会在这一波需求爆发中分到可观的份额。

第二,多通道封装工艺的成熟度。1.6T的16通道封装,对光路对准精度、功率一致性、焊点可靠性都有极高要求。AOI在自有产线上做过多代产品的封装迭代,这种“工艺know-how”是时间堆出来的,新进入者很难快速复制。

第三,垂直整合对客户的信任价值。光模块的客户(云厂商、设备商)在下单前会很认真地审厂:你的芯片自研率多少?产线良率多少?品控体系完善吗?AOI这种“我什么都自己干”的模式,在客户审厂时天然有背书效果。反过来看,纯组装厂的客户粘性往往取决于价格,一旦有更便宜的竞争对手出现,订单转移风险就很高。

3.3 垂直整合的代价:规模门槛与资本开支压力

当然,垂直整合不是没有代价。自建InP产线意味着巨大的资本开支,一条像样的光芯片产线,动辄上亿美元投入,而且良率爬坡周期很长。AOI的体量跟中际旭创、新易盛这种纯模块大厂比,产能规模不在一个量级。这意味着它必须把自己有限的产能投入到高价值的产品和客户上,相对来说,承接大规模、低毛利订单的能力会弱一些。

这也是市场对AOI的争议点:到底是“小而美的IDM”,还是“因为体量不够才被边缘化”?我的看法是,在400G时代,纯组装模式的规模优势很明显,但在1.6T这种技术切换窗口,垂直整合的价值会被重新定价。原因在于,1.6T的早期需求不会像400G那样瞬间爆发,客户更看重的是技术验证能力和交付确定性,这时候“自己搞定一切”的能力就变得非常关键。等到1.6T进入成熟期、价格战打响,AOI能否守住份额,就要看它能不能把产能规模跟上去了。

4. 1.6T之后:LPO、硅光与CPO,三条技术路线的博弈

4.1 LPO(线性驱动可插拔光学):跳过DSP,省下功耗与成本

LPO(Linear-drive Pluggable Optics)是最近两年非常热门的方向,核心逻辑是去掉模块里的DSP芯片,让交换芯片的SerDes直接驱动光模块的光引擎。这么做的好处非常直观:DSP一颗就要好几美元,功耗还高,去掉它,模块的功耗能降30%~40%,成本能降一大截,时延也更低。

但天下没有免费的午餐。DSP在PAM4信号里的作用不只是编解码,它还承担了重要的信号均衡和时钟恢复功能。一旦去掉DSP,交换芯片SerDes输出的信号质量就必须足够好,同时光模块内的Driver、TIA的线性度必须足够高,否则信号经过电-光-电转换之后,眼图会变得一塌糊涂。

从我实际测过的LPO模块来看,它在短距离(<500m)、高质量链路里的表现确实不错,误码率和普通带DSP的模块差距不大。但只要链路里有一个比较差的连接点——比如光纤损耗偏大、连接器端面脏了——LPO的劣势就会立刻暴露。所以LPO比较适合AI集群内部那种“短距离、高质量、密集互联”的场景,而在长距离和复杂链路里,还是得老老实实用带DSP的方案。

4.2 硅光技术:从“可选项”到“必选项”的转变

硅光技术这些年最大的变化是:从“能用”变成了“好用”。早期的硅光芯片性能跟InP分立器件比有差距,尤其是激光器还得外挂InP光源(就是常说的CW激光器+硅光调制器的方案)。但硅光的优势在于可以用成熟的CMOS制造工艺来加工,成本摊薄能力强,而且芯片集成度高,可以在一片硅片上同时做多个调制器和探测器,特别适合1.6T这样多通道的应用。

AOI在硅光上的布局不算激进,它的核心还是InP有源器件。但行业里有一个明显趋势是:1.6T时代,硅光方案和InP方案的边界会更加模糊。有的厂商会采用“硅光调制器+InP激光器”的混合方案,也就是CW激光器外置,硅光芯片负责调制和接收。这种方案既保留了InP激光器的高性能,又利用了硅光的集成优势,可能在800G向1.6T过渡的中间阶段成为主流。

4.3 CPO(共封装光学):把光模块“化整为零”的未来方案

如果说LPO是“去掉模块里的DSP”,那CPO(Co-Packaged Optics,共封装光学)就更激进:直接把光引擎封装到交换芯片旁边,甚至封装进芯片基板里。这意味着光模块这个独立的可插拔部件在CPO架构里基本不存在了,取而代之的是“光引擎+交换芯片”的紧耦合封装。

CPO的优势是功耗和密度:光信号不用再通过PCB走线传到面板端口,省掉了大量的高速电互联损耗,功耗可以大幅下降,端口密度也能显著提升。但CPO的挑战同样巨大:可维护性变差(光引擎坏了得换整个交换机)、芯片与光引擎的热耦合问题、测试难度提升,而且一旦做成CPO,整个供应链的分工格局会被彻底改写——传统的模块组装厂可能会被边缘化,而具备封装和光芯片能力的厂商会占据主导。

AOI在CPO上的存在感目前不强,但它的InP芯片能力在CPO架构里同样有潜在价值,只是需要时间和更紧密的芯片级协同。总的来说,1.6T之后,LPO、硅光和CPO会形成一段相当长的共存期,不会出现某一条路线立刻“通吃”的局面。

5. 实操视角:从mellanox mlxlink工具看懂光模块与线缆诊断

说完了行业和技术路线的宏观框架,回到一个非常实际的问题:你手里拿到一块400G或者1.6T的光模块,怎么判断它是不是真的健康?这里必须提到一个非常实用的工具——Mellanox的mlxlink。这个工具是NVIDIA/Mellanox网卡上用来做链路诊断的命令行工具,尤其适合在数据中心里排查光模块和线缆问题。

5.1 mlxlink的核心功能与参数

mlxlink最常用的两个参数是-m和-c。-m是模块信息查询,-c是线缆信息查询,两个都带具体的端口参数。基本用法大概是这样:

# 查看网卡某个端口的光模块信息 mlxlink -d mlx5_9 -m -p 1 # 查看线缆信息 mlxlink -d mlx5_9 -c -p 1

其中-d后面跟着的是网卡设备名,比如mlx5_9,-p是指定端口号。命令执行后,你会看到一长串输出,包括模块类型、支持速率、厂商信息、序列号,以及非常关键的模块温度、供电电压、发射光功率、接收光功率等实时监控项。

这套信息就是光模块的“体检报告”,基于它可以直接判断链路状态。我实际排查过不少链路问题,基本套路可以归纳成下面几步:

  • 第一步,看温度与电压:如果模块温度超过70℃且持续走高,大概率是散热设计不足或者模块周围风道堵塞。电压异常则可能是电源供电不稳,这种问题往往伴随随机丢包。
  • 第二步,看发射光功率(Tx Power):如果发射功率低于模块规格下限,说明激光器老化或者驱动电路有问题。正常的400G单模模块,发射光功率一般应该在+2dBm到+4dBm之间,具体看模块等级。
  • 第三步,看接收光功率(Rx Power):接收光功率太低,大概率是链路衰减过大或者光纤端面脏了。这时需要检查整个链路的损耗预算:连接器插损、熔接点、光纤本身的衰减,一项一项算过去。
  • 第四步,看误码率(BER):如果光功率都正常但误码率偏高,问题往往出在信号完整性上,比如光纤弯曲半径太小、连接器回损过大,或者是DSP的均衡参数不匹配。

5.2 mlxlink实战:一次典型的链路劣化排查

举一个我自己排查过的案例。某个机房的400G链路频繁出现瞬时丢包,业务影响很大。用mlxlink -m查看模块信息后发现,接收光功率只有-7.8dBm,而该模块的接收灵敏度是-8.5dBm,这意味着链路余量只剩不到0.7dB,稍微有点环境波动就会误码。

接下来我做了三件事:先是检查光纤跳线的插损,用光功率计实测下来发现两个连接器端面的插损加起来超过1.5dB,明显超出正常范围(正常单个连接器插损应该在0.3dB以下);再用光纤显微镜看端面,果然发现了灰尘颗粒和划痕;最后更换了跳线并用酒精棉清洁了模块端面,重新查询mlxlink,接收光功率恢复到-3.2dBm,瞬时丢包消失。

这个案例想说明的是:光模块本身往往没有问题,问题出在链路中那些看似不起眼的光纤连接点上。mlxlink的价值在于它帮你把光模块的“内部健康状态”暴露出来,让你能够快速定位排查方向,省去盲目换模块、换线缆的冤枉路。

5.3 mlxlink输出解读:关键指标速查表

为了让不太熟悉mlxlink的朋友更快上手,我整理了一张常见指标速查表:

指标正常范围(400G单模参考)异常信号排查方向
模块温度30℃~60℃持续高于70℃散热风道、模块周围布局
电压3.2V~3.5V波动超过5%电源模块、背板供电
发射光功率+2dBm~+4dBm低于0dBm激光器老化、驱动异常
接收光功率-5dBm~+2dBm低于灵敏度门限光纤插损、端面污染、链路断点
误码率(BER)小于1E-12大于1E-9DSP均衡、链路衰减、串扰

不同厂商、不同型号的光模块,这些指标的绝对值会有差异,关键是要跟模块在数据中心里实际运行的链路预算做对比,而不是生搬硬套某个固定数值。另外,mlxlink的图形化版本MFT(Mellanox Firmware Tools)也提供了一些Web界面能力,但在headless服务器上,命令行版本通常是效率最高的选择。

6. 从行业数据看需求空间:AI算力集群到底需要多少光模块

6.1 算力集群与光模块数量的对应关系

这一轮光模块需求爆发的直接驱动力是AI大模型训练。以典型的英伟达GPU集群为例,一张A100/H100加速卡需要搭配至少1~2个400G光模块。如果是一台8卡服务器,那就是8到16个光模块;一个千卡级别的AI训练集群,光模块的用量轻松上万只,而且对速率的要求还在不断提高。

这个数字背后有一个更本质的逻辑:AI集群的带宽瓶颈不在计算而在通信。GPU之间需要海量数据交互,传统的电互联在距离超过几米之外就损耗过大,必须靠光互联。GPU数量越多、模型越大,通信占训练总时间的比例就越高。这也是为什么头部云厂商愿意花大价钱升级网络基础设施——光模块做的不是锦上添花,而是直接决定AI集群能否高效运转的基础设施。

有行业分析机构测算过,全球前几大云厂商加在一起,2024年400G光模块的采购量在千万只量级,而800G开始放量后,2025年的增速预期会更高。如果1.6T在2025年下半年开始小批量、2026年规模起量,那整个市场的增量空间会非常可观。AOI之所以在这个时间点被关注,核心逻辑就是它踩中了“速率代际切换+AI集群扩容”的双重风口。

6.2 光纤与光模块的关系:光模块背后的连接生态

再往下一层看,光模块的需求天然带动着光纤光缆的需求。单模光模块匹配的是G.652/G.657单模光纤,多模光模块匹配的是OM3/OM4/OM5多模光纤。1.6T时代单模成为主流后,数据中心内部的单模光纤使用比例会明显提升,对应的高密度MPO/MTP连接器、预制光缆、布线系统的需求量也会跟着涨。

这里有一个容易被忽视的细节:光纤端面的污染问题。单模光纤的模场直径只有几微米,一点灰尘就可能导致巨大的信号衰减。在实际运维中,我见过太多的链路故障最终都是因为端面脏了,而这个问题用再高级的光模块也无法绕过。所以光模块升级的同时,对应的测试仪器(比如光纤显微镜、光功率计、OTDR)和运维规范也必须同步升级。

6.3 投资视角:光模块公司的护城河在哪里

从投资和商业分析的视角看,光模块公司的护城河可以拆成三层:

第一层是技术护城河:光芯片设计能力、高速封装工艺、DSP适配积累。这一层决定了你能做多快的产品、良率有多高。第二层是客户认证护城河:云厂商和数据中心客户的认证周期通常要一年以上,验证过的供应商不会轻易更换,这给先行者提供了一道很厚的壁垒。第三层是成本与交付护城河:在技术趋同之后,成本控制和大规模交付能力就成了决胜因素。这需要供应链管理、产能布局和全球服务网络的全链条配合。

AOI目前的优势集中体现在第一层和部分第二层上,它拥有自研芯片能力和客户设计导入,但在第三层的规模和成本上仍需要补课。400G时代,纯组装厂靠规模赢了一局;1.6T时代,技术上又给了垂直整合厂商一次重新卡位的机会。至于谁能笑到最后,还得看未来两年各家在良率、成本和客户交付上的实际表现。

7. 实操心得:评估一款光模块是否值得信赖的四个维度

最后分享一点我在实际接触光模块产品和项目时积累的经验。不管你是采购光模块、做产品选型,还是单纯对技术感兴趣,评估一款光模块是否值得信赖,可以从四个维度切入。

第一个维度是光芯片来源。问清楚这款模块用的激光器和探测器是自研还是外购,如果外购,供应商是谁。光芯片是整个模块最核心的部件,直接决定了性能上限和成本结构。第二个维度是测试覆盖率。光模块出厂前的测试项目是否覆盖了全温范围、老化测试、误码率测试和眼图余量测试?大厂通常会做全检,而一些小厂可能只会做抽检或只测常温。第三个维度是DSP方案。用的是哪家的DSP?功耗和性能参数如何?这决定了模块在不同链路条件下的适应能力。第四个维度是现场部署表现。有条件的话,一定要在真实的数据中心环境里跑一跑,看它在高温、高负载、复杂链路下的稳定性。

我记得有一次选型测试,某款光模块在实验室里各项指标都非常漂亮,但拿到机房实际部署后,只要机柜温度一上来,丢包就开始出现。后来排查发现是模块的散热设计和壳体的接触热阻出了问题。这个教训让我意识到:实验室数据再好看,也不能替代真实环境里的验证。光模块是一个非常依赖工程经验的行业,纸上谈兵很容易踩坑。

如果你现在正在关注AI集群或者数据中心的网络建设,建议把光模块放到和计算、存储同等重要的位置来看待。算力集群的规模再大,网络如果成为瓶颈,整体效率也上不去。而从400G到1.6T这一轮升级,恰恰是网络基础设施重新洗牌的窗口期,能抓住这个机会的公司和个人,在这个周期里都能获得不小的红利。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/27 20:32:10

PA2(上)课程实验通关指南:从环境搭建到调试避坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/27 20:32:10

告别VeriStand、dSPACE、LabVIEW:自主工具链迁移实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/27 20:29:54

PCIe物理层Preshoot与Boost原理及调试实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华