开场0:00
Hello 大家好 , 欢迎收听本期 《 十分吸引 》, 我是敏姐 。 这期我们比上期 《 康德的基础 》 上聊一个更干的 , 就干到我都想跑路的那种 。
光子没有质量 。
看 , 第一句话我就不懂 ,是啥意思 。
光作为一种粒子 , 没有重量 ,E=mc2,是吧 ? 光子是不是没有质量的 ? 这后面就引出光通信为什么优于电子通信 。
就来源于光 , 它不用那么发热 。 我就粗浅理解这个物理系 。
大家已经听出来了 , 这期门槛非常非常高 。 这期我们想聊一个火了快一年的产业链 , 就是光通信产业链 。
之前我们在第 72 期也讨论过 , 今年 2006 年是一个极端的 K 型分化年,K 的下端是我们熟悉的商贸零售食品饮料 , 就是消费为主 ,而 K 的上端则是通信 , 电子是领涨的 。
所以今年的一个主要行情 , 大家也知道就是 " 站在光里 "。 所以今天我们就来系统性地了解一下光通信产业链 。
也有可能有听友会说 , 你们现在聊 , 都涨上去了再聊 ,是不是有点晚了 ? 我也不知道 ,但我们选择这个时间点聊 ,是因为我们这期特别专业的嘉宾 Kevin,他刚刚从加拿大回国 。
我们是在深圳的线下活动碰头的时候才有机会聊 , 正好我们又碰到了另外一位嘉宾 , 就是上次聊石油那期的孙悦 。
所以这次我们四个人在酒店房间里 , 一起聊一聊光通信产业链 。 欢迎两位嘉宾 。
欢迎欢迎 。
大家好 , 我是第 38 期的嘉宾 Kevin, 当时跟大家聊了一下反脆弱 , 这次聊回我的老本行 , 跟大家分享一下光通信产业链有关的知识和信息 。
大家好 , 我是第 60 期我们讨论石油那期的嘉宾孙悦 。 今天其实是一个特别巧合 , 我只是过来跟大家打个招呼 , 然后被敏姐拉过来一起聊 。
对光我是完全不懂 , 就是一个纯小白 , 所以今天也是特别希望能够听 Kevin 和石总去分享 。 当然我也可以带大家以一个纯小白的视角去问一些特别小白的一些问题 。
今天我们两个纯小白 。
三个三个 。 话说回来 , 去年有一个非常小遗憾的一个事 , 就是去年我记得三季度 , 那时候咱们前面已经录完节目了 , 对吧 ?
我们有一个小群 , 对吧 ? 我是在网上看了一篇网文 , 它标题很惊悚 , 就说未来光通信会取代电子通信 。
这篇我就想 , 哇 , 这个好底层 , 好本质 , 很吸引我这种思维方式的人。 然后仔细一看 , 我是觉得生怕被忽悠 ,因为网文嘛 , 尤其这种浪潮型的那种网文 , 很有煽动性 。
所以我说 ,有专家呀 。 这时候我就抓到我咱们仨这个小群里 , 我问 Kevin 说 , 未来是得去世吗 ? 是光通信要取代电子通信吗 ?Kevin 给的回答是非常肯定的 ,但是可能有一些边界条件 。
光代电2:44
当时我记得我说的是 , 光正在有越来越多的场景去替代相对短距的电子通信 , 电在同样距离下被光取代只是一个时间问题 。
现在我们就看到了各种各样的光的不同的这种封装形式 ,在飞速的发展 , 就是把光这一侧的链路离我们的最后的这个服务器里交换机的芯片越来越近 , 越来越近 , 把电的这一段的通信距离缩得越来越短 , 越来越短 。
是的 , 所以今天我们也不怎么聊那种最硬核的技术 , 我们就聊一些行业为什么会出现光通信的这种替代的底层的逻辑 。
第二也是恢复我这过去一年吧 , 感觉上已经沾上全球最主要最好的这个光通信团队专家的边 ,但是却没有很紧密的沟通光通信的最前沿的这个行业发展 。
所以今天机会难得 , 大家天南海北的聚在深圳 。
对 , 特别难得 ,也很开心 。 那我想问一下 Kevin, 就未来光通信的这个产业 ,在现在来看是个历史性的转折点 。
这个是显而易见的 , 特别是从去年开始 ,2025 年,AI 增长的需求的一个极度爆发 , 它某种程度上改写了整个光通信和整个芯片行业发展的之前的这个摩尔定律 。
之前的增长速率是一个相对比较缓慢的 , 两到三年为周期的这么一个更新迭代过程 。AI 带来的光通信的需求爆发 , 导致了它的速度现在几乎可能加快了将近一倍的水平 。
这个里面对技术的迭代要求 , 还有对整个产业链的上中下游的一些具体的细节 , 我们也会在这期的节目里做一个具体的讨论 。
那我理解 , 这个就像电一样 ,是当下世界的一个基础设施 , 未来光可能就会取代电 , 成为未来世界的一个基础设施 。
是的 。
所以我们今天来聊也不算晚 。 如果是这么一个基础设施的取代 ,其实它不可能是只有一年的昙花一现的机会 。
来得及 。
大家别着急 , 那我们今天我们把它整个展示出来 。 我这里再介绍一下 Kevin 的 ,他的主业就是芯片系统工程师 , 之前是在大厂 , 博士学的也是那个叫啥来着 ?
博士学的就是微电子 , 模拟电路设计 , 还有系统相关的这些东西 。
所以是特别专业的领域的专家 。 我们今天也很荣幸 。在节目开始之前 , 温馨提示几个方面 。 第一 , 就是我们今天提到的所有公司都不做投资推荐 , 我们会提到一些公司的名字 ,但绝不做投资推荐 ,因为投资有风险 , 入市需谨慎 。
第二个提示就是我们这期是有福利的 , 这期我们打算送出 10 个 Alice 系统的一个月的免费账号 , 奖励一下爱学习的朋友们 。
还是老规矩 , 一周之内评论点赞前 10 的听友能够获得 。 第三个提示 , 打个小广告 ,但是是免费的 。
我们最近开发了一款 《 十分吸引 》 的 skill, 叫 《 十分吸引 - 石磊的思维操作系统 》, 这个是我们建立在前面 72 期节目 、245 万字逐字稿基础上的 。
我们对石磊的最强大脑做了一个系统性的蒸馏 , 目前已经上架了腾讯的 SkillHub,而且我们在 GitHub 上也做了开源 。
大家可以用这个 skill 跟石磊提出你想问的一些专业的问题 , 你就会得到实时回答 。 我看下载量已经快到 1000 了 , 大家都反馈说 , 如同石总在耳边低语 , 只要加上声音就是石总在讲节目了 。
澄清一下, 就是这个 skill 基本上提取的是我们的框架视角 , 还有一些说话的特征 ,但是这个观点不代表我的观点 。
对 ,因为很多观点是对未来和数据的预判嘛 。 理解肯定不在我们 72 期节目里 , 所以给的只是思维框架 。
我们的题目就看得出 , 石磊的思维操作系统 , 它不是石磊的投资建议系统 , 所以它绝对不是投资建议 。
而且我们这个评分很高 , 我们在 SkillHub 上评分是 4.8 分 ,96 分将近 。 我觉得还是一个很满意的 skill。
这我问一下, 这个 skill 是不是也能回答一些非投资相关的问题 ? 因为如果是我们过往这么多期的节目里 ,有很多关于人生的一些讨论嘛 。
我理解如果是问一些跟投资没有那么紧密相关的一些问题 ,在我们过往的逐字稿里面也有非常多的内容 ,也可以得到我们节目里面常说的一些思维 , 去帮助大家去讨论这些生活中的问题 。
是有的 , 就比如说我现在很迷茫 , 处于低谷 , 我该怎么度过 , 石总就会用他 20、30、40 的经历 ,以及复杂系统的理论 , 来跟大家做一些观念上的沟通 。
这个是会有 。
向前看 , 别回头 , 积极拥抱这个世界 。
对的对的对的 , 应该会有这些 。 大家感兴趣的话也可以问 ,但是跟这些节目无关的一些内容 , 可能他就会拒绝回答 。
大家可以去试一试 , 还是蛮有意思的 。 好 , 那我们三个温馨提示讲完之后, 话不多说 , 进入今天主要的模块 。
第一部分 , 我是想从资本视角来对今年的光板块做一个复盘 ,也是查了一些资料 ,因为我确实也不是很懂 。
我在查资料的过程中, 就看这个模块 , 像我们今天讲的光通信产业链 , 它也是分为上中下游的 。
我也是鹦鹉学舌 , 资料上说它是一个高度协同的生态系统 , 上游的光芯片和光器件是基础 , 中游的光模块和系统集成是核心 , 下游的光纤 、 光缆和通信设备是应用 。在今年的资本市场的表现来看 , 我举个例子吧 , 中证有一个光通信主题指数 , 它的涨幅就达到了 70% 左右 , 同期的沪深 300 只有 1.4%, 还有一些股票涨幅也有 200% 多的 、100% 多的 。
所以整体像一中天 , 涨幅也是在 50% 到 70%, 所以涨幅都是相当的惊人的 ,是 K 型的上沿嘛 。在上中下游里面 , 我们主要讲的是中游光模块产业 , 这个产业是把光芯片 、 电芯片 、 光器件等等集成在一起的标准化组件 , 负责电信号和光信号的相互转换 ,是光通信系统里面最核心的商业化的产品 。
代表公司就我们熟悉的一中天和华中科技 。 第一部分从产业视角 , 想问问 Kevin, 为什么光模块这么火 ?
我跟大家先简单分享一个故事 。 首先光模块这个话题 , 大家有时候在做股票投资 , 或者是在去想这个问题的时候 , 会觉得光模块实际上是一个离我们非常遥远的东西 ,但实际上我们几乎现在每家每户里都有一个光模块 。
光模块就是我们互联网光纤入户 , 千兆带宽入户里面的叫做光猫 。 光猫里它实际上是光纤接进去的第一个模块 , 它就是一个光模块 ,但它实际上是一个相对低速的光模块 , 跟我们现在比如一中天他们做的光模块比来说的话 , 速度可能还有几十倍的通讯速度的差距 ,但是它的里面的基本构造基本是一样的 。
现在我从裤裆里掏出了一个比较老的光模块 , 黑色的这个防尘口可以把它打开 , 这个里面可以插进去光纤接口 。
接进去之后, 它这个里面就会经过光信号到电信号的转换 。 那么从一端进去的是光 , 它另一端它有这个金手指 , 这就是插在了服务器的交换面板上, 它出去就是电信号 。
光模块9:57
光模块的本质 , 它就是在做一个光电转化的通讯 。 每个服务器它是一个大的机柜 , 就每一层它有很多不同的架子 , 它上面有比如说一个架子抽出来 , 它都是 GPU, 另一个架子抽出来是存储 , 它是有分布式的功能 。
这些架之间的通讯 ,有的时候是需要依靠模块来实现的 。 从光转到电的这个过程 , 这里面是收发一体 , 就是信号的发送和接收是一体的 。
本质上它有两个方向 , 一个是接收的方向 , 接收的方向相当于是光纤的信号进到这个光模块里面 , 然后再转发给我们的交换芯片 。
这个里面就涉及到了这么几个关键的光组件 。 第一是我们在接收的方向有一个叫 PD, 就是 photodetector, 它是一个光子的探测器 。
它的作用很简单 , 就是把接收到的光子转化成电子 ,以电流的形式输出给下一级 。PD 的下一级就是我们经常提到的一个东西 , 叫做跨阻放大器 , 叫做 TIA Transimpedance Amplifier,因为我们收到的光它是非常微弱的 , 我们必须要先把它放大 , 才能后面的电路去识别和处理 。
另一个方向是我们的发送方向 ,也就是说我们的交换芯片要发数据给外面 , 就必须得通过光模块经过一个电光转换的过程 。在这个方向上, 它首先是要有一个驱动光的激光器的驱动器 , 一般叫做 driver, 主要是对信号质量在光模块这一侧进行一定的恢复 。
之后它会直接用电信号去驱动这个激光器 , 把电转化成光 , 然后再进到光纤里 。 之后接收端的故事就一样了 , 相当于在接收端就把它反过来 。
光纤的信号通讯过程中, 我们的收和发是共用的 ,是同一根光纤 。 这里面利用了一个原理 , 就是光纤里传送的这个波的波长是不一样的 , 它本质上是有一个正交性的 。
这样的话 , 我们就可以保证发端和收端之间尽量不互相干扰 , 同时可以增大我们的通讯的带宽和流量 。
我接着你这个话题 , 就是 90 年代的时候 , 我记得我们拨号上网那时代 。
ADSL、ISDN 是吧 ?
对 ,ADSL 那还是升级版 。
那都是电 ?
对 , 都是电话线传的 。
对对对 , 从电话线 。
可能 10 年之后基本都光纤入户了 , 基础设施的改造就是通信上面的光通信 , 就相当于上网 、 电话这些 , 传输一些声讯信号的这个基础设施 , 它是先改的海底电缆 , 还是先改的是用户端 ?
这个其实一会我们节目里也会提到 , 海底的光缆在七八十年代的时候就已经有了 , 它可以承接几千用户的同时通话的需求 , 哪怕是这种长距的海底光缆 , 它最先也都是以电的形式来实现的 ,因为从技术的门槛和成本上来讲 , 一定是电线 。
这个是我们最常用的例子 ,因为海底光缆可能有几万公里 , 海底光缆最后到了一个关键的节点上, 比如我上海可能会有一个电信的骨干网接口 , 之前是我们只是把光接到了整个国家的骨干网的关键的节点处 , 每一个关键的电信的基站 , 包括到每一户人的家里 , 还都是电 。
当时是我们说的叫做 ADSL、SDN。 当速率提升上来 , 用户对带宽的需求的要求上来之后, 最后都不得不去转成光的这种形式 ,因为光它的损耗跟距离之间的关系是非常小的 。
如果我想去做一个高带宽的传输 , 最后大家实际上都是不得不去做光的选择 。 甚至还有一个现在更极端的例子 , 就是我们在讨论有一个概念叫做光芯片 ,因为芯片里面大部分就是晶体管嘛 , 都是电 。
现在有这种小芯片共封装 , 它有多个芯片是做在一个封装里面 , 它这些芯片之间的通讯也必须要是以电的形式来完成的 , 主要是也是成本低 。
但是由于我们现在的计算和通讯 , 对带宽的需求实在太大了 , 同一个封装里的不同芯片 , 它们之间的通讯实际上也可能会以光的形式来进行 。
最开始产业变化 , 它是以成本的逻辑 , 所以我们 ADSL 都是在骨干网之后, 就是分发到终端用户这一段 , 还是电 。
然后现在就已经全是全光在通信领域 , 再到现在可能注意中心和 AI 来了之后, 那要求就更高了 。 光纤出了家门 , 它在先在小区里 , 实际上是汇聚到了一个叫做无源分光器的这么一个设备上, 它是不需要供电的 , 它的作用本质上就是把几十户的光纤合并成一根 , 我们把它这一路汇聚成一根的光纤 , 通到运营商机房里的设备 。
从机房到家里面 , 中间的全过程就已经全部是光通信的链路了 。在规模上, 中国的光纤入户用户已经超过了 6 亿 , 占固定带宽现在的 95% 以上 , 已经是光纤入户接入 , 中国也是全球最大的光接入市场 。
我们也可以看到 , 技术实际上是在一代一代升级的 , 最早的叫做 Gigaport, 就是 GPORT, 它的总带宽是 2.5G, 这个 2.5G 总带宽是几十户共享 , 可能就是一个单元或者一个楼共享一个 2.5G 的带宽 。
后来它升级到了千兆入户 , 这个概念叫做 10GPORT, 电信或者移动现在应该已经是在着手准备 50GPORT 的实测和部署 , 这样也就意味着我们万兆入户正在发生 。G 是 10 的 9 次方 ,50G 是 5 的 10 次方 , 兆是 1 的 6 次方 。
为什么是万兆呢 ? 是因为跟之前的概念一样 , 它这里面是无源分光器 , 汇聚的这一股光纤它是 50G, 所以它是多户共用 , 所以每一户大概比如说几百户共用这么一根线 , 所以最后每一户大概就是万兆的水平 。
那很快啊 。
很快很快 。
哇 , 那上网更舒服了 。
是的 ,以后都不是什么 4K、8K 了 , 应该是 16K 的那个高清视频 。
原来人眼是平静 , 人眼看不出来差别了 。
这个我记得有些老旧小区 , 都说接着光纤 , 掌握移动 , 掌握联通 。 移动好像说这小区它就没有它的光纤 ,也没法未来再去做一些调整和重新的部署 , 所以小区里边可能只能接速度比较慢的 , 且可能只有一些单元 , 可能离的光纤比较近的那些户 , 它比较方便能接 ,有一些户也不太能接 。
这些没法改变的基础设施 ,是不是未来就没法享受到后面的更快的这些 。
这个问题对于电信运营商来说 , 本质上它是一个成本问题 , 就是它想不想去挖的问题 。 有的时候因为老旧小区 , 它的这种改造相对来讲比较复杂 ,因为它由于没有预埋的配电井里面 , 没有预埋的通信线了 , 所以它可能还要在外面的公路上先去把光缆线先挖一个坑 , 然后埋好再接入楼 。
接入楼之后还有这种老旧小区接入户的问题 ,由于老旧的小区里面 , 它的整体的这个结构确实成本比较高 , 这个完全是运营商的一个选择 。
但有可能又是一次消费升级的补贴 ,也可以做到的 。
有人买单就行 。
以旧换新嘛 。
电梯老旧小区加装电梯的那种感觉 。
有的小区很顺利 ,有的小区就一直推不动 。
是的是 。
所以大家可以把整个光通信网络想象成一套人体的血管系统 。 光猫这个小盒子 , 实际上就是深到最末梢的那根毛细血管 , 就是我们终端用户 。其次想跟大家简单聊一聊数据中心和服务器互联 , 这个实际上是一个光模块的主战场 。
作为我们用户端的所有的流量 , 最后都是要汇聚在服务器里面的 。 刚才提到的毛细血管 , 作为光猫在我们家里 , 那么主动脉是在哪里呢 ?
是在数据中心 。 首先我们先看一下这个传统的云数据中心 。 云数据中心有很多服务器 , 它一台服务器有一台大的机柜 , 这个机柜的顶上它一般会放一台交换机 , 这个机柜有好多层 , 它是有不同的功能 ,但是这些功能层一般通过背面的铜缆线直接连到这个顶上的交换机上 。
交换机里面内部的连接一般距离是在 3 米以内 ,因为这个机柜一般也就高大概是 2 米多一点 。 这 3 米以内用的主要还是铜缆 , 叫 Direct Attached Cable, 它是直连的一个铜缆线 。
交换机上再往上, 就是这个交换机要接到别的服务器上去 , 大概率它走的距离会更远 , 它就有这种叫 Leaf 或者 Spine 的概念 , 形成了很系统性的交换网络 。
不同服务器之间 , 交换机交换机之间的通讯 ,在 AI 的应用里面已经全部是光了 。 服务器架子上最顶端的交换机上, 插满了 100G 或者 400G、800G、1.6T 的光模块 。在服务中心的内部 , 服务器和服务器之间的横向交换的流量 , 一般是占总流量的八成以上 。
那么剩下的二成是它服务器同一个机柜内 , 它自己内部的不同的层级之间的通信 。 刚才其实也有提到的是 AI 把这件事情推到了一个极致 。
大语言模型的推理必须要连成一个网络 , 这种连接我们在行话里就叫 Scale Out, 它的带宽的要求是很高的 , 组网层级又很多 。
算下来的 , 就一个人工神经网络训练 ,GPU 和 GPU 之间的通信需求 , 它至少要带动两到三只 , 甚至更多的 800G 或者 1.6T 光模块的通讯需求 。
AI铲子18:16
这是历史上的第一次光模块的需求量和 GPU 的出货量直接是挂钩的 。 淘金的人多了 , 光模块本质上就是一个卖铲子的生意 , 就跟挖比特币 、 卖矿机一样 。
卖光模块其实在产业生态里面也是卖铲子的 , 它的生意就会非常非常好 。 光模块就是这一轮 AI 淘金热里的铲子 。
因为 GPU 的计算方式是这种并行计算 。
对的 , 就是跟原来的 CPU 串行是不一样的 。 所以 GPU 的并行计算相当于有很多张大嘴一起吃东西 , 一起要吃进去信息 。
所以它对于信息的通量效率要求特别高 , 所以这也对我们的内存 、HBM, 还有就是光通信要求是极高 , 所以也诞生了远远超越 CPU 计算通信需求的这么一个市场 。
我来考考石磊 , 刚才提到的对效率的需求 , 这个效率体现在哪里 ?
效率体现在哪里 ? 这真不懂啊 。
延时 。
因为现在的一个很困难的问题 , 就是它刚才说到可能有上万张 GPU 卡 , 它之间要做一个互联通讯 。 这个里面很现实的一个问题就是 , 之前为什么说 GPU 带动不了这么多光模块 ,是因为所有的 GPU 都坐在一个服务器的机柜里 , 它们之间的物理距离还是比较近的 。
现在我们有上万张的这些机群 , 那么这里面就是一个很大规模的服务器机群 。 这个里面有可能一个极端情况就是房间的一个角落 , 它有一台服务器 , 要和坐在正斜对角的另一台服务器去通信 。
这里面它跨的距离可能是有几十米或者是几百米的这么一个间距 。在这么长的间距里面 , 通过光模块在光纤上去通讯 , 它同时还要达到一个要求 , 就是通讯的这种延时尽量短 。
服务器同时要和我离得近的服务器通讯 ,也要和可能会离得很远的服务器通讯 , 它们之间的延时都要做到很小很小的水平 , 才能够让它们一起在同时协同合作去完成一个复杂的大语言模型训练任务 。
这个是不是就华为说的滔定律 ?
滔定律本质上是通过系统设计的方式 , 包括封装这种系统性的形式 , 能够让我们克服一些计算密度的这种物理瓶颈 。
它这个延时的概念跟滔定律是很像的 ,因为滔这个里面实际上指的是时间常数 ,但是延时就是滔定律它改善的一个目标 。
刚才我们也是拿了一个实际的多模光模块里给大家举了一个例子 , 到时候我们会把这个图放到我们的这个 show notes 里面 。
再简单讲一讲现在这个主流的 , 包括 800G、1.6T 的光模块 , 它又是一个什么样子 。 如果我们把一个 800G 的光块拆开 , 我们是看到一个对称的信号链 , 它分别分为发射和接收两个方向 。
但是 800G 的光模块 , 它是指的是 8 路 100G, 它是 8 乘 100。 这就意味着我们接入光模块的插口里面 , 它实际上是有 8 根光纤 , 每根光纤它有一个 100G 的通信速率 。在我们的光模块里面 ,其实也要对应了 8 个通路来去处理光电转化 , 或者是反向的电光转化的这么一个过程 。8 路每路它实际上是 100G,有的时候也叫 112G, 它这个里面是用的是叫做 TAM4, 这个就是
叫做脉冲浮频调制 , 用了 4 级的电压信号来分别表达两个比特的数字 , 就是 0001、1011。 电信号实际上是从模块尾部的金手指过来 , 这些信号是在主板的 PCB 上已经跑了几十厘米 。
主板上的 PCB 本质上就是在连接交换芯片和光模块之间的通讯 。 如果把它当做一条路的话 , 这条路实际上是非常颠簸的 , 它实际上是非常难走的 。
从交换芯片到光模块这一侧 , 我们的这个电信号进来 , 光模块里的第一站 , 它是叫做 ODSP, 它是一个数字信号处理芯片 , 它的本质作用就是做均衡和重定时 。
这个本质就是一个信号在恢复的过程 , 把信号从一个原来很模糊的形式把它弄得更干净 。 经过 ODSP 之后, 刚才也提到过 , 就是要经过一个驱动器 , 把一个干净但微弱的信号放大成能够驱动激光器的幅度 。
那么第三站 , 我们就是有发送端的激光器或者叫调制器 , 这里面大家可能有时候听过一些名词 , 叫做 EML 或者 Vixel, 做了一个把电转化成光的这么一个动作 。
最后光信号经过发射光组件 , 行话叫做 TOSA, 这里面耦合进光纤 , 把信号发送进光纤里 , 然后再最后到达收端 。
接收方向它是一个原路返回的过程 , 是一个从光信号转化成电信号的过程 。 刚才提到的是光电探测器 ,photodetector, 把光变成电流 , 还有刚才提到的快速放大器 。
最后返回的时候 , 我们还要经过这个 DSP, 这个 DSP 里面有些技术 , 一个叫做 ADC,Analog Digital Converter, 它是做魔术转换 , 这里面对信号进行了重采样均衡判决 。
最后从金手指发送出去 , 再经过刚才我们提到的颠簸的这段路 , 经过 PCB 到达交换芯片 , 把数据最后送达到交换芯片里面 。
光模块里面一般还会有一个叫做 MCU,Microcontroller Unit, 它是一个微型的控制器 , 它实际上本质上是一颗很小的管理芯片 。在光模块里的角色 , 实际上充当的是一个体检医生的角色 , 它要实时上报我们光模块的温度 、 光功率 , 还有激光器的偏置电流等等等等 , 一系列的这些关键的电路指标 。
如果我们用的是 EML 的激光器 , 作为发送端的激光器形式 ,由于激光器对温度的环境会比较敏感 , 那么我们通常还要配一颗半导体的制冷器 , 尽量控制激光器运行在同一个温度 , 从而把它激光器发射的波长稳定住 。
最后的最后, 简单跟大家介绍一下光模块的封装 。 现在我们主流 800G 的这个封装形式有两种 , 一种是叫做 QSFP DD, 还有一个叫做 OSFP。
本质上你可以把它理解成它是两种不同的柜子 。OSFP 它稍微大一点 , 它的散热性能肯定会更好 ,1.6T 的光模块基本都是 OSFP 的封装 。
反之这个 QSFP 就稍微小一点 , 它的散热也会稍微差一点 ,但是相对来讲它可能成本会更低一点 。 光模块还有各种各样的方案 , 就包括 SR, 叫做 Short Range, 它是短距 , 多模短距 , 一般用的是 Vixel 的激光器这种方案 。
还有一种就是 DR, 它是定型单模 , 一般它的通讯的距离会比我们之前提到的短距会多一些 , 大概有 500 米左右 。
还有 FR, 它光模块光纤之间光纤的通讯 , 它的有效距离可以达到 2 公里 , 还有一个 LR 是 Long Range, 它可以达到大概 10 公里的级别 。
这三种不同的形式 , 这里面的光都用到的是 1310 纳米的欧波段 , 还有就是这种更长距的 , 叫做相干光 ,ZR, 通讯的距离实际上是要在 80 公里以上 。
这里由于它通讯距离的要求更高 ,也就意味着我们的光的波长可能需要更长 , 这里面它主要是用到的 1550 纳米的 C 波段 。
举一个例子 , 比如说光模块里 800G,DR8, 它是 8 路每路 100G, 走 8 对并行单模光纤 , 大概它的最大的传输距离是 500 米 。
这里面的主要应用场景 , 就是数据中心里面的同楼层互联 。
傅子昂 , 我就问一个我觉得最重要的问题 , 就是从 400G 到 800G 到 1.6T, 刚才说这是路数不同 ,4 路 、8 路 、16 路 , 这种是种简单的堆砌 , 合在一起还是说它中间带来了技术上一个新的跃迁需要 ?
好问题 , 我们就拿 800G, 这是实际上已经是上一代的光模块了 , 和 1.6T 来比 ,800G 指的是什么 ? 是 8 路 100G,1.6T 它不是 16 路 100G, 它是 8 路的 200G。
每一路变大了 。
为什么要这个样子 ? 是因为光纤接入到交换机面板的时候 , 它的密度的数量是有限的 , 一股光纤我只能把 8 束汇在一起 , 很粗的一大股光纤聚在一起 , 然后再分别接到交换面板上, 布线的密度是有物理尺寸的限制的 , 包括交换机的面板 , 它的这个插槽口也是有物理尺寸限制的 。
这种物理尺寸的限制就导致了我们不得不用相同的光纤的数量去承载更高的通讯的带宽 。 那么从 800T 到 1.6T 的光模块 , 我们是 8 乘 100G 到了 8 乘 200G, 它这个 200G 就自然要求了我们所有刚才提到的这些发端和收端的这些光模块 , 它的速率和带宽都要翻倍 。
这里面必须有材料和设计的演进 , 还有包括里面刚才我们提到最重要的这个 ODSP, 那个里面既有电信号的处理部分 ,也有光信号的驱动部分 , 它的设计也涉及到大量的这些模拟设计的问题 。
当我们的信号带宽翻倍的时候 , 它的设计的难度也是指数级上升的 。
就是单路的信号带宽上升 , 然后带来技术上必须要提升 。
对 。
听到这里 , 我感觉我们这期节目有点像行业研究报告的语音版 , 所以大家肯定也听到刚才这么多数据和名词 , 可能有点晕 。
这一期也不用太紧张 , 这期公众号我会把逐字稿给放上去 , 大家听的时候可以听两遍 , 第一遍先听一遍 , 再对着逐字稿再听一遍 , 可能效果会更好一些 。
我把 Kevin 的这些研究的心得都放到我们的公众号上 。
那么简单做一个总结 , 电信号是走得很远是很困难的 , 光是可以很容易走得比较远的 。 所以在数据交换的场景里面 , 如果我们想让数据跑得很远的话 , 就必须得把电先转换成光 , 最后在接收端还要把光再转换成电 。
但是光模块就是这个翻译官 , 它站在电和光的每一个交接处 。
那现在为什么这么火呢 ?
带宽算力27:18
大家可能听过摩尔定律这个概念 , 这里面可能要跟大家讲讲通信芯片的摩尔定律 。 实际上 CPU 的摩尔定律大家肯定听说过 , 对吧 ?
当时在这个 Intel, 摩尔它提出的 CPU 里的晶体管密度每两到三年要翻一倍 。 通信界实际上也有自己的摩尔定律 , 通讯的速度 , 刚才提到的 800T 到 1.6T 光模块这个例子 , 它的这个迭代演进的速度一般是要按照两到三年作为时间周期来进行迭代的 。
这个里面就主要体现在了通讯速率的飞速增长上 。 这里面我还要提到一个叫做 SerDes 的概念 , 后面也会给大家详细解释到什么叫 SerDes。
光通信里面从交换机这一侧 , 它就是有一个 SerDes, 就是在驱动这条单条的 , 比如说 100G 或者 200G LAN 的信号的发送和接收 。SerDes 是芯片上收发高速串行信号的接口 , 它常见的应用场景包括数据中心的服务器互联 , 还有包括我们很常见的现在的 USB 线里面 , 还有包括 PCIe, 比如说主板上, 它的显卡和 CPU 之间的通讯 , 或者是 CPU 和外设之间的通信 , 或者是 CPU 和固
态硬盘之间的通讯 , 全部都走的是 TCIe 的这么一个通道 。 还有包括我们的游戏机或者 PlayStation、Xbox 里接在电视上的时候用的是 HDMI, 一般都是有一个 SerDes, 它的本质就是一个高速的通讯接口 。
它的单通道通讯速率可以大约每三到四年翻一番 , 我们从最先刚开始差不多应该是 10 个 Gbps, 后面到 25G, 然后再翻倍 ,56G, 然后现在 112G, 两三年前是 112G, 从去年 2025 年开始 ,24G 实际上已经在大规模商用了 。
同时服务器里面的交换芯片 , 这里面也用到了 SerDes, 交换芯片它由于是多路不同的数据要互相交换 , 少的情况下有几十路 , 多的情况下有 500 到 600 路 , 同时这些数据要做交换 , 交换芯片的容量随着 SerDes 的速率上涨 ,也是基本上每两到三年要翻一倍 。Broadcom 作为交换机领域的龙头 , 它最有名的交换芯片就叫 Tomahawk 战斧 。
战斧牛排 。
对 , 就是战斧牛排也是这个名字 。Tomahawk 战斧系列最先是从 3.2T 的一个交换芯片 , 上升速率到 6.4T、12.8T、25.6T、51.2T, 现在一路可以翻到 102.4T, 光模块速率也跟着水涨船高 。在 2016 年的时候 , 我们主流的服务器间部署的是 100G 的光模块 , 然后 2019 年是 400G,2023 年我们到了 800G, 就是 8 乘 100 刚才提到的 , 然后 2025 年是 1.6T, 这个 1.6T 已经部署了有一年多的时间了 。
刚才也提到真正的节奏变换实际上是由于 AI 的出现 , 大模型的训练算力需求大约每半年到一年是要翻一番的 , 它实际上远超了我们通讯行业的摩尔定律两到三年的周期定律 。
集群规模从 1000 张卡现在可以走到最多 10 万张卡 , 这个时候网络带宽本身就成了算力的一部分 。 这里面说到底就是四个字 , 带宽就是算力 。
一边我们是处理器的摩尔定律在放缓 , 一边是带宽的需求由于 AI 推理的需求在快速的加速 。
这个就意味着为了我们部署更多的算力 , 我们很难通过扩张单个芯片内部的算力来实现 。 现在英伟达的这个显卡 , 包括 50 系 、5090, 它的封装里面的这个尺寸已经是非常非常大了 。
如果我单纯的是靠堆叠晶体管的数量去增加它的算力的话 ,是很困难的 。 因为它本身的尺寸大 , 它本来就带来了很多封装 、 散热 , 还有供电这方面的挑战 。
我们通过在单个芯片里去堆叠算力 ,其实从 CPU 时代就已经走到虚拟合同了 。2000 年代的时候 , 孙悦你记不记得 , 当时英特尔的处理器品牌叫什么 ?
现在是什么 ? 现在是 I5、I7, 对吧 ? 那个时候是啥机子 ?
最开始是奔腾 。
对了 , 奔腾 , 对吧 ? 奔腾时代 GPU 的主频你还记不记得是多少 ? 大概是 2 到 3G 的水平 ,GHz 的水平 , 就它主频速率基本就代表了它的计算速度 。
现在我们电脑里的看 Intel V4、I5, 它的这个主频数是大概多少水平 ? 最多最多也就是大概 4GHz 左右的水平 , 将近 20 年 。
按理讲 , 如果按照刚才我们讲的摩尔定律里面 , 两三年翻倍的话 , 我们现在的 CPU 的主频可能需要到达一个几十 GHz 的逆向增长的状态 。
对 。
但是实际上并没有 , 摩尔定律在 CPU 上 20 年前已经失效了 , 就是像现在 GPU 一样 , 它在搞什么 ? 叫多核并行 , 原来奔腾都是单核的 , 现在后来慢慢搞成了多核并行 ,但它这种多核并行是在同一个封装里 , 同一个 CPU 里 。
但是 GPU 由于它本身就已经很大了 , 所以我们必须要把它扩展到通过外部连接的形式 , 把成千上万张 GPU 卡连接在一起 。
我们很难通过扩张单个芯片内部的算力来实现算力的扩张 ,而必须要把多个芯片通过一个互联网络连接在一起 , 这就把芯片互联从系统的配角变成了 AI 集群内部的瓶颈 ,也变成了一个价值高地 。
这个我听下来不就是一个网吗 ? 复杂适应性系统呢 ? 是个系统的网络 。
但它可能没有复杂适应性 , 它对于我的应用场景和我的通讯的这种定义需求是非常清晰的 , 复杂度并不体现在网络本身 ,而是体现在了每一个模块的设计 , 还互相之间的配合上 。
主要是要效率 。
对 , 结构上不会特别复杂 ,但是要效率要极致的高 。
对 。
这里面最大的一个问题是什么 ? 你家里的显卡是啥 ?
以前祖国 GeForce 以前 。
那个时候记不记得一张显卡的功耗是多少 ?
我从来不看这数 。
那个时候可能就只有 100W 左右 , 现在 5090 它的功耗要差不多在 500 到 600W。 这是什么概念 ? 就是它的晶片大概是这么大 ,500 到 600W。
民姐酒店里的电运斗功耗是多少 ?
几千瓦 。
2000W。 你把这么大的功耗的这么一个东西集成在我们的 , 比如家用计算机或者服务器里面 , 它对供电的挑战是非常巨大的 。
它就当运斗吗 ?
对 , 就是可以当运斗 。 因为它电运斗一个面它这么大 , 然后你这个芯片只有这么小 , 它实际上比电运斗的功率还要高 。
单位面积的功率更高 。
对 , 然后你就也不得不去把它通过分布式的形式 , 能够让它物理之间能够拉开一定的距离 , 这个之间的通信通过 , 比如光模块 , 通过其他的接口电路 , 包括铜缆线 , 把它们之间拉开一定物理的情况下, 还要把它组成了一张非常规律的分布式的网络 , 来完成 AI 的大规模的推理模型的这种连接 。
这我有问题 , 就是你刚才说到 , 比如说在一个大的数据中心里边 ,有不同的服务器之间可能距离非常远 , 对吧 ?
它必须要实现距离非常远的服务器之间通讯吗 ? 它不能把需要通讯的服务器都集中在一个小范围 。
这个跟刚才说的电运斗的功耗问题的一个类比是一个问题 ,因为我们现在讨论的是 , 比如 10 万张卡的互联 , 那么我一个机柜可能只能塞到几百张卡 , 然后 10 万张卡可能就有几百个机柜 , 它这个机柜自己还有一个物理的机械尺寸的限制 , 那就意味着当你把 10 万张卡放在一起的时候 , 它已经占满了一个 LPO。
所以就是说有的需求是必须 10 万张卡一起跑 , 才可以实现 。
对 ,因为像现在 DNA 最先进的 , 比如 Claude 或者是 Codex、ChatGPT, 大语言模型训练需要的这种模型参数是非常非常巨大的 , 它这个里面就要吃到大量的显存 , 你就不得不去做大规模的多卡的并行的这种集群训练 。
是只有模型训练才需要这么大吗 ? 还是说大家日常使用模型去解决一些其他任务 。
相对要小很多 , 模型训练过程中需要喂给它大量的这种数据 , 所以它这里面需要消耗的这种资源会远多于它已经训练好在部署的时候的这种资源消耗 。
明白 。 那换句话说 ,是不是意味着某个时候模型能力已经到尽头 , 或者很难去提升的时候 ,也就是说对模型的训练的需求没有那么大的时候 , 信号传输的这个需求也会放缓 。
这个隐忧实际上在市场里面已经有所体现了 , 包括 Meta 还有其他的这些北美的大型运转商 , 还在就是不停的承诺去加码数据中心的建设 。
现在市场上已经有一种感觉 , 就是我过度的这种资本开支未必能够见到实际的收益 。 这个里面就是有一个跟 2000 年幻网 PO 一个类比 , 就是当时铺的光纤网已经支撑了未来二三十年的国外网的光纤数据通信的这种需求 。
往期的新一子的节目里面实际上也有提到 , 这个里面的资本最后驱动的产业的这种变革一定会有泡沫的一个阶段 , 我们毫无疑问是处在这个泡沫期 , 所以我觉得你的担忧也是非常合理的 。
光通信产品的需求更多取决于你对更先进模型训练的需求 ,而非更多人去使用或更高频使用的需求 。
对的 , 对的 , 对的 。 这个里面就涉及到了我们现在所讨论的 800T、1.6T 的 , 它实际上是一个相对短距的光通信的概念 。
它的短距就指的是我在 500 米以下的这种场景 ,在服务器之间的这种互联 , 或者是几千米之内 , 包括海底光缆这种长距 。
刚才提到就是 ZR 的这种应用场景 , 实际上很早很早 , 几十年前就已经很充实的存在了 ,而且它也能够承载很大的带宽 。
但是这种长距通讯的模式 ,由于它比如延时高 , 或者它能耗会非常高 , 它不适用于 AI 高密度的大规模推理集群的这种应用场景 。
也就是最近几年短距的这种光通讯 , 才真正由于 AI 的火热把它带火了起来 。
我再问一个问题 ,有的数据中心 , 它也有很大的面积 , 然后有很多的服务器 , 这个数据中心它主要的应用场景不是用于训练顶尖的模型 , 它是不是对于这种距离很远的服务器之间的通讯的需求就没有那么大 ?
是的 ,有可能你如果一个小型的数据中心 , 比如说石磊公司里面的机房 , 这个就是一个很小的数据中心 , 这个里面它就是几台机器之间互联通讯 , 它基本上都是由铜缆线来完成 。
这明白 。 标准的数据中心是不是也不是说每一个数据中心的每一层 , 或者说每一个数据中心有很多机房吗 ?
也不代表每一个机房都是用于去做大模型 。
它这个服务器不同的架构 ,其实也有很多的细节和考究 。 服务器之间的通讯在不同的场景下, 它的整个的网络的结构是非常不一样的 。
光模块带来的这种最大的需求 , 实际上是由这个 AI 推理来主导的 。
明白 。 所以说不同的数据中心 , 或者说同一个数据中心里面的不同的仓库 , 它对光模块的需求可能是不一样的 。
是的 。
甚至可能差异很大 。
是的 ,是的 。
所以它就一个需求 , 就 AI 模型训练的需求 。
对 ,因为这个 AI 大规模的推理 , 它里面需要卡和卡之间的交互的数据量非常大 , 这里面我就需要一个很高速的光模块 。
像你刚才说的 , 如果有一些我只是一些简单的存储的需求的话 , 我可能还是需要光模块 ,但是我不需要这么高速的光模块 。
讲完光的概念 , 我们还必须得讲一讲高速铜电缆通信的问题 , 就是为什么我们现在经常听到一个叫做铜退光进这么一个概念 。
所以我们就必须得讨论一下高速铜电缆通信的难点 。 铜电缆通信到底难在哪呢 ? 这个物理根源是两条 , 一个是叫做趋肤效应 , 就是说我们高速的电信号在铜作为这种介质传输的时候 , 它的这种交变信号 , 它会倾向于贴在这个铜导线的表面来传输 。
这就意味着它的中心部分实际上是阻抗比较大 ,但是这种趋肤效应会随着我们的传输信号的频率增高 , 它会越来越严重 。
也就意味着我们这个铜导线越长 , 传输的信号频率越高 ,在这个铜导线中传输的损耗就会越来越大 。
还有一个物理根源的就是它的这个介质损耗 , 本质就是频率越高 , 信号在铜线里衰减的就越厉害 ,而且是一个急剧上升 。
如果用铜电缆作为通讯的介质 , 现在这一代的标准是每条通道传输 200G, 实际上严格意义上讲它是 24Gbps 的速率 。在这个频率上, 一条 1.5 米长的这个铜缆线 , 差不多到我们身高这个长度 , 信号的损耗从发端到接收端能够达到 40dB。40dB 是一个什么概念呢 ?
铜与光38:23
就是 20 的 log 以 10 为底 , 对吧 ? 然后算这个信号的幅度 。 我们转换过来 , 实际上它从发端到收端 ,在经过 1.5 米铜缆线之后, 信号的幅度衰减了 100 倍 , 只剩下了 1%。
没法用了基本上 。
对 , 基本上 40dB 的差损的铜缆线甭管它有多长 ,因为我速率更低的话 , 这个铜缆线可以做到更长 。
当代的 24G 的传输速率下, 这种无源的铜缆线基本上只能达到一个 1.5 米或者 2 米左右水平的这种通讯长度 。
刚才提到我们在机柜内部的通讯 , 不同层之间 , 它一般还是靠这种无源的直连的电缆线 ,但是之前的这种硬长的 , 它要 2 到 3 米左右的长度 , 就是我们在机柜内部之间的原来的这种铜缆线的这种通讯 , 都由于铜作为介质的这种趋肤效应和介质损耗 , 产生了极大的挑战 。
这是为什么我们有越来越多的通讯的链路应用场景会应用到光 ,因为它的损耗跟距离之间的关系是非常非常小的 。
所以高频是铜上不去的 , 如果你提升频率的话 , 就必须换介质 。
是 ,是的 。 实际上 40dB 的差损是我们现在做 SerDes 信号能够恢复的极限 。
1% 也能恢复 。
能恢复 。
是要靠芯片去还原 。
对的 , 这些信号从交换机发送到了光模块里的时候 , 它第一个见到就是我们这个 ODSP。 这个 ODSP 它的主要的作用就是要先对这个电信号进行一个还原 ,不然如果直接送到光激光器里面的话 , 它实际上这个信号是完全没有办法看的 。
这里面的数字部分需要很多的均衡算法 , 提到一些简单的名词吧 , 就包括这个 FFE、DFE、MSE, 就是这个 Feed Forward Equalizer、Decision Feedback Equalizer、Maximum Likelihood Signal Detection。
这个 rap 非常好
, 很有节奏感 。
这个 MSE 这个东西可能谁有听说过 , 这个叫维特比义码 。 它的本质都是在干一个事情 , 就是把一个已经很糊的信号 , 把它恢复从这个噪声里面给它捞回来 。
这个信号恢复 , 它实际上是有三个维度的代价 。 第一是这个信号如果质量越差 , 那么我们就需要把均衡能力做得越强 ,ODSP 它的功耗就肯定会越高 。
第二是损耗预算 , 铜缆线损耗随着速率的增加 , 它是越来越紧的 , 它也会给我们整个系统设计带来很大的挑战 。
第三就是这个信道本身也是不完美的 , 它里面还有很多各种各样的干扰 , 这里面我们管它叫做串扰 。
这个可能是谁学过的应该知道 , 就是信号在不同材料的介质之间 , 它是会存在反射的 。在服务器通信里也有这种问题 , 比如说我 PCB 上它有这种插座或者连接器 , 光模块本身也是 , 它接触手指有可能会存在很严重的反射问题 。
通信行业最后一个叫做黄金的一个设计标准 , 就是我这个光模块设计出来到底能不能够满足我客户的要求 。
这个黄金的标准叫做误码率 , 就是我在上面跑的这些电信号 , 作为这个数字 0 和 1 的比特 , 我的误码率必须要小到大概万分之一左右 , 或者甚至更严 。
综合起来来看的话 , 特别是在速率越来越高 , 功耗越来越小 , 两者之间本身之间相互矛盾 , 同时要求很低的码率水平 , 包括 ODSP 的设计上, 实际上是一个非常困难的挑战 。
就是我们常说的既要又要还要 。
对的 , 对的 。
所以价值量就凝聚在 ODSP 上 。
对的 。 这点后面也会提到 , 它不光是 ODSP, 包括我们发端的这个激光器 , 它的可靠性也是一个很大的挑战 。
但是铜并没有死 , 现在这个英伟达有一个叫做 NVL72, 它的机柜 , 它的内部用了 5000 多根 NVLink, 它本质上就是一个铜缆线 。
由于速率比较高 , 它的通信的有效距离会很短 , 那么在一米之内 , 铜的功耗 、 成本 、 可靠性依然是碾压光的 。
所以铜的问题从来不是不行 ,而是它的经济半径 , 就是速率每翻一倍 , 抵达的通讯半径就会被砍掉一半 。
下面我们来讲一讲光的优势 。 光通信的本身优势就是损耗和信号的速率无关 。 光纤每公里的衰减才有 0.2 个 dB, 刚才我们讲到了两米的铜缆线 40 个 dB。
我们把速率翻倍 , 它的影响是非常非常微弱 ,而且光电路本身由于是光纤 , 它实际上是波导的一个概念 , 它不像铜 , 它会受到这种电磁干扰 。
这里面它就没有串扰 , 没有电磁干扰 , 它纤细可弯折 , 很轻便 , 布线起来也很容易 。 所以一根光纤可用带宽是 Terahertz 太赫兹量级 , 还是做波分复应 , 多个波长并行跑来提高它的有效的通信带宽 。
那为什么铜还占着这么多的地盘和应用场景呢 ? 这个里面核心的原因就是要提到光模块 。 光转电实际上是要交过路费的 , 无论是电变光 , 光变电在光模块里的转换 , 它实际上是有很多的成本在里面 。
这笔费用还和距离是没关的 , 是一个固定的 。 它特别像是我们之前这个缘由里讨论的 , 货船要过霍尔木兹海峡 , 伊朗要抽一笔过路费 , 这个例子是比较类似的 。
光模块里面它有激光器 、 驱动器 、TIA, 还有包括一些很多这种精密耦合的封装 。 它给光模块整个的设计带来三个产品上的一个挑战 。
第一是我们的成本 , 就是这个高速模块 , 包括光模块 , 还有刚才提到的 ODSP, 轻松就可以有几百美金的物料成本 。
一个高速光模块 , 比如说 800T 和 1.6T, 它这里面的物料成本就可以轻松到大几百美金或者上千美金 。 铜缆就只有几十美金 , 包括刚才提到我们这个长江的例子 , 就是 USB 线 , 还有包括 HIDM 线 , 本质上都是铜缆线 , 它可能更便宜 , 只有十几美金或者几十人民币 , 对吧 ?
这是第一个挑战 , 就是它的成本端 。 然后第二是它的功耗 ,由于光电转化本身里面涉及到我需要集成很多额外的模块 , 光模块 、 激光器 , 还有 TD, 还有 TIA 到这个光模块里面 , 这种模块本身参与光电的转换或者电光转换 , 它是需要消费很多能源功耗的 。
第三是它的可靠性 , 光模块里的这个激光器 , 它用久了之后, 它会老化 , 会失效 ,而且它对温度环境会非常敏感 。
我这里想问一个小白问题 , 就是过路费是谁收的 ?
这个过路费本质上就是指的是功耗 ,因为原来如果我通过电的形式直连 , 我不需要涉及到光电转化这一段 , 所以我就不需要额外的一个部件 , 这些部件它本质上都是需要耗能的 。其实这里面也有一个电模块的概念 , 就是它里面没有这些光的东西 , 它只有一个叫做 DSP, 就是它做一个信号的再恢复 ,但是它输出端也是通过电缆直连 , 这个就是有源电缆线的
这么一种概念 。 那么一旦要涉及到光的话 , 就意味着你要在这个电模块里面去额外的加入刚才提到的这些 TIA、 激光器这些东西 。
首先是这些器件本身买来要花钱 ,其次是它的能耗也非常非常的重要 。 不光是这样 , 就是这些模块在消耗电能的同时, 它还会产生热量 。
我不知道敏姐知不知道 , 服务器里面运行维护 , 这个电钱 , 就假设我一天一个服务器要花 100 块钱 , 这 100 块钱里面有多少是我设备实际的电能消耗所占有的百分比 ?
不到一半 。
不到一半 , 为什么 ? 剩下一半在干嘛 ?
散热 。
Exactly,bingo, 这是正确的 。 实际上这个散热问题也是一个很大的代价 , 实际上你服务器里面的这个电钱 , 只有一半是用来运行这些设备上, 另一半是这些设备散热带来的问题 。
你必须要保证整个的交换机运行的稳定 , 那么我就必须要保证机房的温度保持在一个相对合适的温度 。
那么这里面就涉及到了我需要耗费大量的电能去做热交换 , 这里面电钱的一半成本都是在散热 。
或者把服务器搬到太空 。
这个我们就不谈了 , 扯到太远了 , 我个人对这个觉得不太靠谱 。
那这个过路费实际上就是成本的增加 。
对 。
它不是一个真实的有人收费用 。
但本质上最后都折在电钱里面了 , 还有包括我们光模块里的物料成本 。在我们的应用场景距离短速率低的时候 , 这个过路费是划不来的 。
那么在机柜内 USB 家用网线 , 它依然是铜的天下 。 那么距离一旦变长 , 速率又上升了 , 我们铜的距离费付不起 , 那么我们就要用到光纤 。
如果我们用一句话概括这笔账 , 铜按距离付费 , 光按端口付费 , 每一代的速率升级 , 交叉点都要往更短的距离挪一步 。
光模块市场为什么能持续扩张 , 它的微观机制就是这个 。
这个总结特别好 。 铜是按距离付费的 , 铜因为按照距离来衰减 , 对吧 ? 但是光是按照端口 ,因为你光电要转换 , 转换之后又耗能 , 然后又耗材 。
产业版图46:47
下面我们再聊一聊产业生态 , 就是谁在做 , 钱往哪流的问题 。 这是石磊做这期节目的时候给我抛出的一个核心问题 。
首先我们聊一聊产业链分工 , 光器件设计制造和 ODSP 设计 。 最上游是芯片和光器件 , 这里面包括了激光器 , 还有包括说到的 ODSP, 还有 TIA, 还有很多无源器件的这些设计 。
中游是我们的这个光器件封装 , 再往下是光模块的设计制造 , 最后我们交付给下游 , 就是云厂商 、 设备商 、 运营商做这个交换机 。
这个格局实际上是有两面 , 好的一面是模块环节 , 中国已经是主导的 。 近几年全球前十的光模块厂商 , 中国公司大约占七席 , 这里面大家常见的就是旭创 , 这个是连续的多年的这个规模全球第一 , 还有包括新易盛 、Optalink、 光迅 、Attractor_MS, 还有华工正源都在搒上 。他们的优势主要集中在精密封装制造 、 快速工程迭代和成本控制上, 这也是中国制造业产业链的核
心优势 。
这我问个问题 , 那另外三席 , 它不是中国的企业 ,是因为什么原因 ? 是说供应链要分散 , 还是确实有独特的优势 ?
这个里面主要的原因是剩下的几席 , 还有些是从做这种光器件来出身的 ,他们同时也做光模块 ,其实也是像你说的 , 现在地缘政治和去全球化的大背景下, 它也必须要有厂商能够在国外, 就是美国 。
所以并不是他们的技术或者成本有多大的优势 。
他们的技术本来肯定是有优势的 ,因为我们的光通信这一块 , 包括所有的部件制造和设计 , 实际上我们都是起步比较晚的 。
芯片行业的其他领域上, 你都会发现 , 包括 Foundry, 就是制造厂 , 还有包括其他的整个产业链 , 现在在国外 ,在过去 30 年的发展历史上, 都是有海外的这些龙头存在的 。
但是由于制造业的成本 ,他们会逐步逐步的向低成本的国家转移 ,但是最后现在实际上是一个并轨制 。
中国它整个光模块的产业 , 包括很多的这些关键的这些部件 , 它的起步和设计时尚比较晚的 ,但是现在依托了产业链制造业的这种优势 , 实际上也是在一个快速追赶和发展的过程里 。
中国是怎么在光模块这个产业节点占据了七席 ? 你还说这是一个非常 , 就是你的技术也不是起源于你 , 对吧 ?
那纯是因为我们成本低吗 ?
就是说相对来讲 ,因为光模块它在整个的产业链里面 , 就光模块的制造 , 它不是一个技术含量要求非常非常高 , 用的是非常非常高 , 它是比较高 ,但没有那么那么高的这么一个角色 。
我举个不太恰当的类比 , 光模块的制造商的角色 ,其实有点像是戴尔或者联想 , 它是做了一个整机的这么一个集成 , 它提供了整体系统的这么一个设计方案 , 只不过对戴尔来说 , 这个整体系统是一台电脑 ,但是对于旭创或者是新易盛或者是光迅来说 , 它是一个光模块 。
那么光模块里大部分的部件都不是它自己的 , 很多都是从外面买 ,但是随着我们国产化的要求越来越高 ,他们也在做出很努力的尝试去逐步的把里面的关键部件自研 , 然后来逐步的替代 。
等于说也是一个在中等技术要求情况下, 要求极致效率的一个节点 。
对的 , 对的 , 这也是我们自然而然的产业链的优势能够带来的这种发展 。
有点像那个新能源车的整车集成 。
对 ,因为这个道理很简单 , 刚才提到了 ODSP, 跟你买台电脑一样 , 你可以选你要什么 , 对吧 ?ODSP 你可以选 Marvell 的 , 可以选博通的 , 光器件你可以由 Lumentum, 然后还有什么三菱 , 这日本的这些厂商 , 然后也有国产的 , 很多时候是看客户他的需求是怎么样的 , 然后他如果量大 ,他就可以给你定做去下单 。
特别像原来 PC 里面做主板的 , 还有在做服务器里面的 。
对对对 , 然后另外那三家其实就是它偏一体化 ,因为它是从上游一些关键器件 , 然后它做一体化产业链 。
是的 , 它做下来 。
是的 ,是的 。
我们如果拆开一只 800G 模块 , 然后去看它每个模块 , 看它的物料成本的话 , 那么这里面光芯片加光组件接近整个光模块的成本的一半 。
刚才提到的 ODSP 大概要占两到三成 。 如果单看单个元件 ,ODSP 它的成本是最高的 ,因为所有的光芯片加光组件加在一起是一半 , 最大的大头是 ODSP。ODSP 这一块 , 它恰恰是海外主导的一个环节 。Broadcom 和 Marvell 它是一个双寡头的一个格局 。
刚才提到的这些光器件 , 包括激光器 , 海外主要的厂商是 Lumentum、 三菱 、 住友 。 对于高速 TIA 和驱动器 , 最先进的这些部件的生产和设计都是在海外手里 。
我们的国产化正沿着 25G, 然后 56G 带来每条通道 , 然后 112G 的这个每条通道 , 一级一级的往上打 。
一句话总结这个格局 ,是中国赢下了封装制造的面 , 还没有赢下芯片的点 。
中国还在 25G 翻通路 。
国产化最新的进度差不多是 112G, 这一代也能到了 。 但是就是因为它国内的生态也是初步的发展 , 所以各个厂商的进度和进展都不太一致吧 。
也有些厂商只能到达一个 25 或者 56G 的这个水平 ,但是有一些先进的厂商也基本上现在也在做 112G 的产品化 。
华为很早很早就有 112G 的光模块了 , 华为可能是属于国际一线的水平 , 比如十年前的格局 , 就只有华为自己能够有能力做这个事情 。
最近国产化的这种 ODSP 的厂商越来越多 , 还有包括这种做光器件的厂商越来越多 。 生态已经有一个初步的形成 , 性能可靠性 、 功耗需要面临市场的检验 。
这块我们跟海外先进就差几年了 。
我个人的判断 , 只听个人判断 , 这个也可能没有行业的标准 。 如果单纯从华为的角度来讲 , 可能有三到四年的差距 。
平均数的 , 平均数 , 对 。 但是如果从小厂的角度来考虑的话 , 可能要有七到八年左右的差距 。
那还是挺大的 。
这里面最大的一个难度是它的这个 ODSP 的设计 , 这个里面实际上涉及到了这种尖端模拟电路和数字电路里用到的几乎所有的技术 。
这就意味着我每一个模块都要做得非常非常好 , 还要做到一个非常顶尖的水平 。 它不仅是性能要达到要求 , 还要功耗非常非常的小 。
我们在人才的储备和产业的这种积累上 ,是远远不如国外的 。 国外已经搞了二三十年了吧 , 现在的博通是怎么来的 , 实际上收购了很多很多公司 , 做了 20 多年才有了现在这个龙头的地位 。
我们不存在这个产业生态 ,也没有这么长的积累 , 所以这个里面的技术壁垒还是比较高的 。 下面就是要讲讲光模块里面最贵的这个芯片 , 就是我们这个 ODSP 芯片 , 它也是下一个最关键的投资风口 。ODSP 它相当于是一个光模块的大脑 , 它本质上是做 SerDes 数据的收发和均衡 。
ODSP53:03
它一方面是要补偿光通道的损伤 , 光通道里面带宽受限 、 色散 、 非线性这些问题 , 都需要 ODSP 来处理 。
同时它也是一个功耗大户 , 一只光模块大约有一半的功耗在它身上 。 我们现在这个 800T 光模块 , 它的功耗要求是一只光模块 , 它的功耗控制在 16W 以下 。
那么也就意味着我们 ODSP 芯片的这个功耗要做在 8W 以下 ,但这个 8W 还是我们八条 LAN 总共 , 那么每条 LAN 平均下来只有 1W 以下 。
这个功能耗的这个要求实际上是非常非常非常高的 。 那么 ODSP 的设计难点在哪 ? 这里面主要有三条 。
第一是它有一个极限的模拟性能 , 每通道目前一代的标准是要做到 24G, 它需要高速高精度的一个模数转换 ,ADC 作为一个模拟前端 , 同时这个 ADC 需要 55GHz 以上的模拟前端带宽 。
同时这里面需要一个时钟做采样 , 这个时钟的抖动需要低到 100 分秒以下 。 由于这个功耗和带宽的要求 ,ODSP 的整个的制造需要在 5 纳米 、3 纳米的先进工艺上来完成这个模拟混合信号的设计 。
全球能做这个事情的团队屈指可数 。 这是第一个难点 。 第二是我们算法和功耗的平衡 。ODSP 刚才提到它的主要的作用是做这个信号的恢复 。
如果我们把均衡做强 , 功耗就爆炸 。800G 的光模块大约是 16W 的整体功耗 , 那么 1.6T 甚至会逼近 25W,而数据中心已经一瓦难求 。
第三是我们的资本 , 就是人才和技术的门槛 。 先进制程流一次片 , 几千万美元的量级 , 还需要 SerDes 的 IP 多年的积累 , 光电协同仿真 , 量产测试能力 , 资本 、 人才经验 , 它有三重的壁垒 。
为什么说它是风口呢 ? 因为模块环节的国产化率已经很高 , 包括刚才提到的整个光模块制造 , 我们实际上是世界前十席 , 我们占了七席 。
还有里面的这些 TIA, 还有激光器 , 实际上我们国产化的进展也都非常好 。 但是整条产业链利润的瓶颈 , 同时压在了 ODSP 和光芯片上 。
再叠加地缘因素 , 国产高速的 ODSP 是确定性比较强的一个替代主战场 。 当然我们还要提示一个风险 , 就是后面会提到的是叫做线性直驱方案 , 就是 linear 方案 , 就是 LPO。
如果 LPO 它实际上是一个去掉 DSP 的线性直驱方案 , 它在短距场景大规模铺开的话 , 实际上是会分流一部分 DSP 需求的 。
投资这个赛道必须看清这个技术路线的这种争论 。 下面我们讲一讲 CPO, 就是 CodePackage Optics。CPO 它是供封装光学 , 下一部分我们会专门讨论这个技术 。
这里面我们先讲生态 ,因为有件事情是很关键的 。CPO 不光是光模块厂商的发明 ,而是系统级厂商 , 包括 Broadcom、 英伟达 、 大型云厂商 , 它自上而下推动的一个整体方案 。
封装之争55:50
道理很直白 ,因为 CPO 它作为封装光学 , 做这个的事情的目的 , 就是在节省功耗 。 功耗的收益它实际上是体现在系统层面 , 包括刚才提到的整机功耗 , 包括它的这个信号的通讯的封装密度 , 还有成本 。
它的代价也需要系统方兜底 , 包括维护和供应链 。 这就意味着生态的权利实际上是在转移的 。 原来在可插拔时代的规则是一个开放生态的概念 , 就是我们模块厂商创新之后, 用户即插即用 。
但是在 CPO 的时代 , 价值链的权利是向掌握交换芯片和 GPU 的巨头来集中的 。 传统的模块厂商被迫要重新定位自己 , 要么向上成为光引擎的供封装伙伴 , 要么它必须要坚守可插拔和 LPO 的阵地 。
是不是因为这个 CPO 是封装在 GPU 的内部 ?
是的 , 所以它本质上是要由做 ODSP 或者现在这些厂商 , 做 SerDes 这些厂商 , 它来主导整个的设计和封装方案的 。
因为这个东西还有一个最大的缺点 , 就是 CPO 这个东西 , 它由于把封装做在了芯片内部 , 所以它的可维护性是很差的 。
由于激光器的老化或者一些光纤的原因 , 或者是什么原因 , 光模块坏掉了 , 可插拔我直接把它拔走 , 我重新插一个新的上就修好了 。CPO 它由于把光电路都已经探到封装的里面去了 , 那么也就意味着它一旦某一路光路出现了问题的话 , 它的可维护性是非常差的 。
只有设计的人才能明白的是它怎么去修理和维护 。 这一套的这些方案 , 从整体的产业链 , 我用什么光器件 , 它由原来的光模块可能有很大的话语权 , 到变成了我现在做这个芯片设计的这个厂商有最大的话语权 。
能不能理解为原来的光模块它是一个标准品 ?
对的 。
现在相当于是一个你要适应这个 GPU 里面的设计的一种非标品 , 实际上定制化的方案 。
对的 , 对的 , 对的 。 怎么定制各个厂商这是它的核心利益 。 最后很有可能也会形成某种程度上的标准 。CPO 这种方案跟可插拔比 , 它的灵活性和可维护性大概率是远远要差于可插拔的 。
所以 CPO 是还要更远近一些 , 会更贵吗 ?
对的 , 它不仅是更贵 , 我估计至少还要两三年才能看到一些初步的 ,有些技术的重大的进展 。
原来的这种可插拔它还有一种路线就像 LPO, 能解释 LPO 是 ?
LPO 是怎么回事 ?LPO 实际上也是可插拔 , 这个后面我们也会有详细的例子介绍到 。LPO 跟 CPO 核心的差别就是它都是可插拔 ,但是在这个模块里面 , 它没有这个 ODSP。ODSP 的物料成本有时候要几百美金 , 我如果把这个 ODSP 省掉的话 , 那就是节省了几百美金的成本 。
那它这方案就不需要信号的还原 ?
它为什么叫线性直驱 ? 它本来是这样 , 服务器和服务器之间的通讯是服务器里的交换芯片和交换芯片的通讯 。
我们原来的场景是怎么样 ? 在可插拔的原有的方案里面 , 交换芯片先到面板侧 , 然后我插进去了一个光模块 , 它做了光电转换 , 然后还有这个信号恢复 , 先做信号恢复 , 然后做电光转换 , 发送出去 ,在接收端在另一个光模块里面做了光电转换 , 然后再发送到了交换机 , 交换机那次还会再做一次恢复 。
现在这个线性直驱的方案是怎么样的 ? 就是说这个光模块里的 ODSP 去掉之后, 它的恢复的过程就没有了 。
它会做什么呢 ? 它会在交换机侧用一个驱动能力更强的 SerDes, 让一对 SerDes 去 cover 整个的从第一个交换芯片到面板可插拔侧 , 再到另一端 , 再到另一端的交换机 , 这三段链路 , 它加起来的整个通讯任务 。在这种方案下, 我们的交换芯片里的 SerDes 的驱动能力必须要强于传统的可插拔方案的 。
这个我就给大家举一个很简单的类比 , 就是这个射火箭 , 你是用一级火箭去把这个卫星发上天 , 还是做一个二级或者三级的火箭 ?
我们原来的可插拔的方式类比的话 , 实际上它是一个三级驱动的概念 。 但是现在这种 LPO 的概念 , 就是线性驱动方案 , 它就是一级火箭 , 我就把信号从起点发到终点 。
那所以 LPO 方案是对这 SerDes 要求很高 ?
对的 , 这个也是成熟的吗 ? 这个是成熟的 ,但是它这里面带来的问题其实最后都是系统的问题 。
为什么呢 ? 因为当我去选择用一级火箭的时候 , 我这一级火箭它需要灌装更多的燃料 , 它需要更大的能耗 , 那么也就意味着我交换芯片 , 比如说有 512 路其他的交换芯片 , 我有 512 个 SerDes, 现在原来这些 SerDes 从一个更弱驱动能力 , 相对低功耗的一个选择设计 , 到了一个更高驱动能力 , 更高功耗的设计 , 那么它的整个的功耗 、 散热 , 甚至会给你带来
更高的成本 。
系统要求 。
对 , 对 , 对 。
牵一发动全身 , 这个技术路线 。
最后我们也讲一讲各种各样不同的这个封装方式 , 可以把我们的这种信号传递想象成一个快递网络 。
我们在讨论的 CPO、LPO、NPO 等等等等一系列概念 , 它的本质就是讨论我们如何在搭建最后一公里的快递网络 。
各种不同的光连接方案或者封装方案到底在解决什么问题呢 ? 它们要解决的从来不是光纤那一段 ,因为刚才提到光纤便宜到近乎免费 , 真正的问题是芯片到光引擎之间 , 最后这个二三十厘米的这个电通道 , 就这么一小段的差是全链路成本最高的一段 。
接下来我们做一个类比 , 就是我们把所有封装方案串起来 , 对于一个快递公司来说 , 最困难的就是如何设计最后一公里的快递网络 。
它的设定是这样的 : 光纤就是我们的干线铁路 , 它的运费几乎不随距离涨 ,而且货运成本很低 。
交换芯片或者 GPU, 它就是一个超级写字楼 ,而且它收发快递件的一个量 , 每两年要翻一倍 。 电信号就是我们的旗手 , 街道就是我们的 PCB, 这有很多的坑洼和颠簸 。
最麻烦的是包裹每大一号 ,也就是速率每翻一倍 , 同一条街它的运费就翻一倍 。 光电转换点就是我们的快递站 , 这么一设定 , 所有的封装方案本质上就是同一道选址题 。
我们的这个快递分拣站到底要建在离写字楼多近的地方 ?
这个比喻有意思 。
我们有五种方案 。 第一种就是刚才我们提到的可插拔光模块 , 它在交换机的面板插槽上直接插入 , 就等于我们在写字楼外面的一个标准快递柜 。
这个快递柜它的每一个格子尺寸全国统一 , 哪家的柜子都能插 ,而且它坏了抽出来 , 我们可以换一只就可以了 。
最后一公里我们要雇对撞的旗手 , 收到的包裹要先到达快递站 , 还要拆开重新分拣一遍 , 做这个信号恢复 , 再由旗手送到快递柜 。
这就是我们刚才模块里那个 ODSP 在做的这个信号恢复这么一个动作 。 第二种是我们有这个叫 LPO, 刚才说的 linear 线性直驱的方案 , 这里面的核心是把可插拔光模块里的 ODSP 去掉 , 把它替换成一个光驱动器 。
写字楼外面的快递柜子我们不动 ,但是我们把快递站内的分拣员给裁掉了 , 这样我们在发件端 , 就是快递柜直接发送这个包裹的时候 , 我一次打包到位 , 经过快递站全程我是不拆箱的 , 这样可以让光模块去掉 ODSP, 那么模块的功耗接近腰斩 , 时延也下来了 。
但它对接矿和旗手的要求变得苛刻 ,而且包裹坏了说不清我们是在街上颠的 , 还是我们在这个铁路干线上压的 。
它这个互操作和责任接近难 ,也就是对我们系统设计的要求可能反而会更高 , 所以它只适合接矿好的短途 。
第三种叫做 Near Package Optics, 就是近封装光学 , 这是一个介于我们传统的可插拔光模块和 CPO 中间的这么一个产物 。
它实际上是把光拉到一个离交换芯片很近的位置 ,但又不是那么近 。 快递分拣站它实际上就等同于搬到了写字楼的附近 , 光引擎和主芯片放到了同一块板上, 街道长度从原来的几百米或者一公里缩短到了只有几十米 , 旗手就可以降职成兼职 。
也就意味着交换芯片上只要用一个短距的 SerDes, 用一个功耗很小的代价 , 就可以去完成这个包裹的传递 。
站点它是一个半定制的状态 , 整体还能换 , 它是一个门口柜和进楼之间的这么一个过渡形态 。 第四种就是我们刚才提到的 Code Package Optics, 就是它的共封装光学 。
它的本质就是把光电转化的边界和交换芯片封装在同一个芯片里面 , 就是放在一个 substrate 上面 , 就是一个硅基上 。
我们实际上是把这个写字楼的快递柜直接给取消了 , 我们直接把快递的分拣站直接放进了写字楼 ,而且还和收件人同一层 。
这就意味着光引擎和主芯片是共用一块封装基板 。 那么我们刚才提到的最后一公里变成了走廊的几步路 , 只有毫米级 , 旗手 、 分拣员都基本上裁光了 ,而且能耗会大幅下降 。Broadcom 宣称 800G 的 CPU 大概功耗就是原来的这个 15W 左右的水平 , 可以降低到只有 5.5W 每条链 。
英伟达宣称能效可以提升 3.5 倍左右 ,但是这里面的代价也是相对比较巨大的 。 第一是刚才提到的可维护性 , 就是快递站点和大楼 ,因为它是一体施工 , 那么一旦坏了我们就必须得重新装修 , 它不可热插拔 ,而且维护是一个非常困难的问题 。
第二是站址 , 它紧挨了这个锅炉房 , 我们很多的光器件 , 它的这个稳定运行对整个的这个光模块的温度要求实际上是非常高的 , 这么高的密度都封装在了一个大的这个芯片封装里面 。
光器件和几百瓦的主芯片同封装 ,但是对激光器的稳定运营带来了很大的挑战 。 再往后其实还有一步叫做 OIO, 就是光学的这个小芯片 chiplet, 它相当于更先进 , 就是我们的气动管道直接把包裹送进你的办公桌上, 它实际上是光直接进封装 , 贴着计算裸片 , 连走廊都给省了 。
这个场景是 GPU 之间 scale up 互连的一个战场 ,也是未来的一个热点方向 。 最后跟大家简单总结一下, 就是光电转换点离芯片多近 , 实际上是由最后一公里的运费曲线决定的 。
速率每翻一倍 , 街道运费翻一倍 , 那么快递站就必须得向楼里搬一步 。 门口的快递柜也是永远不会消失的 。
为什么呢 ? 因为它灵活 、 可维护 、 过价竞价 , 那么这些都是真金白银的物料成本节省 。 如果我们做 CPO,也就是进楼建快递站 , 它赢的是 10 万栋楼这种大规模的电费的节省 。
所以未来相当长的时间应该会是一个三分天下的格局 。 可插拔机柜内 , 那么就是看铜和 LPO, 那么跨机柜就是看可插拔光模块 。
放大规模高密度的场景 ,CPO 会渐渐渗透 。 选址之争归根到底是经济学的争论 , 就是谁的成本曲线先弯下去 , 谁会赢得这个争斗 。
这个真的是我觉得很棒的一个案例 。其实技术有很多路线 , 技术也没有绝对的高下之分 ,但是应用场景还有我们的成本费用 , 完全是按照你未来的哪条应用场景去选择的 。
而且是不是有可能会有路径依赖 , 比如说哪些场景先出来 , 那么这条路径会先成熟 , 另外场景它就出不来了 , 还是说它并行的一直会有这么多场景 。
到最后这个东西有多便宜 ,而且有多好用的问题 。 终端客户云厂商在乎的价值就是我这个东西能不能尽早用上 ,而且它要尽量的便宜 。
它的便宜里有多维度的考虑 , 一个是买来的这个模块的成本 , 还有就是它自己的可维护性 ,因为它需要去做一个很大的数据中心 , 大规模的长期在线的维护和运营 。
这里面的涉及到维修里的可替换 , 甚至故障检测 , 这些都是这个系统厂商需要给这些云客户提供一个整体的解决方案 , 才有可能会具有核心竞争力 。
你们那就是哪条路径的场景先出来放量 , 然后让这个产业先成熟 , 很可能这个产业是它的了 。
是的 , 很残酷的技术分叉 。 我们总结一下, 电信号走不远 , 走不远就烧钱 。 所以电和光的转换点 , 离芯片越近 , 省下的钱越多 ,但离得越近出问题时越难修 。
整个封装之战就是在这两头之间找到一个平衡点 。在下一个部分 , 我们想用战略的视角 , 聊一聊光模块的过去和未来 。
先看过去 , 我们来讲讲光通信的历史 。在 1976 年, 武汉邮电科学院的一间实验室里 , 赵梓森用酒精喷灯拉出了中国第一根实用光纤 。
光通信史1:07:48
这个设备简陋到什么程度 ? 就是加热玻璃 , 靠的就是那盏酒精喷灯 。 那么 50 年后的今天 , 一个巴掌大的 1.6T 光模块 , 它每秒可以吞吐 200 个 GB 的数据 , 这就意味着一秒钟我们可以传完几十部的高清电影 。在过去的 50 年, 这个行业操心的问题 , 从能不能通 , 变成了光电转换的位置应该离芯片有多近 。
我们也想在这一部分尝试回答三个问题 : 第一是光通信从哪里来 ? 第二 , 为什么此刻站上风口 ? 第三步 , 下一步走向哪里 ?
通信技术这 100 多年可以浓缩成三次跃迁 , 一个是无线和有线之争 , 同揽的光纤长距离到短距离 。
那我们先一个一个说 。 首先是从无线通信到有线通信 , 我们先纠正一个直觉 , 就是我们通信史里最先发展不是无线取代有线的单行道的规律 ,而是两条路线围绕两个不同的理念来反复拉锯 。
无线它的核心的矛盾是覆盖范围 ,有线它实际上争的是容量 。在历史上 ,有线会是先出现的 。在 1837 年, 电报文是英国的 Winston 和美国的 Morris, 就是发明这个摩斯电码的人, 几乎同时以电报形式做所有的通信 。
那么 1876 年, 贝尔发明电话 , 这里顺带说一句 , 这个构思诞生在加拿大的安大略 。 那么无线就在 1901 年登场了 , 意大利人是 Marconi,他把无线电报从英国的 Conwell 发到了大西洋对岸加拿大的最东边纽芬兰 ,也就是今天的这个加拿大的纽芬兰岛 。
人类第一次不靠电缆实现了跨洋通信 。 这场垃圾站最好的案例就是跨大西洋电话 ,1927 年第一条商用运营电话开通 , 走的是短波无线电 , 整条线路一次只能承载一个通话 , 三分钟要花 75 美金 , 那是 1927 年 。
然后今天的购买力相当于是花上千美金打三分钟的电话 。 那么 30 年后,1956 年, 第一条跨大西洋海底同轴电缆是叫做 Transatlantic No.1, 就是 TAT-1, 它开通 , 一次它可以支撑 36 路的电话的通信 , 质量和容量立刻碾压无线 。
上世纪的六七十年代 , 通信卫星一度把越洋主导权夺了回去 , 直到 1988 年, 第一条跨大西洋海底光缆 , 这是光缆 , 就是这个 Transatlantic No.8, 就是 TAT-8, 它的容量约合 4 万路电话 , 胜负就此写定 。
今天大约 99% 的洲际数据流量走的是海底光缆 , 跨洋的卫星通讯只是一个补充和备份 。 所以这场百年拉锯的结论值得记住 , 就是接入端不断无线化 , 手机 、Wi-Fi、 星链 ,但是我们的骨干网承载大容量通讯的这些网络永远是有线 ,而且是光 , 原因就是这两个字 , 容量 。
包括星链 , 它最终只是提供了覆盖的网络 , 然后最终的大的容量型的交互通信还是靠光缆 。
对的 ,其实星链在国外的用处非常广 , 比如在加拿大中产的一个爱好 , 就是如果自己有一定的财富积累之后 ,他会在很远的地方买一个 cottage, 就是农舍 , 你可能边上有个湖 , 夏天能滑滑水 ,但这个可能有些人会喜欢 , 就是夏天可能一个月都在那里度假 。
但是这里面最大的一个问题就是 , 它没有任何公共的这种服务接入 , 它有电 ,但没有排污 , 可能有水 ,但是没有光纤接入 。
这个时候星链就起到了一个非常非常重要的作用 。 但是星链本身也是相当于是你买了一个它的接收器和发送器 , 放在自己家的阳台上或者屋顶上, 它和卫星通讯 , 卫星再和它离最近的地面基站通讯 , 基站和基站间之间 , 就是相干光通讯的这种方案 , 来之间做这种长距的数据传输 。
所以在国外有很多人来订阅那个星链的服务 。
对的 , 它这个场景是非常非常好的 ,而且包括有些人他觉得自己喜欢房车嘛 ,他露营啊什么的 , 就是你在房车上挂一个星链 , 这个所有的网络问题都可以解决 。在中国有中国移动就行了 。
下面我们来讲一讲从铜缆通信到光通信 , 什么物理性质决定了胜负 。 第二次跃迁是从铜缆到光纤的通讯 ,由于之前提到的趋覆效应和介质损耗的问题 , 让信号在铜线里的衰减频率快速上升 。
如果我们导线数量不变 , 想提升容量就得提高信号频率 , 频率一高衰减就快 , 就得沿着通信路径布置大量的中继节点做信号恢复 。
什么叫中继节点 ? 这个可以想象成接力赛的这个交接棒 , 或者古代驿站的号码处 , 信号跑一段就没劲了 , 幅度变小 , 波形变模糊 , 中继站就是要把它接住放大整形 , 原样发出去 。
这也就是刚才我们提到的再恢复的概念 。 我还可以再举一个很简单的例子 , 比如说我们几个去野营郊游爬山 , 我们分别爬上了三个不同的山头 , 我们之间想互相通信信息 , 我们人的声音可能只能传大概两公里左右 。
这个时候敏姐站在第一个山头上, 我站在中间这个山头上, 想传话给石磊 。 那么这个时候你要先喊给我 , 我听到了这个信息 , 听到你说了什么 , 我再去向石磊喊一下, 这个时候我就对信号做了一个再恢复 , 才能到达石磊 。
如果你直接传话给石磊 ,他是听什么都听不到的 。 所以这个本质上就是中继站就是在干这个事情 , 它对一个已经衰减了的信号判断它是什么 , 再恢复了之后再把它转发出去 。
这感觉有点像小时候玩的游戏 , 就是大家排成一列嘛 , 就第一个人看到一个词语 , 然后就往后传 , 后面人都不能听 , 然后再一直传到最后, 对 , 然后再看最后一个人说的对不对 。
对的 , 这里面其实就涉及到这个问题 , 中继站的恢复不是没有代价的 , 它实际上是要判断你之前发送到的是什么东西 , 它也有可能产生错误 ,而且中继站越多 , 它可能错误就越多 。
所以单纯的线性的去堆叠线性站 ,也不一定是一个可行的解决方案 。 那么回到我们的主线 , 大容量的同轴电缆干线 , 到最后每一两公里就需要一个中继站 , 容量越做越大 , 成本越做越高 , 所以这条路眼看就要到头了 。
转机来自一个大胆的判断 , 就是在 1966 年, 高昆提出玻璃可以作为传光的介质 , 只要把损耗降到每公里 20dB 以下 , 就能用于通信 。
这个判断大胆在哪呢 ? 是当时最好的光学玻璃 , 损耗是每公里 1000dB, 差了两个数量级 。 所以在当时这是被看作一个天方夜谭 。
但是四年后,1970 年成了行业的奇迹年, 美国康宁公司现在还在 ,而且股价连续起飞 , 它拉出了每公里 20dB 量级的低损耗光纤 , 同一年室温下能连续工作的半导体激光器问世 , 这就解决了我们发端的关键的电光转换的问题 , 整套的光通信的理论在一夜之间就落地了 。
再往后的 50 年, 是一条不断下探的损耗曲线 , 今天的光纤每公里的衰减只有 0.14 到 0.17dB, 直观一点说 , 光在光纤里跑 1000 公里 , 衰减程度还不及一副墨镜 。
一根光纤可用的带宽接近 10 个太赫兹 , 那么配合波分复用 , 让不同的波长的光在同一根光纤上并行跑 , 一根头发丝粗细的玻璃丝 , 可以承载几十个 Terabits 每秒 。
太厉害了 。
对中国来说 , 我们的起点在 1976 年, 赵梓森在武汉 , 就是今天中国的光谷所在地 。 我前一日在武汉 , 我说光谷 , 光谷我刚开始没反应过来 ,他这个英文名 , 石磊猜的是吧 ?
光谷的英文名 ,是跟光子 。
它叫 Optics Valley, 叫 Optics,Optics 英文是指光器件 , 光是光学 , 它不是 Light。 所以这就是为什么武汉的光谷就是在这里 , 它是 1976 年赵梓森在武汉 , 拉出了国内第一根实用光纤 , 所以这个地方就叫光谷 。
然后 1982 年, 我们有一个叫做 82 工程 , 它开通了武汉市化光缆 , 中国的光通信产业由此起步 , 一场逆向攀登从这里开始 。
之前那个河北还有一光谷 , 看来我是理解错的 ,因为河北的光谷是光伏 , 这个光谷是光学的器件 , 光纤 , 光纤这些 ,也不是物理里面那个光子 。
我们再讲讲从这个长距光通信到短距光通信 , 刚才也提到了 , 我们最先是骨干网 , 海底光缆用的是光 ,但是后面的这些都是用的是电缆通信 , 后面慢慢慢慢 , 现在已经逐步到了 , 从光延展的距离 , 已经从骨干网慢慢慢慢蔓延到了每一户家庭 , 服务器内部 , 甚至是芯片的内部 。
那么我们这里面看到的就是光的经济边界 ,在不断的向交换芯片这个方向做内推 , 这里面就涉及到了光电的边界移动 , 随着信息爆炸 , 光进铜退的边界 ,50 年来一直向芯片端靠拢 。
这里跟大家分享一条时间线 , 上世纪 80 年代 , 我们有洲际电缆 ,90 年代是省际干线 ,2000 年代是有城域网 ,2010 年代中国光纤入户 ,2015 年之后进了数据中心机房 , 几十到几百米的距离 , 都是由光通信来覆盖的 。
那么到今天 , 机柜和机柜之间超过 1 到 3 米 ,也成为了光纤的天下 。 那么下一站就是机柜之内 , 芯片封装之内 ,也就是这个 CPO 的概念 。
边界移动 , 产业的重心也随着移动 , 从原来在电信市场 , 它的应用场景特点是长距离 、 高性能 、 小批量 , 切换到了现在我们叫数通市场 , 这也就是数据通讯市场 , 它的应用场景特点是短距离 、 拼成本 ,而且量大 。
那么后者恰恰是中国厂商崛起的地理 。 之前我们说的是通信网的百年历史 ,其实同一时期还有一条平行的时间线在流动 , 计算机的世界里 , 芯片和芯片 , 主机和外设 , 机器和机器 ,也是要通讯的 。
这条时间线的历史也可以用一句话来概括 , 就是并行改串行 , 单端改差分的历史 。 上世纪 60 年代 , 我们有一个串口叫做 RS-232, 它本质就是一根线上, 数据一位一位排队走 , 速率最大只能是 115 个 KB 每秒 。
这个我不知道大家有没有概念 , 可以想象我们现在 5G 的带宽已经到了 Gigabytes, 差了已经快一万倍了吧 。 那么放到今天 ,也就意味着我们在传一张手机照片 ,在这个速率下 ,是要三四分钟 。
后来在 70 年代 , 打印机 Synchronics 的并口出现 , 它是一个并行的概念 ,也就意味着我们用 8 根线同时各传一位数据 , 速率达到了每秒大概是一两兆字节 。
当时的直觉很朴素 ,8 根线一起跑 , 当然比一根线要快 8 倍 。 但是后面随着速率的上升 , 这种并行的方案也出现了很大的问题 。
这里面的核心的矛盾是 , 我 8 根线并行的话 ,而且它又放在一起 , 你在线材的制作工艺上, 第一 , 你没有办法保证这 8 根线一模一样 , 它就会导致了一个问题 , 就像好像我有 8 条不同的跑道 , 实际上长度是不太一样的 。
那么我同时发送 , 我到达终点的时候 , 它是先后不同到达 。 那么这个对通讯来说 , 实际上是一个很大的挑战 , 不同跑道之间 , 它的数据最后可能是没有对齐的 。在 2000 年之后, 整个行业又做了一次转身 , 放弃并行 , 全面转向串行 。2003 年,PCIe 登场 , 这里面一个关键点就是用到了差分信号的传输技术 。PCIe 的单通道 , 从第一代的 2.5Gbps 每秒起步 , 到今天的第七代
做到了 128Gbps, 单通道 23 年间快了将近 50 倍 。 那么同一个时期 ,USB 第一代从 12 兆每秒的速度 , 一路演进到了现在 USB 是 80Gbps 每秒 。
硬盘的接口 , 我们以前的机械固态硬盘用的是 SATA 口 ,但是这个已经不是最原始的这一代 , 原来最原始一代还有一个叫 ATA 接口 , 更古老的这种制式 ,也都是串行的 SATA 取代了并行的 ATA。
所有的这些转身 , 核心的思想只有一个 , 就是不再追求多根线同步 ,而是把单根差分线的速率做到一个极致 。
实现这个事情的电路 , 就是刚才我们反复提到的叫做 SerDes,Serializer Deserializer, 它的中文叫串行器加解串器 , 它是在发送端把我们需要的并行数据压缩在一根线上, 进行一个高速的串流 , 接收端再反向把它还原回来 。
数据是并行 。在电脑里的数据都是并行的 , 这些并行的数据一定要经过一个压缩 , 那么通过一个单个的接口 , 比如说 USB, 刚才提到的 HDMI, 视频信号接口 , 它最后都要经过一个压缩 , 把做一个串行转换 。
这个方法都是 SerDes。
对 , 这种方法就是串行和并行的转换 , 相当于是更有效率嘛 。 比如我本来有 10 条泥泞的农村小路 ,在上面我在上面运东西 , 最后我把它交汇到了一条平坦宽敞的高速公路上, 到了最后的终点 , 它又要还原成泥泞的小路 , 所以它还要把它还原回去 。
网络这条线它是输出同规的 ,以太网 1980 年从每秒 10 兆的共享同轴电缆起步 ,1988 年千兆 ,2002 年我们达到了万兆的速率 。
从万兆开始 , 这里面有一个分水岭 , 就是超过 100 米的以太网 , 基本只剩光纤这一种介质 。 数据中心里更是沿着 25G、100G、400G、800G 一路狂奔到 1.6T 的光模块 。
打印机线 、USB、PCIe、 以太网 , 看似它们是不同的江湖 , 底层是一同一套物理学 , 就是我们提到的 SerDes。 它的电信的光与计算机的电 , 两条河最终在数据中心汇流 , 汇流处站着的就是光模块 。
下面我们再讲讲中国光通信产业过去 50 年的需求牵引下的逆向攀登 。 我们把镜头转回中国 , 这 50 年的主线用一句话概括 , 就是中国是从下游往上游打的 , 先做光纤光缆 , 再做系统设备 , 再做光模块 。
如今我们现在在攻坚最上游的光电芯片 , 这是一场标准的逆向攀登 。 我们把它切断成五段 , 每一段希望有三样东西 , 让大家记住 , 一个是需求浪潮 , 一个是代表企业 , 一个是标志事件 。
国产征程1:21:13
这里面第一段是 1976 年到 1988 年, 我们有一个从 0 到 1 的过程 , 背景是 1966 年刚才提到过 , 高昆提出了光纤通信理论 , 十年之后,1976 年赵梓森是拉出了第一根实用化石英光纤 。
标志事件是在 1982 年提到过的 82 工程 , 武汉市化的光缆开通 , 中国的光通信从实验室第一次走向了实用化 。
第二段是 1988 年到 2000 年, 干线建设与引进消化的一个阶段 , 需求浪潮是我们全国长途干线 , 八纵八横骨干网 , 用十年建成 。
光纤的规模化供应 ,由 1988 年中外合资成立的长飞光纤解决 , 这应该也是一家上市公司 , 长飞光纤 。 设备侧是华为 、 中兴完成了第一次的突围 ,他们都是靠这个做万能交换机起家的 , 应该不是万能 ,但是可能整百能 。
烽火承接了武汉游客院的衣钵 ,也是做光纤 。 第三段 ,2000 年到 2012 年, 规模化与替代 , 世纪之交互联网泡沫破裂 , 全行业洗牌 , 活下来的开始收割 。
华为的光传输 ,也就是 WDM, 波分浮影和 OTN 的光传送网设备 , 份额跃居全球第一 。2009 年, 光讯科技 Asselick 上市 , 标志中国的光器件环节正式起步 , 长飞则朝着预制棒 、 光纤 、 光缆三项全球第一迈进 。
预制棒就是拉光纤之前的那根玻璃的母棒 , 这个是产业的真正上游 。 第四段是 2013 年到 2019 年, 宽带中国与数字通讯的崛起 , 国内光纤到户大规模部署 , 中国成为全球最大的介入市场 , 国外云数据中心兴起 , 带动 40G、100G 光模块的需求 。
旭创 、 新易盛这些公司靠精密制造 , 加快速工程迭代的一个组合模式 , 切入北美云厂商的供应链 。 这一段结束的时候 , 中国的身份变了 ,在电信设备的强国之上, 又叠加了一个全球光模块的制造中心 。
第五段是 2019 年至今 ,AI 时代的芯片攻坚 , 分水岭是华为被制裁倒逼之下,ODSP, 高速的 T&A 和光的驱动器 , 这些核心芯片的国产化全面提速 。在需求侧 ,AI 集群把光模块推到 800G、1.6T, 全球前十的光模块厂商 , 刚才提到中国占了七席 , 新战场也已经摆开 , 硅光 、LPO 和 CPO, 还有一个新的概念叫做空心光纤 。
空心光纤它里面就相当于光纤里面是真空的 。
有什么好处 ?
它的好处就是它的损耗还更低 ,但是它非常非常贵 , 它成本可能是现有光纤的好多好多倍 。
这个是不是中国制造会有其 GDP 的 ?
是的 ,是的 ,而且这个是一个比较早期的概念 ,由于成本太高 , 所以很多的方案 ,由于它的这个损耗更低 。
原来在技术端还是个早期 ,在资本市场里面已经被炒完了 。
因为这个东西实际上是太贵了 , 所以它的这个实际应用上还是一个比较大的问号 ,有点像是当年蓝光 DVD 的这种感觉一样 。
这是 50 年来中国第一次和世界站在同一条起跑线上 ,但有一句话我们要说清楚 , 最上游的高端光电芯片 , 就是 ODSP, 仍然是一个短板 。
对 ,因为我们刚才说了 AI 时代的计算是并行计算 , 数据并行 , 模型并行 , 流水线是并行的 , 所以每一个迭代的所有的 GPU 要相互传输中间的计算数据 。
所以有刚才我们讨论的在这个时代里面 ,GPU 的算力越强 , 卡间的流量就越大 。 如果网络的带宽跟不上的话 ,GPU 的长时间会等待数据 , 算力的这种利用率就会大幅下跌 。
所以从经济账上而言 , 拓宽整个的网络的传输的速度 、 速率 , 降低延迟是最高效的在经济上 。 也就是说我们现在形成了一定通讯的网络墙 ,AI 的交换机的端口从 400 到 800G 到 1.6T 的这种快速迭代 , 电信号的频率的翻倍的时候 , 铜缆最大的传输距离直接减半 。
这是刚才 Kevin 说的一个底层的原理 , 所以光通信的时代实际上被 AI 加速的推动出来 。 这就是去年我应该理解到的道理 。
去年我们应该录了一期节目 , 结果说现在时代变成了光站在这里的人。 我其实在 IG 里我也是光站在这里的 ,但是从产业的这个 。
你一直站在光里 。
座位上我是站在光里的 。
就是你虽然是专业人士 ,但是你在 A 股里也没有买这个 。
我不买 A 股 。
没必要 。
你已经布局了 。
这里面我们再结合我们刚才谈到的光模块的这些产业和历史 , 再结合我们的实物规划 , 讨论一下我们未来的方向 。
实物的展望里面 , 这里面核心的一个点题就是科技的自立自强 , 数字中国和光的下一个五年 。 首先在 2026 年 3 月 , 实物刚才规划的正式发布 ,18 篇中有两篇与我们的主题直接相关 。在这个 18 篇的第三篇里面 , 加快高水平科技自立自强 , 引领发展新质生产力 。
和第四篇里面 , 深入推进数字中国建设 , 提升数字化发展水平 , 规划把科技自立自强水平大幅提高 , 重点领域关键核心技术快速突破 , 列入五年主要目标 , 提出抢占科技发展制高点 。
数字中国专篇聚焦算力 、 算法 、 数据的高效供给与人工智能 + 行动 , 算力一条写得很具体 , 就是加快建设全国一体化算力网 , 适度超前建设新型基础设施 , 推进算力资源规模化 、 集约化 、 绿色化 、 普惠化 。
很像新闻联播的发言 。
刚要它是在壮大数字经济核心产业中, 把光电子器件与高端芯片基础软件并列点名 , 要求提升产业水平 。
政策逻辑翻译成白话就是全国一体化的算力网 , 节点是数据中心 , 连接节点就是光 , 东数西算 , 搬的是数据 , 这些数据走的都是光模块 。
算力网它的适度超前 , 落到物理层就是光纤光缆与光互联的一个确定性的需求爆发 。
这句话就是全国一体化算力网 , 节点是数据中心 , 那么连接的节点又是光 , 所以这句话点明了整个光的产业的位置 。
重要性 。
然后我们再讲讲为什么说中国的光产业链有备而来 , 先看我们这个整个产业链 , 首先要看它的这个完整度 。
这条链我们也简单介绍过很多次 , 从最上游到最下游 , 我们实际上是可以在中国的境内走完全程的 , 包括光纤的制造 , 里面涉及到预制棒 , 光纤的制造本身 , 光缆 。
预制棒长飞是三项的全球第一 , 往下游走器件封装 , 光模块制造全球前十的厂商 , 中国占七席 。
再往下就是我们下游系统设备 , 华为 、 中兴 、 烽火 , 最后还坐拥全球最大的网络运营市场 。 简单一句话来说 , 就是从一粒沙子到一座算力中心 , 全链条都可以在境内闭环 , 这个完整度在全球是找不出第二家的 。
闭环之上还有中国叠加了三重优势 , 第一重是速度 , 就是 AI 客户是按季度就要更换自己的算力需求 。
那么一款光模块从样品到百万支的量产的爬坡 , 谁快谁拿单 , 这个速度本身就是壁垒 ,而它恰好在中国制造的基因里 。
第二是需求托底 , 运营商 、 云厂商再加上国家算力工程 , 订单都在我们的自己的家门口 。 对国产 ODSP 芯片来说 , 这些订单给出的是最稀缺的东西 , 就是上机验证的机会 , 芯片装进真实设备 , 跑真实流量 , 暴露真实问题 。
请大家记住一句行业常识 , 芯片不上机永远成熟不了 。 我们作为国产厂商 , 经验是没有像国外那么丰富的 , 它导致的问题就是你必须得发现了一堆问题之后, 然后再去解决 。
我们为什么现在这个机会很好 ,是因为原来在这个 Marvell 和博通垄断的时候 , 国内的厂商你根本连上桌的机会都没有 。
它这里面的核心就是一个典型的强者同吃 , 就是你如果性能好 , 功耗够低 , 你这个东西卖多贵我都要 , 就跟现在英伟达显卡其实是一个意思 。
光模块里面的 ODSP 也是这个道理 , 就是只要你做得足够好 , 然后而且你的差距一定会和其他人会很大 , 所以我多少钱我都要 。
然后现在有两个因素 , 让国产化的 ODSP 产生了一个非常蓬勃发展的一个宏观趋势 。 第一是国产化的要求 。
国产 PDI。
对 , 这个是最重要的一点 。 第二是 AI 的需求爆发之后, 市场缺货 。 它缺货不光是缺现在 24G、1.6T 的光模块 , 它 800G、400G 都缺 ,因为这些都是上一代的产品 , 它可能之前都没有库存了 。
然后它现在的所有产能都放在了 1.6T 的光模块上 ,因为英伟达需要的是这些东西 , 甚至它还需要 3.2T 的 。
这样的话就导致了你如果还要原来的这些 , 它去向 Marvell 和博通下 ODSP 订单的时候 ,Marvell 和博通第一告诉你我没有货 , 第二告诉你我还要加钱 ,因为我现在所有的产能都放在了 1.6T 的这个光模块里 。
国内的数据中心集群 , 它的部署和需求比国外还是要落后两到三年的 , 这就意味着我们现在主要的主流一般是 400G 和 800G 的光模块 。
这个缺口这么大 , 国外厂商没有货 , 那么如果你能供货 , 哪怕你的性能没有博通和 Marvell 那么好 , 只要能够达到基本要求 , 客户有多少有多少 。
那也是个机会 。
第三重就是优势 ,是我们的换道窗口 ,因为硅光它用的是 90 到 45 纳米的成熟制程 ,不卡先进节点 , 所以封锁线画在先进工艺上, 硅光恰好就从旁边绕了过去 。
总结一下就是需求在国内 , 制造在国内 , 验证在国内 , 设计环节最后这一块拼图正在被补上 。
我问一些最基础的 , 就是硅光芯片和咱们一般说的像 GPU、CPU 这种计算芯片 , 还有我们说这个存储芯片 , 它有什么不一样吗 ?
有几个方面 , 简单的解释一下 。 首先是计算芯片 CPO、GPU, 它本质的发展逻辑还是靠晶体管的密度堆叠 。
我们随着半导体工艺的先进 , 晶体管的尺寸逐渐缩小 , 我同样的面积下, 我就可以布置放置更多的晶体管来提高我的算力 。
硅光芯片主要指的是我们刚才提到的这些 T&A, 还有包括了 PD, 就是光子探测器这些芯片 , 这里面本质上并不需要这么好的工艺 ,因为它不涉及到大规模的集成和堆叠的这么一个概念 。
石磊应该会比较明白 , 就是我们有时候物理学这个实验室里面 , 做光实验他自己搭这个光路的激光器 ,有的时候你这个激光器调的这个角度歪了一点点 , 它的整个光路的性能就会受到很大的影响 。
光模块本质上也是一个微缩版实验台 , 它对工艺的节点没有要求 ,70 纳米的工艺或者 90 纳米 、45 纳米都可以用 ,但是它对加工的精度有要求 ,因为比如说我的光子探测器它有一个平面 , 这个平面它要做得很平整 ,不能让光路发生这种弯折或者散射 。
加工制造的要求就和存储芯片这一点上有很大的区别 , 就对制程上没那么高要求 ,但是对于加工精度 , 所以它也是需要用一些 Foundry, 这个 Foundry 它也是要用像台积电这种 , 还是说大家都能 。
一般不是台积电 。 还有一点最大的区别是封装 , 封装在里面也很讲究 ,因为这个封装它 CPO 和 GPU 本质上都是电信号的封装 , 涉及到光器件的话 , 它这里面就是光的信号的封装 , 甚至是光电混合 , 这里面它的这种挑战和难度实际上也是光芯片设计的核心的壁垒 。
设计是一方面 ,但是更重要的甚至是封装 , 封装的整个方向和技术 。
等于说设计和制造环节都很重要 。
我们在这里面也再讲一讲 ODSP 的新生态 。 之前说过中国光模块产业链赢了面 , 没有赢点 , 这个点正在被一批国产高速 ODSP SerDes 的新锐补上 ,而且这个补法很有中国特色 , 它不是孤军攻坚 ,而是与本土模块巨头结成共生生态 。
它的分工是一个天然互补的关系 , 模块厂商手握真实的场景定义权 , 快速验证平台 , 首批订单与量产反馈 。
另一边这些 ODSP 的设计厂商提供一定化的响应 , 成本与供应安全 , 头部模块厂甚至直接以战略投资人的身份入股芯片公司 , 贴身替代 。
这正是当年 Infine 短剧和相关光模块做得非常成功的一家北美的创业公司 , 后来在几年前被 Marvell 收购 , 正是当年 Infine 与北美云厂商模块生态共同成长路径的一个中国翻版 。
只是这一次我们这个母体更大 , 我们有全球最大的光模块产能 , 再加上最强的国产替代意愿与耐心的资本接力 。
举几个例子 , 涉及到了国家的集成电路大基金 N27, 还有地方的集成电路基金 , 还有运营商资本 , 这个是任何海外 ODSP 初创公司都不曾拥有的成长环境 。
地缘因素我们再添了一把火 , 供应链安全诉求 , 让国产 ODSP 进入合规供应商名单 , 从加分项变成了必答题 。
下面这个是要敲黑板说三遍的重点 , 这里面想跟大家分享的相关的投资逻辑 。在 ODSP 行业 , 它是有极强的马台效应的 , 这一小节我们就可以用中国版的 Marvell 和博通作为一个类比来讨论 。
但是我们先看一看美国的先例 。 首先高速互联芯片 , 就是 ODSP 或者 SerDes, 它是一个教科书级的赢者通吃赛道 。
这里面有一个例子 , 就是博通的前身 , 最先是一个公司叫做中文叫安华高 , 叫 Avago, 它一路并购了 LSI, 博通 、Broadcast, 它把交换 SerDes 和光 DSP 的设计能力都攥在自己的手里 , 成为了今天的 Broadcom。
另一个马台效应跑出来的巨头是 Marvell, 它在 2021 年以约百亿美元的市值并购了 Infine, 一步买下了 ODSP 的王座 , 专注 SerDes IP 的加拿大的 RFV, 它在七年之内做到了 2.7 亿美元的营收 ,2025 年被高通以 24 亿美元的价格收购 。
它的机理很清楚 , 先进制程流片与 SerDes IP 研发投入巨大 ,但客户认证周期长 , 生态锁定强 , 一代领先之后, 公司就可以拿下大客户 , 从而导致出货量 、 摊薄研发 , 再进入到下一代的投入研发 , 可以实物发展的雪球越滚越大 。
打不赢的第二名 , 结局往往是被第一名买走 。
这个是技术密集 、 资本密集的 , 所以它需要一个闭环 , 然后不断的增强 。
我举个例子 , 为什么它是技术密集 , 就是刚才提到的设计里 , 它有很多复杂的模块 。SerDes 本身是一个很复杂的系统 , 它里面涉及到了很多 DSP, 就是数字部分复杂的算法 , 还有这些模拟部分的这种均衡设计 。SerDes 也是一个行为 , 它的封装 , 还有包括电源完整性 、 信号完整性 , 包括数字信号 , 它的处理不是需要一个时钟吗 ?
这个时钟实际上是嵌入在我们发送的信号里面的 , 这样你可以节省一根线 。 但是这个时钟在发送端嵌入到这个信号里面 ,在接收端做恢复的时候 , 这种时钟恢复也是一个很复杂的一个挑战 。
这些七七八八的任何一个做好 , 单独拿去作为市场的估值来讲 ,其实都是巨大的 , 那更不要提把它合在一起 。
这是技术壁垒的一个简单讨论 。 然后还有就是重资本的问题 , 大部分的公司它都是 Fabless, 就是它没有自己的制造 ,但是为什么它还是一个重资本 ?
这就涉及了首先人力成本开支就很高 , 包括现在在国内可能新毕业的毕业生从事这个行业 ,他的年薪在二线城市可能都能达到六七十万的水平 。
起薪 。
起薪 , 就是两三年的工资金 , 三四年的工资金 , 或者在一线城市 , 轻松可以达到百万的级别 , 或者是优秀的毕业生也可以轻松达到百万的级别 。
然后如果是相对资深的行业专家的话 , 两百万以上的水平 , 这都是很正常的一个薪资水平 。 这个里面由于整个系统的复杂度 ,他们每一个模块都是有很专业的人, 一个小团队来完成 。
雇佣这个团队做一个 ODSP 的设计的话 , 最少也需要一个一百人以上的团队 。 这里面涉及到了设计 、 芯片验证 , 还有整个封装 , 还有运营等等一些 , 至少要有一个一百人以上的团队 。
这一百人团队的工资一年的开支 , 技术团队就要一百人, 基本上是这样 , 关键就是这个情况 。
这是一方面 , 还有就是我们的设计用到的工具 , 比如 EDA 这些工具 ,Cadence 或者 Synopsis 这种辅助设计工具 , 它们的用户费用也是极其高昂的 。
它一般是按照每年每一个用户 , 可能就要有上万美金的这么一个费用 。 但是这不光是这些 EDA, 可能里面涉及到了其他的一些相关的工具 , 比如说我们在做封装的时候 , 做 PCB 这些七七八八的这种工具 , 这些的费用成本也都是非常非常高昂的 ,也是一个重资本 。
就它不在机器上 ,但是在你看不见的其他的 。
对 , 它是软件开销上 。 因为一个软件公司 , 它为什么是轻资本 ? 因为它用的这些编程的软件和平台 , 哪怕有费用 , 它的费用的门槛也是极低廉的 ,不会说到就是要上万美金一个用户一年的程度 。
回到我们刚才话题 , 同样的物理规律与经济规律叠加成就最大的本土模块产能与算力工程需求 , 中国是必然会有自己的 Marvell 和博通的 。
问题不是有没有 ,而是是谁和多快的问题 。 这里面也给大家介绍一个案例 , 这个不是建股 ,不是建品 ,有一个公司叫做吉易微 , 它是在 2019 年成立于上海张江 , 主要的研发的创始团队主要来自于硅谷 , 海归以高速的 SerDes 为底层核心技术 ,56G、1.2G 的 SerDes IP 已经实现商用 ,并向单通道 24G、PCIe 6.0 的标准在推进 。
芯片侧 ,他们已经将 400G 和 800G 的光模块 ODSP 与 400G 和 800G 的以太网 Retirement 产业化 , 再沿 1.6T 和 3.2T 的 Retirement 和 ODSP。 股东阵容折射生态与政策的双重加持 , 它头部模块厂商中机区创曾经战略入股 , 之后在后面的轮次的融资中更替退出 。
国家的大基金二期 , 中易资本 、 腾讯创投先后进入 ,2025 年完成股改 ,2026 年进入科创板的 IPO 进程 , 现在已经过审 。
它恰好站在了国产 ODSP 和模块生态与十五五政策窗口的焦点上 。 这里面我们也有一个风险提示 ,其一 , 赢者通吃 , 同时意味着多数参与者出局 , 国内的高速 SerDes、ODSP 团队不止吉易微这一家 , 压正哪一个的难度是很高的 。
第二是技术代差是一个很硬的门槛 , 就是如果这个团队做出了 112G, 它也只是拿到了 24G 技术研发产品化台桌的一个门票 ,但是它不一定能站得稳 , 所以它与双寡头的地位仍有身位差 。其三就是我们刚才提到的 LPO 和 CPO 如果快速普及 ,因为这里面都是不需要 ODSP 了 , 所以它会压缩 ODSP 的市场空间 。其四是 AI 资本与开支周期和新股估值波动 , 个股仅为产业
逻辑的具象案例 ,不构成投资建议 。
对 , 所以技术类的公司就是你在技术分叉点上面临着很大的风险 。
对的 , 所以实际上这里是有一个技术分叉点 。
对 。
在这里面我有两个悬念留给听众 , 第一是 AI 这波是否会重演 2000 年, 关键我们要看需求的真实性与折旧周期之间的辩论 。其二 ,CPO、LPO 还有提到的空心光纤谁会赢 , 这个可能取决于哪条成本线先弯折下去 。
投资思维1:40:31
我是想大家猜一下我们这期能听完的听众画像 , 估计得有理工科基础 。
应该是 , 我觉得首先得感兴趣吧 ,不感兴趣肯定是听不完的 。
第一感兴趣 , 我觉得第二你可以分几种 , 一种人是听技术的 , 这样人很少的 , 第二这种人是听这个产业发展主线的人, 还有就是听底层逻辑 , 这个产业发展它驱动力到底是什么 ,其实在这里面已经把它分析得很清晰的 。
你可以有不同视角来听 。其实也可以把这期的文字稿喂给石磊 , 可以 , 喂给石磊的 skill, 让他解读一下 。 所以我的问题就是我们怎么参与一个新赛道 ,但是我又可能不是很懂 , 这个问题其实我也想机会讨论讨论 。
我们有一些产业研究的一些范式 , 可以跟大家来分享一下或者套用一下今天我的个人的一个收获 。 第一 , 可能研究一个新的产业的时候 , 我们需要先建立对这个产业生态的理解 , 这生态包括什么呢 ?
第一就是产业主体 , 产业的主体之间的关系 , 就是产业的结构和产业主体的每一个动作 , 它的动力机制 ,其实我们在今天这里都谈过了 , 结构 、 主体 、 动力机制 。
比如说开篇敏姐说的产业的结构 , 包括上游的材料芯片 , 包括发光收光 , 还有信号处理的核心芯片 , 中游的器件模块 , 光路的封装 , 光互联的成品 , 还有下游的整机设备 , 它是用来把光互联的部件整合成一个交换机传输设备 , 到终端的客户 , 再到一些配套的像电源代工 、 封测 、 设备 、EDA 这些支持 ,其实我们刚才都提到了 , 这就是产业的
结构 , 产业的生态 。 然后在这个比较静态的产业生态之后, 基本摸清楚 , 我相信通过 AI、 通过研究员 、 通过别人的研究 ,其实我觉得第一个部分就可以明确 。
第二个部分我觉得是需要一些洞察力的 , 就是要洞察这个产业生态的主要矛盾 , 还有就是基于这个主要矛盾推演产业可能的发展路径 。在这里刚才 Kevin 说了很多 ,其实是在这里 , 就是产业的主要矛盾在哪 ?
第二 , 这个矛盾带来的未来哪几条路径来解决这个矛盾 ? 比如说刚才我们提到光通信产业发展 , 它的矛盾正好是从 AI 产业发展把它推动的 。
通信的信号本身从我们的电报 、 电话 、 互联网 ,其实这里没什么矛盾了 , 解决了 。 到了 AI 大的发展之后, 主要矛盾就变成了 AI 的并行计算带来的快速的发展要求 , 更大的通信的带宽 , 还有更低的延迟 ,而原有的技术只是支持互联网级别的通信的 , 所以就带来了新的矛盾 。
传统互联网时代 , 它的增长是驱动是人来访问机器 , 所以它的增速是比较平缓的 ,而 AI 时代它的流量是机器访问机器 , 所以万卡集群 , 所以整个同步的流量会有爆炸式的增长 ,而光互联的扩容速度 , 它会跟不上算力的扩张速度 , 会形成网络墙 , 直接压低了 GPU 的有效算力的利用率 , 所以就形成了主要的矛盾 ,并且 AI 的算力是三到四个月
会翻一倍 ,而 GPU 的集群互联带宽的需求也是指数级的增长的 , 所以带宽对 GPU 很重要 。 这个矛盾点和 HBM 它的矛盾的来源是一样的 ,并且在全套的这个智算中心设备总投资里面 , 光通信的设备占比大概有 5% 到 8%, 比例也是很高的 , 对 , 算是比较大的一块了 , 所以这是矛盾 。
然后另外我们看到刚才讨论的一些可能的发展路径 , 比如说刚才说是有 LPO, 对吧 ,有 NPO,有 CPO, 还有空心光纤谁赢 ?
这是刚才 Kevin 做出来一个最重要的 , 我觉得未来的设想的一个总结 , 虽然是个问号 ,他表达了可能的路径 。LPO 这种可插拔的线性光模块 , 它属于光模块内部架构的一些改良 , 当然它更依赖于刚才说的 SerDes 这个模块的发展 , 还有系统架构的一些协调 。CPO 的这种光电共封装 , 它是重构了交换机整机架构 ,并且属于一个系统封装的底层的一种革命 , 它是放在 GPU 里面
的 , 包括空心光纤 , 它是一个传输介质的替代 , 它把实心的这种玻璃光纤换成空气来导光 , 它属于一个底层传输介质的一个革新 , 所以这又是可能发展的不同的路径 。
这三条路线的性能上限可能陆续的都能解决 AI 算力发展带来的这种通信带宽的矛盾 ,但是由于短期的硬件成本 , 长期的全生命周期的成本 TCO, 它的这种下降的斜率 、 下降的速度决定着未来的市场风格 。
这就是我们说复杂系统演化过程中, 它是有路径依赖的 ,而路径依赖在这个关键分叉点之前 ,其实是没法预测的 。
那么谁先实现了良率的提升 、 成本的降低 , 谁就会率先占领主流的场景 。 当然更可能的是一种陆续的这种接力 、 多头并进的一些格局 。
这是把我们刚才的这个做一些总结 , 就是产业矛盾的发展的可能的路径 。 第三步就是在可能的发展路径上会设立一些关键的路标 , 比如说刚才提到的取决于哪条成本曲线先弯下去 , 这样一个问题就引发了 , 这是一个关键的路标 , 成本曲线的下行的速度 , 还有它能占领的场景 。
了解了这个之后, 第四个问题就是根据不同的发展路径 , 我们可以选取合适的估值模型 。 到这其实才到了金融的部分 , 就是路径 , 你这条路径的确定性 , 你这条路径的持续的时间 , 市场的规模 , 天花板在哪里 , 竞争对手 , 你有没有壁垒 。
我觉得新的产业 、 新的技术最不确定的东西就是久期 , 就像最近市场其实变化很大 , 基本面上看 , 产业上看其实没什么变化 ,但是市场你会发现 ,因为 PEG 的估值模型要求的是你那个 G 和它的增长速度和增长速度的预期 ,也就是说它是一个二阶的关系 , 它根本不是说你未来是不是会达到 ,而是说你什么时候达到 , 你什么样的速度达
到 , 决定了你的估值 。 所以在投资领域里 , 估值模型的选择 , 甚至在一定阶段上 ,由于产业矛盾的变化和产业环境的变化 、 不确定性的变化 , 会带来市场切换估值模型 , 这也是带来最大的波动的主要的原因 。
所以要明确估值模型 ,并且匹配产业发展路径之后, 我们就可以根据不同的估值模型的特点 , 你到底是一个不断加强的正反馈的驱动路径 , 还是一个不断回归型的路径 , 那选择自己的一个交易执行系统 。
交易执行系统实际上是一个适应性的纪律系统 。 总结下来就是基于对这个沙盘的设想的可能的路径 , 还有基于观测的这些路径上的路标的反馈 , 我们可以来动态建立一些策略 ,并且这个策略一定是建立在一些估值模型 ,也就是我们上一期说的 , 根据你的洞察会建立一个应染世界 ,在你的世界里的应染 , 然后应染世界映射着一个估值 , 根据这个估值模型的特点 ,
我们去建立一个适应性的交易系统 , 那这才完成了一个闭环 。
最后结论就是你的审美 。
是的 , 这样想起来投资真的是很辛苦的一件事 。
真的 , 我今天听完觉得太辛苦了 。
前半场 Kevin 说了那么多 ,在前三个环节 , 后面还有两个环节 。
对 , 我们站在桌子上刚好是一个互补的功能 , 就是这个东西怎么回事 , 具体的技术细节我都能讲得很清楚 。
你要问我这股票值多少钱 , 该不该买 , 这个问题我自己回答不了 。
确实 , 刚才像 Kevin 讲的还有路径的选择 , 就哪怕在这个时间点觉得这个千好万好 , 实际上它不走这条路线也都是白瞎 。
对 ,但是这个涉及到的就是刚才我们提到的这个路线之争 , 这是一方面 ,但是我个人的看法 , 最先有机会下一步的话就是 ODSP, 它其实跟路径关系没有太大关系 ,因为刚才也提到了 , 就是我们的整个的分析里面 , 可插拔的这种光模块的形式 , 一定是以后大概率是会和这种 CPO 这种共存的 , 一定会存在 。
第二 , 海外就相当于国内要国产替代 , 就是它永远是会有市场和存在的 , 可能是一个很确定的事情 ,但是就是光是国产替代化这条主线所带来的价值 , 应该已经是足够值得关注了 。
最后一部分 , 刚才敏姐说要如何参与一个自己可能不懂的新赛道 , 我觉得第一是如果自己可能不懂就先别参与 。
对 , 如果要参与就得先找懂 。 所以我觉得参与一个自己觉得可能不懂的 , 这个是挺危险的一个事情 。 找懂一个新赛道确实挺难的 , 尤其是像光模块这种这么复杂且技术变化又很快的一个赛道 。
就我自己而言 , 首先我会觉得不是每个赛道都需要找懂 , 哪怕是做投资也是一样的 , 就不是每个赛道都需要找懂 ,也不可能都找懂 。
我觉得大家是不是要找懂这个赛道 , 取决于第一是你自己本身的兴趣 , 包括过往学习工作的经验和这个是不是相关 , 然后以及是不是你有其他自己更懂的赛道 。
我觉得这个是可以大家去考虑的 , 就不是每一个投资者都需要去找懂每一个热门的赛道 。 再有就是我觉得找懂一个新赛道要花好多的时间 , 我觉得一定要有耐心 , 别想着说最近这些特别热 , 我两天找懂 , 第三天我就下单 。
我觉得这个风险其实比较大的 , 就我觉得大家找懂一个新赛道其实要花很多时间的 , 我觉得大家要有耐心 , 机会我觉得永远也有 ,不是说我这周末我就要找懂 , 下周一我就要做投资决策 , 我觉得这种会非常的仓促 。
别着急 , 别 FOMO。
对 , 就别是为了买而去研究一个新赛道吧 , 找懂一个新赛道确实要花很多时间 。 然后我觉得在 AI 的帮助下, 确实能够帮大家提高这个效率 ,但是如果大家都用 AI, 那大家得出的结论都是一样的 。
所以我觉得可能像 Kevin 这种产业里有特别深入洞察和一线经验的人 ,是非常重要的事情 。
距离这些专家要近 。
是 , 沟通频率要高 。
把 Kevin 聘为你的专家库 。
你听到了吧 , 人家的这个年薪 。
我没听到 。
我们属于重资本行业 。
对 。
资本主要年薪带着人。
说二线的就七八十万新毕业的是吧 。
二线大概六七十万吧 , 然后一线的话可能百万都不到 。
而且那个是刚毕业的是吧 。 好 , 那我们今天节目就到这里了 。 说实话 , 这个也是我们节目开播的七十多期以来 , 我感觉是最硬核的一期 , 算吧 。
是 , 世界领先 , 我们也达到了世界领先的水平 。
对 , 没错 , 信息量巨大 。Kevin 一路从光猫数据中心讲到了 CPO、 硅光 、 实物计划 , 整个把光通信产业链 , 尤其光模块板块给我们捋了一遍 , 整个就是一篇非常非常完整的行业研究报告 ,而且是业内顶尖人士的行业研究报告 , 应该对大家很有帮助 。
如果能听得明白的话 , 刚才我也说了 , 我会把这期的文字稿尽量不改动放到我公众号 , 我也没有能力改动 , 放到公众号里 。
如果你听完之后还是意犹未尽或者有些问题 ,也欢迎在评论区给我们留言 , 告诉我们你最感兴趣或者没听懂的哪个点 , 我们也可以请 Kevin 一步评论区答疑 , 可以吧 ?
好的 。
好 , 感谢感谢 , 感谢 Kevin 这次带来这么扎实的内容 ,也感谢孙悦的来访参与 , 当然也要感谢大家听到这里 。
那我们这期节目就到这里了 , 我们下期再见 , 拜拜 。
拜拜 。
