光子学在芯粒系统中已不再只是替代铜互连和提高带宽的手段。光子芯片越靠近处理器,信号传输距离和能耗就越低,但与此同时,系统对热、机械应力、电磁干扰和验证问题的敏感性也会增加。结果是,将光集成到封装内部已经成为一个共同设计问题,涉及芯粒、封装、互连以及系统内部的通信网络。
目前,半导体公司正逐步将集成光子电路(PIC)与高性能处理器、网络交换机和内存芯片置于同一封装中,这一趋势被称为共封装光学(CPO)。光子芯粒架构也开始出现在人工智能数据中心的初步设计中。该来源指出,原型、专用专利和初步商业设计的出现,反映出这项技术正从研究领域迈向更接近实际应用的阶段。
从可插拔互连到封装内集成
TSMC推出了Compact Universal Photonic Engine架构,简称COUPE,将其作为大规模生产光子芯片的开放框架。该架构不再是将电子控制芯片(EIC)和光子芯片(PIC)并排放置在基板上,而是采用垂直堆叠,使控制芯片位于光子芯片之上,并使用铜-铜混合键合取代传统焊球。
据TSMC称,这种布局可缩短信号传输距离,将电寄生电阻降低到接近零的水平,并可将数据传输能耗降低最多85%,同时改善高密度人工智能集群服务器中的空间利用率。然而,这些电气方面的收益也使发热的控制电路非常靠近对温度敏感的光学器件,从而使近距离这一优势转化为新的复杂性来源。
在2.5D设计中,处理、内存、电子接口和光子芯片并排放置在硅中介层、有机基板或先进重分布层上。这种方法更加成熟、风险更低,也允许将光子芯片与不同的处理芯粒重复使用。但EIC与PIC之间的互连长度会增加寄生电容和寄生电感,从而限制调制器的运行速度。
而在采用混合键合或微型互连的三维堆叠中,驱动电路、调制器和光电探测器之间的电气互连可从毫米缩短至微米。这能够实现更高的波特率、更低的驱动电压以及更低的每比特能耗,但也使热设计和机械设计更加困难。Intel、TSMC、Ayar Labs和Broadcom等厂商的共封装光学路线图正朝这一方向发展。
热量不仅是性能问题
硅的折射率会随温度变化,这可能改变光学器件的相位和中心波长。根据相关材料,硅微环的波长可能以每摄氏度约70至80皮米的幅度发生偏移。因此,光子电路可能仍保持电气连接并在逻辑上正常工作,但由于谐振不再与激光波长匹配,其光学性能会下降。
在垂直堆叠中,这一问题会更加严重,因为SerDes和驱动电路可能在距离必须保持狭窄温度范围的谐振器仅几微米处耗散数瓦功率。激光器的效率、功率、波长和寿命也取决于温度。此外,硅、有机基板、玻璃、铜、黏合材料、III–V族半导体和通信光纤之间的热膨胀差异会产生应力,可能影响芯粒或对准。
因此,仅冷却处理器是不够的。热设计必须涵盖芯粒堆叠、中介层、基板、盖板、热界面材料、冷板、光学连接器、光纤布线以及空气流动或液冷环境。光子芯片可以采用加热器、传感器和主动调谐机制来补偿漂移,但这些机制会增加需要验证的控制电路和运行状态。
光学边界处的验证鸿沟
UCIe等电气接口拥有可通过形式化验证方法分析的契约和协议,包括证明不存在死锁状态和协议违规。然而,据Axiomise首席执行官Ashish Darbari称,位于该接口之后的光学系统并不具备同等水平的规范和严谨性。由此产生了一个重要鸿沟:电气接口可能已经通过形式化验证,但光子部分的行为、温度边界、调谐机制和错误概率仍缺乏充分定义。
这一点更加敏感,因为热调谐算法中的错误在现场可能表现为器件的物理故障。因此,该来源建议将系统视为一组“假设—保证”契约:封装保证特定的温度范围,调谐环路则保证在该范围内达到稳定状态。至于数字控制逻辑、UCIe接口和状态机,则可以使用当前已有的形式化验证工具进行验证。
系统设计人员在实践中将面临哪些变化?
最重要的启示是,光子学的位置不应在器件选定之后才确定。Darbari建议先从数据流模式入手,然后确定瓶颈是在封装边界、机架层面还是机架之间。Arteris的Guillaume Boillet认为,光子芯片可以在内部网络中表现为一个高带宽端点,但网络必须能够以所需速率为其提供数据。
相关建议是首先确定带宽、时延和功耗预算,将数据流分类为对顺序和一致性敏感的流以及大规模连续流,然后确定哪些互连确实需要离开封装。只有在此之后,选择CPO、NPO或特定类型的光子芯片才会成为合理的决定。此外,应将热验证和电气—光学接口纳入架构工作,而不是推迟到最终认证阶段。
这并不意味着光子学将处处取代铜。归于Jensen Huang的观点用一句话概括了这一趋势:在必要之处使用光学,在可能之处使用铜。根据相关材料,铜仍适用于机架内或封装内的短距离,而在封装之间、机架之间以及电气互连在能耗和带宽方面变得昂贵的距离上,光学更具优势。真正的变化在于,这一决定不再是硅设计完成后由网络部门作出的后续决定,而是必须从一开始就由处理、封装和互连共同参与制定的架构约束。