光的矩阵运算:MZI 网格如何把矩阵乘法写进芯片

引言:光计算的两条路线

上一篇文章解读的 D2NN 走的是”衍射”路线:光穿过多层衍射面,传播过程本身就是一次前向推理,网络权重被”冻结”在器件结构里。这条路线最大的优点是推理速度接近光速、没有电子计算参与;但它也有一个明显短板——权重一旦刻进结构就固定了,想换一个任务就得重新设计制造。

这篇文章介绍的是另一条路线:干涉型可编程光计算。它的核心器件是马赫-曾德尔干涉仪(Mach-Zehnder interferometer,MZI)——一个在光通信里用了半个世纪的”老熟人”。把它排列成网格,再配上可调的相位器,就能在同一块芯片上实现可编程的矩阵乘法:今天算这个矩阵,明天改几个电压,同一块芯片就能算那个矩阵。

单个 MZI:一个可以”拧”的光学分束器

MZI 的结构非常简单:光进来后先被第一个分束器分成两路,两路各自走过一段光程,再在第二个分束器处合束干涉。如果两臂之间有相位差 $\varphi$,那么两个输出端口的功率之比就是

$$P_{\text{out1}} = P_{\text{in}} \cos^2\left(\frac{\varphi}{2}\right), \qquad P_{\text{out2}} = P_{\text{in}} \sin^2\left(\frac{\varphi}{2}\right)$$

换句话说,一个 MZI 就是一个旋钮:拧动相位 $\varphi$,光能就在两个输出口之间连续分配。

图 1:MZI 结构示意:两个分束器夹着两条干涉臂,相位差 φ 决定两个输出端口的功率分配。

图 2:MZI 透射率随相位差变化的曲线:输出功率按 cos²(φ/2) 在端口间分配,φ=0 时全光进入一个端口,φ=π 时平分。

在实际硅光芯片上,这个”旋钮”通常由热光移相器实现——在一条臂上贴着微加热器,通电后局部温度升高、折射率改变,等效于改变 $\varphi$。控制电压就是控制相位,控制相位就是控制光往哪边走。这就是”可编程”最底层的含义。

从单个 MZI 到矩阵:Reck 分解与 SVD

单个 MZI 只能处理两路光,做不了矩阵。但级联起来就不一样了。1994 年 Reck 等人证明了一个关键结论:任何 N×N 的酉矩阵,都可以分解成一系列”2×2 旋转 + 移相器”的级联。而每一个 2×2 旋转,恰好就是一个 MZI 能干的事。

于是硅光芯片上的做法很直接:把 MZI 摆成规则的三角或矩形网格,每一个 MZI 对应矩阵分解中的一个旋转,每一个移相器对应一个可调参数。整块网格的传输矩阵就是所有 MZI 的乘积——也就是你要的那个酉矩阵。

图 3:硅光 MZI 调制器结构示意:输入光被分束、一臂移相、再合束,输出随相位变化。

那非酉矩阵怎么办?机器学习里的矩阵不都是酉的。答案是用奇异值分解(SVD):任意实数矩阵 $M$ 都可以写成

$$M = U ; \Sigma ; V^{\dagger}$$

其中 $U$、$V$ 是酉矩阵,可以用两组 MZI 网格实现;$\Sigma$ 是对角矩阵,对应一路路的增益或衰减,用可调衰减器实现。三者串起来,一块芯片就”算”出了 $M$ 与输入向量的乘积。

2017 年 MIT 的 Shen 等人就在硅光芯片上用这套方案实验演示了语音分类:光载着输入信号穿过 MZI 网格,输出端的光强分布直接给出分类结果。2022 年 Ashtiani 等人更进一步,把 MZI 网格、光电探测和后续处理集成到同一颗芯片上,完成了片上图像分类。

非线性的难题:为什么总要”电”帮一把

到这里,MZI 网格解决的还只是线性部分——矩阵乘法。但神经网络不能只有线性变换:没有非线性激活函数,多少层线性网络叠加起来还是一个线性网络,表达能力有限。

光学里做非线性比电子里难得多。材料的非线性效应要么太弱(需要很高功率),要么太慢(跟不上高速推理)。目前最实用的方案是光电混合:MZI 网格在光域完成矩阵乘法,输出被光电探测器转成电信号,电子电路做非线性激活(比如 ReLU),再调制回光进入下一层。2022 年 Ashtiani 的芯片走的正是这条路线。

这也是 MZI 网格和 D2NN 的一个关键差异:D2NN 追求”全光、无电”,但缺少非线性;MZI 网格牺牲了”纯光”的纯粹性,换来的是可编程性和实用的非线性路径。

一张表看清:MZI 网格 vs D2NN

表 1:干涉型 MZI 网格与衍射型 D2NN 的对比

对比维度 MZI 网格(干涉型) D2NN(衍射型)
权重实现 移相器相位(电可调) 衍射层几何结构(固定)
可编程性 强:改电压即换任务 弱:重新设计制造
非线性 需光电混合方案 需外接或材料非线性
集成方式 硅光芯片,CMOS 工艺 衍射层 + 探测器
典型速度瓶颈 移相器调谐速度 光传播本身接近光速
适用场景 需频繁重配置的任务 固定任务、极致低延迟

展望:从”算得对”到”算得快、算得省”

MZI 网格证明了光能做可编程矩阵乘法,但从实验室到实用还有几道坎:一是移相器精度和热串扰限制了矩阵的规模与保真度;二是热光调谐慢、功耗高,电光方案又难做;三是芯片损耗随级联层数累积,规模越大越吃亏。这些正是当前硅光可编程光计算研究的主战场。

参考资料

  • Shen, Y., Harris, N. C., Skirlo, S., Prabhu, M., Baehr-Jones, T., Hochberg, M., Sun, X., Zhao, S., Larochelle, H., Englund, D., Soljačić, M. “Deep learning with coherent nanophotonic circuits.” Nature Photonics 11: 441–446 (2017). DOI 页面
  • Reck, M., Zeilinger, A., Bernstein, H. J., Bertani, P. “Experimental realization of any discrete unitary operator.” Physical Review Letters 73(1): 58–61 (1994). DOI 页面
  • Ashtiani, A., Geers, A. J., Aflatouni, F. “An on-chip photonic deep neural network for image classification.” Nature 606: 207–216 (2022). DOI 页面