文献解读 | 片上复用衍射神经网络:把多任务写进一块超表面(Light Sci Appl 2022)
论文简介
本文解读的是 2022 年 5 月发表在 Light: Science & Applications 上的论文:Metasurface-enabled on-chip multiplexed diffractive neural networks in the visible(DOI 10.1038/s41377-022-00844-2,arXiv 开放全文),作者是湖南大学的罗旭豪、胡跃强、段辉高,以及合作者欧祥年、李鑫、赖佳敏、刘娜、程鑫彬、潘安练。
一句话概括:这篇论文用”偏振复用”把多个衍射神经网络同时写进同一块超表面,并直接贴到 CMOS 成像芯片上——光穿过超表面,芯片一次曝光就能同时完成多个识别任务。 手写数字和时尚物品的分类可以在两个偏振通道里并行完成,全部发生在光传播与光电转换的瞬间。
引言:从”自由空间里的网络”到”芯片上的多任务”
2018 年,Science 上发表的 D2NN 首次证明:把神经网络”刻”进多层衍射面,光穿过器件的过程就是网络前向推理的过程,推理速度接近光速。但自由空间的 D2NN 有两个先天短板:一是系统体积大——输入平面、衍射层、探测器之间要保持一定的衍射距离,整体是个”台式”装置;二是它一次只能干一件事,网络权重训练好就固定了,无法像大脑那样同时处理多种输入。
Luo 等人的工作同时回应了这两个问题:体积上用超表面替代厚衍射层、并把探测器换成商用 CMOS 成像芯片,做成”芯片级”器件;多任务上用偏振复用,让同一块超表面在不同偏振下”扮演”不同的网络——相当于在 0.1 平方毫米的芯片上塞进了多个各司其职的分类器。
核心思想:偏振复用 = 一块超表面里藏多个网络
理解这篇论文,先要抓住一个事实:一个普通衍射网络的所有权重,就是超表面上每个像素的相位。 如果这些像素的相位能同时”看偏振”——x 偏振光看到的是一套相位分布,y 偏振光看到的是另一套——那么同一块超表面就同时是两个不同的网络。
这正是超表面的拿手好戏:亚波长纳米柱在 x 和 y 两个正交偏振下可以独立调制透射光的相位(分别记为 $\varphi_{xx}$ 和 $\varphi_{yy}$)。论文把这两套相位分布分别训练成两个分类器的权重,光以 x 偏振入射时走”通道 1”,以 y 偏振入射时走”通道 2”,输出端互不干扰。
图 1 是论文的架构示意:多通道输入 → 偏振复用超表面(隐藏层)→ CMOS 芯片上的分区域检测器(输出层)。

图 1:集成在成像传感器芯片上的多路复用超表面衍射神经网络(MDNN)示意图。(a) 人类大脑的多通道感官包括视觉、听觉、嗅觉、味觉和触觉,其中视觉可细分为物体识别、手势识别、字符识别与人脸识别等;(b) MDNN 架构:多个网络的 meta-neuron 分别训练,获得复用的相位分布,光穿过超表面后由芯片上的检测区域直接读出。
架构:掩模输入 → 超表面隐藏层 → CMOS 输出
论文的网络结构与电子神经网络一一对应:
- 输入层:要识别的物体以光场形式进入网络——论文用振幅掩模(镂空的铝膜)把”0””1””T 恤””运动鞋”等图案编码进入射光,一束 532 nm 的平面波照上去,透过的光就带着输入信息;
- 隐藏层:偏振复用超表面。每个亚波长像素就是一个”meta-neuron”(元神经元),它的相位就是权重;光经过超表面后被逐点调制并继续向前衍射传播;
- 输出层:CMOS 成像芯片上的检测区域。芯片表面被划分成若干个区域,每个区域对应一个类别;哪个区域收到最多光能,网络就”认为”输入属于哪一类。
光在输入掩模、超表面和 CMOS 之间的传播遵循惠更斯-菲涅尔原理——波前上每一点都是次级球面波的源,下一层波前由这些次级波的包络决定。这就是衍射网络的”连接方式”:不需要物理连线,衍射自然把每个输入点的信息散布到所有输出点。
设计细节:TiO₂ 纳米柱与”神经元密度”
论文的 meta-neuron 是二氧化钛(TiO₂)纳米柱:高度 600 nm、周期 400 nm、工作波长 532 nm。每个纳米柱的横向尺寸($D_x$、$D_y$)独立可调,从而在 x/y 偏振下分别获得所需的透射相位(和透射率),用 FDTD 仿真标定。
一个值得注意的数字是神经元密度:像素周期 400 nm,意味着每平方毫米可以有 6.25×10⁶ 个 meta-neuron——这是单个通道的密度,偏振复用再乘以通道数。相比传统空间光调制器(像素毫米级),超表面的神经元密度高出几个数量级,这是它能”贴”在指甲盖大小芯片上的物理基础。
图 2 是 meta-neuron 的设计细节:单元结构、双偏振相位响应、SEM 照片,以及一个用于验证偏振复用的双焦点金属透镜。

图 2:多通道 meta-neuron 的设计。(a) 单个 TiO₂ meta-unit 示意图,高度 H 固定,结构尺寸 Dx、Dy 可调,每个 meta-unit 充当一个经机器学习训练、具有多路复用相位分布的神经元;(b–e) x/y 偏振入射光下透射系数(Txx、Tyy)与相移(φxx、φyy)的仿真值,入射波长 532 nm、纳米柱周期 400 nm、高度 600 nm;(f)(g) 制造超表面的 SEM 图像(俯视图/侧视图),比例尺 1 μm;(h) 双焦点超表面,用于演示两个正交偏振下的独立相位调制;(i) 焦点强度场的仿真与实验结果,绿色箭头对应 x 偏振、蓝色对应 y 偏振。
训练:误差反向传播,但前向模型是物理
MDNN 的训练与电子神经网络几乎一样:把网络当作可微分计算图,用交叉熵损失 + 随机梯度下降做误差反向传播。唯一的区别是前向传播模型不是抽象的矩阵乘法,而是真实的衍射物理——用标量衍射传播描述光从输入到输出的过程,再用 FDTD 验证单元相位响应的准确性。
论文对 MNIST(手写数字)和 Fashion-MNIST(时尚物品)两个数据集分别训练了两个偏振通道的分类器,数值仿真中训练收敛精度都达到 99% 以上。图 3 展示了训练收敛曲线,以及神经元数量、检测区域大小对精度的影响。

图 3:MDNN 的数值演示。(a) 相位调制 MNIST 与 Fashion-MNIST 的训练收敛曲线,插图为两个分类器的性能对比,两者精度相近且随隐藏层层数增加可进一步提高;(b) MNIST 数据集分类精度随神经元数量的变化(不同检测区域尺寸);(c) 检测平面上的仿真输出模式与能量分布百分比。
实验:双通道双任务,CMOS 直接出结果
论文做了完整的实物验证:
- 制造了偏振复用 TiO₂ 超表面,单个隐藏层含 280×280 共 78400 个 meta-neuron,面积 112×112 μm²;
- 输入用镂空铝掩模:通道 1(x 偏振)识别手写数字”0”和”1”,通道 2(y 偏振)识别”T 恤”和”运动鞋”;
- 输出直接由 CMOS 成像芯片采集——这是”片上”的关键:光穿过超表面后,芯片上的检测区域直接读出能量分布,不需要额外镜头;
- 实验分类结果与仿真96% 一致,能量正确聚集到目标检测区;残余偏差主要来自偏振片无法完全消除正交偏振光(串扰)。
在贴到 CMOS 之前,论文还用 CCD 在 0–100 μm 的衍射距离上验证了输出图像,确认器件行为符合设计。
图 4 是实验演示:器件与 CMOS 的集成示意、实物照片、掩模输入以及双通道分类的能量分布。

图 4:片上 MDNN 的实验演示。(a) 与 CMOS 芯片集成的 MDNN 分解示意图;(b) 片上 MDNN 实物照片;(c) 单个制造在 CMOS 成像传感器上的 MDNN 光学显微图;(d) 铝沉积后(左)与加 spacer 层后(右)形成的掩模;(e) 左:MDNN 的仿真输入/输出及其能量分布;右:最终超表面器件(上)、成像传感器探测到的输出场强(中)与实验结果的能量分布(下),比例尺 20 μm。
意义与展望
意义:这篇论文把”全光学习机”从自由空间推进到了芯片级,并且首次把”多任务”做进超表面光计算:偏振复用让一块静态超表面同时承载多个网络,神经元密度达到每平方毫米数百万量级,输出端直接是商用 CMOS——整个识别链路(光传播 + 光电转换)没有电子计算参与。这为机器视觉、自动驾驶、精准医疗等对速度、功耗和体积敏感的”前端识别”场景提供了可集成的物理层方案。
展望(从原理验证走向实际应用,仍有待推进的方向):
- 规模与复杂度:实物验证是单隐藏层 280×280 神经元、双通道各识别两类物体;论文指出更复杂任务需要多层网络(套刻光刻制造),多层片上超表面的对准与效率是下一步值得攻克的方向;
- 真实场景输入:实验用铝掩模编码输入,实际应用需要把真实场景的光学信息耦合进 112×112 μm² 的孔径,前端光学方案是走向落地的重要一环;
- 偏振隔离度:输出端能量有少量串扰(实验与仿真 96% 一致),改进偏振片的消光性能可进一步提升通道隔离度;
- 非线性能力:光传播是线性过程,MDNN 目前没有非线性激活层,引入光学非线性是扩展表达能力的方向;
- 集成距离:超表面与 CMOS 之间仍需要一定衍射传播距离(验证时 0–100 μm),进一步压缩到”零厚度直接贴合”是工程化的目标。
参考资料
- Luo, X., Hu, Y., Ou, X., Li, X., Lai, J.-M., Liu, N., Cheng, X., Pan, A., Duan, H. “Metasurface-enabled on-chip multiplexed diffractive neural networks in the visible.” Light: Science & Applications 11(1): 158 (2022). DOI 页面 · arXiv 开放全文
- Lin, X., Rivenson, Y., Yardimci, N. T., Veli, M., Luo, Y., Jarrahi, M., Ozcan, A. “All-optical machine learning using diffractive deep neural networks.” Science 361(6406): 1004–1008 (2018). DOI 页面
- Luo, X. et al. “Metasurface-enabled on-chip multiplexed diffractive neural networks in the visible.” Semantic Scholar 记录(被引 282 次,2026-08-09 检索). Semantic Scholar
- Liu, T., Qiu, J., Shi, X., Liu, Q., Xiao, S. “Flat optics for analog computing: from fundamental mechanisms to advanced meta-processors.” arXiv:2604.16849 (2026). arXiv 页面
- Zhou, H., Zhao, C., He, C., Huang, L., Man, T., Wan, Y. “Optical computing metasurfaces: applications and advances.” Nanophotonics 13(4): 419–441 (2024). DOI 页面