文献解读 | 深度学习如何设计光子器件(Photonics Research 2021)

论文简介

本文解读的是 2021 年发表在 Photonics Research 上的综述:Deep learning in nano-photonics: inverse design and beyondDOI 10.1364/PRJ.415960arXiv 存档),作者是法国图卢兹 LAAS/CEMES(CNRS)的 Peter R. Wiecha、Arnaud Arbouet、Christian Girard 和英国南安普顿大学的 Otto L. Muskens。论文为开放获取在线期刊文章。

一句话概括:这篇综述把”用深度学习做光子器件逆向设计”从头到尾批判性地梳理了一遍——先讲神经网络为什么能胜任这个任务,再讲前向代理模型、直接从目标反推结构的逆向网络,接着讲解决”一对多歧义”和鲁棒性的各种改进方案,最后扩展到物理信息神经网络(PINN)以及知识发现、实验数据解读等”超越逆向设计”的应用。 和大多数只展示成功案例的论文不同,它把每种方法的缺陷也讲得很清楚,对想入门这个方向的读者是一张很好的地图,对已经入行的研究者也是一种”方法选择”的提醒。

为什么”设计光子器件”要请深度学习出场

器件设计本质上是逆向问题:给定目标光学响应(比如”在某个波长聚焦、对某种偏振分束、把特定图案写到焦平面”),找到能满足它的结构参数——纳米柱的尺寸、形状、旋转角、材料等。超表面的每个单元都有多个几何自由度,一块器件包含成千上万个单元,整个参数空间是天文数字级别的。想靠物理直觉”试”出最优结构,基本不可能。

传统上大家依赖两类工具。一是基于物理直觉的参数扫描:适用于参数少、规律清楚的问题,但维度一高就力不从心。二是伴随方法(adjoint method)这类梯度优化:它一次仿真就能算出全部梯度,效率很高,但每轮优化仍需要多轮电磁仿真,而且目标一变就要重算,优化的结果也和初始猜测、制造约束耦合在一起。

深度学习的吸引力来自三点:第一,训练完成后,前向预测几乎是瞬时的,可以当”仿真替代品”,把一次设计迭代从小时级压缩到毫秒级;第二,网络可以直接学习”目标→结构”的映射,跳过显式的仿真循环;第三,训练数据可以同时来自仿真和实验,用实验数据校正仿真模型,弥合”仿真与实物之间的鸿沟”。

要理解这些方法,先要清楚神经网络是怎么”学习”的。一个人工神经元(artificial neuron)只是对输入做加权求和、再过一层非线性激活函数;把大量神经元按层连接起来,就得到人工神经网络(ANN,artificial neural network),它本质上是输入向量到输出向量的一个参数化函数。训练的目标是让网络的预测尽量接近训练样本,通常用均方误差(MSE,mean squared error)损失来衡量:

$$L(w_i,b_j)=\frac{1}{N}\sum_{l=1}^{N}\left(y_{\mathrm{train},l}-y_{\mathrm{ANN}}(x_{\mathrm{train},l})\right)^2$$

其中 $w_i$、$b_j$ 是网络参数,$x_{\mathrm{train},l}$ 和 $y_{\mathrm{train},l}$ 是训练样本,$y_{\mathrm{ANN}}$ 是网络预测,$N$ 是批量大小(batch size)。训练就是沿着损失函数关于参数的梯度”往下滑”,最常用的算法是随机梯度下降(SGD,stochastic gradient descent)。这一段背景来自综述 Box 1。

但论文开篇就提醒:深度学习不是万能钥匙。很多相关工作是针对特定器件的高度定制方案,各自的缺陷并不明显,盲目套用容易失败。这正是这篇综述要做的:把方法分门别类,讲清楚每类的适用场景与短板。

路线一:前向代理模型——把仿真换成网络(图 1)

最直觉的用法,是训练一个网络学习”结构→响应”的前向映射,用网络输出替代昂贵的仿真。论文图 1 给出三个层次不同的例子。

图 1:深度学习前向求解器用于超快物理预测。(a) 多层纳米球的电/磁偶极共振预测与逆向设计;(b) 基于多个洛伦兹振子的纳米光学求解器,右图显示基于物理的数据表示让网络在训练数据范围之外仍能泛化(蓝点);(c) 内部电极化密度预测网络,其结果可接入耦合偶极近似框架计算近远场效应。

图 1(a) 是最直接的”结构→响应”映射:输入多层纳米球的几何参数,同时预测电偶极和磁偶极共振,相当于把电磁仿真压缩成一个多输出网络。

图 1(b) 更值得琢磨:它不直接预测光谱曲线,而是让网络预测一组洛伦兹振子的参数(共振频率、线宽、强度),再用振子模型合成光谱。这种”物理化的数据表示”让网络学会的是物理规律本身,而不是死记训练样本,因此如蓝点所示——即使输入超出训练数据范围,预测依然合理。这是本文反复出现的一个主题:把物理知识编码进网络结构或数据表示,往往比堆更多数据更有效。

图 1(c) 则更进一步:网络预测的不是某个标量响应,而是结构内部的电极化密度分布;把这个分布接入耦合偶极近似(CDA,coupled dipole approximation)框架,就能一次性推出一大堆近场和远场量。代理模型从”预测一个数”升级成了”预测一个场”。

当然,代理模型也有代价:它的精度受限于训练数据的分布,在数据稀疏的区域外推并不可靠;训练数据本身需要大量仿真来生成,这是一笔前置成本。所以代理模型的价值在于”训练一次、使用无数次”的场景,比如后面的迭代优化和系统级参数扫描。

路线二:逆向网络——直接从目标到结构(图 2)

更激进的思路是训练逆向网络:输入目标响应,直接输出结构参数。但这里藏着一个核心困难——一对多歧义:多个不同的结构可能产生几乎相同的光学响应。论文用金纳米棒的消光光谱举例:固定波长下,想让消光系数等于某个值,可以由好几根不同长度的纳米棒实现;朴素网络面对这些互相矛盾的训练样本,会学到它们的”平均解”,结果哪个都做不好。

对策之一是 tandem 串联网络:先训练一个前向模型并冻结它,再把它接到逆向网络后面作为”物理损失”——生成的结构必须经过前向模型验证、预测确实接近目标才被奖励。这一思路的代表工作来自 Jiang 与 Fan 2019 年在 Nano Letters 上提出的物理驱动神经网络全局优化方法。这样逆向生成器不会跑偏,但也把问题限制为”每个目标只给一个解”。

若要保留多个解,可以用三类生成模型。混合密度网络(mixture density network)让网络输出一组高斯分布来描述解集合,解的个数和权重都显式可读;条件生成对抗网络(cGAN,conditional generative adversarial network)和条件自编码器把解空间装进一个潜变量 z,每次采样 z 就得到一种不同的设计,图 2(b) 中的双焦点透镜使用的条件 WGAN(Wasserstein 生成对抗网络)就是这类生成模型的代表;变分自编码器(VAE,variational autoencoder)则把潜变量约束成正态分布,让解空间平滑连续,支持在两种设计之间”插值”。论文 Box 2、Box 3 分别解释了前两者的原理。

图 2:由机器学习算法逆向设计的器件实例。(a) 编码器-解码器型串联逆向网络设计 3×3 多模干涉器(MMI)的扰动图案,以实现任意传输矩阵元;(b) 条件 WGAN 逆向网络设计的双焦点平面透镜,(i) 介质超表面、(ii) 振幅分布、(iii) 相位掩模、(iv) 数值仿真的场强验证。

图 2 给了两个具体例子。图 2(a) 中,串联网络的逆向部分输出 3×3 多模干涉器的扰动图案,让不同输入通道按目标任意路由到输出,传输矩阵元的映射可以按需”改写”;图 2(b) 中,条件 WGAN 直接生成介质超表面的几何,并同时给出振幅与相位掩模,最后用数值仿真验证两个焦点确实按预期形成。这两个例子说明,逆向网络输出的”结构”可以是离散图案、连续几何,也可以是相位掩模这类中间表示。

路线三:给逆向网络”打补丁”——六种改进与数据预处理(图 3、图 4)

直接逆向网络除了歧义问题,还会遇到数据不足、对噪声敏感、网络容量不够等毛病。论文图 3 总结了六类改进思路,共性都是”把更多物理放进训练流程”:

图 3:改善逆向设计神经网络常见缺点的六类概念。(a) 迭代训练数据生成,网络从自身错误中学习(隐身斗篷设计);(b) 迭代生成数据集前后光子晶体腔品质因子(Q 因子)分布对比;(c) 网络结构随训练渐进增长,逐步学习更精细特征;(d) 用高斯概率分布表示多个解的混合密度网络;(e) 针对带噪训练数据的去噪逆向网络;(f) GLOnet:用可微的传输矩阵物理模型作损失函数的逆向设计网络。

逐项来看:

(a) 迭代训练数据生成——最有意思的一种。第一轮网络从随机数据里学,然后用它设计一批结构、跑仿真找出表现最差的那部分,专门补齐这些”易错区域”的数据,让网络在第二轮针对性地补短板。训练数据由网络自己的错误驱动生成,而不是一开始就撒一大片随机样本,数据效率高得多。论文用它演示了隐身斗篷的逆向设计。

(b) 迭代数据集的效果——同样是光子晶体腔 Q 因子预测,随机数据集里高性能样本稀少,迭代生成一轮之后,数据集里的高质量样本明显变多,网络学到的分布更贴近真实设计需求。

(c) 渐进网络增长——网络容量跟着训练进度逐步增加:先学粗糙的全局特征,再逐步加入精细结构的学习,避免一开始就过拟合噪声。

(d) 混合密度网络——处理一对多问题的另一种思路:不强迫网络输出单一结构,而是输出”解的分布”,让用户从中挑选,多个高斯峰对应多个可行设计。

(e) 去噪逆向网络——训练数据里显式加入噪声(噪声参数自上而下增大),网络学会忽略测量噪声,提升在实际测量场景下的鲁棒性。

(f) GLOnet——用可微的物理模型(传输矩阵)直接作为损失函数,网络在训练时”看到”的就是真实的物理响应,而不是仿真数据的代理,优化目标更接近物理本身。

除了改进训练流程,数据的表达方式同样重要。论文图 4 展示了两种数据预处理技巧:

图 4:面向优化物理域表示的输入数据预处理示例。(a-b) 通过坐标变换在不规则网格上做深度学习,变换内置在深度学习工具库中、梯度可以穿过坐标变换反向传播,让网络能在复杂形状的物理域上高效训练;(c) 用低频傅里叶分量描述拓扑并压缩数据,实现自由曲面超光栅等复杂形状的数据高效表达。

图 4(a-b) 解决的是”结构几何不规则、标准卷积网络吃不下”的问题:通过一个可微的坐标变换,把不规则网格映射到规则网格,网络可以在变换后的域上训练,梯度还能穿过变换反传回原始几何。图 4(c) 则用低频傅里叶分量来描述结构拓扑:相比逐像素描述,自由曲面超光栅这类复杂形状只需要很少几个傅里叶系数就能表达,既压缩了数据,也让网络更容易学到光滑的结构规律。

路线四:物理信息神经网络——把方程写进损失(图 5)

前面几种方法都需要大量”结构—响应”训练数据。物理信息神经网络(PINN,physics-informed neural network)换了一条路:把物理方程本身写进损失函数。2019 年 Raissi 等人提出的通用框架是:网络不仅要拟合数据,还要让输出满足偏微分方程,总损失写成数据拟合项与方程残差项之和:

$$L=L_{\mathrm{data}}+\lambda L_{\mathrm{PDE}}$$

其中 $L_{\mathrm{data}}$ 衡量网络输出与已知数据/边界条件的偏差,$L_{\mathrm{PDE}}$ 衡量输出代入方程后的残差大小,$\lambda$ 是两项之间的平衡权重。

论文图 5 展示了它在纳米光学中的两个应用:一是时域求解波动方程,网络直接给出随时间演化的场分布;二是频域求解亥姆霍兹方程,并进一步把它变成逆向问题——已知目标场分布,反推隐身斗篷区域的介电常数分布。

图 5:面向纳米光学的物理信息神经网络(PINN)。(a) 时域求解波动方程;(b) 上:求解频域亥姆霍兹方程;下:用 PINN 对隐身斗篷应用的介电常数分布进行逆向设计。

PINN 的好处是不依赖海量标注数据,理论上”方程即数据”,还能天然保证解满足物理规律;代价是训练更慢、收敛更难,数据项与方程项的权重 λ 需要细心调节,复杂边界条件的处理也不简单。目前 PINN 在纳米光学里主要停留在方法验证阶段,但它把”物理”放进损失的做法,和前面的物理化数据表示、GLOnet 的可微物理损失是一脉相承的。

超越逆向设计:知识发现与实验数据分析(图 6、图 7)

论文的后半部分提醒读者:深度学习在光子学里的价值不止于”设计器件”,还能反过来帮人理解物理、处理实验数据。

知识发现

图 6 给出几个用网络”发现物理”的例子:

图 6:通过机器学习实现”知识发现”的实例。(a) 用自编码器降维与非凸包判定,判断指定几何模型能否实现目标物理响应;(b) 瓶颈神经元数量与设计参数变化对激活的影响,可评估各设计参数的物理重要性;(c-d) 模拟人类建模思路的条件编码器-解码器,从数据中发现隐式物理概念;(e) 利用高速物理预测网络,系统分析超表面单元可实现的相位与强度变化范围。

图 6(a) 用自编码器把高维结构参数压缩到低维,再画低维点集的非凸包:如果目标响应落在包外,说明这个几何模型根本实现不了,省掉大量无用仿真。图 6(b) 分析瓶颈神经元的激活模式,可以判断哪些设计参数在物理上真正重要——比如某个几何参数变化时神经元激活几乎不动,说明它对响应影响很小。图 6(c-d) 模拟人类建模的思路,用条件编码器-解码器从数据中”发现”隐式的物理概念,相当于让网络帮人提出物理假设。图 6(e) 则利用前向代理模型的速度,系统扫描超表面单元能实现的相位与强度范围,为设计者提供一张”可达域”地图。

实验数据分析

设计之外,深度学习在实验数据解读上的应用同样丰富(图 7):

图 7:机器学习用于实验数据解读的示例。(a-c) 神经网络从亚衍射纳米结构的散射光谱中解码光存储信息,每个几何结构对应唯一光谱,网络能解码未见结构的带噪光谱,仅探测少量波长即可高精度读出;(d-e) 全息显微图像上的炭疽孢子分类;(f) 显微力场校准,用网络从欠采样的布朗运动数据重建势阱;(g) 基于多芯多模光纤束散斑的实时超光谱图像重建;(h) 少量数据采集下的统计重建方案。

图 7(a-c) 演示”光存储光谱解码”:每个纳米结构几何对应一个独特的散射光谱,相当于一位信息位;网络在大量光谱上训练后,能解码从未见过的结构的带噪光谱,甚至只探测几个波长就能高精度读出。图 7(d-e) 用机器学习对全息显微图像上的炭疽孢子分类;图 7(f) 用网络从欠采样的布朗运动轨迹中重建光镊势阱,比传统统计方法更抗噪声;图 7(g) 利用多芯多模光纤束散斑的波长依赖性,实现实时超光谱图像重建;图 7(h) 展示了从少量数据采集做统计重建的思路。这些场景的共同点是”实验数据少、噪声大、反演难”,而网络恰好擅长在高噪声中学统计规律。

一张表看懂五种范式

表 1:深度学习用于光子器件设计/分析的五种范式对比。优缺点与代表例子均来自综述正文(Wiecha 等,Photonics Research 2021),来源见文末参考资料。

范式 输入 → 输出 主要优点 主要短板 综述中的代表例子
前向代理模型 结构 → 光学响应 训练后近乎瞬时预测,可替代仿真 精度受训练数据分布限制 多层纳米球共振预测、Lorentz 振子求解器(图 1)
直接逆向网络 目标响应 → 结构 端到端一步出设计 一对多歧义,易学到平均解 金纳米棒消光光谱反演(Box 2)
串联/生成模型 目标 → 前向校验 → 结构 用物理损失稳定生成,可保留多解 串联网络每目标仅给单解;生成模型训练不稳定 tandem 设计 3×3 MMI、条件 WGAN 双焦点透镜(图 2)
物理信息网络(PINN) 方程 + 少量数据 → 场/结构 不依赖海量标注,方程即先验 训练慢、收敛难、权重难调 亥姆霍兹求解与隐身斗篷逆向设计(图 5)
知识发现/实验分析 高维数据 → 物理规律/测量结果 反哺物理理解,抗噪 结果可解释性有限 自编码器可行性判定、散射光谱解码(图 6、图 7)

六种改进策略对照

表 2:路线三中六类改进策略的对照。内容来自综述图 3 及其正文,来源见文末参考资料。

改进策略 主要解决什么问题 核心机制
迭代训练数据生成 训练数据在”难区”稀疏 网络先从随机数据学,再用仿真补齐自己出错最多的结构
迭代数据集 高性能样本稀少、分布偏斜 多轮迭代让数据集分布贴近真实设计需求
渐进网络增长 网络容量与学习阶段不匹配 先学粗糙特征,再逐步增加容量学精细特征
混合密度网络 一对多歧义被压成平均解 输出多个高斯分布描述解集合,供用户挑选
去噪逆向网络 训练数据含噪声时预测不稳 显式向训练数据加噪,强迫网络学会去噪
GLOnet 代理损失与真实物理有偏差 用可微物理模型(传输矩阵)直接作损失

意义与展望

这篇综述的价值首先在视角:它不是”深度学习又赢了一次”式的成果集锦,而是冷静地告诉你每个范式会在哪里失败——直接逆向会因一对多歧义学到平均解,串联网络把多解压成单解,PINN 训练又慢又难收敛,代理模型的精度受数据分布限制。对刚入门的读者来说,这种”带坑说明”的地图比一堆成功案例有用得多;对已经入行的人,它也提醒了”方法选择要先想清楚你的问题属于哪一类”。

从原理验证走向实际应用,仍有几条明显的路要铺:其一,综述写于 2021 年,此后扩散模型、大语言模型辅助设计等新工具出现,值得单独跟踪;其二,数据生成成本仍是最大瓶颈——高质量”结构—响应”数据要靠大量仿真,这本身不便宜,迭代数据生成和物理化数据表示正是为了缓解这个问题;其三,也是最关键的,网络设计的结构要能真正造出来,需要把制造约束(最小线宽、圆角、工艺误差)纳入训练闭环。深度学习让”设计”变快了,但”设计出来的东西能不能造”这个问题,最后还是要回到工艺本身。

参考资料

  1. Wiecha P. R., Arbouet A., Girard C., Muskens O. L. Deep learning in nano-photonics: inverse design and beyond. Photonics Research 9(5), B182 (2021).
  2. Wiecha P. R., Arbouet A., Girard C., Muskens O. L. Deep learning in nano-photonics: inverse design and beyond(作者存档,配图镜像来源). arXiv:2011.12603 (2020).
  3. Jiang J., Fan J. A. Global optimization of dielectric metasurfaces using a physics-driven neural network. Nano Letters 19(8), 5366–5372 (2019).
  4. Raissi M., Perdikaris P., Karniadakis G. E. Physics-informed neural networks: a deep learning framework for solving forward and inverse problems involving nonlinear partial differential equations. Journal of Computational Physics 378, 686–707 (2019).

文献解读 | 深度学习如何设计光子器件(Photonics Research 2021)
https://time-frame.cloud/2026/08/13/2026-08-13-deep-learning-inverse-design/
作者
Time Frame
发布于
2026年8月13日
许可协议