
假设你手头有一个分布生成任务。你习惯性地选择一个可编程量子电路把它当作一个酉变换从全零态开始演化最后测量。训练了几十轮损失函数卡在某个值附近无论怎么加层都下不去。有人提醒你为什么不试试信道模型你的第一反应是信道不也是量子操作吗酉变换本来就是信道的特例信道还能比酉更强你甚至觉得两个模型只是数学形式不同只要电路够深表达能力应该差不多。然而一项研究的标题抛出了一个关键概念representational separation表示分离。它提示我们在浅层深度条件下借助共享经典随机性酉量子生成模型和信道量子生成模型之间存在不是平凡等价的能力差异。这个现象既影响我们对量子生成模型的理论理解也影响实际建模时的模型选择。1. 量子生成模型为什么会有“酉”和“信道”两个家族1.1 从“用电路生成分布”这个动作说起量子生成模型的目标很直接用一个可以在量子设备上实现的参数化过程生成一个目标概率分布 $p(x)$。最简单的流程是准备固定初态比如 $|0\rangle^{\otimes n}$作用一个参数化酉算子 $U(\theta)$然后在计算基下测量得到比特串 $x$。这个比特串被当作采样结果。训练时调整参数 $\theta$让测量得到的经验分布逐渐接近目标分布。这类模型有一个非常经典的名字量子电路 Born 机。后来很多人把参数化量子电路接进生成对抗网络框架就有了量子 GAN 这类混合量子-经典模型。它们的共同点是中间的量子演化被严格限制为酉演化。也就是说系统始终处于纯态直到测量那一刻才产生概率。但量子力学并不要求生成过程必须是一整个酉演化。更一般的做法是允许系统经历非酉过程比如噪声信道、环境耗散、或者准备一个更大的纯态后丢弃部分子系统。这样得到的是一个混合态再去测量生成样本。这类模型就是“信道模型”。它不是某一种固定算法而是一类建模方式生成过程由一个参数化量子信道 $\Phi(\theta)$ 描述。1.2 两种模型的数学结构差异从数学上看酉模型和信道模型的差别并不只是“多一个噪声”。一个参数化酉 $U(\theta)$ 可以看成参数化信道 $U(\theta)\rho U(\theta)^\dagger$所以信道模型确实包含了酉模型。但信道模型还允许更一般的 CPTP 映射比如把量子态的一部分丢弃只测量剩余子系统经过一个参数化噪声信道引入混合态通过测量其中一个子系统将结果用于另一个子系统的条件演化。这些操作在纯态酉演化的框架里是无法直接表达的。信道模型因为有了混合态和偏迹这两个工具生成的分布与“丢弃信息”绑定得更紧密。而酉模型必须保留整个系统的可逆结构经典随机性只能通过初态或测量得到。我用一个非常不严谨但形象的类比来理解酉模型像一个确定性工艺流程所有不确定性都来自最后一步的测量信道模型则像一条允许中间环节产生损耗和分支的生产线某些信息在过程中被主动扔掉反而让最终输出更符合目标分布。1.3 为什么信道模型不被当成默认选择奇怪的是多数量子生成建模入门材料仍然以酉模型为主。原因很实际梯度估计方便数学上干净而且酉电路可以映射到现有量子硬件上直接执行。信道模型虽然更一般但参数化信道在物理实现上不容易控制噪声本身虽然是非酉的但不能保证噪声方向恰好是你想要的生成方向。所以信道模型在很长一段时间里被看成“酉模型的退化版本”或者“在噪声环境里不得不面对的东西”。这项关于表示分离的研究正是对这种直觉的一次修正信道模型不是酉模型的附属品在浅层深度下它的可达分布集合和酉模型并不重合。2. 共享经典随机性不是采样细节而是表示资源的拼图2.1 经典随机性在量子生成模型里的三种用法在实际实现一个量子生成模型时经典随机性至少会出现三次。第一次是采样随机种子。每次运行量子线路之前后端会生成一组随机数用于决定测量次数、噪声采样路径等。如果你在模拟器上运行这个随机种子的选择会影响训练稳定性。第二次是显式条件输入。很多生成模型会引入一个经典随机变量 $z$把它编码到量子态中再执行参数化电路。比如把 $z$ 的二进制表示准备好作为额外量子比特的初态。这相当于用经典随机变量控制生成条件。第三次是共享随机性。多个子电路、多个测量批次、或者多次叠加运行之间如果使用同一组经典随机数这些随机性就可能被当作一种“共同记忆”或“公共参照”。在经典生成模型里这种共享随机数是实现复杂相关结构的重要手段。在量子生成模型里它同样会影响模型能表示哪些分布。2.2 共享随机性为什么会在浅层电路里放大差异浅层电路的量子相关性是有限的。电路深度越浅能生成的长程纠缠越少测量结果之间的量子关联也越受限。但是如果一组经典随机数被共享给多个测量单元模型可以在不增加量子深度的情况下引入经典意义上的跨比特相关性。对酉模型和信道模型来说共享经典随机性的效果并不对称。酉模型处理经典输入时经典数字会被量子叠加吸收。一个比特的状态一旦被编码进量子系统它就成为纯态演化的一部分后续只能通过酉操作翻转或纠缠。想利用共享经典随机性在输出分布里制造特定的经典相关结构往往需要额外的电路深度或辅助比特。信道模型则不同。它可以通过丢弃系统、保留混合态、或者在信道内部把经典信息复制到不同子系统更直接地保留和操控共享随机性带来的经典关联。换句话说在同样的浅层深度预算下信道模型更容易把“共享经典随机性”变成“输出样本之间的相关性”。这并不等于信道模型一定会更好。它只能说明如果你设计了一个带共享随机性的浅层生成任务两个模型家族的能力边界可能已经分道扬镳。2.3 实践中最容易忽略的随机源管理常见的工程失误是把经典随机性当成无关紧要的实现细节。你在模拟器上跑小规模任务时可能把伪随机数生成器设成了自动模式每次运行使用不同的随机序列然后在真实设备上又因为硬件调度问题无法保证多个线路共用同一组随机数。这类随机源不一致会让一些依靠共享随机性的模型失效也会让理论上的表达能力在实验中完全体现不出来。我的建议是在做生成模型对比实验时至少固定三层随机源训练集和测试集的采样种子量子线路测量的噪声种子模型内部显式经典随机输入 $z$ 的种子。只有把随机源管理清楚你才能判断实验中观察到的能力差异到底来自模型结构还是来自随机性调度方式。注意共享随机性并不总是帮你它可能让同一个量子线路在不同实验条件下产生完全不同的输出分布。先做小样本验证再谈批量训练。3. “浅层深度”为什么是这次分离的关键舞台3.1 深度约束让平凡结论变得不平凡如果允许任意深的电路任何量子生成模型理论上都可以变成非常强大的通用模型。这个时候讨论酉模型和信道模型谁更强往往只会得到一个“信道模型包含酉模型”的平庸结论因为酉变换只是信道的特例。但真实量子设备不是这样的。硬件噪声随深度累积每个两比特门都会引入误差。任何实际可运行的量子生成任务都必须考虑深度预算。浅层电路也因此成为一个真正有意义的复杂度关卡在有限深度下模型不能靠“更深”来弥补结构上的不足。所以这项研究把分离结果放在“浅层深度”背景下本身就是一个很强的信号。它说明两类模型的能力差异不是纯理论上的无限资源结论而是在资源受限时就能观察到的结构性问题。3.2 浅层电路里经典相关性可以绕过量子相关性的瓶颈浅层电路的纠缠能力有限这是量子生成模型表达能力的天然天花板。你不可能用一个很浅的电路直接生成带高度复杂量子关联的样本除非加入辅助系统或经典后处理。共享经典随机性可以理解为一种“外部相关性注入”。它不需要通过增加电路深度来建立量子纠缠而是直接在经典层面建立比特串之间的相关性。这就带来一个非常有意思的取舍深度不够时你可以用额外经典随机数换相关性而额外经典随机数如何与量子系统交互又决定了不同模型家族的表现。从工程角度看这意味着当你发现浅层酉模型已经无法提升时不要马上加深度。先检查你的模型是否充分使用了经典随机性是否允许共享随机数进入量子信道结构。很多情况下问题不在深度而在模型家族和随机性使用方式不匹配。3.3 阅读这类结果时要先确认门集与架构假设浅层电路的一个尴尬点在于“浅”并不是一个绝对定义。同样的深度在超导平台上可能只够做一个最近邻两比特门链在离子阱平台上可能已经做了很多全连接操作。门集、连通性、是否允许中间测量和反馈都会改变表达能力。阅读“深度的表示分离”相关结果时需要先确认三层假设使用的是什么门集是否包含任意单比特旋转和两比特纠缠门电路拓扑是线性的、全连接的还是受限于硬件原生连接是否允许中间测量、条件重置和经典反馈。如果一项结果是在全连接门集下证明的那么迁移到近邻拓扑上可能需要更深电路才能复现如果结果是基于不带中间测量的模型那么加入中间测量可能也会改变边界。所以把“浅层深度下存在表示分离”读成“只要电路很浅信道模型就打遍天下无敌手”是错误理解。更合理的读法是关于资源配比的一个提醒在电路层数和随机性资源都受限时模型家族的选择会变成一个真正起作用的变量。4. 表象分离证明了什么又没证明什么4.1 分离的核心含义如果把酉模型能表示的所有浅层分布集合记为 $\mathcal{U}$信道模型能表示的所有浅层分布集合记为 $\mathcal{C}$那么表示分离意味着这两个集合不相等。而且这种不相等是通过一组共享经典随机性构造出来的。换句话说存在一些目标分布信道模型可以用浅层电路表示而酉模型在同样的浅层深度条件下做不到或者至少存在一个方向上的严格包含关系。这里的关键不是“信道模型比酉模型多一个噪声项”而是说这种多出来的机制在浅层深度下会带来质的区别。它影响的是可表示分布集合的边界而不只是训练时的数值稳定性。这对实践者来说是一个很直接的提示当你用一个浅层酉模型训练某个分布一直失败时问题可能不是优化器不好也不是超参数没调好而是当前模型家族根本无法逼近那个目标分布。4.2 为什么这个结论不是“信道包含酉”这么简单信道包含酉这是数学上的包含关系。按照这一关系信道模型的能力至少不弱于酉模型。如果这个包含关系直接给出答案就不需要专门讨论分离了。问题在于包含关系是在“理想数学对象”层面成立的。一旦加入浅层深度约束事情就会变得复杂信道模型虽然数学上更强但它要把非酉操作映射到有限深度量子电路上可能需要额外资源或者它刻画目标分布的方式与经典随机性的结合点与酉模型完全不同。因此分离结果的价值在于它不依赖“加更多层”这种无限资源假设而是在固定浅层资源下指出两个模型家族的可达目标集合存在结构差异。这已经不是简单的包含关系能够解释的现象了。4.3 它不证明信道模型全面更强表示分离是一个存在性结论不是一个平均性能结论。它可能构造了一个非常特殊的分布让信道模型在浅层下能够表示而酉模型不能。但你的实际任务分布可能离那个特殊分布很远。进一步说即使某个模型家族“能够”表示目标分布也不代表它的训练算法能在合理时间内找到一组合适的参数。表示能力只回答了“存在性”没有回答“可发现性”。一个表达能力更强但梯度难以优化的模型在实际工程中可能还不如一个表达能力稍弱但训练稳定的模型。所以看到“表示分离”时不要立刻把所有实现都切换成信道模型。它更应该被用来解释你已经观察到的现象而不是指导你盲改架构。项目证明了什么没证明什么分布集合在浅层深度和共享经典随机性下酉模型与信道模型的可表示集合不等价所有真实任务都偏袒某一类模型资源需求某一类模型可能在更浅的深度下表达同一分布信道模型在任意深度下都优于酉模型可训练性模型家族之间存在表示边界差异强表示能力的模型更容易训练工程含义选型会影响最终表达能力光换模型不能解决优化陷阱和噪声问题5. 回到工程浅层量子生成模型的选型与验证方法5.1 用小规模任务做“家族体检”如果你在做一个实际项目最不应该做的事情是照搬某篇论文的架构然后直接跑自己的数据。理论结果用的是特制分布你的分布未必满足同样条件。我的建议是先做一个“家族体检”。用一个小规模但能代表任务特征的分布分别用浅层酉模型和浅层信道模型去逼近。重点不是看最终损失函数的大小而是看两者随深度增长的曲线趋势。具体做法是固定输入维度比如 6 到 10 个量子比特固定一组随机种子确保共享经典随机性处于相同状态分别准备一个酉模型和一个信道模型从深度 1 开始逐步增加深度到某个浅层上限记录每个深度下两模型的训练损失、测试时采样误差和梯度方差。如果训练多次后差距仍然稳定存在那么你才可以说这个任务上两个模型家族的表现确实不同。否则可能只是某个模型的优化器没有调好。5.2 一个从酉模型切换到信道模型的判断流程这里给一个可以复用的判断流程1. 先用浅层酉模型训练目标分布 2. 如果损失能稳定下降但最终精度不够先增加少量深度 3. 如果增加深度后改善微弱检查是否出现梯度消失或噪声累积 4. 保持同样深度在模型中引入去极化噪声或辅助系统偏迹 5. 观察输出分布的变化判断是否更接近目标分布 6. 如果非酉机制能带来明显改善再考虑完整建模为信道模型 7. 最后回测拟合速度和采样成本确认收益不是来自额外计算。这个流程的关键是“逐步引入非酉机制”而不是一步跳到一个复杂的参数化信道。你需要在每一步都保留对照才能知道是哪个机制带来了改变。5.3 基准对比时必须控制的变量对比酉模型和信道模型时最容易犯的错误是资源不公平。酉模型和信道模型可能使用不同数量的辅助量子比特、不同的门数量、不同的测量次数。如果对比的是最终精度却没有记录资源消耗结论很容易失真。至少需要记录四类资源电路深度包括所有使用的门层数两比特门总数量子比特总数包括辅助比特单次训练迭代需要的测量次数或采样数量。只有这些变量接近表示分离才有工程意义。否则你观察到的可能只是“信道模型花了更多资源从而表现更好”。5.4 用图表检查“表示分离”的痕迹在做完上述实验后可以画出误差-深度曲线以及误差-采样数曲线。观察两类曲线的相对位置如果两条曲线差距不大说明在你的任务上两个模型家族的能力边界接近如果信道模型在某个较小的深度就开始下降而酉模型需要更深才达到同等效果这正是表示分离可能存在的痕迹如果差距只在某个高精度区域出现说明它更多体现在分布细节上而不是宏观趋势上。这种图表的价值在于它把一个理论概念变成一个可观察的行为模式。后续你再读类似论文时也能更快地对应到自己的实验现象。当你有条件在模拟器上重现原论文的可分离分布时优先用模拟器复现再用真机验证。真机上额外的噪声和线路调度问题会严重掩盖表示能力差异。6. 我建议每个量子生成建模项目都做一次四步拆解6.1 第一步定义模型家族的符号不要只说“我用了一个量子生成模型”要明确写出初态是什么演化是酉算子还是参数化信道是否允许丢弃子系统是否引入经典随机变量以及它如何进入量子系统。用一个简短符号表示会很有帮助。比如酉模型可以记作 $p_\theta(x)|\langle x|U(\theta)|0^n\rangle|^2$而信道模型可以记作 $p_\theta(x)\mathrm{Tr}[M_x \Phi_\theta(\rho_0)]$。这不仅能让你沟通更清楚也能帮你在代码里保持一致。6.2 第二步定义深度与随机性预算想清楚你的深度上限是多少以及你的随机性预算有多少。这里的“随机性预算”指的是你愿意引入多少经典随机数、多少辅助比特、多少次采样。理论上的表示分离通常是在某个特定资源组合下成立的。如果你的深度预算很大分配方式会不一样如果你的共享随机数可以无限生成情况也会不同。先定义好预算后续实验才可比较。6.3 第三步选择可验证的代理任务直接使用真实数据训练通常很难判断失败来自模型家族还是数据复杂度。更好的做法是先用一个已知分布作为代理任务。比如构造一个简单的经典关联分布两个子系统的边缘分布独立但联合分布存在强相关。这种分布天然适合观察共享经典随机性的作用。再比如可以构造一个需要混合态才能高效表示的分布。通过这个任务你可以看到信道模型是否真的能利用混合态优势。6.4 第四步判断分离结果是能力差异还是算法差异当你观察到两个模型家族表现不同时不要马上归因于表示能力。需要做一次“反向检查”把两个模型的参数初始化方式、优化器、学习率、测量次数全部对齐重新跑一组实验。如果差距消失了说明更可能是算法层面的差异而不是模型家族的表达边界差异。如果差距仍然存在并且随深度变化出现稳定趋势才能进一步考虑表示分离的解释。这一步虽然麻烦但能避免你把一个优化器问题错当成理论问题。7. 下一步把理论分离变成建模直觉7.1 对研究者的建议这类表示分离结果最有价值的地方是给了人们一批“问题分布”。你可以把它们当作测试基准用来检验新的生成算法、新的电路编译策略、新的随机性注入方案。对一个理论结果我建议先关注三点分离的方向和构造方式门集和随机性假设是否贴近你的平台是否能在小规模规模下被数值实验验证。如果这三个点都能被确认这个结果就不会只是一个抽象的证明而会变成一个可复现的建模实验。7.2 对工程实践者的建议如果你只是在做应用不一定要读懂证明但至少要形成一种判断习惯当浅层量子生成模型效果不理想时除了调参数可以检查你是否被困在错误的模型家族里。具体落地时可以先从酉模型开始因为它简单稳定但当问题出现“深度加不上去、精度卡住”的迹象时一定要给信道模型一个机会。对噪声环境尤其如此因为真实噪声本身就是非酉过程信道模型更贴近物理现实。7.3 长期来看这个结果会改变什么量子生成模型还远没有像经典生成模型那样成熟。现在的研究者仍然在回答一些基础问题什么样的任务适合量子生成模型哪一类模型更值得投入浅层深度下哪些资源能真正换取表达能力表示分离这一类结果给了我们一个更清楚的坐标模型家族的差异不只是“多一个噪声项”或“少一个酉约束”而是会直接影响你能表示什么样的概率分布。共享经典随机性也不再只是采样层面的细节它会和模型结构一起共同决定能力边界。下次再看到两个模型家族之间的对比实验你至少不会再简单地认为“信道模型只是酉模型的加噪版本”。它们可能在同一个浅层深度下面对着完全不同的表达空间。而你要做的是先判断自己的目标分布落在哪一个空间里再决定往哪个方向调模型。