Q-VAE生成&判别:MNIST图像

QBM-VAE

基于MNIST手写数字数据集,使用Q-VAE学习低维潜变量表示,实现图像重构、潜空间可视化和下游数字分类。

玻色量子
手写数字识别量子变分自编码器MNIST

业务痛点 PAIN POINTS

手写数字识别看似是基础视觉任务,但是适合作为量子生成模型的标准验证场景,能够直观展示模型是否学到了有效表征。MNIST图像为28×28灰度图片,输入会被展平成784维向量,Q-VAE需将高维图像压缩到低维潜空间,再从潜变量中恢复原图。

📉

经典先验过于简单

经典VAE通常使用简单的独立高斯或伯努利先验,潜空间表达能力有限,容易把复杂数据结构压缩成过于简单的分布。对于图像生成、重构和表征学习任务,仅靠普通先验可能难以充分刻画潜变量之间的相关性。

场景亮点 HIGHLIGHTS

⚛️
生成、重构、分类一体化验证
🗺️
BM/RBM先验增强潜空间建模
🔀
结果可解释、易展示

解决方案 SOLUTION

01
量子生成式架构
方案融合玻尔兹曼机(BM/RBM)与变分自编码器(VAE)生成式架构,构建量子经典混合的手写数字表征与生成模型。经典编码器将MNIST图像压缩为低维潜在表示,BM/RBM进一步学习潜变量之间的复杂能量关联,经典解码器根据潜在表示完成图像重构与生成。相较采用固定高斯先验的传统VAE,该方案利用可学习的能量先验增强潜在空间建模能力,为手写数字生成、特征可视化和图像分类提供统一的特征基础。
02
哈密顿能量求解 · 量子全域寻优
模型将手写数字潜在特征的组合优化问题转化为BM/RBM能量模型求解问题。训练过程中,编码器输出用于计算正相统计,采样器搜索低能量状态并完成负相统计,从而持续优化潜在空间的能量分布。

落地效果 RESULTS

🔬

图像生成与重构质量稳定

-41%

训练损失

在公开MNIST数据集上训练30轮后,Q-VAE训练损失由约0.75降至0.4408,测试损失由约0.65降至0.4457;模型生成10,000张手写数字图像,FID指标达到1.49,能够稳定学习手写数字的主要形态特征。

Q-VAE训练损失曲线

📈

潜在特征分类能力突出

97.92%

准确率

利用Q-VAE提取的潜在特征训练MLP分类器,最佳验证集准确率达到97.92%,测试集准确率达到97.62%;训练约20轮后,验证准确率已稳定在97%以上,表明模型学习到的潜在表示能够有效区分不同类别的手写数字。

Q-VAE潜在特征分类效果

应用价值 VALUE

🎓

量子生成模型标准验证样例

MNIST数据简单、直观、可视化效果明确,适用于展示Q-VAE如何把经典深度学习结构与量子能量模型结合,降低用户理解门槛。
🎓

验证低维表征质量

Q-VAE学到的潜变量不仅用于图像重构,还能作为MLP分类器的输入特征,分类器代码可基于Q-VAE表征训练MLP,并保存最佳模型best_mlp_classifier.pth,通过验证集准确率评估表征是否具备类别区分能力。