蛋白质生成

Q-Diffusion

基于预训练DPLM生成蛋白质候选序列,并引入BM能量模型进行重排筛选,使生成结果更接近真实蛋白序列分布

玻色量子
蛋白质序列生成AI for Science离散扩散模型

业务痛点 PAIN POINTS

蛋白质序列设计需要在极大的氨基酸组合空间中寻找合理候选。一个序列是否可用,不只取决于单个氨基酸是否常见,还取决于整条序列是否符合真实蛋白质的统计分布、结构稳定性、进化保守性和潜在功能模式。

📉

传统筛选成本高

传统方法多依赖人工规则或枚举方式筛选候选序列成本极高,难以覆盖有效搜索空间。
⚠️
候选质量难判
经典预训练扩散模型可以生成蛋白质候选序列,但生成多个候选后,仍需要判断哪些序列更接近真实蛋白分布。仅依赖生成模型自身的采样概率,可能无法充分完成候选质量筛选。

场景亮点 HIGHLIGHTS

⚛️
生成与筛选解耦,逻辑闭环清晰
形成“候选生成—能量评估—优选输出”闭环
🗺️
量子技术切入点明确
BM能量模型的候选评分和采样求解
🔀
baseline vs guided
对照结果

解决方案 SOLUTION

01
DPLM+BM融合架构
本案例采用扩散蛋白质语言模型(DPLM)与玻尔兹曼机能量模型 (BM) 融合的生成方案。冻结的DPLM Proposal Backbone根据噪声序列预测氨基酸token,并生成多个候选蛋白质序列;Energy分支使用独立的DPLM Backbone,提取噪声序列与候选序列的上下文特征,经池化、拼接和投影后映射到BM可见空间,由BM计算候选序列的条件能量;Q-Diffusion根据能量分数完成候选重排,并通过迭代去噪和重掩码逐步优化生成结果;专用量子计算机主要参与BM能量模型的组合采样与低能量状态搜索。

落地效果 RESULTS

📈

生成序列整体质量提升

-15.42%

平均余弦距离

在公开蛋白质数据集的100组测试样本中,Q-Diffusion引入BM能量引导后,ESM2平均余弦距离由0.228741降至0.193466,下降15.42%,生成序列在ESM2表征空间中更接近参考蛋白质序列。

📈

典型样本生成效果改善

-21.71%

余弦距离中位数

ESM2余弦距离中位数由0.208566降至0.163282,下降21.71%,表明质量提升并非仅由少数样本贡献,多数测试样本均获得改善。

📈

蛋白质表征偏差降低

-8.36%

平均L2距离

ESM2平均L2距离由5.105006降至4.678294,下降8.36%;L2距离中位数由4.967555降至4.484152,下降9.73%。

应用价值 VALUE

🎓

提升蛋白质候选序列筛选效率

该案例在DPLM生成多个候选后,通过BM能量模型进行二次筛选和重排,有助于从大量候选中优先挑选更接近真实蛋白分布的序列,降低后续人工筛查和实验验证成本。
💊

适用于蛋白质设计早期探索阶段

在酶设计、抗体序列优化、蛋白变体生成等任务中,早期通常需要快速生成并筛选大量候选序列。该方案可作为前置生成与排序模块,为后续结构预测、功能预测和实验验证提供更优候选池。