蛋白质生成
业务痛点 PAIN POINTS
蛋白质序列设计需要在极大的氨基酸组合空间中寻找合理候选。一个序列是否可用,不只取决于单个氨基酸是否常见,还取决于整条序列是否符合真实蛋白质的统计分布、结构稳定性、进化保守性和潜在功能模式。
📉
传统筛选成本高
传统方法多依赖人工规则或枚举方式筛选候选序列成本极高,难以覆盖有效搜索空间。
⚠️
候选质量难判经典预训练扩散模型可以生成蛋白质候选序列,但生成多个候选后,仍需要判断哪些序列更接近真实蛋白分布。仅依赖生成模型自身的采样概率,可能无法充分完成候选质量筛选。
场景亮点 HIGHLIGHTS
解决方案 SOLUTION
01
DPLM+BM融合架构
本案例采用扩散蛋白质语言模型(DPLM)与玻尔兹曼机能量模型 (BM) 融合的生成方案。冻结的DPLM Proposal Backbone根据噪声序列预测氨基酸token,并生成多个候选蛋白质序列;Energy分支使用独立的DPLM Backbone,提取噪声序列与候选序列的上下文特征,经池化、拼接和投影后映射到BM可见空间,由BM计算候选序列的条件能量;Q-Diffusion根据能量分数完成候选重排,并通过迭代去噪和重掩码逐步优化生成结果;专用量子计算机主要参与BM能量模型的组合采样与低能量状态搜索。
落地效果 RESULTS
📈
生成序列整体质量提升
-15.42%
平均余弦距离
在公开蛋白质数据集的100组测试样本中,Q-Diffusion引入BM能量引导后,ESM2平均余弦距离由0.228741降至0.193466,下降15.42%,生成序列在ESM2表征空间中更接近参考蛋白质序列。
📈
典型样本生成效果改善
-21.71%
余弦距离中位数
ESM2余弦距离中位数由0.208566降至0.163282,下降21.71%,表明质量提升并非仅由少数样本贡献,多数测试样本均获得改善。
📈
蛋白质表征偏差降低
-8.36%
平均L2距离
ESM2平均L2距离由5.105006降至4.678294,下降8.36%;L2距离中位数由4.967555降至4.484152,下降9.73%。
应用价值 VALUE
🎓
提升蛋白质候选序列筛选效率
该案例在DPLM生成多个候选后,通过BM能量模型进行二次筛选和重排,有助于从大量候选中优先挑选更接近真实蛋白分布的序列,降低后续人工筛查和实验验证成本。
💊
适用于蛋白质设计早期探索阶段
在酶设计、抗体序列优化、蛋白变体生成等任务中,早期通常需要快速生成并筛选大量候选序列。该方案可作为前置生成与排序模块,为后续结构预测、功能预测和实验验证提供更优候选池。