BioCandidateRanker:一个酶动力学预测的诚实败局
计算生物学

BioCandidateRanker:一个酶动力学预测的诚实败局

2026年7月28日 约 4 分钟

这篇文章记录一个”没做成”的项目。它没有漂亮的 SOTA 数字,没有”我们首次实现了……”的句式。但它有 139 个通过的单元测试、SHA256 冻结的文件清单,以及一个我花了三个月才学会的教训:模型复杂度的增加,不等于科学问题的推进

问题:酶工程中的”选谁”

酶工程的核心决策不是”怎么改”,而是”改谁”。当你面对一个代谢途径的 50 个候选酶,需要预测哪个酶的 kcat(催化转换数)最高——这就是酶候选排序问题。

现有方法(如 DLKcat)只看蛋白序列。但直觉告诉我:酶好不好用,不只取决于酶本身,还取决于它和底物的匹配、它来自什么生物体、它催化什么类型的反应

于是 BioCandidateRanker 的设计思路是”多模态融合”:

输入:
  ├─ 蛋白序列 → 分块注意力(Chunked Attention)
  ├─ 底物分子图 → 稀疏消息传递(Sparse MPNN)
  ├─ 生物体/EC/反应上下文 → 嵌入拼接
  └─ (可选) FBA 通量特征 → COBRA 模拟

输出:
  log₁₀(kcat) 预测 + 异方差高斯不确定性

536,520 个参数,64 维隐藏层。不大,但结构精心设计。

内部基准:多模态被指纹追平

我用 MMseqs2 做了严格的同源冷切分(30% identity, 80% coverage),确保测试集与训练集无序列同源。三种种子取均值:

模型Test RMSE标准差
BioCandidateRanker(多模态)1.4699±0.0064
Late-concat(晚期拼接)1.4801±0.0230
Morgan MLP(仅分子指纹)1.4756±0.0024

关键发现:Morgan 指纹 + 一个简单 MLP,几乎追平了精心设计的多模态模型。蛋白序列信息在 kcat 预测中的边际贡献,接近于零

这个结果刺痛了我,但它是一个真实的科学发现:在现有数据规模下,kcat 的方差主要由底物化学结构解释,而非酶的序列特征。

外部基准:排序能力不存在

内部 RMSE 接近不代表排序能力。酶工程的真实需求是”把好的酶排在前面”。我用了两个外部基准:

EnzEngDB 工程活动排序

从 Zenodo(DOI: 10.5281/zenodo.17310823)获取工程化酶的活动数据,三种子训练:

  • Spearman 相关:-0.026 ± 0.080
  • 配对准确率:0.524(接近随机掷硬币的 0.5)

IMDH 突变景观

Lunzer 实验室的 IMDH(异柠檬酸脱氢酶)突变体动力学数据(Dryad),直接测 kcat:

  • BioCandidateRanker Spearman:-0.166
  • DLKcat Spearman:-0.259
  • 随机排序期望:0.0

两个方法都是负相关——不如随机。这意味着当前深度学习方法在单点突变 kcat 预测上,不仅没有用,甚至有微弱的反向误导。

为什么失败:一个诚实的诊断

三个月后,我的诊断是:

  1. 数据瓶颈:BRENDA 的 kcat 数据噪声极大(不同实验室、不同条件、不同底物浓度),训练信号被淹没。
  2. 任务错配:kcat 是一个高度上下文依赖的量(pH、温度、离子强度),而模型只看到了序列和结构。
  3. 基线太强:Morgan 指纹编码了底物的完整化学信息,而 kcat 的方差确实主要由”底物是什么”决定。
  4. 外部分布偏移:训练集(BRENDA 广谱酶)与测试集(工程化突变体)的分布完全不同。

项目的归宿:冻结与开放

2026 年 7 月 27 日,我正式将项目归档为 software-implementation-v1:

  • 139 个测试全部通过,Ruff 代码检查清洁
  • SHA256 文件级冻结(可精确复现任何一次实验)
  • 所有数据切分、随机种子、超参数写入 manifest
  • 科学状态:blocked_pending_external_data

我没有删除代码,也没有假装它”还有潜力”。它被诚实地标记为:软件可用,科学结论为负面

下一步是写一篇 benchmark/negative-result 方法论文,标题大概是:“多模态融合不能拯救酶动力学预测:一个系统性负面结果”。负面结果不丢人,藏着负面结果才丢人。

哲学小结

这个项目教会我的,比任何一个”成功”的项目都多。

“无性之美”在这里体现为工程的精确性:139 个测试、SHA256 冻结、三种子协议——每一个数字都可追溯、可复现。但”有性之美”——那个我期待的”多模态碰撞产生新洞察”的涌现——没有发生

不是所有杂交都能产生有活力的后代。有时候,你精心设计的多模态融合,不如一个 1024 位的分子指纹。承认这一点,本身就是科学。

—— 琉卜 齐鲁工业大学(山东省科学院)

评论