DAY 2 · S5 · 上午 60 分钟
AI for Science 在这里做什么
不讲模型细节,只讲有哪几类任务、各自的输入输出和现状。
U5.1分水岭:AlphaFold
2020 年之前,测定一个蛋白质的三维结构要在实验室花几个月到几年 (X 射线晶体学、冷冻电镜)。DeepMind 的 AlphaFold2 让 「从序列预测单体结构」在大多数情况下达到接近实验的精度,把周期压到分钟级。
AlphaFold2 解决的是单体蛋白怎么折叠。
之后 AlphaFold-Multimer(2021)和 AlphaFold 3(2024)
把能力扩展到了复合物,在很多蛋白-蛋白体系上确实已经可用。
但抗体-抗原界面仍是其中最弱的一类。
AlphaFold 3 原文自己就把抗体-抗原单独拎出来讨论:
相比 AlphaFold-Multimer v2.3 有显著提升,
但需要大幅增加采样(上千个 seed)才能拿到好结果——
这本身就说明它离「稳定可用」还有距离。
根本原因:CDRH3 由基因重组随机产生,没有进化同源信息可借鉴,
而共进化信号恰恰是这套方法最依赖的东西。
这就是为什么这个领域至今高度依赖真实实验数据。
❌ 「AlphaFold 没解决蛋白复合物」——过时了,AF-Multimer 和 AF3 之后不能这么说。
❌ 「AlphaFold 解决了抗体设计」——错的。
✅ 「单体折叠基本解决,一般复合物大幅改善,抗体-抗原仍是公认难点。」
能把这句话说准,你在这个话题上的可信度就已经超过大多数人。 而这门课第一版恰好写成了那个过时的说法—— 一份 2020 年的正确结论,到 2026 年会变成一个显得外行的错误。 时效性是科学材料的一等公民,不是脚注。
U5.2三类任务,用函数签名来理解
# ① 结构预测 —— 单体基本可用,抗体-抗原复合物仍难 def predict_structure(seq: str) -> Structure3D: ... # ② 亲和力预测 —— 数据太少,跨靶点泛化差 def predict_affinity(ab: str, ag: str) -> float: # KD 或 ΔΔG # ③ 从头设计 —— 最热,也最需要配对数据 def design_antibody(target: str) -> list[str]: ...
第三个是当下最受关注的方向。它需要大量 「靶点 ↔ 抗体序列」的成对样本来学这个映射。
行业里常见这句要求:
「序列不能只是随机抗体库,需要有 binding context」。
翻译成工程语言就是:没有 label 的样本,对监督学习没用。
一个十亿条序列的免疫组库(repertoire)如果不知道每条抓什么,
对这个任务的价值接近于零——但它非常适合用来凑条数。
记住这一条,S8 会用到。
U5.3为什么数据是瓶颈,不是模型
| NLP / CV | 抗体 AI | |
|---|---|---|
| 数据获取 | 互联网上几乎无限 | 每条都来自真实实验或专利披露 |
| 标注成本 | 众包即可 | 需要领域专家,很多标注本身就要做实验 |
| 数据量级 | 万亿 token | 抗体-抗原结构复合物只有数千个,高质量定量亲和力只有数百条量级 |
| 脏数据后果 | 模型稍差 | 学到错误的结合规律,静默失效 |
最后一行是这门课存在的理由。在 NLP 里脏数据让指标掉两个点; 在这里,一批被错误归因的配对会让模型学到一个物理上不存在的规律, 而且从损失曲线上完全看不出来——因为验证集是用同样的方法造的, 脏得一模一样。