DAY 2 · S5 · 上午 60 分钟

AI for Science 在这里做什么

不讲模型细节,只讲有哪几类任务、各自的输入输出和现状

U5.1分水岭:AlphaFold

2020 年之前,测定一个蛋白质的三维结构要在实验室花几个月到几年 (X 射线晶体学、冷冻电镜)。DeepMind 的 AlphaFold2 让 「从序列预测单体结构」在大多数情况下达到接近实验的精度,把周期压到分钟级。

AlphaFold 解决的给定一条序列,它折成什么形状
predict(str) -> Structure3D单体,已基本可用
但要精确地记住它的边界(这一段值得慢读)

AlphaFold2 解决的是单体蛋白怎么折叠。 之后 AlphaFold-Multimer(2021)和 AlphaFold 3(2024) 把能力扩展到了复合物,在很多蛋白-蛋白体系上确实已经可用。

但抗体-抗原界面仍是其中最弱的一类。 AlphaFold 3 原文自己就把抗体-抗原单独拎出来讨论: 相比 AlphaFold-Multimer v2.3 有显著提升, 但需要大幅增加采样(上千个 seed)才能拿到好结果—— 这本身就说明它离「稳定可用」还有距离。

根本原因:CDRH3 由基因重组随机产生,没有进化同源信息可借鉴, 而共进化信号恰恰是这套方法最依赖的东西。
这就是为什么这个领域至今高度依赖真实实验数据。

说法要精确,这本身就是判断力的一部分:
❌ 「AlphaFold 没解决蛋白复合物」——过时了,AF-Multimer 和 AF3 之后不能这么说。
❌ 「AlphaFold 解决了抗体设计」——的。
✅ 「单体折叠基本解决,一般复合物大幅改善,抗体-抗原仍是公认难点。」

能把这句话说准,你在这个话题上的可信度就已经超过大多数人。 而这门课第一版恰好写成了那个过时的说法—— 一份 2020 年的正确结论,到 2026 年会变成一个显得外行的错误。 时效性是科学材料的一等公民,不是脚注。
AlphaFold — The Most Useful Thing AI Has Ever Done YouTube · Veritasium · 如果整个课程你只看一个视频,就看这条。 顶级科普频道,完全面向外行,可开自动中文字幕。

U5.2三类任务,用函数签名来理解

# ① 结构预测 —— 单体基本可用,抗体-抗原复合物仍难
def predict_structure(seq: str) -> Structure3D: ...

# ② 亲和力预测 —— 数据太少,跨靶点泛化差
def predict_affinity(ab: str, ag: str) -> float:   # KD 或 ΔΔG

# ③ 从头设计 —— 最热,也最需要配对数据
def design_antibody(target: str) -> list[str]: ...

第三个是当下最受关注的方向。它需要大量 「靶点 ↔ 抗体序列」的成对样本来学这个映射。

翻译一句常见的验收标准

行业里常见这句要求: 「序列不能只是随机抗体库,需要有 binding context」
翻译成工程语言就是:没有 label 的样本,对监督学习没用。
一个十亿条序列的免疫组库(repertoire)如果不知道每条抓什么, 对这个任务的价值接近于零——但它非常适合用来凑条数。 记住这一条,S8 会用到。

U5.3为什么数据是瓶颈,不是模型

NLP / CV抗体 AI
数据获取互联网上几乎无限每条都来自真实实验或专利披露
标注成本众包即可需要领域专家,很多标注本身就要做实验
数据量级万亿 token抗体-抗原结构复合物只有数千个,高质量定量亲和力只有数百条量级
脏数据后果模型稍差学到错误的结合规律,静默失效

最后一行是这门课存在的理由。在 NLP 里脏数据让指标掉两个点; 在这里,一批被错误归因的配对会让模型学到一个物理上不存在的规律, 而且从损失曲线上完全看不出来——因为验证集是用同样的方法造的, 脏得一模一样

训练集和验证集用同一条脏管线生成指标很好看,模型是错的
data leakage你已经很熟悉这种失败模式
AI 製藥的護城河:不是大模型,而是「定制化模型」 YouTube · 制藥漫談 · 中文 · 和上面这张表互为印证

当堂自测

S5 · AI 在做什么