AI FOR SCIENCE · 生物数据方向 · 免费开源

看懂生物数据,
判断一个 AI4S 项目的真假

两天,零生物背景,学会读懂一份抗体/蛋白数据集、并在五分钟内判断它可不可信。这个领域最稀缺的不是模型能力,是判断一份科学数据是真是假的能力——而那正是你已经练了很多年的东西。

2 天 · 8 节课6 个可运行实验35 道检验题结业可领结业证明前置:会写 Python生物基础:

学完这两天,你能做四件以前做不了的事

01
看懂一份生物数据表的每一列

拿到一份抗体/蛋白数据集,能逐列说出它是什么、为什么存在、缺了它会怎样。 不再是「看不懂所以只能信对方」。

02
五分钟判断它可不可信

不需要生物学知识,用纯算术和抽查就能发现数据是编的、抄的、还是真算出来的。 课程直接给你那份清单。

03
问出让对方答不上来的问题

供应商报「结合数据 8,000 条」时,你知道该追问「其中定量 KD 有多少条」—— 真实案例里答案是 49 条

04
亲手跑通一条生物数据管线

六个可运行的 Python 实验:读数据、做体检、复现 bug、交叉验证、 从三维结构算表位、写质检断言。

一句话

这门课的目标是判断力,不是让你去训模型。
因为在这个领域,判断一份数据是真是假,比选哪个模型重要得多

先花 5 分钟,看看这个领域在解决什么问题

看完你就知道这门课值不值得学下去。可开自动中文字幕。

这条讲的是结构预测这一块。 课程的 S5 会告诉你它解决了什么、没解决什么—— 以及为什么剩下没解决的那部分,瓶颈在数据不在模型。

怎么学:两天,四个阶段

从零基础到能独立判断。每一阶段都有当堂自测,做错了回上一节。

1
建立词汇表

把生物概念翻译成你已经懂的编程概念。蛋白质是字符串,抗体是 4 条链的对象, UniProt 登录号是主键。

150 分钟 · 9 道自测
2
看懂真实数据

格式、标识符、三套并存的编号体系。然后打开一条真实记录, 把前面学的每个概念在里面逐个找到。

150 分钟 · 6 道自测 · 2 个实验
3
建立判断力 ← 全课核心

AI 在这里做什么、数据工程的真实形态,然后亲手把四个真实的 bug 跑出来: 词边界假阳性、别名劫持、从结构实算表位、断言式质检。

210 分钟 · 14 道自测 · 4 个实验
4
拿去用

三维验收标准、十个必问问题、五分钟抽查法、红旗清单。 可以直接抄进合同或尽调清单。

60 分钟 · 20 题结业考
时间不够怎么办:直接跳到阶段 3 的 S7 和阶段 4 的 S8。 那两节讲的是方法不是知识——「不能自证要用独立源复核」这类结论, 不需要你先懂抗体也能用。概念卡住了回术语表查。

说清楚这门课的范围

AI for Science 很大,这门课只讲其中一块:生物数据。 具体是抗体与蛋白质方向的数据采集、清洗、归一与质量验证。

✓ 讲
  • 蛋白质/抗体序列与结构的数据表示
  • 抗原、表位、亲和力这些概念怎么读
  • 生物数据的实体归一与交叉源验证
  • 数据质量的证伪方法与验收标准
  • AI 在这个方向能做什么、边界在哪
✗ 不讲
  • 材料、气候、天文等其它 AI4S 方向
  • 怎么训练模型、调参、写网络结构
  • 湿实验操作、分子生物学实验技术
  • 药物化学、小分子药物设计
  • 系统的免疫学或结构生物学课程
为什么要把范围说这么死

因为一门讲「怎么识破夸大数据」的课,没有资格夸大自己的覆盖面
你花两天能真正拿到的是生物数据这一块的判断力——这已经足够让你判断 一个抗体 AI 项目、一份科学数据集、或一个这方向的候选人。

为什么程序员学这个特别快

因为这个方向真正难的部分不是生物学,是数据工程——而那是你的主场, 只是词汇表不一样:

它在这个领域叫什么你其实早就在做的事
靶点归一化entity resolution / 外键解析
证据分级数据血缘 + 置信度分层
交叉源验证不能用被测代码自己的逻辑写断言
IMGT / Kabat / Chothia 编号并存的多个 schema 版本
表位编号跨毒株失效两份数据用了不同的坐标基准
断言式质检写 pytest,挂了打印哪几行

缺的不是能力,是词汇表。补上大概需要两天。

先剧透最值钱的那一节

S7 有个实验,同时问两个独立权威数据库同一个问题, 用两种都很「合理」的查法。真实输出:

输入     HGNC      UniProt-A 朴素                      UniProt-B 严谨
CCR4   CCR4      CCR4 P51679 [Homo sapiens]        NOCT Q9UK39      ← 别名劫持
HER2   ERBB2     GTF1 P53260 [Saccharomyces]     ERBB2 P04626     ← 跨物种泄漏
OX40   TNFRSF4   - O02764 [Oryctolagus]          (查不到)         ← 兔子同源

两种查法都不对,而且它们以不同方式错。 「朴素」查法把 HER2 认成了酿酒酵母的基因, 「严谨」查法把 CCR4 认成了另一个完全不同的蛋白。 而这些结果字段齐全、格式正确,从表面完全看不出来

整门课的方法论

用产出结果的同一个源去检查结果 = 循环论证。
必须拿另一个独立权威源来对,两边一致才算过。
这条对你用 AI 生成的任何东西同样成立。

常见问题

需要生物学基础吗?

不需要,一点都不需要。课程的设计前提就是零生物背景: 每个生物概念都先映射到一个你已经熟悉的编程概念,再讲它的生物含义。 唯一的前置要求是会写 Python。

这是完整的 AI for Science 课程吗?

不是。它只覆盖生物数据这一个方向(抗体与蛋白质的数据工程与质量验证)。 材料、气候、天文等其它 AI4S 方向不在范围内,模型训练也不讲。 范围声明见上面那一节。

学完有证书吗?

有一份自助结业证明:做完 结业考试 达标后可以直接下载, 也可以提 PR 进仓库的结业名录。
但要说清楚——它是自助生成的,不是第三方认证。 一门讲「怎么识破包装」的课,不会给自己发一个假装很权威的证书。 它的用处是证明你真的跑完了这套材料,仅此而已。

要花多少钱?

免费。全部内容和六个实验的源码都在 GitHub 上开放, 内容 CC BY-SA 4.0,代码 MIT。不卖东西,不收邮箱。

从这里开始