GLOSSARY

术语表:生物词 → 编程词

遇到不认识的词直接 Ctrl+F。每一条都给一句人话一个编程类比

共 45 条

分子与结构

氨基酸 amino acid
蛋白质的组成单元,标准的有 20 种,每种用一个大写字母表示。 ≈ 字符集(20 个字母)
序列 sequence
把一个蛋白质的氨基酸按顺序写成的字符串,如 DVQLQESGPGLV…。 这个领域一切数据的基础形态。≈ str
残基 residue
序列里的一个位置。说「第 202 位残基」就是说「字符串的第 202 个字符」, 只不过它还带着编号基准这个上下文。≈ 字符串的一个索引位
折叠 folding
一维序列自发卷成特定三维形状的过程。形状决定功能, 所以「序列 → 结构 → 功能」是整个领域的主线。
结构 structure
蛋白质的三维原子坐标。实验测定成本高(晶体学、冷冻电镜),所以数量远少于序列。 ≈ 每个原子一条 (x, y, z) 记录
抗体 antibody / immunoglobulin, Ig
免疫系统用来识别特定目标的蛋白。最常见的 IgG 形态是 Y 形, 由 2 条重链 + 2 条轻链组成。(分泌型 IgM 是五聚体、分泌型 IgA 常是二聚体, 但做数据时你遇到的绝大多数是 IgG 形态。) ≈ 由 4 条 string 组成的复合对象
重链 / 轻链 heavy chain / light chain
抗体的两种链,重链长、轻链短。数据字段里常写作 H / L。
可变区 variable region, VH / VL
Y 的两个尖端,每个抗体都不同,决定这个抗体抓谁。做数据时保留的就是这一段。 ≈ 实例字段
恒定区 constant region, CH / CL
Y 的下半部分,同类抗体几乎完全一样,对区分实例没有信息量,通常切掉。 ≈ 类的公共部分
CDR / 互补决定区 complementarity-determining region
可变区里真正伸出去接触目标的 6 个环(重链 3 个、轻链 3 个)。 占序列比例很小却决定特异性。≈ 决定行为的那几个关键子串
CDRH3
重链的第三个 CDR,最长、变化最大,由基因重组随机拼接产生, 是特异性的主要来源。去重和聚类通常以它为轴。≈ 天然主键
框架区 framework region, FR
可变区里 CDR 之外的部分,起支撑作用,序列上保守得多。 ≈ 骨架代码,CDR 是可插拔的策略
VHH / 纳米抗体 nanobody, sdAb
只有重链、没有轻链的单域抗体,来自骆驼科动物(羊驼、骆驼、美洲驼)。 个头小、易改造,是热门方向。写代码判断「有无轻链」时必须考虑这一类。
VNAR / IgNAR
来自鲨鱼的单域抗体,与 VHH 是独立演化出来的两套东西。 「VHH 来自羊驼和鲨鱼」是流传很广的错误说法——鲨鱼那类叫 VNAR。
Fab / Fv / scFv
抗体的几种常见片段形式。Fv 是最小的完整识别单元(VH + VL); scFv 是用一段接头把 VH 和 VL 连成单链;Fab 还带一部分恒定区。 数据里同一个抗体可能以不同片段形式出现。
种系基因 germline gene
抗体可变区重组前的基因模板。切可变区、判断编号边界都要与它比对。 ≈ 基类 / 模板,实例由它变异而来

结合与亲和力

抗原 antigen
被抗体抓住的整个分子,比如「PD-1 蛋白」。 一个抗原上通常有多个不同的表位。≈ 整个对象
靶点 target
做药时想干预的那个蛋白。在数据里通常就是抗原, 必须归一到 UniProt 登录号才能当外键用。
表位 epitope
抗原上真正被抓住的那几个残基。不是整个抗原。 ≈ 对象实际暴露出来的那个接口
互补位 paratope
抗体这一侧实际发生接触的残基,位于 CDR 上。 ≈ 接口的实现方
线性表位 linear / continuous epitope
连续的一段氨基酸,可以直接当子串比对。
构象表位 conformational / discontinuous epitope
序列上离得很远、折叠后才凑到一起的几个残基。 只能从三维结构算,而且占大多数。 所以「从一维序列预测表位」对这一类并不成立。
亲和力 affinity
抗体和抗原结合的牢固程度,通常用 KD 表示。
KD / 解离常数 dissociation constant
单位 M(摩尔浓度),数值越小结合越强。 治疗性抗体大致在低 nM(10⁻⁹)到 pM(10⁻¹²)区间。 关系式 KD = koff / kon≈ 延迟指标:越小越好,只看数量级
kon / koff(也写作 ka / kd)
结合速率与解离速率。结合越快、脱落越慢,KD 越小。 只有实时动力学方法(SPR、BLI)能同时给出这两个值。
ΔΔG
单点突变造成的结合自由能变化,单位常为 kcal/mol。 不同数据库对「变强」用正号还是负号约定不一致, 合并前必须核对符号约定。≈ A/B 测试的 delta
SPR surface plasmon resonance
表面等离子共振。实时测结合与解离,同时给 ka / kd / KD。亲和力的金标准。
BLI bio-layer interferometry
生物膜干涉。同样是实时动力学方法,同样给 ka / kd / KD,通量高、成本低。
ELISA enzyme-linked immunosorbent assay
酶联免疫吸附。可以定量测浓度,但在亲和力方向只给 EC50 / IC50 这类 表观值,受实验条件影响、跨实验室不可直接比较,不是 KD 的来源
中和抗体 neutralizing antibody
不仅结合、还能阻断目标功能的抗体。「结合」和「中和」是两个不同的标签, 数据里混用会出问题。

格式与标识符

FASTA
最简单的序列文件格式:> 开头一行描述(defline),下面是序列。 1985 年至今没被取代。≈ 一行 header + 一段 payload
PDB Protein Data Bank
全球蛋白质三维结构的公共库,每个结构一个 4 位编号(如 5B8C)。
链 ID chain ID
PDB 结构里每条链的字母标识。没有语义,完全由沉积者自定。 以为「H 就是重链、L 就是轻链、A 就是抗原」是常见且代价很高的错误—— 5B8C 的重链就是 B/E/H/K、轻链是 A/D/G/J、抗原是 C/F/I/L。
UniProt 登录号 accession
蛋白的全球唯一标识,如人 PD-1 是 Q15116靶点必须归一到它,因为名字会撞。≈ 主键 / UUID
HGNC
人类基因命名委员会,人类基因符号的权威。 和 UniProt 是相互独立的两个源,所以适合互相复核—— 但要注意它们对「什么算别名」的记录并不完全一致
别名 / CD 号 alias / synonym
同一个蛋白的多个名字(PD-1 = PDCD1 = CD279)。 不同基因之间的别名会互相撞车,所以别名不能当第一路由。 ≈ display name,会变、会撞
编号体系 numbering scheme
让不同长度的抗体可变区能按「结构位置」对齐比较的一套规则。 常用的不止三套,还有 Martin、AbM、Contact、AHo、North 等。 ≈ 并存的多个 schema 版本
IMGT
1997 年提出的编号体系,跨物种、跨受体类型通用,目前最主流
Kabat
1970 年代起的最早一套编号,按序列变异度划 CDR。早期文献大量沿用。
Chothia
1987 年提出,按结构环的起止划 CDR,做建模时常用。 注意:Chothia 与 Kabat 对 CDR-H3 的定义是相同的,差别在 H1 / L1。
ANARCI
常用的抗体编号工具,能按多种体系给序列编号。 它是复核你自己 CDR 切法的独立工具
模糊码 ambiguity code
序列里表示「不确定是哪个残基」的字母,如 XBZ。 真实数据一定有,正确做法是标记出来而不是放宽校验。

数据工程与质量

实体归一 entity resolution / normalization
把各种写法的名字统一映射到一个稳定主键。这个领域最容易出错的一层。 ≈ 主数据管理
交叉源验证 cross-source validation
用一个独立的权威源复核另一个源产出的结果,两边一致才算过。 用产出结果的源检查结果 = 循环论证。 ≈ 不能用被测代码自己的逻辑写断言
证据分级 evidence tier
给每条记录标明「凭什么成立」和强度:结构确证 > 官方靶点 > 策展实验记录 > 文献/专利声明 > 仅关键词共现(应剔除)。 ≈ 数据血缘 + 置信度分层
可溯源 provenance / traceability
每条记录能指回原始出处,且打开之后内容确实佐证这条关系。 链接能打开只是最低要求。
QC 标记 QC flags
数据集自带的已知缺陷清单。全是 OK 反而可疑—— 真实策展数据一定有瑕疵。≈ known issues 列表
免疫组库 repertoire
从个体测序得到的海量抗体序列集合,可达十亿级, 但不知道每条抓什么。对从头设计任务价值很低,却非常适合用来凑条数
binding context
「这条抗体序列配的是哪个靶点」这个标签。 没有它的序列对监督学习是没有 label 的样本
AI for Science / AI4S
用机器学习方法解决自然科学问题。与通用 AI 最大的区别是 数据来自真实实验:成本极高、总量极小,所以数据质量常比模型选择更决定成败。
AlphaFold
DeepMind 的蛋白结构预测模型。AlphaFold2 让单体折叠预测达到接近实验精度; AlphaFold-Multimer 与 AlphaFold 3 扩展到复合物。 抗体-抗原界面仍是其中最弱的一类。
从头设计 de novo design
给定靶点直接生成抗体序列。当前最热的方向, 也是最依赖「靶点 ↔ 序列」配对数据的方向。
没找到你要的词?

这份表会持续补。缺哪个词 提个 issue 告诉我, 或者直接发 PR——词条源文件在这里