本教程用于快速理解常见生物分子结构文件格式:PDB、PDBQT、PQR 和 mmCIF。重点放在文件内容、字段含义、典型用途和示例,不涉及编程解析实现。
| 格式 | 主要用途 | 核心特点 | 常见场景 |
|---|---|---|---|
| PDB | 通用三维结构坐标 | 固定列宽,人眼可读 | 蛋白、核酸、配体、水、离子结构 |
| PDBQT | 分子对接 | PDB + partial charge + AutoDock atom type | AutoDock, AutoDock Vina |
| PQR | 静电势计算 | PDB + charge + radius | APBS、PDB2PQR |
| mmCIF | 现代 PDB 数据库格式 | 标签化字段,适合大结构 | RCSB PDB 下载、结构数据库、复杂体系 |
一句话记忆:
PDB 看坐标,PDBQT 看对接,PQR 看电荷半径,mmCIF 看结构化字段。
PDB 是最经典的生物大分子结构格式。它用文本保存原子坐标、残基信息、链信息、晶胞信息、实验注释等内容。
PDB 的核心特点是:固定列宽。也就是说,每一行中某个字段的位置由列号决定,而不是简单按空格分隔。
一个典型 PDB 文件可能包含这些记录:
| 记录 | 含义 |
|---|---|
HEADER |
文件头,包含分类、日期、PDB ID |
TITLE |
结构标题 |
COMPND |
分子组成信息 |
SOURCE |
来源物种或表达系统 |
KEYWDS |
关键词 |
EXPDTA |
实验方法,如 X-ray、NMR、EM |
REMARK |
注释信息 |
SEQRES |
序列信息 |
CRYST1 |
晶胞参数 |
ATOM |
标准残基中的原子坐标 |
HETATM |
非标准残基、配体、水、离子等坐标 |
TER |
一条链结束 |
MODEL / ENDMDL
|
多模型结构 |
CONECT |
原子连接关系 |
END |
文件结束 |
最常用、最重要的是 ATOM 和 HETATM。
HEADER OXYGEN TRANSPORT 07-MAR-84 4HHB
TITLE THE CRYSTAL STRUCTURE OF DEOXY HUMAN HEMOGLOBIN
EXPDTA X-RAY DIFFRACTION
CRYST1 63.150 83.590 53.800 90.00 99.34 90.00 P 1 21 1 4
ATOM 1 N VAL A 1 18.715 24.840 4.621 1.00 33.80 N
ATOM 2 CA VAL A 1 17.647 23.823 4.529 1.00 33.22 C
ATOM 3 C VAL A 1 16.307 24.438 4.965 1.00 32.66 C
ATOM 4 O VAL A 1 16.167 25.650 5.138 1.00 33.14 O
HETATM 1001 FE HEM A 142 12.323 18.441 7.552 1.00 21.30 FE
HETATM 2001 O HOH A 301 25.113 17.892 10.442 1.00 40.10 O
TER
END
PDB 的坐标行有固定字段。下面以 ATOM 行为例:
ATOM 1 N VAL A 1 18.715 24.840 4.621 1.00 33.80 N
| 字段 | 示例 | 含义 |
|---|---|---|
| record | ATOM |
记录类型 |
| serial | 1 |
原子编号 |
| atom name | N |
原子名 |
| altLoc | 空 | 替代构象标记 |
| resName | VAL |
残基名 |
| chainID | A |
链 ID |
| resSeq | 1 |
残基编号 |
| iCode | 空 | 插入码 |
| x, y, z | 18.715 24.840 4.621 |
三维坐标,单位通常是 Å |
| occupancy | 1.00 |
占有率 |
| B-factor | 33.80 |
温度因子 |
| element | N |
元素符号 |
| 记录 | 常见对象 |
|---|---|
ATOM |
标准蛋白氨基酸、标准核酸残基 |
HETATM |
配体、金属离子、水、辅因子、非标准残基 |
例子:
ATOM 1 CA ALA A 1 10.000 12.000 8.000 1.00 20.00 C
HETATM 501 C1 LIG A 101 15.200 10.400 5.600 1.00 18.00 C
HETATM 601 O HOH A 201 20.100 15.300 9.200 1.00 35.00 O
HETATM 701 NA NA A 301 22.000 13.000 7.500 1.00 25.00 NA
这里:
ALA 是标准氨基酸,所以通常是 ATOM。LIG 是小分子配体,所以通常是 HETATM。HOH 是水。NA 是钠离子。chainID 是链 ID,通常为一个字符:
ATOM 1 N MET A 1 ...
ATOM 500 N GLY B 1 ...
这里 A 和 B 是两条链。
注意:PDB 的 chain ID 很短,复杂体系中可能不够用,这也是 mmCIF 更适合大结构的原因之一。
resName 是残基名:
ALA GLY VAL LYS ARG
DA DT DG DC
HOH WAT SOL
LIG ATP HEM
写 GROMACS selection 或做结构筛选时,残基名非常重要。例如:
resname LIG
resname HOH
resname ATP
resSeq 是残基编号,iCode 是插入码。有些结构中会出现:
42
42A
42B
这表示残基编号相同,但插入码不同。做精确残基定位时,不应只看编号。
altLoc 表示替代构象,常见为 A、B:
ATOM 32 CA AARG A 10 11.281 86.699 94.383 0.50 35.88 C
ATOM 33 CA BARG A 10 11.296 86.721 94.521 0.50 35.60 C
这通常表示同一个原子有两个可能位置,每个位置 occupancy 为 0.50。
优点:
限制:
REMARK 中,不够结构化。因此,现代结构数据库更推荐使用 mmCIF。
PDBQT 常用于分子对接,尤其是 AutoDock 和 AutoDock Vina。
可以把 PDBQT 理解为:
PDB + Q + T
其中:
Q = partial charge,部分电荷T = AutoDock atom type,AutoDock 原子类型ROOT
HETATM 1 C1 LIG A 1 12.345 10.234 5.678 1.00 0.00 0.120 C
HETATM 2 N1 LIG A 1 13.210 11.002 5.112 1.00 0.00 -0.350 NA
HETATM 3 O1 LIG A 1 11.800 9.100 5.000 1.00 0.00 -0.420 OA
ENDROOT
TORSDOF 3
和 PDB 相比,PDBQT 行尾多了两类信息:
| 字段 | 示例 | 含义 |
|---|---|---|
| partial charge |
0.120、-0.350
|
对接程序使用的部分电荷 |
| AutoDock atom type |
C、NA、OA
|
AutoDock 原子类型 |
常见 AutoDock atom type:
| 类型 | 大致含义 |
|---|---|
C |
碳 |
A |
芳香碳 |
N |
氮 |
NA |
氢键受体氮 |
O |
氧 |
OA |
氢键受体氧 |
S |
硫 |
HD |
极性氢 |
配体 PDBQT 里可能出现:
ROOT
ENDROOT
BRANCH
ENDBRANCH
TORSDOF
它们用于描述配体可旋转键。
| 记录 | 含义 |
|---|---|
ROOT / ENDROOT
|
配体的刚性核心 |
BRANCH / ENDBRANCH
|
可旋转分支 |
TORSDOF |
可旋转自由度数量 |
示意:
ROOT
HETATM 1 C1 LIG A 1 ...
HETATM 2 C2 LIG A 1 ...
ENDROOT
BRANCH 2 3
HETATM 3 C3 LIG A 1 ...
HETATM 4 O1 LIG A 1 ...
ENDBRANCH 2 3
TORSDOF 1
如果只是查看坐标,可以关注 ATOM/HETATM 行。
如果要用于对接,不要随意删除 ROOT/BRANCH/TORSDOF 这些记录。
PDBQT 常用于:
receptor.pdbqt
ligand.pdbqt
注意事项:
PQR 常用于静电势计算,例如 APBS、PDB2PQR。
可以把 PQR 理解为:
PDB + charge + radius
它通常把 PDB 中 occupancy 和 B-factor 的位置换成:
ATOM 1 N MET A 1 38.428 13.947 27.214 -0.3000 1.8500
ATOM 2 CA MET A 1 37.319 14.801 27.701 0.2100 2.2750
ATOM 3 C MET A 1 36.008 14.042 27.457 0.5100 2.0000
ATOM 4 O MET A 1 35.900 12.820 27.300 -0.5100 1.7000
这里末尾的两个数字不是 occupancy 和 B-factor,而是:
| 字段 | 示例 | 含义 |
|---|---|---|
| charge | -0.3000 |
部分电荷 |
| radius | 1.8500 |
原子半径 |
| 问题 | PDB | PQR |
|---|---|---|
| 主要用途 | 通用结构坐标 | 静电势计算 |
| 坐标 | 有 | 有 |
| occupancy | 有 | 通常没有 |
| B-factor | 有 | 通常没有 |
| charge | 通常没有 | 有 |
| radius | 没有 | 有 |
因此,不要把 PQR 直接当普通 PDB 用,否则软件可能把 charge/radius 错读成 occupancy/B-factor。
PQR 常用于:
PQR 的质量高度依赖:
mmCIF,也常写作 PDBx/mmCIF,是现代 PDB 数据库推荐使用的结构格式。
PDB 是固定列格式,而 mmCIF 是标签化、表格化格式。
mmCIF 的基本单位是:
| 概念 | 示例 | 含义 |
|---|---|---|
| data block | data_4HHB |
一个数据块 |
| data item | _entry.id 4HHB |
单个键值 |
| category | _atom_site |
一类相关数据 |
| attribute | Cartn_x |
category 下的具体字段 |
| loop | loop_ |
表格数据开始 |
data_4HHB
#
_entry.id 4HHB
#
_cell.length_a 63.150
_cell.length_b 83.590
_cell.length_c 53.800
_cell.angle_alpha 90.00
_cell.angle_beta 99.34
_cell.angle_gamma 90.00
#
loop_
_atom_site.group_PDB
_atom_site.id
_atom_site.type_symbol
_atom_site.label_atom_id
_atom_site.label_comp_id
_atom_site.label_asym_id
_atom_site.label_seq_id
_atom_site.Cartn_x
_atom_site.Cartn_y
_atom_site.Cartn_z
_atom_site.occupancy
_atom_site.B_iso_or_equiv
ATOM 1 N N VAL A 1 18.715 24.840 4.621 1.00 33.80
ATOM 2 C CA VAL A 1 17.647 23.823 4.529 1.00 33.22
ATOM 3 C C VAL A 1 16.307 24.438 4.965 1.00 32.66
#
_atom_site 表mmCIF 中,原子坐标通常位于 _atom_site category。
常见字段:
| mmCIF 字段 | 对应 PDB 概念 | 含义 |
|---|---|---|
_atom_site.group_PDB |
ATOM/HETATM |
记录类型 |
_atom_site.id |
serial | 原子编号 |
_atom_site.type_symbol |
element | 元素 |
_atom_site.label_atom_id |
atom name | 原子名 |
_atom_site.label_comp_id |
resName | 残基名 |
_atom_site.label_asym_id |
chainID | 链或不对称单元 ID |
_atom_site.label_seq_id |
resSeq | 残基编号 |
_atom_site.Cartn_x |
x | x 坐标 |
_atom_site.Cartn_y |
y | y 坐标 |
_atom_site.Cartn_z |
z | z 坐标 |
_atom_site.occupancy |
occupancy | 占有率 |
_atom_site.B_iso_or_equiv |
B-factor | B 因子 |
mmCIF 中经常有两套字段:
label_asym_id
auth_asym_id
label_seq_id
auth_seq_id
label_atom_id
auth_atom_id
它们的区别:
| 前缀 | 含义 |
|---|---|
label_* |
数据库规范化后的标识 |
auth_* |
作者提交结构时使用的原始标识 |
例如:
_atom_site.label_asym_id A
_atom_site.auth_asym_id H
这可能表示数据库内部把链标为 A,但作者原始链名是 H。
实际使用建议:
auth_*。label_*。相比 PDB,mmCIF 的优点是:
缺点是:
loop_ 和字段名。| 需求 | 推荐格式 |
|---|---|
| 查看普通蛋白结构 | PDB 或 mmCIF |
| 从 RCSB 下载复杂结构 | mmCIF |
| 准备 GROMACS 初始结构 | PDB/GRO,必要时从 mmCIF 转换 |
| 分子对接输入 | PDBQT |
| 静电势计算 | PQR |
| 长期保存结构数据库信息 | mmCIF |
| 人工快速查看坐标 | PDB |
实际项目中,不建议手动改后缀来转换格式。推荐使用我们平台中的:
推荐流程:
蛋白 mmCIF/PDB -> PDBFixer 清理和补全 -> 检查链、残基、水、离子 -> 导出目标格式
小分子 SDF/MOL2/PDB -> Open Babel 转换和加氢 -> 检查键级、电荷、质子化状态 -> 导出目标格式
对接任务:
蛋白结构 -> 清理 -> 加氢/赋电荷 -> receptor.pdbqt
配体结构 -> 转换 -> 加氢/赋电荷/设置可旋转键 -> ligand.pdbqt
静电势任务:
PDB -> 修复结构 -> 赋电荷和半径 -> PQR -> APBS/静电分析
转换后建议检查:
PDB = 经典结构坐标格式,适合查看和通用交换
PDBQT = 对接格式,在 PDB 基础上加入电荷和 AutoDock 原子类型
PQR = 静电势格式,在 PDB 基础上加入电荷和原子半径
mmCIF = 现代结构数据库格式,字段结构更完整,适合复杂体系
实践上: