平台文档 # PDB、PDBQT、PQR 与 mmCIF 文件格式入门教程

admin · 2026年07月13日 · 47 次阅读
本帖已被管理员设置为精华贴

PDB、PDBQT、PQR 与 mmCIF 文件格式入门教程

本教程用于快速理解常见生物分子结构文件格式:PDB、PDBQT、PQR 和 mmCIF。重点放在文件内容、字段含义、典型用途和示例,不涉及编程解析实现。

0. 四种格式先对比

格式 主要用途 核心特点 常见场景
PDB 通用三维结构坐标 固定列宽,人眼可读 蛋白、核酸、配体、水、离子结构
PDBQT 分子对接 PDB + partial charge + AutoDock atom type AutoDock, AutoDock Vina
PQR 静电势计算 PDB + charge + radius APBS、PDB2PQR
mmCIF 现代 PDB 数据库格式 标签化字段,适合大结构 RCSB PDB 下载、结构数据库、复杂体系

一句话记忆:

PDB 看坐标,PDBQT 看对接,PQR 看电荷半径,mmCIF 看结构化字段。

1. PDB 文件格式

PDB 是最经典的生物大分子结构格式。它用文本保存原子坐标、残基信息、链信息、晶胞信息、实验注释等内容。

PDB 的核心特点是:固定列宽。也就是说,每一行中某个字段的位置由列号决定,而不是简单按空格分隔。

2. PDB 文件整体结构

一个典型 PDB 文件可能包含这些记录:

记录 含义
HEADER 文件头,包含分类、日期、PDB ID
TITLE 结构标题
COMPND 分子组成信息
SOURCE 来源物种或表达系统
KEYWDS 关键词
EXPDTA 实验方法,如 X-ray、NMR、EM
REMARK 注释信息
SEQRES 序列信息
CRYST1 晶胞参数
ATOM 标准残基中的原子坐标
HETATM 非标准残基、配体、水、离子等坐标
TER 一条链结束
MODEL / ENDMDL 多模型结构
CONECT 原子连接关系
END 文件结束

最常用、最重要的是 ATOMHETATM

3. PDB 示例

HEADER    OXYGEN TRANSPORT                         07-MAR-84   4HHB
TITLE     THE CRYSTAL STRUCTURE OF DEOXY HUMAN HEMOGLOBIN
EXPDTA    X-RAY DIFFRACTION
CRYST1   63.150   83.590   53.800  90.00  99.34  90.00 P 1 21 1      4
ATOM      1  N   VAL A   1      18.715  24.840   4.621  1.00 33.80           N
ATOM      2  CA  VAL A   1      17.647  23.823   4.529  1.00 33.22           C
ATOM      3  C   VAL A   1      16.307  24.438   4.965  1.00 32.66           C
ATOM      4  O   VAL A   1      16.167  25.650   5.138  1.00 33.14           O
HETATM 1001 FE   HEM A 142      12.323  18.441   7.552  1.00 21.30          FE
HETATM 2001  O   HOH A 301      25.113  17.892  10.442  1.00 40.10           O
TER
END

4. PDB 的 ATOM/HETATM 字段

PDB 的坐标行有固定字段。下面以 ATOM 行为例:

ATOM      1  N   VAL A   1      18.715  24.840   4.621  1.00 33.80           N
字段 示例 含义
record ATOM 记录类型
serial 1 原子编号
atom name N 原子名
altLoc 替代构象标记
resName VAL 残基名
chainID A 链 ID
resSeq 1 残基编号
iCode 插入码
x, y, z 18.715 24.840 4.621 三维坐标,单位通常是 Å
occupancy 1.00 占有率
B-factor 33.80 温度因子
element N 元素符号

5. ATOM 与 HETATM 的区别

记录 常见对象
ATOM 标准蛋白氨基酸、标准核酸残基
HETATM 配体、金属离子、水、辅因子、非标准残基

例子:

ATOM      1  CA  ALA A   1      10.000  12.000   8.000  1.00 20.00           C
HETATM  501  C1  LIG A 101      15.200  10.400   5.600  1.00 18.00           C
HETATM  601  O   HOH A 201      20.100  15.300   9.200  1.00 35.00           O
HETATM  701 NA    NA A 301      22.000  13.000   7.500  1.00 25.00          NA

这里:

  • ALA 是标准氨基酸,所以通常是 ATOM
  • LIG 是小分子配体,所以通常是 HETATM
  • HOH 是水。
  • NA 是钠离子。

6. PDB 里几个容易混淆的字段

6.1 chainID

chainID 是链 ID,通常为一个字符:

ATOM      1  N   MET A   1      ...
ATOM    500  N   GLY B   1      ...

这里 AB 是两条链。

注意:PDB 的 chain ID 很短,复杂体系中可能不够用,这也是 mmCIF 更适合大结构的原因之一。

6.2 resName

resName 是残基名:

ALA  GLY  VAL  LYS  ARG
DA   DT   DG   DC
HOH  WAT  SOL
LIG  ATP  HEM

写 GROMACS selection 或做结构筛选时,残基名非常重要。例如:

resname LIG
resname HOH
resname ATP

6.3 resSeq 与 iCode

resSeq 是残基编号,iCode 是插入码。有些结构中会出现:

42
42A
42B

这表示残基编号相同,但插入码不同。做精确残基定位时,不应只看编号。

6.4 altLoc

altLoc 表示替代构象,常见为 AB

ATOM     32  CA AARG A  10      11.281  86.699  94.383  0.50 35.88           C
ATOM     33  CA BARG A  10      11.296  86.721  94.521  0.50 35.60           C

这通常表示同一个原子有两个可能位置,每个位置 occupancy 为 0.50

7. PDB 的优点和限制

优点:

  • 人眼可读。
  • 生态成熟,几乎所有分子软件都支持。
  • 小型蛋白、配体、水、离子结构表达很直观。

限制:

  • 固定列宽,字段容量有限。
  • 原子编号、链 ID、坐标范围都有格式限制。
  • 不适合超大复合物和复杂元数据。
  • 很多注释在 REMARK 中,不够结构化。

因此,现代结构数据库更推荐使用 mmCIF。

8. PDBQT 文件格式

PDBQT 常用于分子对接,尤其是 AutoDock 和 AutoDock Vina。

可以把 PDBQT 理解为:

PDB + Q + T

其中:

  • Q = partial charge,部分电荷
  • T = AutoDock atom type,AutoDock 原子类型

9. PDBQT 示例

ROOT
HETATM    1  C1  LIG A   1      12.345  10.234   5.678  1.00  0.00     0.120 C
HETATM    2  N1  LIG A   1      13.210  11.002   5.112  1.00  0.00    -0.350 NA
HETATM    3  O1  LIG A   1      11.800   9.100   5.000  1.00  0.00    -0.420 OA
ENDROOT
TORSDOF 3

和 PDB 相比,PDBQT 行尾多了两类信息:

字段 示例 含义
partial charge 0.120-0.350 对接程序使用的部分电荷
AutoDock atom type CNAOA AutoDock 原子类型

常见 AutoDock atom type:

类型 大致含义
C
A 芳香碳
N
NA 氢键受体氮
O
OA 氢键受体氧
S
HD 极性氢

10. PDBQT 中的柔性配体记录

配体 PDBQT 里可能出现:

ROOT
ENDROOT
BRANCH
ENDBRANCH
TORSDOF

它们用于描述配体可旋转键。

记录 含义
ROOT / ENDROOT 配体的刚性核心
BRANCH / ENDBRANCH 可旋转分支
TORSDOF 可旋转自由度数量

示意:

ROOT
HETATM    1  C1  LIG A   1      ...
HETATM    2  C2  LIG A   1      ...
ENDROOT
BRANCH   2   3
HETATM    3  C3  LIG A   1      ...
HETATM    4  O1  LIG A   1      ...
ENDBRANCH 2   3
TORSDOF 1

如果只是查看坐标,可以关注 ATOM/HETATM 行。
如果要用于对接,不要随意删除 ROOT/BRANCH/TORSDOF 这些记录。

11. PDBQT 的用途和注意事项

PDBQT 常用于:

  • 对接受体文件:receptor.pdbqt
  • 对接配体文件:ligand.pdbqt
  • Vina docking 输入

注意事项:

  • PDBQT 不是普通 PDB 改后缀。
  • 必须正确处理氢原子。
  • 必须正确赋 partial charge。
  • 必须正确识别 AutoDock atom type。
  • 配体 PDBQT 还需要合理的可旋转键定义。

12. PQR 文件格式

PQR 常用于静电势计算,例如 APBS、PDB2PQR。

可以把 PQR 理解为:

PDB + charge + radius

它通常把 PDB 中 occupancy 和 B-factor 的位置换成:

  • partial charge,部分电荷
  • atomic radius,原子半径

13. PQR 示例

ATOM      1  N   MET A   1      38.428  13.947  27.214 -0.3000 1.8500
ATOM      2  CA  MET A   1      37.319  14.801  27.701  0.2100 2.2750
ATOM      3  C   MET A   1      36.008  14.042  27.457  0.5100 2.0000
ATOM      4  O   MET A   1      35.900  12.820  27.300 -0.5100 1.7000

这里末尾的两个数字不是 occupancy 和 B-factor,而是:

字段 示例 含义
charge -0.3000 部分电荷
radius 1.8500 原子半径

14. PQR 与 PDB 的区别

问题 PDB PQR
主要用途 通用结构坐标 静电势计算
坐标
occupancy 通常没有
B-factor 通常没有
charge 通常没有
radius 没有

因此,不要把 PQR 直接当普通 PDB 用,否则软件可能把 charge/radius 错读成 occupancy/B-factor。

15. PQR 常见用途

PQR 常用于:

  • APBS 静电势计算
  • 分子表面电势可视化
  • 蛋白质电荷分布分析
  • pH 相关质子化状态分析后的结构表达

PQR 的质量高度依赖:

  • 力场参数
  • pH 设置
  • 质子化状态
  • 原子半径集合
  • 缺失原子和氢原子处理

16. mmCIF 文件格式

mmCIF,也常写作 PDBx/mmCIF,是现代 PDB 数据库推荐使用的结构格式。

PDB 是固定列格式,而 mmCIF 是标签化、表格化格式。

mmCIF 的基本单位是:

概念 示例 含义
data block data_4HHB 一个数据块
data item _entry.id 4HHB 单个键值
category _atom_site 一类相关数据
attribute Cartn_x category 下的具体字段
loop loop_ 表格数据开始

17. mmCIF 示例

data_4HHB
#
_entry.id 4HHB
#
_cell.length_a 63.150
_cell.length_b 83.590
_cell.length_c 53.800
_cell.angle_alpha 90.00
_cell.angle_beta 99.34
_cell.angle_gamma 90.00
#
loop_
_atom_site.group_PDB
_atom_site.id
_atom_site.type_symbol
_atom_site.label_atom_id
_atom_site.label_comp_id
_atom_site.label_asym_id
_atom_site.label_seq_id
_atom_site.Cartn_x
_atom_site.Cartn_y
_atom_site.Cartn_z
_atom_site.occupancy
_atom_site.B_iso_or_equiv
ATOM 1 N N VAL A 1 18.715 24.840 4.621 1.00 33.80
ATOM 2 C CA VAL A 1 17.647 23.823 4.529 1.00 33.22
ATOM 3 C C VAL A 1 16.307 24.438 4.965 1.00 32.66
#

18. mmCIF 的 _atom_site

mmCIF 中,原子坐标通常位于 _atom_site category。

常见字段:

mmCIF 字段 对应 PDB 概念 含义
_atom_site.group_PDB ATOM/HETATM 记录类型
_atom_site.id serial 原子编号
_atom_site.type_symbol element 元素
_atom_site.label_atom_id atom name 原子名
_atom_site.label_comp_id resName 残基名
_atom_site.label_asym_id chainID 链或不对称单元 ID
_atom_site.label_seq_id resSeq 残基编号
_atom_site.Cartn_x x x 坐标
_atom_site.Cartn_y y y 坐标
_atom_site.Cartn_z z z 坐标
_atom_site.occupancy occupancy 占有率
_atom_site.B_iso_or_equiv B-factor B 因子

19. label 与 auth 的区别

mmCIF 中经常有两套字段:

label_asym_id
auth_asym_id
label_seq_id
auth_seq_id
label_atom_id
auth_atom_id

它们的区别:

前缀 含义
label_* 数据库规范化后的标识
auth_* 作者提交结构时使用的原始标识

例如:

_atom_site.label_asym_id  A
_atom_site.auth_asym_id   H

这可能表示数据库内部把链标为 A,但作者原始链名是 H

实际使用建议:

  • 想和论文、PDB 显示、可视化软件对应:优先看 auth_*
  • 想做数据库规范化处理:优先看 label_*

20. mmCIF 的优点

相比 PDB,mmCIF 的优点是:

  • 不受 80 列限制。
  • 支持更大的结构和更多链。
  • 字段含义清楚。
  • 元数据更完整。
  • 更适合程序读取和数据库存储。
  • 是现代 PDB 数据库推荐格式。

缺点是:

  • 不如 PDB 直观。
  • 人眼快速浏览坐标时稍微麻烦。
  • 初学者需要理解 loop_ 和字段名。

21. 四种格式使用建议

需求 推荐格式
查看普通蛋白结构 PDB 或 mmCIF
从 RCSB 下载复杂结构 mmCIF
准备 GROMACS 初始结构 PDB/GRO,必要时从 mmCIF 转换
分子对接输入 PDBQT
静电势计算 PQR
长期保存结构数据库信息 mmCIF
人工快速查看坐标 PDB

22. 我们平台推荐的转换和清理流程

实际项目中,不建议手动改后缀来转换格式。推荐使用我们平台中的:

  • Open Babel:用于常见结构格式转换、小分子格式处理、加氢、简单标准化。
  • PDBFixer:用于蛋白结构清理,例如补缺失原子、补氢、处理缺失残基、移除不需要的异质分子。

推荐流程:

蛋白 mmCIF/PDB -> PDBFixer 清理和补全 -> 检查链、残基、水、离子 -> 导出目标格式
小分子 SDF/MOL2/PDB -> Open Babel 转换和加氢 -> 检查键级、电荷、质子化状态 -> 导出目标格式
对接任务:
蛋白结构 -> 清理 -> 加氢/赋电荷 -> receptor.pdbqt
配体结构 -> 转换 -> 加氢/赋电荷/设置可旋转键 -> ligand.pdbqt
静电势任务:
PDB -> 修复结构 -> 赋电荷和半径 -> PQR -> APBS/静电分析

转换后建议检查:

  • 链 ID 是否保留。
  • 残基名是否改变。
  • 配体是否完整。
  • 水和离子是否按预期保留或删除。
  • 氢原子是否合理。
  • PDBQT 是否有 partial charge 和 AutoDock atom type。
  • PQR 是否有 charge 和 radius。
  • 大结构转 PDB 时是否发生编号或链名截断。

23. 最后总结

PDB    = 经典结构坐标格式,适合查看和通用交换
PDBQT  = 对接格式,在 PDB 基础上加入电荷和 AutoDock 原子类型
PQR    = 静电势格式,在 PDB 基础上加入电荷和原子半径
mmCIF  = 现代结构数据库格式,字段结构更完整,适合复杂体系

实践上:

  • 普通查看:PDB 最直观。
  • 数据库下载:mmCIF 更推荐。
  • 分子对接:用 PDBQT。
  • 静电势计算:用 PQR。
  • 格式转换和结构清理:优先使用平台里的 Open Babel 和 PDBFixer。
admin 将本帖设为了精华贴。 07月13日 16:14
需要 登录 后方可回复, 如果你还没有账号请 注册新账号