La Banque de données PDB (Protein Data Bank) est notre source principale d’obtention de coordonnées structurales (structures 3D) d’enzymes, de récepteurs ou de protéines au sens général. Dans le domaine du structure-based drug design nous sommes plus particulièrement intéressés par des protéines qui sont complexées avec un substrat, un inhibiteur, un ligand, un effecteur … plus généralement une petite molécule organique dont nous allons étudier les interactions avec la protéine, un peu comme une clef (le ligand) dans une serrure. On en tirera des informations qui nous permettrons, peut être, de concevoir une nouvelle molécule (une autre clef) sur des bases rationnelles. Par exemple un inhibiteur qui soit capable de bloquer une fonction de la protéine, qui soit assez actif sans pour cela être trop toxique, qui soit suffisamment spécifique de la cible, qui puisse être internalisé dans l’organisme et les cellules etc (beaucoup de conditions en fait).
D’après un article publié dans buildblog.buidez.net en 2009.
Le format PDB classique
Dans ce cadre, une bonne utilisation des fichiers PDB est primordiale. Ce type de fichiers correspond à un format bien précis, qui mélange des données sur la protéine (par exemple la séquence) à des métadonnées (informations sur le fichier, date de dépôt …) et les coordonnées structurales, c’est à dire le type d’atomes qui constituent la structure 3D et les positions des atomes dans l’espace (un repère cartésien dans ce cas). Il n’est pas question ici de faire un cours exhaustif sur le sujet, il existe suffisamment de pages disponibles sur le Web. On va simplement donner quelques informations pour aider à la compréhension articles de ce blog. Mais tout d’abord, quelques URLs importantes à connaître:
A lire ...
- Protein Data Bank [ https://en.wikipedia.org/wiki/Protein_Data_Bank ].
- PDB File format documentation [ https://www.wwpdb.org/documentation/file-format ].
- Introduction to Protein Data Bank Format [ https://www.cgl.ucsf.edu/chimera/docs/UsersGuide/tutorials/pdbintro.html ].
- Guide to Understanding PDB Data [ https://pdb101.rcsb.org/learn/guide-to-understanding-pdb-data/introduction ].
Exemple de l’aldolase
Nous allons nous intéresser à la structure 1ADO [Blom_1997] qui correspond à une enzyme, une aldolase (D-fructose 1,6-bisphosphate aldolase) de lapin.
![]() |
La structure de cette enzyme se présente sous forme d’une unité asymétrique comportant 4 chaines polypeptidiques qui sont étiquetées A, B, C, D et qui complexent (ligandent) différents ligands: deux molécules de 13P (1,3-dihydroxyacetonephosphate pour A et B) et deux ions sulfate (SO4 pour C et D), ainsi que des molécules d’eau (points rouges tout autour de la figure précédente). Le fichier PDB correspondant à cette structure comporte différents blocs que nous allons explorer :
1. L’entête
Nous allons commencer par l’entête (header), les trois petits points à la fin de l’extrait (cet entête compte 994 lignes de texte ASCII) signalent simplement le fait que des lignes ont été masquées pour alléger l’affichage :
|
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 |
HEADER LYASE 02-DEC-96 1ADO TITLE FRUCTOSE 1,6-BISPHOSPHATE ALDOLASE FROM RABBIT MUSCLE COMPND MOL_ID: 1; COMPND 2 MOLECULE: ALDOLASE; COMPND 3 CHAIN: A, B, C, D; COMPND 4 EC: 4.1.2.13 SOURCE MOL_ID: 1; SOURCE 2 ORGANISM_SCIENTIFIC: ORYCTOLAGUS CUNICULUS; SOURCE 3 ORGANISM_COMMON: RABBIT; SOURCE 4 ORGANISM_TAXID: 9986; SOURCE 5 TISSUE: MUSCLE KEYWDS ALDOLASE, LYASE (ALDEHYDE), SCHIFF BASE, GLYCOLYSIS EXPDTA X-RAY DIFFRACTION AUTHOR N.S.BLOM,J.SYGUSCH REVDAT 2 24-FEB-09 1ADO 1 VERSN REVDAT 1 24-DEC-97 1ADO 0 JRNL AUTH N.BLOM,J.SYGUSCH JRNL TITL PRODUCT BINDING AND ROLE OF THE C-TERMINAL REGION JRNL TITL 2 IN CLASS I D-FRUCTOSE 1,6-BISPHOSPHATE ALDOLASE. JRNL REF NAT.STRUCT.BIOL. V. 4 36 1997 JRNL REFN ISSN 1072-8368 JRNL PMID 8989320 JRNL DOI 10.1038/NSB0197-36 REMARK 1 REMARK 1 REFERENCE 1 REMARK 1 AUTH N.S.BLOM,J.SYGUSCH REMARK 1 TITL ENHANCED ELECTRON DENSITY ENVELOPES BY EXTENDED REMARK 1 TITL 2 SOLVENT DEFINITION REMARK 1 REF TO BE PUBLISHED REMARK 1 REFN REMARK 2 REMARK 2 RESOLUTION. 1.90 ANGSTROMS. REMARK 3 REMARK 3 REFINEMENT. REMARK 3 PROGRAM : X-PLOR 3.1 REMARK 3 AUTHORS : BRUNGER ... |
Dans cet entête on trouve des informations signalées par une première colonne (mots clefs tels que HEADER, TITLE, COMPND, SOURCE, KEYWDS, EXPTA, AUTHOR, REVDAT, JRNL, REMARK ) liés à la taxonomie, bibliographie, à des paramètres liées à la cristallographie. La cohérence des blocs signalés par le terme REMARK est assurée par une seconde colonne qui comporte un numéro (4 chiffres disponibles). On trouve également (entre autres) :
- Une liste des résidus dont les angles phi/psi ne correspondent pas au diagramme de Ramachandran;
- Des données sur l’attribution de molécules d’eau et de ligands à chaque chaine polypeptidique et les résidus de la protéine correspondant à chaque site (liaison, actif, etc);
- La séquence primaire de la protéine, le nom et la formule brute des hétéro atomes (ligands, ions, molécules d’eau …), la délimitation d’éléments de structure secondaire ou tertiaire (hélices, feuillets, ponts disulfures) …
La longueur et le contenu de l’entête peuvent être très variable d’un fichier à l’autre, que ce soit pour des molécules différentes ou identiques, par exemple la même molécule sauvée sous la forme d’un fichier PDB par un autre logiciel pourra voir un entête très réduit:
|
1 2 3 4 5 6 |
REMARK Accelrys Discovery Studio PDB file REMARK Created: Thu Nov 22 17:06:10 Paris, Madrid 2012 CRYST1 163.880 57.470 85.030 90.00 102.70 90.00 P21 ATOM 1 N PRO A 1 33.618 -3.131 1.743 1.00 41.17 N1+ ATOM 2 CA PRO A 1 33.720 -3.187 3.223 1.00 39.67 C ATOM 3 C PRO A 1 33.048 -4.452 3.773 1.00 38.22 C |
Ici il s’agit de 3 lignes (REMARK, CRYST1) suivi des premières lignes du bloc de coordonnées moléculaires (6979 lignes dans le fichier initial).
2. Bloc ATOM: coordonnées moléculaires (protéine)
Les lignes de coordonnées sont définies par les mots clefs ATOM pour les atomes de protéines et HETATM (hétéro-atomes) pour les autres composés. On trouve plusieurs colonnes (cas de la seconde ligne de coordonnées atomiques) telles que le mot clé (ATOM), le numéro d’atome (2), le type d’atome (CA, carbone alpha) au sens PDB, le nom du résidu (PRO, proline), l’identificateur de chaine (A), le numéro de résidu dans la séquence (1), les coordonnées x (33.720), y (-3.187) et z (3.223), le facteur d’occupation (1.0), le facteur de ‘température’ (39.67), et d’autres colonnes optionnelles.
Pour le dernier atome (numéro 3383) de l’avant dernier résidu (ALA 362) de la chaine A et la totalité des atomes du dernier résidu (TYR 363) on aura:
|
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 |
... ATOM 3383 H ALA A 362 27.194 55.846 37.956 1.00 83.75 H ATOM 3384 N TYR A 363 25.326 54.015 39.466 1.00 84.47 N ATOM 3385 CA TYR A 363 23.974 53.476 39.435 1.00 84.33 C ATOM 3386 C TYR A 363 22.937 54.472 38.910 1.00 82.79 C ATOM 3387 O TYR A 363 23.284 55.215 37.965 1.00 80.68 O ATOM 3388 CB TYR A 363 23.586 52.909 40.807 1.00 86.73 C ATOM 3389 CG TYR A 363 24.009 51.470 40.979 1.00 88.62 C ATOM 3390 CD1 TYR A 363 25.281 51.133 41.451 1.00 89.66 C ATOM 3391 CD2 TYR A 363 23.149 50.437 40.618 1.00 90.36 C ATOM 3392 CE1 TYR A 363 25.683 49.798 41.549 1.00 90.07 C ATOM 3393 CE2 TYR A 363 23.541 49.110 40.708 1.00 90.20 C ATOM 3394 CZ TYR A 363 24.802 48.791 41.173 1.00 90.31 C ATOM 3395 OH TYR A 363 25.170 47.465 41.247 1.00 90.52 O ATOM 3396 OXT TYR A 363 21.795 54.485 39.415 1.00 82.47 O ATOM 3397 H TYR A 363 25.988 53.527 38.944 1.00 84.39 H ATOM 3398 HH TYR A 363 24.430 46.930 40.943 1.00 88.92 H TER 3399 TYR A 363 ATOM 3400 N PRO B 1 48.166 25.527 1.896 1.00 46.54 N1+ ATOM 3401 CA PRO B 1 47.903 25.714 3.342 1.00 43.59 C ATOM 3402 C PRO B 1 48.846 26.774 3.907 1.00 41.36 C ATOM 3403 O PRO B 1 49.715 27.270 3.187 1.00 39.82 O ATOM 3404 CB PRO B 1 48.173 24.375 4.001 1.00 43.38 C ATOM 3405 CG PRO B 1 49.209 23.777 3.065 1.00 44.24 C ATOM 3406 CD PRO B 1 48.721 24.180 1.667 1.00 45.92 C ATOM 3407 H2 PRO B 1 47.277 25.870 1.473 1.00 46.30 H ATOM 3408 H3 PRO B 1 48.702 26.405 1.784 1.00 46.31 H ATOM 3409 N HIS B 2 48.647 27.148 5.170 1.00 42.24 N ... |
La fin de chaine est marquée par un mot clé TER, puis on retrouve la totalité des atomes du premier résidu (PRO 1) et un atome (3409) du second résidu (HIS 2) correspondant à la chaine suivante (chaîne B).
2. Bloc HETATM: coordonnées (ligands et eau)
A la fin du bloc ATOM (donc des lignes correspondant à la chaîne D) on commence à trouver les atomes des ligands et molécules d’eau qui sont marqués par des lignes HETATM. Dans le bloc suivant, le premier ligand (13P A1104 pour la chaîne A) puis le second (13P 1053 pour la chaîne B) à la suite du dernier atome (13595 d’une tyrosine, TYR 363) de la chaine D :
|
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 |
... ATOM 13595 HH TYR D 363 17.878 -22.812 1.031 1.00 25.76 H TER 13596 TYR D 363 HETATM13597 P A13P A1104 23.058 27.232 23.781 0.50 57.86 P HETATM13598 P B13P A1104 23.305 27.139 23.708 0.50 54.76 P HETATM13599 O1PA13P A1104 23.274 25.761 24.431 0.50 55.99 O1- HETATM13600 O1PB13P A1104 23.117 28.069 25.000 0.50 55.10 O1- ... HETATM13617 2HOPA13P A1104 21.552 25.966 23.097 0.50 56.06 H HETATM13618 2HOPB13P A1104 25.215 27.908 23.371 0.50 53.93 H HETATM13619 HO3A13P A1104 26.172 29.853 23.315 0.50 47.28 H HETATM13620 HO3B13P A1104 27.180 24.131 23.364 0.50 39.53 H TER 13621 13P A1104 HETATM13622 P 13P B1053 58.312 -6.451 23.575 0.70 41.63 P HETATM13623 O1P 13P B1053 59.798 -5.947 23.281 0.70 41.05 O1- HETATM13624 O2P 13P B1053 57.597 -6.592 22.173 0.70 40.23 O HETATM13625 O3P 13P B1053 57.576 -5.370 24.420 0.70 42.06 O HETATM13626 O1 13P B1053 58.395 -7.842 24.375 0.70 40.75 O HETATM13627 C1 13P B1053 57.341 -8.180 25.274 0.70 39.23 C HETATM13628 C2 13P B1053 56.553 -9.274 24.600 0.70 41.80 C HETATM13629 O2 13P B1053 56.651 -10.435 24.996 0.70 41.92 O HETATM13630 C3 13P B1053 55.629 -8.939 23.444 0.70 43.39 C HETATM13631 O3 13P B1053 55.054 -10.137 22.954 0.70 43.90 O HETATM13632 2HOP 13P B1053 57.372 -5.657 21.892 0.70 40.61 H HETATM13633 HO3 13P B1053 54.180 -10.288 23.333 0.70 42.66 H TER 13634 13P B1053 ... |
Ces résidus sont immédiatement suivis par les molécules de SO4 et les molécules d’eau (3288 résidus répartis sur les 4 chaînes) :
|
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 |
HETATM13635 S SO4 C1326 62.384 23.822 9.546 1.00 45.48 S HETATM13636 O1 SO4 C1326 62.466 25.222 9.751 1.00 47.22 O1- HETATM13637 O2 SO4 C1326 63.139 23.496 8.397 1.00 45.56 O HETATM13638 O3 SO4 C1326 61.032 23.472 9.376 1.00 45.73 O HETATM13639 O4 SO4 C1326 62.740 23.048 10.680 1.00 44.96 O1- TER 13640 SO4 C1326 HETATM13641 S SO4 D1261 19.083 -1.843 9.354 1.00 44.13 S HETATM13642 O1 SO4 D1261 18.148 -1.565 8.303 1.00 41.27 O1- HETATM13643 O2 SO4 D1261 20.368 -1.498 8.940 1.00 42.81 O HETATM13644 O3 SO4 D1261 19.084 -3.229 9.619 1.00 43.32 O HETATM13645 O4 SO4 D1261 18.924 -1.049 10.526 1.00 39.67 O1- TER 13646 SO4 D1261 HETATM13647 O HOH W 1 20.249 -9.699 13.859 1.00 88.93 O HETATM13648 O HOH W 2 16.003 -10.262 14.444 1.00 84.92 O HETATM13649 O HOH W 3 17.892 -9.871 12.644 1.00 68.05 O ... HETATM16932 O HOH W3286 11.590 -8.194 -4.092 1.00 70.70 O HETATM16933 O HOH W3287 2.546 22.187 -11.668 1.00 97.32 O HETATM16934 O HOH W3288 17.773 -5.859 -42.027 1.00 79.07 O TER 16935 HOH W3288 |
Enfin à la fin du fichier, s’il y a des molécules organiques qui ne sont pas de l’eau (dans ce cas précis, 13P et SO4) on trouve (ou pas, cela dépends des fichiers) un bloc de connectivité.
Bloc de connectivité
Vous aurez remarqué qu’il n’y a que les coordonnées (x, y, z) des atomes dans le bloc de coordonnées structurales. Ces positions peuvent servir à reconstruire une structure chimique mais ce n’est pas toujours possible sans ambiguïté. Dans ce cas il vaut mieux disposer de la connectivité, c’est à dire savoir quel atome est connecté avec un(des) autre(s).
Par exemple, le bloc de connectivité du ligand 13P 1053 sera:
CONECT1362113622136231362413625CONECT1362213621CONECT136231362113631CONECT1362413621CONECT136251362113626CONECT136261362513627CONECT13627136261362813629CONECT1362813627CONECT136291362713630CONECT136301362913632CONECT1363113623CONECT1363213630 |
Ce qui correspond à la structure suivante:
![]() |
On voit que l’atome 13621 (première ligne du bloc connectivité) est connecté aux atomes 13622, 13624, 13623, 13625. Dans ce bloc de connectivité il n’y a pas de séparations entre chaque numéros d’atomes, car l’espace réservé n’occupe que 5 chiffres et dans le cas de cette structure, on a des numéros d’atomes supérieurs ou égaux à 10000 pour les ligands.
Taux d’occupation
Regardons maintenant les valeurs de la colonne correspondant aux taux d’occupations des atomes du premier ligand (13P 1104) dans la chaîne A. On remarquera qu’ils sont égaux à 0.5 au lieu de 1.0 ! cela veut simplement dire qu’une moitié des atomes de ce ligand sont assignés dans une position et une autre moitié dans une autre, ce qui se traduit pour un observateur attentif par deux conformations alternatives de la structure moléculaire de 13P.
![]() |
Heureusement les molécules de SO4 sont plus simples, on les reconnait assez rapidement à l’œil dans le bloc de connectivité:
...CONECT1363513636136371363813639CONECT1363613635CONECT1363713635CONECT1363813635CONECT1363913635CONECT1364113642136431364413645CONECT1364213641CONECT1364313641CONECT1364413641CONECT1364513641END |
Chaque atome de Soufre (S, jaune) étant connecté par 4 atomes d’oxygène (O, rouge) :
![]() |
Le mot clé END termine le fichier PDB. Il s’agit ici d’un fichier qui ne contient qu’une structure protéique, d’autres fichiers, dits multi-modèles, peuvent contenir plusieurs (typiquement 5 à 20) conformations (modèles, frames …) de la même molécule et sont généralement obtenus par d’autres techniques (RMN, calculs).
4. Conclusion
Cet article donne une idée d’un fichier de coordonnées moléculaires pour une macromolécule et dans le contexte PDB. Il existe d’autres formats (par exemple mmCIF) mais celui ci est majeur dans la communauté biologie structurale et au delà. Ces fichiers comportent de nombreuses subtilités, car il y a des variations dans la manière d’organiser des données, même si la syntaxe et les mots-clés sont normalisés (cf. liens au début de l’article). En conséquence, les composants logiciels qui les prennent en compte pour des affichages ou des calculs peuvent être plus ou moins robustes de ce point de vue.
Liens et lectures
- Structure PDB 1ADO [ https://www.rcsb.org/structure/1ADO ].
- UniProt P00883 · ALDOA_RABIT [ https://www.uniprot.org/uniprotkb/P00883/entry ].
- Ligand expo
13P[ https://www.rcsb.org/ligand/13P ]. - Ligand expo
SO4[ https://www.rcsb.org/ligand/SO4 ]. - Fructose-bisphosphate aldolase [ https://en.wikipedia.org/wiki/Fructose-bisphosphate_aldolase ].



