Certains espaces de travail Molegro sont issus d’un processus d’analyse structurale qui va plus loin que la classification structurale nécessaire au choix d’une structure pour le docking. Commençons donc par cette dernière question, que nous résumerons par calculer oui, mais calculer sur quoi ? En effet, il nous faut une structure pour l’arrimage moléculaire et si nous avons plusieurs entrées PDB disponibles, laquelle choisir ?
Il y a plusieurs manières de répondre. Dans les temps anciens ou il y avait peu de diversité, le choix de la meilleure résolution atomique était une option. Puis les structures se sont multipliées, d’abord des protéines non ligandées (apo-enzymes) puis de plus en plus de structures co-cristallisées avec un ligand (ligandées) au sens large : cofacteur, inhibiteur, susbtrat, effecteur, cofacteur et inhibiteur, ions et métaux. Et c’est bien les structures ligandées qui nous intéressent, dans une optique de positive design. Nous partons de quelque chose qui existe pour le modifier dans un projet que l’on qualifiera structure-based drug design.
D’après un article publié dans buildblog.buidez.net en 2021 – Mise à jour novembre 2025.
1. Une classification pour objectiver
Donc il faut choisir, et pour choisir il faut faire des comparaisons croisées : protéines et ligands, c’est l’objet de l’analyse structurale en amont des calculs. Ce qui nécessite de comparer les structures après leur alignement 3D par rapport à une structure de référence (par exemple une apoenzyme) et de combiner l’analyse avec d’autres connaissances : isoenzymes, organismes, évolution, tissus, localisation dans la cellule, similarités structurales et fonctionnelles avec d’autres protéines …
Parfois (et même souvent) l’analyse structurale ne tranche pas en faveur d’une structure et n’apporte pas une corrélation évidente entre les caractéristiques des ligands (structure, groupements, conformation, descripteurs …) et les structures protéiques. Ce qui est normal, puisque une enzyme peut exister dans plusieurs états conformationnels, par exemple avec un site actif ouvert ou fermé. Ce qui nous amène à réaliser une classification des structures, le processus ne fait pas l’objet de cet article, mais il aboutit à des classes (clusters) qui regroupent des protéines qui sont similaires à plusieurs niveaux: topologie du site, squelette de la protéine (backbone), réseaux d’interactions, descripteurs, parfois la structure chimique des ligands.
Lorsque l’ensemble de ces informations sont regroupées, on choisit une structure représentative (ou canonique) pour chaque cluster. Puis en s’appuyant sur l’ensemble des connaissances, le modélisateur va choisir sur quelle classe il va travailler. Parfois nous sommes obligés de travailler sur plusieurs classes, donc faire du docking sur plusieurs structures représentatives. Et nous pouvons argumenter, la question du choix des structures est la première question à poser si nous devons évaluer un travail.
2. Un exemple à 2 états
Prenons le cas d’un transporteur de lipides, il s’agira du domaine START de la CERT (Ceramide transfer protein). L’image suivante montre l’alignement de plusieurs structures, et nous voyons clairement 3 classes, une dont le site est large (structures en vert) qui est représentée par 2E3N_ [Kudo_2008] et une dont le site est plus réduit (structures en orange) représentée par 3HT3a [Kudo_2010]. La partie gauche de la poche, qui est ligandée (zone PH et chaines alkyle s’étendant dans le site, ligands 6CM, 18C, 16H) ne varie pas beaucoup, avec un réseau d’interactions hydrogènes très conservé. Le volume à deux états de la partie droite est modulé par le basculement d’un résidu tryptophane (TRP473) et le positionnement d’une boucle qui le porte. Quand à l’apoenzyme (la structure non ligandée, en rose) 2E3M_ [Kudo_2008] qui représente la troisième classe, nous constatons que la position de TRP473 apparaît intermédiaire.
![]() |
Ce cas de figure, lié au basculement de résidus, qui modulent l’ouverture ou le volume d’un site n’est pas rare. Si nous pouvons le corréler à des caractéristiques des ligands (par exemple: la structure, taille, configuration, conformation, présence de groupements …) nous pouvons en profiter pour concevoir des inhibiteurs efficaces et avoir une idée sur les causes de cette efficacité [Santos_2015][Duris_2016] et donc définir de nouvelles pistes de recherche.
3. Un exemple à n états
Mais il existe des mouvements de plus grande ampleur qui font intervenir des motifs structuraux (groupements d’éléments tels que hélices et feuillets).
Revenons vers un espace de travail frame_06_1P45a_NAD_Flex19_tmpl.mvdml à la racine du projet pour expliquer la terminologie frame_06 associée à 1P45a [Kuo_2003]. Rappelons que 1P45a est une structure de InhA et que cette enzyme se caractérise, à notre niveau, par plusieurs états (discrets) possibles du site actif. Ces conformations, résultant d’un échantillonnage, sont représentées dans l’image suivante (backbones de différentes couleurs).
Nous appelons ‘frames’ ces différentes structures (42 dans cette classification, gen3-2017 [1]. Chaque frame fait partie de ce que l’on appelle un ensemble (terminologie US-UK). Il s’agit d’une collection de structures, correspondant à la même protéine mais qui adoptent des conformations différentes. Ces différentiels peuvent être corrélés, notamment, à la flexibilité structurale (vibrations basses fréquences) ou à des évènements moléculaires liés au fonctionnement (ajustements induits, mécanismes réactionnels, associations, mouvements de résidus, re-conformation après clivage …) de la macromolécule.
Dans le cas présenté, cet ensemble est similaire à la séquence des images d’une animation. D’un coté (frame 1) la protéine montre une ouverture principale (major portal) largement ouverte et une ouverture secondaire (minor portal) fermée. A l’opposé (frame 42), le portail majeur reste ouvert mais l’ouverture est moins large, et le portail mineur est ouvert. Ici nous avons un ordonnancement qui correspond une séquence linéaire, ce qui n’a pas vraiment de signification car: i) des structures ultérieures peuvent modifier la classification, et ii) la séquence ne présume pas d’un mécanisme structural qui serait ordonné de la même manière.
![]() |
Il ne s’agit que d’une classification, utile pour le choix de structures pour l’arrimage et qui dépends des informations dont nous disposons, pas plus.
Les 42 structures sont associés à des couleurs différentes, qui peuvent soit être calculées (dynamique moléculaire, modes normaux de vibration, morphing …) soit correspondre à des structures de la PDB. C’est le cas de 06, elle correspond à une ‘vraie’ structure 1P45a, insérée dans la séquence, nous parlons de structure pivot, et 7 structures pivot sont présentes dans cette classification. Chaque structure pivot peut être représentative d’une classe de structures ou non, cela dépendra du processus utilisé pour la génération des frames et de la macromolécule.
La frame 06/1P45a (surface bleue) montre la cavité du site actif (ouvert vers le haut), après coupure (clipping) de sa surface, et le cofacteur NAD (à la base de la cavité, groupe nicotinamide vers la droite). Nous voyons donc les différentes frames, et nous constatons que les fluctuations concernent essentiellement un motif hélice-boucle-hélice (en haut à droite) qui est appelé SBL (substrate binding loop).
4. Le dernier mot est au ligand
Dans ce projet nous cherchons à concevoir des macrocycles (ou des précurseurs de macrocycles) en tant qu’inhibiteurs directs (le NAD reste présent). Il s’agit de composés assez volumineux. Pour donner une idée c’est comme si nous cherchions à insérer par la tranche une pièce de monnaie, ronde assez épaisse au dessus du NAD+/NADH.
Donc, en première approximation, il nous faut choisir un jeu de structures ou le portail majeur est largement ouvert. Ce qui revient à choisir une frame dont l’index est inférieur à 10, ce qui correspond à deux clusters dans la classification (gen3).
D’accord, nous avons des classes correspondant à des sites ouverts, mais quelle structure choisir ? Quelle classe ? Est ce que nous sommes obligés de prendre la structure de référence ? La réponse est évidemment non.
Nous aurions pu choisir la frame 01/1BVRa [Rozwarski_1999] qui ligande le substrat (THT) et qui apparait en blanc, superposé dans 1P45a (image suivante à gauche). Si nous regardons la structure de 1P45a, nous constatons qu’elle est ligandée par 2 molécules de triclosan (TCL_400 et TCL_450 en rose vif et cyan). Cette structure est à comparer avec 2B35a [Sullivan_2006] qui n’est ligandée que par un seul triclosan (TCL_300 en rose clair, image de droite). La structure 2B35a parait plus ouverte que 1P45a, mais en fait des parties ne se sont pas structurées suffisamment pour être visibles au niveau de la cristallographie, d’ailleurs nous constatons que la partie basse-droite du site est identique dans les deux cas. Ainsi que les conformations du NAD (gris pour 1P45a et jaune pour 2B35a) et du TCL associé (celui du bas: rose vif et rose clair).
![]() |
![]() |
Les structures 06/1P45a et 2B35a sont très intéressantes car nous cherchons à réaliser des macrocycles dérivés du triclosan, mais 2B35a est inutilisable pour la modélisation (pseudo délétion). Si nous observons les deux TCL de 06/1P45a, nous voyons qu’il ne faudrait pas grand chose pour les relier et réaliser un macrocycle dérivé du triclosan, nous l’avons déjà fait [Rodriguez_2019]. La structure 1P45a fait partie d’un cluster qui comprend aussi InhA co-cristallisée avec d’autres inhibiteurs directs, mais dont la structure n’a rien à voir avec le triclosan. Il se trouve que 1P45a est également une structure pivot, représentative de la classe, mais ce détail n’a pas d’importance, c’est juste une coïncidence. D’ailleurs, lorsque nous travaillons avec des dérivés du GEQ, nous utilisons la structure 1P44a [Kuo_2003] qui est une autre structure de la classe.
5. Conclusion
En d’autre termes, il s’agit d’un éclairage sur le processus de choix d’une structure. Dans l’exemple InhA présenté, l’arrimage ne se fera que sur 1P45a. Si les dérivés s’écartent significativement d’un type macrocycle, ce choix devra être révisé et conduira peut être à une autre structure. Dans certains cas nous sommes obligés de docker sur l’ensemble (généralement les structures représentatives). On peut trouver ce genre d’approches dans la littérature sous le terme ensemble docking, cross docking parfois 4D docking. Sauf que … rien ne garantit que les paramètres et algorithme du calcul soient optimaux pour l’ensemble des structures. Ce qui veut dire qu’il faut soit adapter un protocole à chaque classe, soit utiliser un jeu protocoles (optimaux pour certaines classes) sur l’ensemble de la collection, puis réaliser une analyse basée sur le consensus en comparant les résultats. Pour ces raisons je préfère parler de protocoles de docking multimodaux et consensus que d’ensemble docking.
Liens et lectures
- Ceramide transfer protein CERT / COL4A3BP / STARD11 [ https://en.wikipedia.org/wiki/COL4A3BP ].
- UniProt Q9Y5P4 · CERT_HUMAN [ https://www.uniprot.org/uniprotkb/Q9Y5P4/entry ].
- Énoyl-[acyl-carrier-protein] réductase (NADH) [ https://fr.wikipedia.org/wiki/%C3%89noyl-(acyl-carrier-protein)_r%C3%A9ductase_(NADH) ].
- InhA [ https://proteopedia.org/wiki/index.php/InhA ].
- UniProt P9WGR1 · INHA_MYCTU [ https://www.uniprot.org/uniprotkb/P9WGR1/entry ].
- La structure 1P45 dans la PDB [ https://www.rcsb.org/structure/1P45 ].
- La structure 2B35 dans la PDB [ https://www.rcsb.org/structure/2B35 ].
- [1] Nous travaillons à la gen5.



