
Une signature cachée dans la matière biologique
Google DeepMind a présenté SynthID Bio le 30 septembre 2026, en même temps qu’une étude évaluée par les pairs dans la revue Nature. La technologie vise à inscrire une signature détectable dans des protéines conçues ou prédites par une intelligence artificielle. Contrairement à une étiquette ajoutée à un fichier, cette marque est intégrée à la séquence d’acides aminés ou aux coordonnées tridimensionnelles de la structure. Pour une séquence ensuite fabriquée en laboratoire, le signal demeure donc lié à la protéine physique. Le projet répond à un problème qui grandit avec l’IA générative en biologie : une séquence entièrement nouvelle peut ressembler à un objet naturel inconnu, même si elle provient d’un modèle. Les laboratoires, les fournisseurs de synthèse d’ADN et les bases scientifiques ont alors peu d’indices pour en retracer l’origine. SynthID Bio ne dit pas si une protéine est sûre ni si elle fonctionne. Il fournit plutôt un signal de provenance qui peut indiquer qu’un outil compatible a participé à sa conception.
Deux méthodes pour les séquences et les structures
SynthID Bio regroupe deux méthodes. La première modifie subtilement le choix des acides aminés pendant la génération d’une séquence. Elle a été intégrée à ProteinMPNN, un modèle couramment utilisé pour proposer des séquences compatibles avec une forme protéique. Une clé secrète permet ensuite à un détecteur de mesurer la présence du signal. La deuxième méthode ajuste une petite partie du réseau de diffusion d’AlphaFold 3 afin que les coordonnées atomiques prédites portent elles aussi une marque statistique. Selon l’étude, le détecteur de structure reconnaît presque parfaitement les sorties marquées tout en conservant l’exactitude globale des prédictions. Le signal résiste à des transformations simples, comme déplacer ou tourner la structure, ainsi qu’à un faible bruit numérique. Cette protection n’est toutefois pas absolue. Les auteurs signalent notamment qu’une étape de relaxation moléculaire peut affaiblir la marque et que leur version actuelle ne permet pas de distinguer plusieurs utilisateurs. Le détecteur demeure secret, ce qui limite aussi la vérification indépendante par une personne qui ne possède pas la clé.
Des protéines fonctionnelles testées sur trois cibles
Pour vérifier que la marque ne détruit pas l’utilité biologique, l’équipe a conçu des protéines capables de se lier à trois cibles : PD-L1, VEGF-A et le domaine de liaison du virus SRAS-CoV-2. Les versions marquées ont ensuite été fabriquées et testées en laboratoire. D’après les résultats publiés, leur taux de réussite, leur affinité de liaison et leur diversité naturelle étaient comparables à ceux des versions non marquées. Les chercheurs rapportent des protéines se liant dans l’ordre du nanomolaire ou du sous-nanomolaire, selon la cible. Ce résultat est important parce qu’un filigrane inutilisable biologiquement ne servirait à rien. Il demeure néanmoins un résultat ciblé. L’étude porte sur des protéines de liaison conçues avec une chaîne d’outils précise et sur trois cibles. Elle ne prouve pas que la méthode préservera toutes les fonctions, toutes les familles de protéines ou chaque protocole industriel. Le financement provient d’Alphabet et les auteurs travaillent pour l’entreprise. La publication dans Nature renforce la documentation scientifique, mais d’autres équipes devront reproduire les résultats dans des contextes différents.
Un outil possible pour le filtrage et les bases de données
Un fournisseur de synthèse d’ADN examine normalement les commandes afin de repérer des séquences associées à des agents dangereux. L’arrivée de modèles capables de produire des séquences inédites complique ce travail : l’absence de correspondance avec une base connue ne signifie plus nécessairement qu’un objet est naturel et inoffensif. Une marque vérifiable pourrait aider le fournisseur à reconnaître une séquence issue d’un modèle approuvé et à concentrer l’examen humain sur les cas plus ambigus. Elle constituerait une couche supplémentaire, pas un laissez-passer automatique. La même logique s’applique aux bases ouvertes comme Protein Data Bank, UniProt et GenBank. Une structure synthétique mal étiquetée peut contaminer des recherches futures ou fausser un système de détection. Au moment d’un dépôt, le signal pourrait inciter la plateforme à ajouter une mention ou à demander une vérification. Pour qu’un tel usage fonctionne, les modèles, les laboratoires et les bases devront toutefois s’entendre sur les détecteurs, la gestion des clés et les règles de conservation. Une marque propre à un seul fournisseur ne crée pas à elle seule une norme commune.
Une preuve de concept, pas une solution complète
Google DeepMind présente explicitement SynthID Bio comme une preuve de concept. Les auteurs ont publié le code et les données de validation pour les séquences, ainsi que des instructions pour demander les poids du modèle de structure. Ils reconnaissent que la résistance à une suppression volontaire doit encore être améliorée. Dans un environnement hostile, une personne pourrait tenter de modifier une séquence, de recalculer une structure ou d’utiliser un autre modèle qui n’ajoute aucune marque. Pour une organisation québécoise qui travaille en biotechnologie, la conséquence immédiate est surtout une question à ajouter aux achats et aux procédures : peut-on retracer l’outil qui a produit une séquence ou une structure, et que signifie réellement cette preuve? Il faut conserver les journaux, les paramètres, l’auteur de la demande et les contrôles de laboratoire, même lorsqu’un filigrane existe. SynthID Bio pourrait devenir un élément utile de cette chaîne de traçabilité. Sa valeur dépendra d’essais indépendants, de standards partagés et d’une adoption assez large pour que les détecteurs soient disponibles là où les protéines sont conçues, commandées et répertoriées.





