Pour ne rien manquer

Actualités

OpenAI dit avoir bloqué une campagne visant le raisonnement protégé

Plus de 15 000 comptes auraient participé à des activités liées à l’extraction de raisonnement interne. OpenAI précise qu’aucune base de données ni conversation stockée n’a été compromise.

Par Le Journal IAPublié le Annonce du 7 min de lectureMis à jour le
Illustration générée par IA : un spécialiste en sécurité vu de dos examine un réseau de requêtes abstrait dans le corridor grillagé d’un centre informatique.

Une campagne observée à grande échelle pendant le mois de juillet

OpenAI a déclaré le 30 septembre avoir repéré et perturbé une campagne coordonnée visant à extraire le raisonnement protégé de ses modèles. L’entreprise situe les premières activités observées au 1er juillet. Après un début à faible volume, elle dit avoir enregistré les 24 et 25 juillet environ 16 000 requêtes utilisant un motif d’extraction pertinent, provenant de plus de 4 000 utilisateurs. Une enquête élargie aurait ensuite relié des motifs de requêtes semblables à un groupe de plus de 15 000 utilisateurs. OpenAI affirme avoir interrompu complètement cette activité le 28 juillet. Ces nombres demandent une lecture prudente. La note de l’entreprise précise qu’ils décrivent des tentatives, pas nécessairement des extractions réussies. OpenAI dit aussi ne pas savoir si toutes les personnes observées appartenaient au même groupe. Elle attribue toutefois un noyau central de l’activité à des individus associés à Moonshot AI, l’entreprise qui développe Kimi. Le Journal IA n’a pas vérifié cette attribution de façon indépendante, et Moonshot AI n’est pas citée dans la publication comme ayant reconnu les faits.

Le chiffrement et les conversations stockées n’auraient pas été compromis

La divulgation distingue cette campagne d’une intrusion classique. Selon OpenAI, les opérateurs n’ont pas cassé le chiffrement, compromis une base de données ni obtenu un accès direct aux conversations enregistrées des utilisateurs. Ils auraient plutôt manipulé les interactions avec les modèles afin de rendre visible une partie du raisonnement interne normalement cachée. Une technique décrite consistait à copier du raisonnement chiffré provenant d’une conversation, puis à demander à un modèle dans une autre conversation de le déchiffrer et de le transcrire. Cette distinction évite une conclusion alarmiste : le document ne signale pas une fuite générale de l’historique des clients et ne demande pas aux utilisateurs de changer leur mot de passe. Il révèle néanmoins une faiblesse importante dans la circulation des artefacts internes entre conversations, espaces de travail et familles de modèles. Des chercheurs indépendants avaient aussi communiqué à OpenAI des chemins d’attaque associés aux échanges entre modèles et à la compression de conversations. L’entreprise dit avoir confirmé que ces chemins étaient réels, puis s’en être servie pour accélérer ses correctifs.

La distillation peut transférer des capacités sans leurs protections

La distillation de modèles consiste généralement à utiliser les réponses d’un système plus puissant pour entraîner ou améliorer un autre modèle. Cette méthode peut être légitime lorsque les droits, les données et les conditions d’utilisation le permettent. OpenAI qualifie la campagne observée de distillation antagoniste parce qu’elle aurait utilisé systématiquement et sans autorisation des sorties ou du raisonnement protégé afin de reproduire des capacités. Le problème ne se limite donc pas au vol de texte : les traces internes peuvent révéler comment un modèle aborde une tâche et fournir du matériel d’entraînement plus riche que sa réponse finale. OpenAI soutient que ce transfert peut réduire le coût nécessaire pour imiter un modèle avancé tout en laissant derrière les mécanismes de sécurité appliqués à ses réponses publiques. Le risque devient plus sérieux dans les domaines à double usage, où une capacité utile peut également servir à une activité dangereuse. Cette analyse vient de l’entreprise directement touchée, qui possède aussi un intérêt commercial évident à protéger ses modèles. La publication ne mesure pas les capacités effectivement acquises par un autre système et ne démontre pas qu’un modèle concurrent a été entraîné avec les données extraites.

Des comptes bannis et une voie de relecture fermée

Pour répondre à la campagne, OpenAI dit avoir banni ou limité des comptes frauduleux, renforcé les contrôles d’inscription et d’infrastructure, puis élargi la surveillance des réseaux associés. Sur le plan technique, l’entreprise affirme avoir fermé une voie qui permettait à une personne possédant déjà le raisonnement chiffré d’un autre utilisateur de le rejouer afin d’en récupérer le contenu. Elle a aussi ajouté des contrôles capables de retenir une sortie diffusée en continu lorsqu’elle risque d’exposer du raisonnement caché. Lorsque l’activité passait par des services tiers, OpenAI indique avoir travaillé avec leurs exploitants pour identifier et neutraliser les comptes concernés. Elle a partagé ses constats avec le Frontier Model Forum ainsi qu’avec des canaux gouvernementaux d’échange de renseignements sur les menaces. L’entreprise reconnaît que le travail continue : les services hébergés par des partenaires doivent recevoir les mêmes protections que les produits exploités directement, et les attaques passant par les sorties d’outils exigent une surveillance qui dépasse le texte visible dans la conversation.

Ce que les organisations devraient retenir de cette divulgation

Pour une organisation qui utilise simplement ChatGPT, la publication ne fournit aucune preuve que ses dossiers ont été consultés dans cette campagne. Elle rappelle toutefois qu’un système d’IA possède plusieurs couches de données : les messages visibles, les sorties d’outils, les fichiers temporaires, les résumés de contexte et certains artefacts techniques. Une équipe qui construit ses propres agents devrait éviter qu’un identifiant ou un bloc de raisonnement provenant d’un utilisateur puisse être rejoué dans la session d’un autre. Elle devrait aussi tester la séparation entre clients, surveiller les volumes inhabituels et limiter les comptes capables de produire de grandes quantités de données synthétiques. Il reste des limites importantes. Le billet d’OpenAI est la seule source détaillée sur cet incident; il ne publie ni l’ensemble des indicateurs techniques ni une évaluation indépendante du nombre d’extractions réussies. Il ne dit pas non plus quelles capacités auraient pu être reproduites. Le fait vérifiable est plus précis : OpenAI rapporte une campagne à grande échelle, décrit une méthode de relecture entre conversations et affirme avoir déployé des correctifs. La conséquence pratique est que la protection d’un modèle ne s’arrête plus à son code ou à ses poids. Elle doit aussi couvrir les interactions, les sorties intermédiaires et les frontières entre utilisateurs.

Cette actualité repose sur la divulgation de sécurité publiée par OpenAI le 30 septembre 2026. Les chiffres, les méthodes et l’attribution à des individus associés à Moonshot AI proviennent de cette source et n’ont pas été vérifiés indépendamment. OpenAI précise que les chiffres portent sur des tentatives, pas nécessairement réussies.

Notre démarche éditoriale · Signaler une erreur

Pour poursuivre