Aller au contenu

OpenAI relie une campagne d'extraction de raisonnement à Moonshot AI

Selon OpenAI, des utilisateurs liés à Moonshot AI, créateur de Kimi, ont envoyé en juillet 16 000 requêtes d'extraction émanant de plus de 4 000 utilisateurs pour copier le raisonnement caché des modèles d'OpenAI.

Par Tech AI Wire Team

4 min de lecture

XLinkedIn
Two laptops on a dark desk at night, one showing a grid of chat windows and the other OpenAI's knot logo, linked by network cables to a switch.

En chiffres

extraction requests in the July 24-25 spike
16,000
users behind that spike
4,000+
users in the wider related cluster
15,000+
date OpenAI says it fully shut the campaign down
July 28

OpenAI a annoncé le 30 septembre 2026 avoir stoppé une campagne coordonnée visant à copier le raisonnement caché de ses modèles d'IA. L'entreprise attribue un noyau de cette activité à des personnes liées à Moonshot AI, la société chinoise à l'origine des modèles Kimi. Les attaquants ont utilisé une méthode qu'OpenAI qualifie de « nouvelle » : ils ont amené le propre modèle d'OpenAI à déverrouiller pour eux son raisonnement protégé.

L'enjeu, c'est la copie. Le raisonnement est la réflexion étape par étape qu'un modèle mène avant de répondre, et il constitue des données d'entraînement précieuses. Un concurrent qui en collecte suffisamment peut apprendre à son propre modèle à raisonner de la même manière, sans fournir le même travail coûteux.

Ce qui s'est passé selon OpenAI

La campagne s'est déroulée sur quatre semaines en juillet, selon l'article de CyberScoop sur la divulgation d'OpenAI.

DateCe qui s'est passé
1er juilletOpenAI détecte l'activité pour la première fois
24-25 juilletUn pic de 16 000 requêtes provenant de plus de 4 000 utilisateurs
28 juilletOpenAI indique que la campagne est entièrement stoppée

En élargissant l'analyse, OpenAI a trouvé des schémas de prompts apparentés dans un groupe de plus de 15 000 utilisateurs, rapportent CyberScoop et AI Weekly.

OpenAI qualifie cette activité de distillation adversariale. La distillation consiste à entraîner un modèle sur les sorties d'un autre. AI Weekly cite la définition d'OpenAI : « l'utilisation systématique et non autorisée des sorties ou du raisonnement d'un modèle pour aider à entraîner, reproduire ou améliorer un autre modèle ».

Comment l'extraction a fonctionné

OpenAI masque aux utilisateurs le raisonnement complet de ses modèles. Ce raisonnement circule sous forme chiffrée, illisible pour un utilisateur.

Les attaquants ont trouvé un moyen de contourner cela sans casser le chiffrement. Ils ont copié le raisonnement chiffré depuis une conversation. Puis, dans une conversation distincte, ils ont demandé à un modèle de le déchiffrer et de le restituer en texte clair, rapporte CyberScoop. Autrement dit, c'est le modèle lui-même qui a fait le déverrouillage.

OpenAI insiste sur ce que les attaquants n'ont pas fait. « Les opérateurs n'ont pas cassé notre chiffrement, compromis une base de données ni obtenu un accès direct aux conversations d'utilisateurs stockées », a déclaré l'entreprise, selon CyberScoop.

L'attribution et ses limites

OpenAI relie « un noyau de l'activité à des individus associés à Moonshot AI », rapporte SL Guardian. L'entreprise n'a pas pu déterminer si tous les opérateurs travaillaient pour un même groupe.

CyberScoop note qu'OpenAI n'a fourni aucune preuve technique ni aucun raisonnement pour désigner Moonshot. Moonshot n'a pas répondu immédiatement à une demande de commentaire de CNBC, selon SL Guardian. OpenAI indique avoir partagé ses conclusions avec le Frontier Model Forum, un groupe de sécurité du secteur, ainsi qu'avec des contacts gouvernementaux.

Moonshot a déjà fait l'objet de ce type d'accusation. Anthropic a accusé des développeurs chinois d'IA, dont Moonshot et Alibaba, d'utiliser ses modèles Claude pour entraîner des systèmes concurrents, rapporte SL Guardian. CyberScoop ajoute que des responsables américains et des entreprises américaines d'IA ont accusé des sociétés chinoises de distillation « systématique » au moyen de milliers de comptes achetés.

OpenAI affirme ne pas viser les modèles ouverts. « Notre préoccupation porte sur la violation de nos conditions d'utilisation, pas sur les modèles ouverts ni sur la distillation légitime », a déclaré Caroline Zier, d'OpenAI, selon AI Weekly.

Ce qu'OpenAI a changé

OpenAI a corrigé la faille qui permettait à des données chiffrées de passer d'une conversation à une autre, rapporte CyberScoop. L'entreprise a aussi renforcé les contrôles à l'inscription, durci son infrastructure et ajouté une surveillance du réseau. AI Weekly ajoute qu'OpenAI a banni les comptes concernés et ajouté de nouvelles protections pour le raisonnement caché.

Ce que cela signifie pour les développeurs

Attendez-vous à des contrôles plus stricts sur les comptes OpenAI. L'attaque reposait sur des milliers d'utilisateurs, donc une vérification plus stricte à l'inscription est la défense évidente. Si votre équipe gère de nombreux comptes de test, prévoyez davantage d'étapes de vérification.

Lisez les conditions avant d'entraîner un modèle sur des sorties de modèles. OpenAI affirme que la distillation légitime n'est pas sa cible. Mais utiliser ses sorties pour construire un modèle concurrent peut tout de même enfreindre ses conditions d'utilisation. Si votre équipe affine un petit modèle sur les réponses d'un plus grand, vérifiez quelles conditions de fournisseur s'appliquent.

Testez votre propre modèle face à la même astuce. Si vous exploitez un service de modèle qui remet aux utilisateurs des données protégées ou chiffrées, partez du principe qu'ils peuvent les lui renvoyer. Vérifiez si votre modèle accepte de décoder, traduire ou résumer ces données sur demande. Cette attaque n'a nécessité aucune clé volée, seulement un modèle prêt à aider.

Surveillez les schémas entre comptes, pas seulement le volume par compte. Le pic de juillet provenait de plus de 4 000 utilisateurs envoyant des requêtes similaires sur deux jours. Des limites de débit par compte ne l'auraient pas détecté. Cherchez le même schéma de prompt réparti sur de nombreux nouveaux comptes.

Considérez l'attribution comme une affirmation pour l'instant. OpenAI a nommé Moonshot mais n'a pas publié ses preuves. Si votre entreprise utilise des modèles Kimi, suivez la réaction de Moonshot et des responsables américains avant de modifier vos plans.

Sources

  1. OpenAI reveals 'novel' encryption bypass used in distillation attack - CyberScoop
  2. OpenAI Disrupts AI Model Distillation Campaign Linked to Chinese Startup - SL Guardian
  3. OpenAI Links Moonshot Users to 16,000-Request Distillation Push - AI Weekly

Articles liés