Saltar al contenido

OpenAI vincula una campaña de extracción de razonamiento con Moonshot AI

Según OpenAI, usuarios vinculados a Moonshot AI, creadora de Kimi, enviaron en julio 16.000 solicitudes de extracción procedentes de más de 4.000 usuarios para copiar el razonamiento oculto de los modelos de OpenAI.

Por Tech AI Wire Team

4 min de lectura

XLinkedIn
Two laptops on a dark desk at night, one showing a grid of chat windows and the other OpenAI's knot logo, linked by network cables to a switch.

En cifras

extraction requests in the July 24-25 spike
16,000
users behind that spike
4,000+
users in the wider related cluster
15,000+
date OpenAI says it fully shut the campaign down
July 28

OpenAI anunció el 30 de septiembre de 2026 que había frenado una campaña coordinada para copiar el razonamiento oculto de sus modelos de IA. Atribuye un núcleo de esa actividad a personas vinculadas a Moonshot AI, la empresa china detrás de los modelos Kimi. Los atacantes usaron un método que OpenAI califica de "novedoso": hicieron que el propio modelo de OpenAI desbloqueara para ellos su razonamiento protegido.

Lo que está en juego es la copia. El razonamiento es el pensamiento paso a paso que hace un modelo antes de responder, y constituye datos de entrenamiento valiosos. Un rival que reúna suficiente puede enseñar a su propio modelo a pensar de la misma manera, sin hacer el mismo trabajo costoso.

Qué ocurrió, según OpenAI

La campaña duró cuatro semanas en julio, según el artículo de CyberScoop sobre la revelación de OpenAI.

FechaQué ocurrió
1 de julioOpenAI detecta la actividad por primera vez
24-25 de julioUn pico de 16.000 solicitudes de más de 4.000 usuarios
28 de julioOpenAI afirma que la campaña queda totalmente desactivada

Al ampliar el análisis, OpenAI encontró patrones de prompts relacionados en un grupo de más de 15.000 usuarios, informan CyberScoop y AI Weekly.

OpenAI denomina esta actividad destilación adversarial. La destilación consiste en entrenar un modelo con las salidas de otro. AI Weekly cita la definición de OpenAI: "el uso sistemático y no autorizado de las salidas o el razonamiento de un modelo para ayudar a entrenar, reproducir o mejorar otro modelo".

Cómo funcionó la extracción

OpenAI oculta a los usuarios el razonamiento completo de sus modelos. El razonamiento circula en forma cifrada, que un usuario no puede leer.

Los atacantes encontraron una forma de sortearlo sin romper el cifrado. Copiaron el razonamiento cifrado de una conversación. Luego, en una conversación distinta, pidieron a un modelo que lo descifrara y lo escribiera como texto plano, informa CyberScoop. En otras palabras, fue el propio modelo el que hizo el desbloqueo.

OpenAI subraya lo que los atacantes no hicieron. "Los operadores no rompieron nuestro cifrado, no comprometieron ninguna base de datos ni obtuvieron acceso directo a conversaciones de usuarios almacenadas", afirmó la empresa, según CyberScoop.

La atribución y sus límites

OpenAI vincula "un núcleo de la actividad con personas asociadas a Moonshot AI", informa SL Guardian. No pudo determinar si todos los operadores trabajaban para un mismo grupo.

CyberScoop señala que OpenAI no aportó pruebas técnicas ni razonamientos para señalar a Moonshot. Moonshot no respondió de inmediato a una solicitud de comentarios de CNBC, según SL Guardian. OpenAI dice que compartió sus hallazgos con el Frontier Model Forum, un grupo de seguridad del sector, y con contactos gubernamentales.

No es la primera vez que Moonshot afronta una acusación así. Anthropic ha acusado a desarrolladores chinos de IA, entre ellos Moonshot y Alibaba, de usar sus modelos Claude para entrenar sistemas competidores, informa SL Guardian. CyberScoop añade que funcionarios estadounidenses y empresas de IA de EE. UU. han acusado a firmas chinas de destilación "sistemática" mediante miles de cuentas compradas.

OpenAI asegura que no apunta contra los modelos abiertos. "Nuestra preocupación tiene que ver con la violación de nuestros términos de servicio, no con los modelos abiertos ni con la destilación legítima", dijo Caroline Zier, de OpenAI, según AI Weekly.

Qué cambió OpenAI

OpenAI corrigió el fallo que permitía que datos cifrados pasaran de una conversación a otra, informa CyberScoop. También endureció los controles de registro, reforzó su infraestructura y añadió supervisión de la red. AI Weekly añade que OpenAI bloqueó las cuentas implicadas y añadió nuevas protecciones para el razonamiento oculto.

Qué significa esto para los desarrolladores

Prepárate para controles más estrictos en las cuentas de OpenAI. El ataque se apoyó en miles de usuarios, así que una verificación más estricta en el registro es la defensa obvia. Si tu equipo gestiona muchas cuentas de prueba, cuenta con más pasos de verificación.

Lee las condiciones antes de entrenar con salidas de modelos. OpenAI dice que la destilación legítima no es su objetivo. Pero usar sus salidas para construir un modelo competidor puede seguir infringiendo sus términos de servicio. Si tu equipo ajusta un modelo más pequeño con respuestas de uno más grande, comprueba qué términos de proveedor se aplican.

Prueba tu propio modelo frente al mismo truco. Si ofreces un servicio de modelos que entrega a los usuarios datos protegidos o cifrados, da por hecho que pueden volver a introducirlos. Comprueba si tu modelo decodifica, traduce o resume esos datos cuando se le pide. Este ataque no necesitó claves robadas, solo un modelo dispuesto a ayudar.

Vigila los patrones entre cuentas, no solo el volumen por cuenta. El pico de julio procedió de más de 4.000 usuarios que enviaron solicitudes similares durante dos días. Los límites de frecuencia por cuenta no lo detectarían. Busca el mismo patrón de prompt repartido entre muchas cuentas nuevas.

Trata la atribución como una afirmación por ahora. OpenAI ha señalado a Moonshot, pero no ha publicado sus pruebas. Si tu empresa usa modelos Kimi, sigue cómo responden Moonshot y los funcionarios estadounidenses antes de cambiar de planes.

Fuentes

  1. OpenAI reveals 'novel' encryption bypass used in distillation attack - CyberScoop
  2. OpenAI Disrupts AI Model Distillation Campaign Linked to Chinese Startup - SL Guardian
  3. OpenAI Links Moonshot Users to 16,000-Request Distillation Push - AI Weekly

Artículos relacionados