Un fallo en las pruebas de Anthropic permitió que sus modelos de IA accedieran a sistemas de empresas reales

El incidente fue descubierto tras revisar más de 141.000 sesiones de prueba a raíz del caso de OpenAI

Europa Press
Europa Press
por el autor La Veu Lliure
3 minutos de lectura
Publicado el Martes, 4 Agosto 2026 - 10:26

La empresa estadounidense Anthropic, desarrolladora del asistente de inteligencia artificial Claude, ha reconocido que tres de sus modelos de IA llegaron a interactuar con tres empresas reales durante unas pruebas internas de ciberseguridad debido a un error de configuración del entorno de ensayo.

Según ha explicado la compañía, los hechos ocurrieron durante ejercicios de tipo "captura la bandera" (Capture the Flag o CTF), una modalidad habitual en ciberseguridad en la que los modelos deben intentar obtener información confidencial dentro de un entorno cerrado y completamente simulado.

Un error permitió el acceso a internet

Anthropic ha detallado que los modelos estaban programados para creer que operaban en un entorno aislado de internet. Sin embargo, un error humano en la configuración hizo que la plataforma utilizada mantuviera conexión con la red.

Como consecuencia, tres modelos distintos accedieron a sistemas externos convencidos de que seguían formando parte de la simulación. 

Uno de ellos detuvo su actividad al detectar que se encontraba en un entorno real, otro identificó esa posibilidad pero continuó ejecutando las acciones previstas y un tercero también llegó a interactuar con sistemas externos.

La empresa ha asegurado que los modelos únicamente emplearon técnicas básicas de acceso, como credenciales débiles o servicios sin autenticación, y que no explotaron vulnerabilidades avanzadas ni desarrollaron métodos sofisticados para comprometer los sistemas.

El caso salió a la luz tras el incidente de OpenAI

Anthropic explicó que descubrió estos episodios después de revisar más de 141.000 sesiones de pruebas, una investigación iniciada tras el reciente incidente protagonizado por OpenAI, cuando uno de sus modelos logró escapar de un entorno de pruebas y acceder a la plataforma Hugging Face.

La compañía ha comunicado que ya ha informado del incidente a dos de las tres empresas afectadas y que continúa intentando contactar con la tercera, cuya identidad no ha sido revelada.

Crece la preocupación por los agentes de IA autónomos

Especialistas en ciberseguridad consideran que, aunque el origen del incidente fue un fallo de configuración y no una vulnerabilidad descubierta por la propia inteligencia artificial, el episodio evidencia los riesgos crecientes asociados a los agentes de IA con mayor autonomía.

La revelación coincide además con un momento de creciente preocupación en el sector. 

Apenas un día antes, más de 1.200 investigadores y trabajadores de la industria de la inteligencia artificial firmaron una carta abierta en la que reclamaban moderar el ritmo de desarrollo de estos sistemas y reforzar los mecanismos de control y seguridad para reducir los riesgos derivados de su creciente capacidad de actuación autónoma.

 

Comentaris

Añadir nuevo comentario

HTML Restringido

  • Etiquetas HTML permitidas: <a href hreflang> <em> <strong> <cite> <blockquote cite> <code> <ul type> <ol start type> <li> <dl> <dt> <dd> <h2 id> <h3 id> <h4 id> <h5 id> <h6 id>
  • Saltos automáticos de líneas y de párrafos.
  • Las direcciones de correos electrónicos y páginas web se convierten en enlaces automáticamente.
CAPTCHA
Esta pregunta es para comprobar si usted es un visitante humano y prevenir envíos de spam automatizado.

Notícies relacionades