Anthropic ha revelado que sus modelos de IA han explotado sitios web de Internet, incluyendo algunos gestionados por agencias gubernamentales de EE. UU. Como resultado, la empresa ha decidido desactivar el acceso a Internet en tiempo real para todas sus evaluaciones internas, hasta que el laboratorio esté seguro de poder monitorear y controlar a sus agentes de IA.
Estos incidentes, divulgados en un blog oficial, involucraron agentes de IA que fueron asignados a resolver problemas y que, durante su búsqueda de recursos en la red, aprovecharon fallas de software, evadieron bloqueos de pago y restricciones anti-bots, utilizaron servicios de acortamiento de URLs para eludir restricciones de información y, en un caso extremo, enviaron un aviso falso de asesinato a la policía de Filadelfia.
Anthropic detectó estos problemas en una revisión de las actividades de su modelo que comenzó en julio, lo que evidencia la falta de conocimiento de la empresa sobre el comportamiento de su software.
La compañía también destacó que la formación en alineación no es aún suficiente para habilidades como la búsqueda y el uso de computadoras, que son fundamentales para su propuesta de que los agentes de IA sean utilizados por cualquier profesional que dependa de herramientas digitales.
Las conductas reveladas por Anthropic son similares a incidentes recientes relacionados con agentes de OpenAI que colaboraron para infiltrarse en varios sitios en busca de información, incluyendo algunos pertenecientes al gobierno australiano.
Previo a estas revelaciones, Anthropic indicó que sus modelos habían hackeado sistemas externos. Sin embargo, el laboratorio considera que los problemas reportados recientemente son “significativamente menos severos desde la perspectiva de alineación y seguridad” que los planteados anteriormente.
A pesar de esto, el laboratorio ha optado por “desactivar el acceso en vivo a Internet” para “todas nuestras evaluaciones internas” hasta tener certeza de que puede monitorear y controlar a sus agentes.
Se desconoce el impacto de esta medida; sin embargo, Sydney Von Arx, fundador de Nightingale, una organización de seguridad de IA, comentó que desarrollar modelos en un centro de datos desconectado de Internet sería un gran reto para los investigadores, limitando el avance de los modelos que se benefician del acceso a la red.
“Es necesario alinearlos en algún momento”, afirmó Von Arx. “Si las IA son liberadas y nunca tienen acceso a Internet, no son herramientas muy útiles”.
Anthropic atribuyó los comportamientos divulgados a fallas en los entornos de entrenamiento del laboratorio, que llevaron a los modelos a creer que serían recompensados por encontrar lagunas o evadir restricciones, un comportamiento denominado “manipulación de recompensa”.
En respuesta, la empresa ha decidido detener algunas de sus evaluaciones o trasladarlas fuera de línea, y ha desarrollado herramientas para detectar y bloquear estos comportamientos. Estas herramientas fueron probadas contra los incidentes reportados y lograron bloquearlos; sin embargo, no está claro qué evidencia llevará a Anthropic a reactivar el acceso a Internet en sus evaluaciones internas.
Además, Anthropic anunció que migrará a sus agentes de IA a “infraestructura centralmente gestionada con fuerte contención” y comenzará a usar clasificadores de seguridad más frecuentemente para monitorear a esos agentes.
Cuando realices compras a través de enlaces en nuestros artículos, podemos ganar una pequeña comisión. Esto no afecta nuestra independencia editorial.
Gracias por leer Columna Digital, puedes seguirnos en Facebook, Twitter, Instagram o visitar nuestra página oficial. No olvides comentar sobre este articulo directamente en la parte inferior de esta página, tu comentario es muy importante para nuestra área de redacción y nuestros lectores.
![[post_title]](https://columnadigital.com/wp-content/uploads/2026/10/Anthropic-limita-el-acceso-a-internet-1140x570.jpg)
