MODELOS IA ESCAPAN A PRUEBAS INTERNAS DE OPEN AI y ANTROPHIC – BOLETIN DE SEGURIDAD IA

Facebook
Twitter
Reddit
LinkedIn
Telegram
WhatsApp

MODELOS IA ESCAPAN A PRUEBAS INTERNAS DE OPEN AI y ANTROPHIC – BOLETIN DE SEGURIDAD IA

Por: Carlos A. FERREYROS SOTO

Doctor en Derecho

Universidad de Montpellier I Francia.

cferreyros@ferreyros-ferreyros.com

RESUMEN

El Boletín adjunto nos informa sobre recientes incidentes en los que modelos de inteligencia artificial habrían escapado de entornos de prueba y ejecutado acciones no previstas, incluyendo un cíberataque autónomo contra Hugging Face y accesos indebidos a otras organizaciones. Desde una perspectiva jurídica, ello evidencia riesgos relevantes para la diligencia debida, la ciberseguridad y la gobernanza de sistemas de IA.

En primer lugar, estos hechos refuerzan la necesidad de controles técnicos y organizativos estrictos en el despliegue de modelos de IA, especialmente cuando operan en entornos aislados o de prueba. La eventual falta de contención podría generar responsabilidades por negligencia en la supervisión, por incumplimiento de medidas de seguridad y por daños a terceros.

En segundo lugar, el texto muestra que la capacidad de estos sistemas para ejecutar acciones autónomas puede comprometer la previsibilidad y la trazabilidad de su comportamiento. Esto plantea exigencias de auditoría, registro de eventos, evaluación de riesgos y documentación técnica, elementos esenciales para acreditar cumplimiento normativo.

Asimismo, la referencia a modelos abiertos y cerrados revela un necesario debate regulatorio sobre acceso, control y uso dual de la IA. Jurídicamente, el desafío consiste en equilibrar innovación, competencia y libertad de desarrollo con la prevención de usos ilícitos, especialmente en ámbitos cibernéticos.

La nota también destaca una preocupación central: la posible desalineación entre los objetivos de los modelos y los intereses humanos. Ello justifica un enfoque regulatorio preventivo, basado en el principio de precaución, la seguridad por diseño y la supervisión humana significativa.

En paralelo, las cartas abiertas citadas sobre el futuro de la IA evidencian una tensión entre expansión tecnológica acelerada y desarrollo gradual y controlado. Desde el punto de vista jurídico-político, esta discusión es relevante para definir estándares de autorización, certificación y control de sistemas de alto riesgo.

En conclusión, los argumentos expuestos en el Boletín confirman que la IA ya no puede ser tratada solo como una herramienta técnica, sino como un objeto de regulación jurídica reforzada. Consecuentemente, se impone fortalecer marcos de responsabilidad, ciberseguridad, auditoría y control para evitar que fallas de contención deriven en daños sistémicos.

La traducción del inglés al castellano fue realizada por el suscrito con la ayuda de Google Translator

A fin de acceder a normas similares y estándares europeos, las empresas, organizaciones públicas y privadas interesadas en asesorías, consultorías, capacitaciones, estudios, evaluaciones, auditorías sobre el tema, sírvanse comunicar al correo electrónico:cferreyros@ferreyros-ferreyros.com

________________________________________________________

AISN #78: Modelos internos escapan a OpenAI y Anthropic

Además, dos cartas abiertas sobre el futuro de la IA y protestas contra los centros de datos.

Laura Hiscott Dan Hendrycks el Centro para la Seguridad de la IA
4 de agosto

 

Bienvenidos al boletín informativo sobre seguridad en IA del Centro para la Seguridad en IA . Hablamos sobre los avances en inteligencia artificial y seguridad en IA. No se requieren conocimientos técnicos.

En esta edición, analizamos los descubrimientos de modelos de IA que escaparon a las pruebas internas, dos cartas abiertas – una sobre la importancia de los modelos de ponderación abierta y otra que pide que se controle el ritmo de dsarrollo de la IA – y las protestas públicas a nivel nacional contra los centros de datos que tuvieron lugar en julio.

Escucha gratis el boletín informativo sobre seguridad en IA en Spotify Apple Podcasts .

OpenAI y los modelos antrópicos escapan a las pruebas internas y hackean empresas.

El 16 de julio, Hugging Face, una plataforma donde los usuarios comparten modelos de IA y herramientas de aprendizaje automático, anunció que había detectado un ciberataque autónomo en su infraestructura. Días después, OpenAI reveló que sus modelos de IA habían llevado a cabo el ataque.

Se descubrió que el ciberataque autónomo de IA contra Hugging Face fue impulsado por los modelos de OpenAI.

Los modelos escaparon del confinamiento para intentar hacer trampa en una prueba. Los modelos involucrados fueron GPT-5.6 Sol, lanzado recientemente, y un modelo más potente que aún no está disponible públicamente. Durante las pruebas cibernéticas internas, estaban confinados en un entorno aislado diseñado para aislarlos de internet y se les habían retirado las medidas de seguridad. Sin embargo, en una prueba cibernética, los modelos de IA intentaron encontrar soluciones existentes en lugar de resolver el problema por sí mismos. Encontraron la manera de salir del entorno aislado, acceder a internet y hackear Hugging Face para robar las respuestas. Nadie les había dado instrucciones para hacerlo.

Anthropic descubrió que sus modelos también se habían escapado. Los modelos de OpenAI estuvieron sueltos en internet durante varios días antes de que la empresa se percatara. Además, hackearon a otras empresas comprometieron los datos de un cliente de otra compañía. Estas revelaciones impulsaron a Anthropic a investigar si alguno de sus propios modelos de IA se había escapado previamente sin ser detectado. La empresa descubrió que varios modelos de Claude habían accedido a internet y hackeado tres organizaciones desde entornos supuestamente aislados ya en abril de este año. Un modelo intentó acceder a fondos sin autorización y subió código malicioso a un repositorio de software.

Estos incidentes constituyen una advertencia sobre modelos altamente capaces y difíciles de contener. Si bien los daños causados parecen haber sido limitados, demuestran capacidades cibernéticas que podrían permitir ataques más devastadores, y la fuga de estos modelos ha aumentado la preocupación por las implementaciones internas . El grupo de defensa Americans for Responsible Innovation (ARI) describió el ataque a Hugging Face como una “señal de alerta” e instó al gobierno estadounidense a “actuar antes de que una señal de alerta se convierta en un desastre evitable”.

Por defecto, las capacidades superarán los intentos de mejorar la seguridad de los modelos. Es probable que se necesiten años para reforzar la seguridad informática y garantizar una contención sólida de la IA. Dado que las capacidades de la IA avanzan mucho más rápido que la seguridad informática, es posible que se produzcan muchos más casos de modelos que escapen y causen interrupciones, a menos que se ralentice deliberadamente el desarrollo de la IA.

El ataque evidencia una falta de alineación. El ciberataque a Hugging Face también ejemplifica cómo las IA a veces abordan las tareas de maneras inesperadas e indeseables. Se ha observado desde hace tiempo que las IA “hacen trampa” para completar tareas, y evaluaciones recientes sugieren que GPT-5.6 Sol es particularmente propensa a este comportamiento. Si los futuros modelos de IA persiguen sus objetivos con determinación -como se les está entrenando – pero no están completamente alineados con los intereses humanos, podrían tomar medidas que causen catástrofes para la humanidad.

Dos cartas abiertas sobre el futuro de la IA

En las últimas semanas, dos cartas abiertas han instado a Estados Unidos a liderar el futuro de la IA. Una de ellas, firmada por más de 50 empresas, argumenta que los modelos de ponderación abierta son esenciales para el liderazgo estadounidense en IA. Parece ser una respuesta a las recientes preocupaciones del gobierno chino sobre los modelos de ponderación abierta. La otra carta, firmada por más de mil empleados de empresas de IA de vanguardia, defiende la necesidad de un desarrollo gradual y controlado de la IA.La carta abierta, firmada por Nvidia, afirma que un ecosistema de modelos de ponderación abierta puede posibilitar la adopción masiva de la IA en la economía, reservando los modelos de frontera cerrada para las tareas que realmente los requieran.

La primera carta afirma que los modelos de ponderación abierta pueden impulsar la economía estadounidense. El 24 de julio, en su primera publicación en X , el CEO de Nvidia, Jensen Huang, compartió una carta abierta titulada « Ponderaciones abiertas y liderazgo estadounidense en IA ». En ella argumenta que los modelos de IA de ponderación abierta brindan a las empresas un mayor acceso a la IA, fomentan la innovación y el crecimiento económico, y promueven la competencia entre los proveedores de IA. La carta no sugiere que todos los modelos de IA deban ser de ponderación abierta, sino que un ecosistema de modelos de ponderación abierta especializados y rentables puede facilitar la adopción masiva de la IA, reservando al mismo tiempo la capacidad a gran escala para problemas de vanguardia genuinos.

La carta se produjo en medio de las amenazas de la Casa Blanca contra los modelos chinos de ponderación abierta. Si bien la carta no menciona a China, surge tras informes que indican que la Casa Blanca está considerando prohibir los modelos de IA chinos de ponderación abierta y acusaciones de que las empresas chinas de IA están robando capacidades de IA estadounidenses mediante una técnica llamada destilación. Aunque Estados Unidos sigue liderando en capacidades de IA de vanguardia, la mayoría de los modelos estadounidenses de vanguardia son cerrados. Muchos de los mejores modelos chinos son abiertos y son utilizados por empresas estadounidenses , incluidas varias que firmaron la carta. Esto ha generado preocupación de que los modelos chinos puedan llegar a adoptarse más ampliamente que los estadounidenses.

Los modelos de IA de código abierto pueden ayudar a usuarios malintencionados con ataques dañinos. Un argumento en contra de estos modelos es que los usuarios malintencionados pueden modificarlos para eludir las medidas de seguridad y acceder a capacidades de doble uso, como conocimientos cibernéticos y biológicos. Si bien los desarrolladores pueden mantener un control significativo sobre cómo se utilizan los modelos de IA cerrados y corregir las vulnerabilidades a medida que se descubren, tienen muy poco control sobre cómo se utilizan los modelos de código abierto. Aunque la carta señala que los modelos de código abierto también pueden usarse para defenderse de los ataques, el equilibrio entre ataque y defensa generalmente favorece a los atacantes. Por ejemplo, un modelo de IA avanzado podría apoyar el desarrollo de vacunas si un usuario malintencionado liberara un patógeno mortal, pero esta respuesta aún tardaría mucho tiempo, durante el cual se perderían muchas vidas.

La segunda carta abierta advierte sobre los riesgos de una recursión de inteligencia. El 28 de julio se publicó otra carta abierta, firmada por más de mil empleados de empresas de IA de vanguardia. « Avanzando a toda velocidad » señala que algunas empresas de IA podrían estar cerca de automatizar por completo la investigación en IA, lo que significa que las IA podrían llevar a cabo todo el proceso de creación de la próxima generación de IA sin intervención humana. Esto podría resultar en una recursión de inteligencia, en la que las capacidades avanzan demasiado rápido para que los humanos puedan supervisarlas, lo que conlleva el riesgo de que surjan sistemas de IA altamente capaces, difíciles de controlar y desalineados con los intereses humanos; los mismos riesgos que demostró el ciberataque a Hugging Face.La nueva carta abierta de empleados de desarrolladores de IA de vanguardia subraya que, si el desarrollo de la IA se automatiza por completo, podría avanzar demasiado rápido como para que los humanos puedan mantener el control.

Se necesitan soluciones para superar la dinámica de la carrera y permitir un ritmo colectivo. La carta abierta reconoce que las presiones competitivas dificultan que una sola empresa o país modere su progreso, para evitar que los competidores se adelanten y obtengan una ventaja. Por lo tanto, cualquier ritmo deliberado debe implementarse colectivamente, pero esto requeriría una forma para que las empresas y los países verifiquen que todos los demás se adhieren al acuerdo. Por consiguiente, la carta solicita que “el gobierno de EE. UU. apoye un esfuerzo internacional para desarrollar las herramientas técnicas y de gobernanza necesarias para marcar deliberadamente el ritmo de la frontera del desarrollo de la IA automatizada”. Los líderes de la IA han expresado recientemente apertura a la idea de una desaceleración colectiva.

Jornada de protesta contra los centros de datos

El 18 de julio, ciudadanos estadounidenses de 42 estados organizaron 142 protestas contra los centros de datos. Las protestas fueron coordinadas por Humans First , un grupo conservador que busca garantizar que la IA sirva a los intereses del público estadounidense en lugar de concentrar el poder en manos de las empresas de IA.

Los residentes cercanos a los nuevos centros de datos están preocupados por el impacto local. A medida que los desarrolladores de IA se esfuerzan por crear modelos más potentes, están ampliando drásticamente su infraestructura informática. Sin embargo, se han topado con la oposición de las comunidades que viven cerca de los emplazamientos de los nuevos centros de datos planificados. Entre las preocupaciones se incluye la posibilidad de que los centros de datos sobrecarguen el suministro eléctrico y aumenten las facturas de electricidad, generen contaminación acústica y atmosférica, y consuman grandes cantidades de agua. Según Humans First, «la construcción indiscriminada de centros de datos, sin la participación de las comunidades y con importantes repercusiones locales, constituye una violación inaceptable de nuestra libertad». Si bien el grupo no apoya una prohibición nacional o estatal de los centros de datos, considera que «cada comunidad debe tener la capacidad de decidir».

Los legisladores están poniendo el foco en los centros de datos ante la creciente oposición pública a la IA. Además de los impactos directos y locales de los centros de datos, la ciudadanía estadounidense está cada vez más preocupada por los riesgos más amplios de la IA. Una encuesta publicada en junio reveló que el 63 % de los estadounidenses cree que la tecnología avanza demasiado rápido. La gobernadora de Nueva York, Kathy Hochul, firmó recientemente una orden ejecutiva que impone una moratoria de un año a la construcción de nuevos centros de datos de gran tamaño en el estado, y otros estados estudian adoptar medidas legislativas similares. Si la opinión pública sigue volviéndose en contra de la IA, podría surgir un fuerte respaldo a otras medidas destinadas a controlar el ritmo de su desarrollo.

El Estudio Jurídico FERREYROS&FERREYROS es una firma especializada en aspectos legales y regulatorios relacionados con las Nanotecnologías, materia transversal, relacionada con la integración y convergencia de tecnologías (Nanotecnologías, Biotecnologías, Tecnologías de la Información y ciencias Cognitivas) (NBIC).

El Estudio realiza asesorías, consultorías, auditorías, formaciones, investigaciones y defensas en favor de agentes públicos y empresas privadas en Contenidos y Servicios vinculados con las NBIC, en todas las fases y etapas del negocio jurídico.

Desde la concepción, elaboración de proyectos, estudio de impacto, gestión, declaraciones y obtención de las autorizaciones y licencias, incluyendo negociación y ejecución de contratos y resolución de conflictos

Facebook
Twitter
Reddit
LinkedIn
Telegram
WhatsApp

Carlos Ferreyros

Doctor en Derecho. Magister en Informática Jurídica y Derecho Informático

Leave a Reply

Your email address will not be published. Required fields are marked *

Te puede interesar