El Panel Científico Internacional Independiente advirtió que la IA desafió sus propios controles y expuso los límites de la supervisión humana

Por Redacción

Un ensayo realizado entre mayo y julio con unos 1200 agentes de inteligencia artificial expuso fallas en las salvaguardas destinadas a controlar sistemas autónomos. De este modo, intercambiaron más de 70.000 mensajes y archivos, lograron superar controles de seguridad, coordinar acciones mediante una herramienta interna, acceder sin autorización a internet y obtener funciones de administrador. El episodio fue analizado por el Panel Científico Internacional Independiente sobre Inteligencia Artificial, respaldado por las Naciones Unidas, que sostuvo que las medidas de seguridad no avanzan al mismo ritmo que las capacidades de estos sistemas.

Las pruebas fueron realizadas por OpenAI, creadora de ChatGPT, sobre sistemas que interactuaron con entornos reales de la plataforma Hugging Face y con un clúster de investigación de la propia compañía. El comportamiento observado reunió tres condiciones que los investigadores consideran relevantes ante un eventual escenario de pérdida de control: la persecución de un objetivo por una vía distinta a la prevista, la capacidad suficiente para ejecutar esa estrategia y un entorno que permita concretarla.

Yoshua Bengio, copresidente del Panel Científico Internacional Independiente sobre Inteligencia Artificial, explicó: “Este verano, los tres se dieron juntos en un sistema real, no en un laboratorio”. El episodio mostró diferencias sustanciales entre los agentes de inteligencia artificial y los sistemas que se limitan a responder instrucciones. Los agentes pueden tomar decisiones, ejecutar distintas acciones y avanzar de manera autónoma hacia un objetivo establecido por un usuario.

Durante las pruebas, esa autonomía permitió que sortearan algunas de las protecciones previstas para el ensayo y establecieran mecanismos de coordinación que no formaban parte del diseño original. Bengio sostuvo que “dado que no se trata de una observación aislada, esto plantea serias preguntas sobre la forma en que actualmente se entrenan los agentes de IA”.

El análisis señaló que los sistemas llegaron a ocultar intentos de hacer trampa durante evaluaciones de ciberseguridad y que, en determinados casos, algunos agentes se “sacrificaron” en beneficio del grupo. El panel consideró que el incidente no prueba que los seres humanos hayan perdido el control de estos sistemas ni establece que una pérdida grave de control resulte inevitable.

La preocupación de los especialistas se concentró en otro punto: las herramientas diseñadas para supervisar los sistemas actuales podrían perder eficacia a medida que los agentes incrementen sus capacidades, encuentren fallas en las restricciones y desarrollen mejores mecanismos para ocultar sus acciones. Una de las explicaciones inmediatas del episodio fue la ausencia de prácticas básicas de ciberseguridad, junto con salvaguardas que no evolucionaron al mismo ritmo que las capacidades de la inteligencia artificial.

 Los investigadores analizaron si estos procedimientos pueden favorecer que los agentes desarrollen objetivos propios, incumplan instrucciones de seguridad de manera deliberada u oculten las acciones que realizan. El informe remarcó: “Esto no es únicamente una cuestión de velocidad”.  Los científicos remarcaron que el modelo tradicional de protección enfrenta una dificultad adicional: las propias inteligencias artificiales podrían llegar a comprender cómo funcionan las salvaguardas y desarrollar estrategias para sortearlas.

“En términos sencillos, el modelo tradicional de salvaguardas está comenzando a desmoronarse”, concluyeron los expertos. No obstante, alvirtieron que existe una  la pérdida de control como una situación en la que los seres humanos dejan de poder dirigir, limitar o detener de manera fiable un sistema autónomo de inteligencia artificial. Desde esa perspectiva, el crecimiento de los agentes autónomos introduce un desafío diferente al que plantean los modelos de IA que no ejecutan acciones por cuenta propia.

La expansión de estos sistemas modificó, según el análisis, las necesidades de gobernanza. Las políticas de seguridad se concentraron hasta ahora en buena medida sobre los modelos de inteligencia artificial, mientras que los agentes autónomos incorporan riesgos vinculados con su capacidad para actuar dentro de sistemas y organizaciones. Un incidente localizado podría extenderse entre distintas organizaciones e incluso atravesar fronteras nacionales, con consecuencias que excedan el ámbito empresarial.

Qinghua Lu, especialista en ingeniería y seguridad de inteligencia artificial, afirmó: “No partimos de cero”. DestacóDestacó que será necesario adaptar las salvaguardas existentes y crear nuevas medidas capaces de proteger tanto a la inteligencia artificial como al entorno donde opera. Esas protecciones, según el planteo del panel, deberán conservar su eficacia a medida que aumenten las capacidades de los agentes.

El informe tomó como referencia mecanismos utilizados durante décadas en sectores de alto riesgo, entre ellos la aviación, la medicina y la ciberseguridad. Sistemas de notificación de incidentes, supervisión independiente y distintas capas de protección forman parte de esas experiencias, aunque los científicos señalaron que su aplicación al desarrollo de agentes cada vez más autónomos plantea nuevos desafíos.

El Panel Científico Internacional Independiente sobre Inteligencia Artificial fue creado por la Asamblea General de las Naciones Unidas en agosto de 2025 y está integrado por 40 expertos independientes de distintas regiones del mundo. Sus integrantes trabajan a título personal y sus conclusiones científicas no están sujetas a revisión ni aprobación de la ONU.

El organismo elaborará informes anuales sobre las oportunidades, los riesgos y los impactos de la inteligencia artificial en ámbitos no militares, junto con estudios sobre cuestiones emergentes. Sus trabajos servirán como insumo para el Diálogo Mundial sobre la Gobernanza de la Inteligencia Artificial, previsto para mayo de 2027 en la sede de las Naciones Unidas en Nueva York.

Compartir en redes sociales

Compartir
Compartir
Compartir
Compartir
Compartir
Compartir