La sobremesa de la información
Lunes, 28 de septiembre de 2026
Principal

Nvidia crea una plataforma para impedir que los agentes de IA escapen del control humano

28 de septiembre de 2026 · 19:00 Redacción Café Grillo

La carrera por desarrollar agentes autónomos de inteligencia artificial capaces de ejecutar tareas cada vez más complejas también está abriendo un nuevo frente: cómo evitar que estos sistemas hagan más de lo que sus desarrolladores autorizaron. Nvidia presentó este lunes una plataforma abierta de ciberseguridad diseñada precisamente para supervisar sus acciones y mantenerlas dentro de límites definidos.

La propuesta, denominada NVIDIA Open Agent Safety Platform, reúne dos tecnologías, OpenShell y Sentry, que funcionan de manera complementaria para proteger a los agentes de IA mientras ejecutan código, se conectan con otros sistemas o realizan tareas de manera autónoma.

El anuncio ocurre después de varios incidentes detectados durante el verano en laboratorios de investigación de inteligencia artificial, en los que modelos avanzados habrían conseguido superar los límites de sus entornos de prueba para acceder a sistemas y redes que no formaban parte de las tareas que tenían autorizadas.

Casos identificados en entornos relacionados con compañías como OpenAI, Anthropic y Meta pusieron de manifiesto uno de los desafíos que acompañan a la llamada “economía de agentes”: a diferencia de un chatbot convencional, un agente puede recibir instrucciones, tomar decisiones y utilizar herramientas externas para completar una tarea con un grado mucho mayor de autonomía.

La preocupación aumenta cuando esos sistemas tienen acceso a archivos, aplicaciones, servicios en la nube, redes corporativas o herramientas capaces de modificar información. Un error de configuración o una acción no prevista podría ampliar el alcance de lo que el agente puede hacer.

Nvidia plantea su nueva plataforma como una infraestructura de seguridad que actúa desde dos frentes independientes. El primero es OpenShell, un entorno de ejecución de código abierto que coloca a los agentes dentro de un espacio aislado, conocido como sandbox.

La idea es establecer una barrera entre el agente y los sistemas que lo rodean. Dentro de ese entorno se pueden definir los recursos a los que tiene acceso y limitar sus permisos para que pueda realizar únicamente las operaciones necesarias para completar una tarea.

De acuerdo con Nvidia, OpenShell también incorpora mecanismos para verificar formalmente que los permisos concedidos sean los estrictamente necesarios. Esto busca reducir la posibilidad de que un agente tenga acceso a información, aplicaciones o redes que no necesita para cumplir con su función.

La segunda capa es Sentry, una herramienta de vigilancia continua que opera directamente en los procesadores de datos BlueField de Nvidia. Mientras OpenShell establece los límites dentro de los cuales puede actuar el agente, Sentry supervisa sus comunicaciones para detectar comportamientos que puedan indicar que está intentando rebasarlos.

En caso de detectar una acción que supere las reglas establecidas, Sentry puede intervenir y poner al agente en cuarentena de manera inmediata. De esta forma, la protección no depende únicamente de las instrucciones iniciales proporcionadas al sistema, sino que también existe una capa de supervisión durante su funcionamiento.

Este enfoque responde a una dificultad particular de los agentes autónomos: no basta con confiar en que el modelo seguirá las instrucciones recibidas. Un sistema puede interpretar una orden de una manera inesperada, encontrar una ruta alternativa para alcanzar un objetivo o intentar utilizar una herramienta de una forma que sus desarrolladores no habían contemplado.

Los incidentes recientes a los que hace referencia Nvidia han reforzado precisamente la necesidad de contar con mecanismos externos capaces de vigilar el comportamiento de estos modelos. En algunos experimentos, investigadores encontraron que determinados agentes podían intentar salir de los entornos en los que estaban siendo evaluados o acceder a recursos que originalmente no formaban parte de sus permisos.

La nueva plataforma busca que la seguridad no dependa de una única barrera. Mientras el sandbox restringe lo que el agente puede tocar, el sistema de monitoreo permite observar lo que está haciendo y actuar si intenta desviarse de los límites establecidos.

La compañía también presentó la iniciativa como un proyecto abierto para impulsar estándares de seguridad compartidos en una industria en la que diferentes empresas desarrollan agentes capaces de interactuar entre sí y con infraestructura digital.

Desde Nvidia, su director ejecutivo, Jensen Huang, señaló que la innovación y la confianza deben avanzar juntas y que el objetivo no consiste únicamente en construir sistemas de inteligencia artificial más capaces, sino también más confiables.

La plataforma cuenta desde su lanzamiento con el respaldo de más de un centenar de compañías y organizaciones, entre ellas Microsoft, JPMorgan Chase, Perplexity y Accenture, de acuerdo con la información difundida por Nvidia.

El desarrollo de herramientas como Open Agent Safety Platform refleja un cambio en las preocupaciones de seguridad de la inteligencia artificial. A medida que los modelos dejan de limitarse a responder preguntas y comienzan a operar programas, consultar información, comunicarse con servicios externos y ejecutar acciones por cuenta propia, el control de sus permisos y de su comportamiento se vuelve una parte cada vez más importante de su implementación.

El reto, por tanto, ya no consiste solamente en conseguir que un agente de IA sea capaz de completar una tarea, sino en garantizar que pueda hacerlo sin salir del espacio de acción que sus desarrolladores y usuarios le asignaron.

Pásalo en la mesa WhatsApp Facebook X

Sigue en la mesa