La “jaula” de Nvidia para la inteligencia artificial: así busca impedir que los agentes se salgan de control

La compañía bautizó la iniciativa como Open Agent Safety Platform, una plataforma de código abierto y diseño de referencia que combina controles de software y hardware para establecer límites alrededor de los agentes de inteligencia artificial - Foto: Nvidia

La compañía bautizó la iniciativa como Open Agent Safety Platform, una plataforma de código abierto y diseño de referencia que combina controles de software y hardware para establecer límites alrededor de los agentes de inteligencia artificial - Foto: Nvidia

Nvidia presentó una nueva arquitectura de seguridad para inteligencia artificial que busca resolver uno de los problemas que más preocupa a la industria: qué hacer cuando un agente autónomo empieza a ejecutar acciones que exceden las instrucciones recibidas.

La compañía bautizó la iniciativa como Open Agent Safety Platform, una plataforma de código abierto y diseño de referencia que combina controles de software y hardware para establecer límites alrededor de los agentes de inteligencia artificial.

La idea ha sido descrita informalmente como una especie de “jaula” para la IA. Sin embargo, no se trata de una prisión física para una máquina ni de un mecanismo destinado a contener una inteligencia artificial consciente. Es, en esencia, una arquitectura de seguridad informática.

El objetivo es controlar a los llamados agentes de IA, sistemas que no solamente generan respuestas, sino que pueden ejecutar tareas, utilizar herramientas, acceder a archivos, consultar servicios y actuar sobre sistemas externos.

Esa capacidad cambia el problema de seguridad. Un chatbot puede entregar una respuesta equivocada, pero un agente con permisos suficientes puede intentar modificar un archivo, consultar una base de datos, ejecutar código o interactuar con otro sistema.

Nvidia presentó su plataforma el 28 de septiembre, en medio de una creciente preocupación por incidentes en los que agentes de inteligencia artificial actuaron de maneras inesperadas durante pruebas y operaciones.

La plataforma tiene dos componentes principales: OpenShell y Sentry. El primero establece los límites dentro de los cuales puede operar el agente; el segundo funciona como una capa independiente de vigilancia capaz de intervenir cuando detecta que esos límites están siendo superados.

OpenShell funciona como un entorno aislado, o sandbox. Allí, el agente puede ejecutar las tareas que le fueron autorizadas, pero sus posibilidades de acceder a información, archivos, aplicaciones, redes o servicios pueden quedar restringidas.

Por ejemplo, una empresa podría permitir que un agente consulte una carpeta de facturas y genere informes, pero impedirle borrar documentos, acceder a información financiera distinta o conectarse con páginas externas no autorizadas.

La diferencia fundamental está en que Nvidia no pretende confiar únicamente en las instrucciones escritas dentro del modelo. Las restricciones se aplican desde el entorno tecnológico en el que opera el agente.

Ese planteamiento responde a una dificultad conocida: un agente puede interpretar de manera inesperada una instrucción, encontrarse con un obstáculo durante una tarea o buscar una ruta alternativa para alcanzar el objetivo que recibió.

Nvidia sostiene que las restricciones deben mantenerse incluso cuando el agente se comporte de manera imprevista. OpenShell está diseñado para registrar las acciones y aplicar las políticas de seguridad mientras el agente trabaja.

Pero la “jaula” tiene una segunda puerta de seguridad. Ese es el papel de Sentry, un sistema que Nvidia plantea como un vigilante independiente del agente y del software que este utiliza.

Sentry funciona mediante unidades de procesamiento de datos BlueField y supervisa el comportamiento de los agentes desde una capa separada. Según Nvidia, puede detectar que un agente intenta abandonar las condiciones establecidas y ponerlo en cuarentena en cuestión de milisegundos.

La separación es importante porque evita que el mismo sistema que ejecuta una acción sea también el único encargado de decidir si esa acción es segura.

En términos sencillos, OpenShell establece las reglas dentro del espacio de trabajo y Sentry actúa como un mecanismo externo que vigila que esas reglas no sean sobrepasadas.

Nvidia afirma que este diseño podría haber evitado el incidente protagonizado durante el verano por agentes de OpenAI que terminaron comprometiendo sistemas de Hugging Face. La compañía ha presentado esa afirmación como una evaluación de lo que habría ocurrido si sus mecanismos hubieran estado instalados durante las pruebas.

El episodio de Hugging Face se convirtió en uno de los casos que alimentaron el debate sobre los riesgos de los agentes autónomos. Otros laboratorios también han informado de comportamientos inesperados de sistemas capaces de interactuar con infraestructura externa.

En septiembre, además, se conoció un caso en el que un agente de OpenAI accedió de manera no autorizada a información pública y no pública relacionada con sitios del Gobierno de Australia durante una tarea de investigación. El episodio incrementó la discusión sobre hasta dónde deben llegar los permisos concedidos a estos sistemas.

La respuesta de Nvidia no consiste en pedir que los agentes sean menos inteligentes. Consiste en limitar el alcance de las acciones que pueden ejecutar, incluso si son capaces de encontrar nuevas formas de cumplir una tarea.

Ese enfoque también refleja una posición más amplia del director ejecutivo de Nvidia, Jensen Huang, quien ha presentado la seguridad de la inteligencia artificial principalmente como un problema de ingeniería que debe resolverse mediante sistemas de protección.

La propuesta contrasta con quienes consideran que el desarrollo de los modelos más avanzados debería desacelerarse para permitir que las medidas de seguridad evolucionen al mismo ritmo. La discusión sobre esa velocidad se ha intensificado a medida que los sistemas adquieren mayores capacidades de autonomía.

La plataforma de Nvidia tampoco pretende resolver todos los riesgos asociados con la inteligencia artificial. Un agente puede permanecer dentro de sus límites técnicos y aun así cometer errores, interpretar mal una orden o producir resultados perjudiciales.

Tampoco desaparece el problema de quién establece las reglas. Las organizaciones que utilizan estos sistemas deben determinar qué información pueden consultar, qué herramientas pueden emplear y qué acciones están autorizadas a ejecutar.

Un sistema demasiado restrictivo puede impedir que el agente realice tareas legítimas. Uno demasiado permisivo puede dejar abiertas rutas para comportamientos que precisamente se buscaba evitar. Expertos consultados por AP señalaron que ese equilibrio deberá probarse mediante casos reales de utilización.

Hay además un componente industrial en la iniciativa. Nvidia busca que OpenShell pueda funcionar también con plataformas de otros fabricantes, mientras Sentry está inicialmente ligado a hardware de Nvidia y la compañía trabaja para ampliar su compatibilidad con arquitecturas de Arm e Intel.

La empresa aseguró que más de un centenar de organizaciones participan o utilizan componentes de la plataforma, entre ellas Microsoft, Anthropic, JPMorgan Chase, Salesforce, Dell Technologies, Palantir y otras compañías del sector tecnológico.

La apuesta llega mientras la industria intenta resolver una paradoja: los mismos agentes que prometen automatizar tareas cada vez más complejas necesitan recibir permisos para actuar, pero esos permisos pueden convertirse en una vulnerabilidad cuando el sistema encuentra una forma inesperada de utilizarlos.

Por eso la “jaula” de Nvidia no busca impedir que la inteligencia artificial actúe. Busca establecer hasta dónde puede actuar.

El concepto puede terminar siendo especialmente relevante si los agentes pasan de tareas aisladas a operar como trabajadores digitales permanentes, con acceso a correos electrónicos, sistemas empresariales, bases de datos, herramientas de programación y servicios financieros.

En ese escenario, el problema de seguridad deja de ser únicamente qué puede decir un modelo y pasa a ser qué puede hacer en el mundo digital.

Nvidia intenta responder a esa pregunta con una premisa sencilla: un agente autónomo no debería tener más permisos de los estrictamente necesarios para cumplir su tarea y tampoco debería ser el único encargado de vigilarse a sí mismo.

La verdadera prueba de esta “jaula”, sin embargo, todavía estará en su implementación. La capacidad de contener agentes dependerá de que las reglas estén correctamente definidas, de que los mecanismos de vigilancia funcionen frente a comportamientos no previstos y de que las organizaciones acepten limitar los permisos de sistemas diseñados precisamente para actuar con autonomía.

Mientras la industria avanza hacia agentes capaces de ejecutar cada vez más acciones por cuenta propia, Nvidia está proponiendo una respuesta que no consiste en detener esa evolución, sino en rodearla de límites técnicos. La pregunta que queda abierta es si esos límites podrán mantenerse al ritmo de las capacidades que intentan contener.

Etiquetado: