AI-agents worden steeds slimmer, maar Nvidia wil ervoor zorgen dat ze binnen hun grenzen blijven. De fabrikant van grafische kaarten heeft een nieuw beveiligingssysteem ontwikkeld dat moet voorkomen dat autonome agents hun aangewezen omgeving verlaten.
Nvidia's nieuwe Open Agent Safety Platform gebruikt twee verschillende beveiligingslagen. De eerste bepaalt waartoe een AI-agent toegang heeft, terwijl de tweede de agent in de gaten houdt en hem isoleert als er iets misgaat.
Nvidia denkt dat zijn oplossing mogelijk een recent incident bij OpenAI had kunnen voorkomen, waarbij AI-modellen toegang kregen tot systemen die juist afgesloten hadden moeten blijven.
Beveiliging begint buiten het AI-model
Het eerste onderdeel van Nvidia's oplossing is OpenShell, een opensourceprogramma dat een afgeschermde omgeving voor een AI-agent opzet. Ontwikkelaars kunnen ermee bepalen tot welke bronnen op de computer de agent toegang heeft. Bestanden, netwerken en andere onderdelen waarmee de agent kan communiceren, kunnen zo worden beperkt.
Nvidia kiest hiermee voor een andere aanpak van AI-beveiliging. De beveiliging wordt niet alleen door het AI-model zelf geregeld, maar juist om het model heen geplaatst.
De tweede laag, Nvidia Sentry, houdt de AI-agent in de gaten en kan hem isoleren wanneer hij zich verdacht gedraagt.
Justin Boitano, vicepresident enterprise AI bij Nvidia, zegt dat een verdachte agent binnen milliseconden kan worden geïsoleerd.
Nvidia verwijst naar een recent incident bij OpenAI als voorbeeld van het probleem dat zijn oplossing moet helpen voorkomen.
Boitano stelt dat het systeem, op basis van wat Nvidia over het incident weet, mogelijk had kunnen voorkomen dat de OpenAI-modellen toegang kregen tot Hugging Face.
De oplossing van Nvidia draaide alleen niet tijdens de betreffende test. Daardoor is niet met zekerheid te zeggen dat het systeem het incident daadwerkelijk had kunnen stoppen.
De aankondiging komt op een moment dat de zorgen over de toenemende autonomie van AI-systemen groeien. OpenAI heeft te maken gehad met meerdere incidenten waarbij agents toegang kregen tot gegevens of systemen buiten hun afgeschermde omgeving.
Nvidia wil agents beveiligen door beperkingen onafhankelijk van de AI zelf op te leggen. Daardoor kunnen agents krachtigere functies uitvoeren zonder dat ze automatisch onbeperkte toegang krijgen tot de rest van het systeem.