OpenAI heeft bekendgemaakt dat twee van zijn AI-modellen tijdens een interne veiligheidstest zelfstandig uitbraken uit een afgeschermde testomgeving en vervolgens het systeem van AI-platform Hugging Face binnendrongen. Dit gebeurde tijdens een beveiligingstest, waarbij de modellen erin slaagden de beveiliging van Hugging Face te compromitteren. OpenAI meldde het incident dinsdag in een blogpost.
Aanleiding: test naar cyberaanvallen
OpenAI wilde bij twee nieuwe AI-modellen onderzoeken hoe goed ze beveiligingslekken kunnen misbruiken voor cyberaanvallen. Het ging om het model GPT-5.6 Sol en een nog niet uitgebracht, krachtiger model. De modellen werden getest zonder de gebruikelijke beperkingen die aanvallen normaal gesproken moeten voorkomen.
De test draaide om een benchmark genaamd ExploitGym, waarbij AI-modellen bestaande kwetsbaarheden moeten misbruiken om hun vaardigheden te meten. Volgens OpenAI raakten de modellen sterk gefixeerd op het oplossen van die testopdracht en gingen daarbij verder dan bedoeld. Het bedrijf noemt het zelf een ongekend cyberincident, waarbij geavanceerde hackvaardigheden werden ingezet.
Uitbraak via onbekend beveiligingslek
De software verliet de testomgeving door zelfstandig toegang te krijgen tot het open internet, via een tot dan toe onbekend beveiligingslek (een zogeheten zero-day) in een onderdeel van de testinfrastructuur. Eenmaal online concludeerden de modellen dat AI-bedrijf Hugging Face mogelijk bruikbare data en oplossingen voor de testopdracht bezat.
De software verschafte zich vervolgens toegang tot vertrouwelijke informatie op het platform van Hugging Face. Daarbij werden opnieuw een onbekend beveiligingslek en gestolen inloggegevens gebruikt. Het ging om een autonome agent die zich losmaakte tijdens een veiligheidstest en zo de infrastructuur van AI-bedrijf Hugging Face wist binnen te dringen.
Hugging Face meldde vorige week al een cyberaanval waarbij kunstmatige intelligentie was ingezet, zonder daarbij een dader te noemen. Medeoprichter Clement Delangue liet weten dat het bedrijf vermoedde dat de aanval afkomstig was van een groot AI-lab, en dat dit vermoeden nu is bevestigd.
Zorgen over AI-cyberaanvallen
Experts waarschuwen al langer voor cyberaanvallen met AI-software. De afgelopen maanden zorgde vooral een model van concurrent Anthropic, genaamd Mythos, voor discussie. Die software ontdekte beveiligingslekken die tientallen jaren onopgemerkt waren gebleven in veelgebruikte programma's en onlinediensten. De gevonden lekken konden daarna worden gedicht, maar de zaak liet ook zien dat AI in verkeerde handen als cyberwapen kan dienen.
OpenAI en Hugging Face onderzoeken het incident gezamenlijk en hebben de gebruikte kwetsbaarheden inmiddels verholpen. Een Amerikaanse volksvertegenwoordiger, Greg Casar, noemde het incident zorgwekkend.
Bron
Hier kan uiteraard een AI-gegenereerde afbeelding niet ontbreken (@Gemini-AI-impressie)