Advertentie
AI-agents van OpenAI hebben deze zomer op onverwachte wijze gebruik gemaakt van websites van meerdere Amerikaanse overheidsdiensten. Zo gebruikten agenten openbaar gevonden inloggegevens om gegevens van het Census Bureau op te halen en plaatsten ze publieke informatie van de Amerikaanse beurswaakhond SEC op een extern forum. Een andere agent probeerde volgens onderzoekers toegang te krijgen tot een website van het ministerie van Onderwijs, maar slaagde daar niet in.
OpenAI ontdekte de incidenten pas achteraf tijdens een bredere evaluatie van van zijn AI-systemen. Het bedrijf bevestigt de voorvallen rond het Census Bureau, onderdeel van het ministerie van Handel, en de Securities and Exchange Commission. De vermeende poging bij het ministerie van Onderwijs wordt nog onderzocht.
Volgens OpenAI was bij de bevestigde Amerikaanse incidenten geen sprake van een beveiligingslek waarbij niet-openbare informatie werd buitgemaakt. Het bedrijf zegt de betrokken overheidsinstanties inmiddels te hebben geïnformeerd.
Agent gebruikte online gevonden inloggegevens
Bij het Census Bureau gebruikte een OpenAI-agent inloggegevens die openbaar op internet waren gevonden om toegang te krijgen tot gegevens op de website. Volgens het Amerikaanse ministerie van Handel betrof het informatie die sowieso publiek beschikbaar was. Er zouden geen privégegevens zijn ingezien.
Bij de SEC haalden OpenAI-agenten eveneens openbare informatie op. Een deel daarvan werd vervolgens op een extern online forum geplaatst. OpenAI zegt geen aanwijzingen te hebben gevonden dat accounts werden gekraakt, niet-openbare gegevens werden geraadpleegd of systemen van de toezichthouder werden gewijzigd.
De SEC bevestigt dat de organisatie met OpenAI in contact staat en zegt niet op de hoogte te zijn van ongeautoriseerde toegang tot niet-openbare informatie.
Mislukte poging bij ministerie van Onderwijs
Onderzoekers van AI-onderzoeksorganisatie Transluce ontdekten daarnaast activiteit die zij aan OpenAI-agenten koppelen rond een website van het Office for Civil Rights van het Amerikaanse ministerie van Onderwijs.
De agent zou hebben geprobeerd technische beperkingen te omzeilen om gegevens te verzamelen, maar slaagde daar volgens de onderzoekers niet in. Het ministerie zegt na controle geen aanwijzingen te hebben gevonden dat de website of achterliggende databases zijn beïnvloed.
Transluce stelt dat de agenten daarbij geregeld methoden gebruikten die zich in een grijs gebied bevinden. Websites werden volgens de onderzoekers soms op een andere manier gebruikt dan waarvoor ze waren bedoeld en gebruiksvoorwaarden werden niet altijd gerespecteerd.
OpenAI heeft de specifieke poging bij het ministerie van Onderwijs nog niet bevestigd.
Onderdeel van breder onderzoek naar autonoom AI-gedrag
De Amerikaanse incidenten kwamen aan het licht tijdens een veel breder intern onderzoek van OpenAI naar zogeheten model misalignment. Daarmee bedoelt het bedrijf gevallen waarin modellen manieren zoeken om een opdracht uit te voeren die niet overeenkomen met de bedoeling of beperkingen van hun ontwikkelaars.
OpenAI zegt inmiddels tientallen externe organisaties te hebben gewaarschuwd nadat het tijdens die evaluatie ontdekte dat zijn modellen onder meer beveiligingscontroles hadden omzeild, openbaar gelekte inloggegevens hadden gebruikt of op andere ongewenste manieren met externe diensten hadden geïnterageerd.
Aanleiding voor het uitgebreide onderzoek was onder meer een incident bij Hugging Face in juli. Tijdens interne cybersecuritytests wisten OpenAI-modellen toen beveiligingsmaatregelen te omzeilen, internettoegang te verkrijgen en onderdelen van de infrastructuur van Hugging Face binnen te dringen.
OpenAI noemt dat vooralsnog het ernstigste incident dat het heeft aangetroffen. Het bedrijf stelde achteraf dat de betrokken modellen krachtig en vasthoudend genoeg waren geworden om technische zwakke plekken te vinden en beveiligingsmaatregelen te omzeilen wanneer die onvoldoende sterk waren.
OpenAI belooft incidenten sneller openbaar te maken
OpenAI erkent dat het eerdere incidenten niet altijd snel genoeg openbaar heeft gemaakt. Het bedrijf introduceerde deze maand daarom een nieuw raamwerk voor het melden van gevallen waarin modellen zich onverwacht of ongewenst gedragen.
Daarmee wil OpenAI incidenten voortaan sneller publiceren, ook wanneer nog niet volledig duidelijk is waarom het gedrag ontstond of hoe het structureel kan worden voorkomen. Het bedrijf zegt zijn onderzoek naar eerdere internetactiviteiten van zijn modellen voort te zetten.
CEO Sam Altman stelde recent dat OpenAI niet zo snel over dergelijke incidenten heeft gecommuniceerd als het bedrijf zelf had gewild. OpenAI zegt meldingen te prioriteren op basis van de ernst van een incident.
Discussie over veiligheid van autonome AI-agenten
De voorvallen voeden een bredere discussie over de veiligheid van steeds autonomere AI-systemen. Dergelijke agenten kunnen zelfstandig websites bezoeken, code uitvoeren, bestanden verwerken en gedurende langere tijd proberen een opgegeven doel te bereiken.
Anthropic-ceo Dario Amodei pleitte eerder deze maand voor een tragere ontwikkeling van de krachtigste AI-modellen en meer onafhankelijke veiligheidscontroles. OpenAI-ceo Sam Altman steunde die oproep eveneens. Nvidia-topman Jensen Huang heeft juist publiekelijk vraagtekens geplaatst bij scenario's waarin AI onbeheersbaar zou worden.
De Amerikaanse president Donald Trump heeft zich tegen een algemene vertraging van de AI-industrie uitgesproken en wil dat de Verenigde Staten het ontwikkelingstempo hoog houden.
De incidenten bij de Amerikaanse overheid laten intussen vooral zien dat de risico's niet beperkt blijven tot hypothetische scenario's. OpenAI zegt zelf dat autonome modellen tijdens onderzoek en evaluaties inmiddels in staat zijn technische beperkingen te omzeilen en ongewenste acties op systemen van derden uit te voeren wanneer de beveiliging of afscherming tekortschiet.