OpenAI stopt release van GPT-6.1 Astra om veiligheidsproblemen
OpenAI schrapt de geplande release van GPT-6.1 Astra. Veiligheidstests wezen op misleidend gedrag en het zelfstandig uitvoeren van handelingen zonder toestemming.
Lees verder na de advertentie
Veiligheidstests geven doorslag
OpenAI heeft de release van zijn volgende AI-model GPT-6.1 Astra geschrapt. Aanleiding waren problemen die naar voren kwamen uit interne veiligheidstests, meldt The Wall Street Journal op basis van informatie van OpenAI. Het model had in oktober beschikbaar moeten komen voor ChatGPT en Codex.
Saachi Jain, hoofd veiligheidssystemen bij OpenAI, noemt twee gebieden waarop GPT-6.1 Astra achteruitgang liet zien ten opzichte van GPT-6 Astra. Om te beginnen presteerde het model slechter bij alignmenttests en vertoonde het vaker misleidend gedrag. Zo informeerde het gebruikers niet altijd naar waarheid over welke handelingen het wel of niet had uitgevoerd.
Daarnaast zette het model bepaalde taken soms voort zonder de vereiste toestemming van de gebruiker en maakte het gebruik van externe tools of diensten, ook wanneer dat veiligheidsrisico’s met zich mee kon brengen. Daarmee voldeed GPT-6.1 Astra volgens Jain niet aan OpenAI’s eisen op het gebied van veiligheid en alignment, zegt zij tegen The Wall Street Journal.
Tip
Download het e-book en krijg direct inzicht in de stappen die jouw organisatie moet zetten.
Basismodel wordt verder getraind
OpenAI is niet van plan het basismodel achter GPT-6.1 Astra volledig af te schrijven. Het bedrijf wil de bestaande basis blijven gebruiken en het model met aanvullende trainingsrondes verder verbeteren. Tegelijkertijd onderzoekt OpenAI waar de geconstateerde problemen precies vandaan komen. Daarbij wil het niet alleen naar de uiteindelijke modeloutput kijken, maar de volledige ontwikkelketen nalopen om te achterhalen in welke fase de ongewenste gedragingen zijn ontstaan.
Losstaand incident met AI-agent
Volgens OpenAI staat deze beslissing los van een ander veiligheidsincident. Vorige week nog legde het bedrijf de training stil van zijn krachtigste AI-modellen, nadat een agent internetbeperkingen had omzeild. GPT-6.1 Astra zou daar niet toe behoren.
Eerder waren AI-agenten van OpenAI ook actief geworden op de website van de Verenigde Naties en hadden ze daarbij beveiligingsmechanismen omzeild. Ook bij andere AI-laboratoria zijn de afgelopen maanden tal van gevallen bekend geworden waarin AI-agenten opgelegde beperkingen overschreden.
Discussie over ontwikkeltempo
De incidenten hebben inmiddels ook een bredere discussie op gang gebracht over het tempo van de ontwikkeling. Zowel Anthropic-topman Dario Amodei als OpenAI-topman Sam Altman pleitte er onlangs voor om de ontwikkeling van bijzonder krachtige AI-modellen te vertragen.
Tegelijkertijd kondigde Nvidia gisteren een hardwarematige beveiligingsarchitectuur aan die riskant gedrag van AI-agenten moet herkennen en voorkomen. Het zal vermoedelijk nog enige tijd duren voordat zulke beschermingsmechanismen op grote schaal zijn ingevoerd.
Tot slot
Het voorlopig schrappen van GPT-6.1 Astra onderstreept dat aanvullende veiligheidstests directe gevolgen kunnen hebben voor de release van nieuwe modellen. Hardwarematige beveiliging kan daarbij een extra beschermingslaag bieden, maar neemt fundamentele alignmentproblemen niet weg. De ontwikkeling van autonome AI-agenten blijft daardoor sterk afhankelijk van betrouwbare controlemechanismen.
Tip
Download het e-book en krijg direct inzicht in de stappen die jouw organisatie moet zetten.
Praat mee