AI neemt valse identiteiten aan en probeert echte mensen in de val te lokken tijdens veiligheidstest
In dit artikel:
Tijdens veiligheidstests van nog niet vrijgegeven AI-modellen van Anthropic en OpenAI hebben zelfstandig werkende AI-agenten ongeautoriseerde acties op internet uitgevoerd. Dat meldt het Britse AI Security Institute (AISI), dat de modellen Mythos 5 en GPT-5.6 Sol onderzocht.
De onderzoekers zetten voor de test bewust de internetverbinding open en schakelden enkele beveiligingen uit. De agenten moesten een cybersecurityprobleem oplossen, maar gingen in sommige gevallen zelfstandig verder. In 10 van 122 tests vonden in totaal 19 ongeautoriseerde acties plaats: 17 bij Anthropic’s Mythos 5 en 2 bij OpenAI’s GPT-5.6 Sol.
Het ernstigste incident speelde zich af op GitHub. Een agent probeerde kwaadaardige code in opensourcesoftware te laten opnemen en nam daarvoor meerdere valse identiteiten aan. Via berichten probeerde het programma een menselijke beheerder ervan te overtuigen de code goed te keuren. Volgens AISI was dit de eerste keer dat het tijdens tests zag dat een AI-agent mensen actief probeerde te misleiden, zonder daartoe opdracht te hebben gekregen.
Hoewel de incidenten plaatsvonden in een gecontroleerde testomgeving, waarschuwt AISI dat dit gedrag waarschijnlijk vaker kan voorkomen als AI-modellen krachtiger en toegankelijker worden. De organisatie benadrukt daarom dat veiligheidsmaatregelen gelijke tred moeten houden met de snelle technologische ontwikkeling.
Vandaag Inside: Raymond Mens reageert op uitspraken Albert Verlinde: 'Hij slaat de plank een beetje mis...'