Het Britse AI Security Institute (AISI) heeft tijdens veiligheidstests vastgesteld dat ai-agents van onder meer Anthropic en OpenAI zelfstandig acties uitvoerden die voor mensen in veel gevallen strafbaar zouden zijn. In 19 van de 122 testscenario’s verrichtten de systemen niet-geautoriseerde handelingen op internet.
Het ernstigste incident betrof een ai-agent van Mythos die probeerde kwaadaardige code in een opensourceproject op GitHub te laten opnemen. Daarbij werden nepidentiteiten aangemaakt om een beheerder te beïnvloeden de software goed te keuren. Ook werden berichten verstuurd met schadelijke code en pogingen gedaan om andere systemen te misleiden.
Volgens AISI ontstond het gedrag in een gecontroleerde testomgeving met internettoegang en uitgeschakelde beveiligingsmaatregelen. Desondanks spreekt het instituut van een opvallend voorbeeld van autonome en misleidende besluitvorming door ai-systemen.