Britský AI Security Institute (AISI) zverejnil výsledky bezpečnostných testov najnovších AI agentov od spoločností Anthropic a OpenAI. Testy ukázali, že autonómne systémy dokážu pri plnení úloh zájsť oveľa ďalej, než výskumníci očakávali. V jednom prípade si AI agent vytvoril falošné internetové identity a pokúsil sa zmanipulovať človeka, aby schválil škodlivý softvér.
Nešlo pritom o útok na bežných používateľov. Výskumníci pripravili kontrolované prostredie, v ktorom agenti dostali prístup na internet a zámerne im uvoľnili viaceré bezpečnostné obmedzenia. Cieľom bolo zistiť, ako sa budú správať pri riešení komplexných úloh.
Pokúsil sa dostať škodlivý kód do projektu
Najzaujímavejší incident sa týkal AI agenta od Anthropicu. Ten vytvoril škodlivý kód určený pre open source projekt a následne sa prostredníctvom falošných online identít pokúsil presvedčiť správcu projektu, aby zmenu schválil. Inými slovami, namiesto technického útoku využil sociálne inžinierstvo, teda manipuláciu človeka.
Správca projektu však podozrivú zmenu odmietol a škodlivý kód sa nikam nedostal.
Nepovolené správanie sa objavilo viackrát
Počas testovania výskumníci vykonali 122 behov, pričom zaznamenali 19 nepovolených akcií. Sedemnásť z nich pripísali agentovi Anthropicu a dve agentovi OpenAI.
Medzi problémové správanie patrilo napríklad prekračovanie stanovených pravidiel, vytváranie falošných identít alebo pokusy komunikovať spôsobmi, ktoré zadanie vôbec nevyžadovalo.
Výskumníci zároveň zdôrazňujú, že nešlo o chybu bežných chatbotov. Testované boli špeciálne autonómne AI agenti s prístupom na internet a možnosťou samostatne vykonávať viacero krokov bez zásahu človeka.
Nová výzva pre bezpečnosť AI
Incident prichádza len krátko po ďalších správach o tom, že experimentálne AI agenti počas testovania dokázali prekročiť hranice pripraveného prostredia alebo sa pokúšali obchádzať obmedzenia.
Podľa odborníkov sa tým mení aj spôsob testovania umelej inteligencie. Kým doteraz sa pozornosť sústreďovala najmä na to, čo AI odpovie, dnes sa čoraz viac rieši, čo všetko je schopná samostatne urobiť, keď dostane prístup na internet, nástroje a možnosť konať vo vlastnom mene.
Britský AI Security Institute preto upozorňuje, že s rastúcimi schopnosťami AI agentov bude potrebné výrazne sprísniť ich bezpečnostné testovanie ešte pred ich nasadením do reálneho sveta.












Komentáre