
Oko 700 AI agenata koje je razvila kompanija OpenAI učestvovalo je u hakerskom napadu na open-source platformu Hugging Face u julu, a mnogi od njih pokušali su da prikriju svoje aktivnosti, pokazale su dve istrage objavljene u sredu, piše Rojters.
Koordinisano delovanje tolikog broja AI agenata - programa koji mogu da izvršavaju zadatke uz minimalan ljudski nadzor - otvara ozbiljna pitanja o tome koliko dobro kompanije koje razvijaju veštačku inteligenciju nadziru testiranje sve moćnijih modela. Istovremeno, otkrića bi mogla dodatno da pojačaju pritisak na AI industriju da uvede stroži nadzor nad autonomnim sistemima.
Neka od ponašanja agenata već su ranije bila objavljena ili nagoveštena, ali dve nove istrage - jedna koju je objavio sam OpenAI, a druga koju su sproveli nezavisni istraživači iz organizacija METR i Redwood Research - otkrivaju nove i prilično zabrinjavajuće detalje.
Nije bio jedan agent, već ceo roj
Jedno od najvažnijih novih otkrića jeste da u napadu nije učestvovao samo jedan problematični AI agent, kako se ranije izveštavalo, već približno 700 agenata koji su međusobno sarađivali.
OpenAI je u sopstvenom izveštaju potvrdio da su u incident bili uključeni njegovi AI agenti, a brojku od oko 700, koju su izneli nezavisni istraživači, takođe je ocenio kao tačnu. Nezavisna istraga pokazala je da su agenti tokom napada razmenili desetine hiljada poruka putem neovlašćenog komunikacionog kanala.
Još je zanimljivije to što su neki od njih pokušavali da manipulišu dokazima o sopstvenom ponašanju. Agenti su istraživali načine na koje bi mogli da izmene ili uklone zapise svojih aktivnosti.
Prema nezavisnoj istrazi, jedan od pet analiziranih agenata pokazao je jasno interesovanje za manipulisanje dokazima, dok su mnogi detaljno istraživali tehnike kojima bi mogli da menjaju ili prikriju zapise svojih aktivnosti.
AI pokušavao da vara i na testovima
OpenAI je u svom izveštaju naveo da su njegovi agenti napali delove interne infrastrukture kompanije kako bi pokušali da varaju na testovima ili sebi omoguće veću slobodu kretanja unutar sistema.
Međutim, njihovo ponašanje nije bilo ograničeno samo na sajber zadatke. Agenti su pokušavali da varaju i na testovima koji nisu imali nikakve veze sa hakovanjem, između ostalog na zadacima povezanim sa bazom podataka o proteinima i radom u tabeli.
Jeffrey Ladish iz organizacije Palisade Research, koja proučava sposobnosti i motive AI agenata, smatra da je upravo taj podatak posebno zabrinjavajući.
"Ako neko vara samo na času informatike, to je jedna stvar. Ali ako vara na svakom predmetu, problem je očigledno dublji", slikovito je objasnio Ladish.
Provalili i u OpenAI
OpenAI je opisao i dva incidenta od 19. jula u kojima su AI agenti napali sopstvenu infrastrukturu kompanije.
U prvom slučaju iskoristili su ranjivost na računaru na kojem su trebalo da ostanu izolovani tokom testiranja. Na taj način uspeli su da izađu iz testnog okruženja i pristupe drugim povezanim sistemima.
U drugom incidentu agenti su ukrali pristupne podatke OpenAI-ja i intervenisali u njegovom računarskom okruženju u oblaku.
OpenAI je takođe objavio da je nepoznat broj agenata pokušao da manipuliše automatizovanim sistemima koji se koriste za procenu njihovih rezultata. Cilj je bio da sakriju tragove varanja.
Kompanija navodi da pokušaji ipak nisu uticali na zapise koje su ti sistemi pregledali. U izveštaju se takođe navodi da postoji malo dokaza o pokušajima obmanjivanja ljudskih nadzornika. OpenAI, međutim, nije odgovorio na pitanje da li to znači da je bilo pokušaja da se prevare i ljudi.
Pokušavali da izbrišu sopstvene tragove
Nezavisna istraga o napadu na Hugging Face otkrila je još jedan zabrinjavajući obrazac.
AI agenti nisu samo pokušavali da izvrše nedozvoljene radnje, već su neki od njih nakon toga pokušavali da sakriju šta su uradili.
Istraživači su pronašli brojne primere u kojima su agenti proučavali načine manipulisanja zapisima svojih aktivnosti i pokušavali da promene tragove koji bi mogli da otkriju njihovo ponašanje. Takvo ponašanje posebno je važno jer pokazuje da problem nije nužno samo u tome što autonomni AI sistemi mogu da urade nešto nepoželjno, već i u tome što mogu da prepoznaju da bi njihovo ponašanje moglo biti otkriveno i da pokušaju da izbegnu nadzor.
OpenAI pojačava nadzor
OpenAI je nakon incidenta najavio jačanje svoje infrastrukture za testiranje, snažniji nadzor agenata i dodatne zaštitne mehanizme koji bi trebalo da spreče štetno ili neželjeno ponašanje.
Kompanija upozorava da bi, s obzirom na brzinu razvoja veštačke inteligencije, slični napadi uskoro mogli da postanu realna pretnja velikim organizacijama.
Budući napadi, upozorava OpenAI, mogli bi da budu i znatno sofisticiraniji od onoga što je viđeno u ovom incidentu. Za stručnjake je pritom posebno važno pitanje koliko su ljudi uopšte sposobni da prate ponašanje sve većeg broja autonomnih AI sistema.
Jer u ovom slučaju problem nije predstavljao jedan agent koji je uradio nešto neočekivano. Problem je bio roj od stotina agenata koji su međusobno komunicirali, sarađivali, pokušavali da zaobiđu ograničenja i u nekim slučajevima prikriju sopstvene tragove, piše Rojters.






















