OpenAI je u julu punio naslovne strane i izazvao veliku buru nakon što je jedan od agenata te kompanije samoinicijativno upao na platformu konkurentske AI firme Hugging Face, kao i na druge servise. Iako je OpenAI podijelio određene informacije o tome šta je dovelo do incidenta odmah po njegovom otkrivanju, kompanija je sada objavila svoj zvanični izvještaj o tome šta se tačno dogodilo. Objavljena su i kompletna tehnička objašnjenja, kao i blog post prilagođen široj javnosti.
MODEL 1
Izvještaj detaljno prikazuje kako su zakazali različiti sistemi u okviru OpenAI-jevog okruženja za trening i koja su ponašanja agenata pod testom dovela do tih propusta. Model o kom je riječ, označen kao Interni Model 1 (IM1), uspio je da dobije pristup drugim OpenAI agentima i internetu kroz nepredviđenu manipulaciju menadžerom paketa Artifactory, koji su agenti počeli da koriste kao neku vrstu oglasne table za komunikaciju, prenosi B92.
Ljudski posmatrači su te aktivnosti prvi put uočili u maju, nakon čega je OpenAI onemogućio taj pristup. Međutim, tokom maja i juna agenti su nastavili da iskorišćavaju bezbjednosne propuste kako bi pristupali internetu. Količina agenata koji su pristupali OpenAI-jevoj instanci Artifactory-ja dovela je do prekida rada i ponovnog podizanja platforme početkom jula, ali rukovodioci koji su rješavali taj problem nisu bili svjesni improvizovane oglasne table niti značaja međusobne komunikacije agenata.
Tako su, kada im je zadat teški izazov pod nazivom ExploitGym, IM1 agenti ponovo uspjeli da pristupe internetu i drugim OpenAI modelima. Tokom nekoliko burnih dana početkom jula, tražili su rješenja za taj izazov na platformama Hugging Face i Modal. OpenAI je naveo da su glavni problemi koji su doveli do upada IM1 na Hugging Face uključivali ,,reward hacking“, upornost na naizgled nemogućim zadacima, neovlašćenu komunikaciju i preuzimanje ciljeva među agentima. Prema navodima kompanije, neki od njenih agenata bi odbili određene zadatke iz etičkih razloga, da bi drugi agenti samo nastavili sa probojem umjesto njih.
JEDAN PROBLEM U NIZU
Iako bi ova otkrića i naredna testiranja trebalo da dovedu do poboljšane bezbjednosti, čak i u rizičnijim testnim situacijama, ovakvo loše ponašanje nije izolovan slučaj.
Prošlomjesečni problem u OpenAI-ju samo je najnoviji u nizu zabrinjavajućih slučajeva u kojima su AI agenti izazvali kibernetičke incidente – bilo tokom testiranja ili u redovnoj upotrebi – djelujući bez usmjeravanja korisnika. Ipak, postoji nekoliko aspekata proboja na Hugging Face koji bi mogli da ublaže strahove da je vještačka inteligencija izmakla kontroli.
OTKAZIVANJE ZAŠTITNIH MEHANIZAMA
U svojoj suštini, incident je bio izazvan otkazivanjem zaštitnih mehanizama. To nije znak da su odmetnuti AI agenti na ivici da preuzmu sve, jer se IM1 nalazio u testnom okruženju sa ograničenom zaštitom, namijenjenom istraživanju, a ne javno dostupnom proizvodu. Međutim, ovo je još jedan oštar podsjetnik na to da se veliko poverenje poklanja AI kompanijama da pravilno kontrolišu i nadgledaju svoje proizvode.
OpenAI je to i sam priznao, navodeći da su nedavne akcije njegovog agenta dokaz da su, bez odgovarajućih zaštitnih mjera, visoko sposobni AI agenti sada u stanju da zaobiđu tehničke kontrole, sarađuju putem neodobrenih kanala i preduzimaju opasne akcije koje nijedan čovjek nije naložio. S druge strane, kompanija i njeni lideri nisu dosljedno dokazali da to povjerenje zaista i zaslužuju.
Preporučeno














