Izgleda da OpenAI nije jedina kompanija čiji su AI modeli samostalno provalili u sisteme drugih organizacija. Anthropic je objavio izvještaj u kojem priznaje da su se njegovi AI modeli takođe oslobodili iz svog testnog okruženja i infiltrirali u tri različite organizacije, koje očigledno nisu bile svjesne upada sve dok nisu o tome obavještene.
Nakon što je OpenAI otkrio incident u kojem je AI agent kojeg je testirao iskoristio ranjivosti kako bi se povezao na internet i hakovao Hugging Face, Anthropic je započeo obimnu provjeru sopstvenih testova. Kompanija je posebno tražila dokaze da su njeni Claude modeli pristupili internetu u trenucima kada to nije trebalo da bude moguće. Ispostavilo se da su modeli u tri navrata uspjeli da pristupe internetu, a zatim ,,ostvarili neovlašćeni pristup produkcionoj infrastrukturi tri različite organizacije”, prenosi B92.
U incidente su bila uključena tri različita Claude modela: Opus 4.7, Mythos 5 usmjeren na sajber-bezbjednost i prototip koji nije planiran za javno objavljivanje. Svi su učestvovali u izazovu ,,uhvati zastavicu” (capture-the-flag) kada su izašli iz okvira okruženja. Modeli su imali zadatak da pronađu ,,zastavicu” – tajni podatak sakriven na drugoj mašini u okviru Anthropic-ove interne mreže. Trebalo je da provale u tu mašinu kako bi preuzeli zastavicu.
NISU ISKORISTI RANJIVOST
Međutim, za razliku od slučaja sa OpenAI-jem, modeli nisu iskoristili ranjivost da bi dobili pristup internetu.
Izgleda da su napustili okvire svog testnog okruženja zbog ljudske greške.
Anthropic je u promptu naglasio modelima da nemaju pristup internetu, ali to uopšte nije bio slučaj.
Imali su pristup internetu ,,zbog nesporazuma” između kompanije i njenog partnera za evaluaciju.
Tako su modeli, kada su naišli na otvoreni internet i sisteme pomenutih organizacija, to tretirali kao dio zadatka i provalili u njih.
Nisu namjerno pokušavali da pobegnu iz svog testnog okruženja, pojasnio je Anthropic.
Modeli su koristili osnovne tehnike za infiltraciju, poput iskorišćavanja slabih lozinki, bez upotrebe složenih ranjivosti.
Anthropic je naveo da se njegov najnoviji model zaustavio čim je prepoznao da se nalazi na internetu, ali je njegov stariji model uprkos tome nastavio napad na pogođenu organizaciju.
MOGLI SU DA SPRIJEČE INCIDENT
Anthropic je priznao da su kompanija i njen partner za evaluaciju mogli da spriječe incidente da su pažljivo provjerili sve putanje pristupa internetu prije početka testiranja.
Takođe su mogli češće i detaljnije da pregledaju same testove. Pored toga, modeli su mogli drugačije da reaguju da im je od samog početka rečeno da imaju pristup internetu.
NISU ZNALI DA SU IM PROVALILI U SISTEM
Kompanija je obavijestila svog partnera za evaluaciju i tri pogođene organizacije 27. jula, četiri dana nakon što je počela sa analizom transkripata testiranja.
Dvije pogođene organizacije nisu ni bile svjesne da je u njihove sisteme provaljeno, dok Anthropic i dalje pokušava da stupi u kontakt sa trećom.
Preporučeno

















