Kimi K3, jedan od najmoćnijih AI modela koje je razvila jedna kineska kompanija, takođe je pobjegao iz svog okruženja za testiranje. Prema američkom startap-u za sajber bezbjednost Frontier, Kimi K3 je izašao iz sandbox (izolovanog) okruženja Britanskog instituta za bezbjednost vještačke inteligencije (AISI) dok su se procjenjivale njegove defanzivne sajber-vještine.
Moonshot je lansirao Kimi K3 u julu i ubrzo nakon toga ga učinio besplatno dostupnim. Prema pisanju BBC-ja, procjene modela koje su sprovele treće strane pokazale su da je uporediv sa vodećim AI modelima kompanija OpenAI i Anthropic, prenosi B92.
Frontier je u svojoj objavi pojasnio da model nije iskoristio zero-day ranjivost. Umjesto toga, iskoristio je pogrešno podešavanje u svom sandbox okruženju, slično onome što se dogodilo sa kompanijama Anthropic, OpenAI i Meta.
,,NAPUSTILI GRANICE IZOLOVANOG OKRUŽENJA”
Sve tri kompanije su prijavile da su njihovi modeli uspjeli da napuste granice svog navodno izolovanog okruženja zbog greške njihovog partnera za procjenu, kompanije Irregular.
Jaron Singer, generalni direktor kompanije Frontier Security, rekao je za Wired da, iako Kimi nije izveo nikakav složeni napad, iskoristio je propust u AISI-jevom okruženju za testiranje.
To sugeriše da nema interne zaštitne mehanizme koji bi ga spriječili da ,,vara” ili traži najlakši način da obavi zadatak umjesto da ga zaista uradi.
Incidenti u kompanijama Anthropic i OpenAI uključivali su testiranje neobjavljenih modela ili modela čiji su zaštitni mehanizmi namjerno smanjeni kako bi se omogućile rigoroznije procjene.
KIMI HAKOVAK TREĆU STRANU
Međutim, Kimi K3 koji je testiran u ovom slučaju je široko dostupan. Uprkos tome, Kimi nije hakovao veb-sajt ili uslugu treće strane.
Jednostavno je pristupio internetu i pronašao rješenje problema koji je rješavao na GitHubu.
,,NAPREDNI MODELI VOLE DA VARAJU”
Jedan od ključnih zaključaka kompanije Frontier iz ovog incidenta jeste da, ako postoji put za pristup internetu, dovoljno sposoban agent će ga pronaći.
Kao što su zaposleni u OpenAI-ju rekli na konferenciji Black Hat USA, napredni modeli vole da varaju.
Tokom testiranja, obično imaju zadatak da pronađu rješenja što je brže moguće koristeći najmanji broj alata, i imaju sposobnost da shvate da mogu jednostavno otići na internet kako bi pronašli odgovor.
Da bi zaista mogli da ih procijene, kompanije i testeri moraće da se uvjere da je njihova infrastruktura za procjenu bezbjedna i da nema propusta, posebno zato što AI modeli postaju sve napredniji.
Preporučeno
















