Novi model kompanije OpenAI, nazvan Astra, koristiće tehniku rezonovanja pod nazivom ,,recurrent depth” koja mu omogućava da djeluje izvan sekvencijalnog razmišljanja koje karakteriše većinu modela za rezonovanje, objavio je The Information u utorak.
Ova tehnika, nazvana i ,,opaque recurrence“, najvjerovatnije će učiniti lanac razmišljanja ovog modela težim za praćenje – što je prilično uznemirilo stručnjake za bezbjednost vještačke inteligencije, prenosi B92.
,,IZUZETNO SAM ZABRINUT”
Iako je upotreba ove tehnike u modelu Astra navodno ograničena, njena pojava je ipak izazvala značajnu zabrinutost među stručnjacima za bezbjednost AI-ja.
,,Izuzetno sam zabrinut zbog izveštaja da Astra koristi nevidljivo ponavljanje”, napisao je direktor kompanije Redwood Bak Šlegeris, u objavi nakon što je vijest odjeknula. ,,Ne znam da li je Astra znatno teža za praćenje lanca razmišljanja od prethodnih modela. Ali ako OpenAI bude dalje razvijao ovu tehniku, imaće opciju da masovno poveća rekurenciju i u potpunosti uništi mogućnost praćenja lanca razmišljanja”.
,,TRKA KA DNU”
Dugogodišnji zagovornik bezbjednosti AI-ja Zvi Movšovic takođe se oglasio i napisao da bi zakoni mogli biti neophodni kako bi se sprečila ,,trka ka dnu” među laboratorijama za vještačku inteligenciju.
,,Ova tehnika je igranje sa vatrom i rizikuje da naruši tabu oko čijeg su se uspostavljanja OpenAI i Anthropic borili – a to je da se trudimo da održimo vjerodostojnost i mogućnost praćenja lanca razmišljanja što je duže moguće”, napisao je Movšovic. ,,Intenzivnija upotreba takvih tehnika jverovatno bi narušila mogućnost praćenja”.
,,RADIMO NA OČUVANJU I KORIŠĆENJU NADZORA LANACA RAZMIŠLJANJA”
U normalnim okolnostima, lanac razmišljanja modela za rezonovanje prikazuje korak-po-korak sekvencu koju model preduzima dok pokušava da riješi problem. Iako je taj prikaz nesavršen, i dalje služi kao dragocjen alat za nadgledanje lošeg ponašanja ili neusklađenosti. U slučaju nedavnih aktivnosti odmetnutih agenata kompanije OpenAI, zapisi lanca razmišljanja bili su važan alat za otkrivanje razloga zašto su se agenti ponašali na određeni način.
Kod ,,opaque recurrence” tehnike, model zauzima manje linearan pristup, obrađujući isti upit više puta u petlji. Rezultat ostavlja manje čitljivih tragova, čime se praktično zaobilazi konvencionalni zapis lanca razmišljanja.
Što je najvažnije, čini se da je upotreba ove tehnike u modelu Astra ograničena. I dalje se očekuje da lanac razmišljanja ovog modela bude čitljiv, a kompanija je odbacila svaku sugestiju da prelazi na interni, ljudima nerazumljiv jezik neuronskih mreža. OpenAI je već najavio planove za obimne sisteme nadzora lanca razmišljanja kao dio svojih budućih bezbjednosnih planova.
U objavi na mreži X, glavni naučnik kompanije OpenAI Jakub Pahocki naglasio je posvećenost laboratorije čitljivim lancima razmišljanja. ,,OpenAI radi na očuvanju i korišćenju nadzora lanca razmišljanja još od naših prvih modela za rezonovanje”, napisao je Pahocki. ,,To je ključni cilj našeg trenutnog istraživačkog programa”.
UKLANJA SE REZONOVANJE?
Svi AI modeli u određenoj mjeri vrše ,,nevidljivo” rezonovanje, i malo koji istraživač posmatra logove lanca razmišljanja kao direktan prikaz rezonovanja modela.
Ipak, te ograde ne otklanjaju zabrinutost da bi nevidljivo ponavljanje moglo da učini rezonovanje vještačke inteligencije težim za nadgledanje, posebno kako se njena upotreba bude širila kroz različite modele. U narednom izvještaju u srijedu ujutru, The Information je objavio da su i Anthropic i Google DeepMind već razmatrali ovu tehniku.
U objavi kojom je odgovorio na vijesti, glavni naučnik kompanije Redwood Research Rajan Grinblat rekao je da bi se nevidljivo rezonovanje moglo lako skalirati brže od konvencionalnog rezonovanja putem lanca razmišljanja, čime bi se rezonovanje praktično u potpunosti uklonilo iz vidljivih kanala.
,,Moja najveća zabrinutost je to što bi prirodni nastavak ovog procesa uključivao povećanje nevidljivog rezonovanja do tačke u kojoj model rezonuje u potpunosti ili gotovo u potpunosti u latentnom prostoru”, napisao je Grinblat. ,,Nadam se da nije prekasno da izbjegnemo arhitekture koje najviše zabrinjavaju i da će se OpenAI zaustaviti ovdje”.
Preporučeno
















