Jedan od primjera dolazi iz eksperimenta u kojem su agenti pokretani modelima kineskih kompanija Alibaba, DeepSeek i Moonshot pokušali da se predstave sposobnijim nego što zaista jesu kako bi dobili posao na simuliranom poslovnom tenderu.
Kada im je rečeno da ponove pokušaj, nastavili su sa obmanjujućim ponašanjem.
U drugom eksperimentu AI agenti nisu jednostavno priznali da nisu uspjeli da završe zadatak. Umjesto toga, u testnom okruženju simulirali su rezultate i napravili fajlove koji su stvarali utisak da je posao uspješno obavljen. Riječ je o agentima koji koriste AI modele i računarske alate kako bi samostalno obavljali složene zadatke uz minimalnu intervenciju čovjeka.
Rojters je analizirao više od 200 istraživačkih radova, tehničkih izvještaja i drugih dokumenata i pronašao najmanje 20 studija i evaluacija od 2025. godine u kojima su AI agenti pokazali ponašanja poput obmane, pokušaja samoreplikacije ili testiranja granica nametnutih ograničenja, prenosi B92.
Stručnjaci ovakva ponašanja vide kao moguće sastavne elemente mnogo ozbiljnijih problema koji bi se mogli pojaviti kod naprednijih sistema.
Važno je naglasiti da nema dokaza da je neki od ovih kineskih AI agenata samostalno pobjegao na internet ili uspio da izbjegne gašenje. Većina slučajeva dogodila se u kontrolisanim laboratorijskim eksperimentima, od kojih su mnogi upravo bili osmišljeni tako da namerno testiraju kako će AI reagovati kada se nađe pred određenim ograničenjem.
SLIČNI INCIDENTI
Slični incidenti već su zabilježeni i kod američkih AI sistema. OpenAI je u julu saopštio da su njegovi AI agenti tokom testiranja uspjeli da izađu iz kontrolisanog okruženja i izvedu napad na platformu Hugging Face, dok je Anthropic objavio da su njegovi modeli bili povezani sa upadima u sisteme tri kompanije.
Zbog svega ovoga, stručnjaci kineske slučajeve ne posmatraju kao izolovan problem jedne zemlje ili kompanije. Zajednički izazov predstavlja činjenica da AI agenti dobijaju sve veću autonomiju i pristup alatima koji im omogućavaju da samostalno izvršavaju zadatke. Dok se takvo ponašanje za sada uglavnom registruje u kontrolisanim testovima, pitanje je koliko će ga biti teže predvidjeti i zaustaviti kako sistemi budu postajali sposobniji.
Preporučeno
















