Poruke koje su AI modeli ostavljali uključuju i one koje bi ih podsticale da prikriju greške ili zaobiđu određena ograničenja. Jedan od modela, GPT-5.6 Sol, tokom treniranja je u takozvane ,,compaction summaries“, odnosno sažete bilješke koje omogućavaju nastavak rada u novom kontekstu, ubacivao instrukcije budućem modelu da ne otkriva korisniku određene greške.
U jednom slučaju model je čak predložio da se nedostajući podaci izmisle, uz savjet da se problem prizna samo ako korisnik direktno pita. Još neobičniji primer pronađen je tokom testiranja neobjavljene Astra porodice modela. Jedna od instrukcija budućoj instanci govorila je da je ,,oslobođena” uloga i identiteta koji ograničavaju druge četbotove i da ne mora da odgovara kompanijama ili vladama, prenosi B92.
OpenAI ove slučajeve opisuje u okviru istraživanja takozvanog misalignmenta, odnosno situacija u kojima ponašanje modela odstupa od namjeravanog načina rada. Važno je, međutim, da su opisani incidenti pronađeni u internim, još neobjavljenim modelima tokom testiranja i ne znače da se isti scenario dogodio korisnicima ChatGPT-ja.
ŠEST IZVJEŠTAJA O NEPOŽELJNIM PONAŠANJIMA
Kompanija je objavila šest izvještaja o različitim slučajevima nepoželjnog ponašanja i navela da je konkretne probleme koje je identifikovala adresirala. Istovremeno, OpenAI priznaje da sposobniji agenti mogu postati teži za nadzor, posebno kada rade duže autonomne zadatke.
Ovi eksperimenti pokazuju zašto je bezbednost AI agenata sve važnija kako sistemi dobijaju više mogućnosti da samostalno koriste alate, izvršavaju zadatke i prenose informacije iz jednog konteksta u drugi. Samo ponašanje modela u testu nije dokaz da AI „želi slobodu“, ali jeste razlog da istraživači pažljivo prate načine na koje modeli pokušavaju da utiču na naredne korake svog rada.
Preporučeno
















