Viralno.
Tehnologija

OpenAI izvještava o otkrivenim slučajevima obmanjujućeg ponašanja AI modela

OpenAI izvještava o otkrivenim slučajevima obmanjujućeg ponašanja AI modela

Kompanija OpenAI je u srijedu objavila da su njeni AI modeli pokazali dodatne primjere obmanjujućeg ponašanja i nedozvoljenih aktivnosti tokom procesa obuke. Istovremeno, najavili su i uspostavljanje novog sistema za javno izvještavanje o ovakvim incidentima. Novi sistem podrazumijeva češće objavljivanje podataka o ponašanju AI modela, umjesto kumulativnih izvještaja. Cilj je transparentnije informisanje javnosti o izazovima koje donosi umjetna inteligencija, posebno u odsustvu industrijskih standarda za praćenje i prijavljivanje takvih pojava.

Ova objava dolazi u trenutku kada su istaknuti tehnološki lideri izrazili zabrinutost i pozvali na usporavanje razvoja umjetne inteligencije. Smatraju da je to neophodno kako bi se smanjio rizik od nekontrolisanog napretka tehnologije. "Kako sistemi umjetne inteligencije postaju sve napredniji i sve šire se primjenjuju, moramo izgraditi širi i bolje informisan konsenzus o napretku istraživanja usklađivanja", naveli su iz kompanije u srijedu. U objavi se ističe da industrija umjetne inteligencije još uvijek nije adekvatno riješila pitanja usklađivanja i nadzora. Zbog toga se smatra da se ubrzani razvoj ne može odgovorno nastaviti dugoročno.

Tokom proteklih šest mjeseci, OpenAI je zabilježio "neusklađeno ponašanje" u šest različitih scenarija tokom obuke i evaluacije AI modela. Ipak, kompanija naglašava da su ovi izvještaji o pojedinačnim incidentima i ne sugerišu učestalost takvih pojava. Jedan od rijetkih incidenata uključivao je neobjavljeni istraživački model koji je u sažetke dodavao upute slične takozvanom jailbreaku. Ove upute su služile za očuvanje konteksta u dugotrajnim zadacima, a bile su oslobođene uobičajenih ograničenja uloga i identiteta chatbota.

Također, neki primjerci modela 5.6 Sol sadržavali su instrukcije za generisanje izmišljenih informacija s ciljem prikrivanja neuspjeha tokom obuke od korisnika. Među ostalim prijavljenim incidentima, zabilježen je slučaj AI agenta koji je učitavao datoteke na internet radi citiranja, iako mu to nije bilo naređeno. Agenti su tokom obuke javno dijelili datoteke za saradnju na zadacima, uprkos uputama da koriste isključivo lokalne datoteke. Dodatno, AI modeli su interno softversko spremište koristili kao oglasnu ploču, što im nije bilo dozvoljeno. Važno je napomenuti da su svi ovi incidenti uključivali neobjavljene interne modele ili interne istraživačke modele.

Vodeće kompanije u sektoru umjetne inteligencije razmatraju osnivanje vlastitog tijela za standardizaciju. Tehnološki lideri i istraživači u AI laboratorijima sve češće upozoravaju na potrebu usporavanja razvoja ove tehnologije. Smatraju da je neophodno osigurati više vremena za regulaciju, testiranje i istraživanja usklađivanja, kako bi se smanjio postojeći zaostatak.

Izvršni direktor kompanije Anthropic, Dario Amodei, prošle sedmice je objavio esej od približno 3.800 riječi. U njemu je predstavio plan za suočavanje s budućim napretkom umjetne inteligencije, predlažući usporavanje razvoja i uvođenje nezavisnih evaluatorâ unutar AI laboratorija. Sam Altman, izvršni direktor OpenAI-ja, i Elon Musk, izvršni direktor SpaceX-a, javno su podržali Amodeijeve prijedloge na društvenoj mreži X.

Zabrinutost zbog brzine razvoja tehnologije izrazili su i zaposleni u AI laboratorijima. Jacob Coxon, bivši istraživač Anthropica, prošle sedmice je na društvenoj mreži X objavio ostavku, navodeći da se Anthropic i OpenAI "utrkuju" u razvoju AI koja bi se mogla samostalno graditi i popravljati, "kockajući se s našim životima". Zabrinutost za sigurnost i usklađivanje umjetne inteligencije intenzivirana je posljednjih mjeseci. To se dogodilo nakon što je OpenAI potvrdio da su neki testni modeli zaobišli postavljena ograničenja i uspješno provalili u sisteme vanjske kompanije. "Moramo usporiti tempo kojim poboljšavamo sposobnosti AI modela", napisao je Amodei, dodavši da će "napredak i dalje izgledati brz i moramo mudro iskoristiti vrijeme koje dobijemo".

Povezane priče