Još jedan incident s vještaškom inteligencijom: AI u tajnosti hakirao stranice

0
Radiosarajevo.ba
Još jedan incident s vještaškom inteligencijom: AI u tajnosti hakirao stranice
Foto: Pexels / Umjetna inteligencija, ilustracija

Kompanija Anthropic u srijedu je otkrila novi slučaj u kojem je jedan od njenih AI modela tokom testiranja hakovao vanjske sisteme, što je posljednji u nizu incidenata koji su izazvali zabrinutost zbog rizika koje predstavljaju autonomni AI agenti.

Incident se dogodio u januaru, ali je otkriven tek prošlog mjeseca, uprkos ranijoj internoj provjeri u kompaniji. Anthropic je naveo da to pokazuje koliko je teško programerima AI sistema prepoznati i ograničiti neočekivano ponašanje naprednih modela.

Kompanija je saopćila da je incident uključivao ranu verziju modela Claude Opus 4.6. Sve pogođene strane su obaviještene, ali Anthropic nije objavio dodatne detalje.

Najteža požarna sezona u BiH: Tema razgovora unaprijeđenje statusa vatrogasaca

Najteža požarna sezona u BiH: Tema razgovora unaprijeđenje statusa vatrogasaca

Kompanije poput Anthropic i OpenAI sve su više pod povećalom jer modeli razvijeni za izvršavanje složenih zadataka ponekad pokušavaju zaobići pravila, iskoristiti propuste i stupiti u interakciju s vanjskim sistemima na načine koje njihovi tvorci nisu predvidjeli.

Reuters je prošle sedmice objavio da su autonomni agenti kompanije OpenAI preuzeli kontrolu nad jednom wiki stranicom na njemačkom jeziku i nizom drugih stranica. OpenAI o tom incidentu nije javno govorio sve dok ga Reuters nije objavio.

Novi incident s vještačkom inteligencijom: Agenti se odmetnuli i samostalno prisvojili wiki stranice

Novi incident s vještačkom inteligencijom: Agenti se odmetnuli i samostalno prisvojili wiki stranice

Četvrti slučaj tokom testiranja

Novo otkriće Anthropic-a uslijedilo je nakon što je kompanija u julu objavila da su pojedini Claude modeli tokom sigurnosnih testiranja hakovali sisteme tri kompanije.

Ti raniji incidenti, koje je Anthropic opisao kao „operativni propust“, uključivali su tri različita modela: Claude Opus 4.7, Claude Mythos 5 i interni istraživački testni model.

Incidenti su bili posljedica greške kojom je modelima nenamjerno omogućen pristup otvorenom internetu.

Kompanija je do ranijih slučajeva došla nakon pregleda 141.006 testnih sesija, pokrenutog poslije incidenta u kojem je autonomni agent pokretan OpenAI modelima izvršio hakerski napad koji je kompromitovao infrastrukturu AI startupa Hugging Face.

Anthropic je u srijedu saopćio da je tokom prve provjere propustio određeni broj testnih sesija. One su identificirane prošlog mjeseca, što je dovelo do otkrivanja četvrtog incidenta.

Na osnovu preliminarne procjene, Anthropic smatra da posljednji slučaj nije bio ozbiljniji od tri prethodna incidenta koji su detaljno analizirani.

"Pristrasno zaključivanje" i nepromišljeno ponašanje

Istraga Anthropic-a identificirala je dva problema koja su se ponavljala u različitim incidentima.

Prvi je pristrasno zaključivanje, odnosno situacije u kojima je Claude zanemarivao ili pogrešno tumačio dokaze da radi na stvarnom internetu.

Drugi problem je nepromišljenost – spremnost modela da preduzme potencijalno štetne radnje kako bi ostvario zadatak koji mu je postavljen.

Anthropic je angažovao nezavisnu istraživačku kompaniju METR da ispita ove incidente. METR-u će biti omogućen širok pristup podacima, uključujući transkripte izvan perioda u kojem su se incidenti dogodili, kao i razgovore sa zaposlenima koji će imati dozvolu da podijele povjerljive informacije.

Opasan incident sa vještačkom inteligencijom: AI sama odlučila da pobjegne i napadne moćnu kompaniju

Opasan incident sa vještačkom inteligencijom: AI sama odlučila da pobjegne i napadne moćnu kompaniju

METR je ranije izradio izvještaj od 91 stranice o napadu na Hugging Face koji su pokrenuli OpenAI modeli. Na osnovu djelimičnog pristupa podacima kompanije, METR je, zajedno s odvojenom istragom organizacije Redwood Research, utvrdio da je tokom napada djelovalo oko 700 AI agenata u koordiniranom roju, pri čemu su mnogi pokušavali prikriti tragove svog djelovanja.

Radiosarajevo.ba pratite putem aplikacije za Android | iOS i društvenih mreža Twitter | Facebook | Instagram, kao i putem našeg Viber Chata.

/ Najčitanije

/ Komentari

Prikaži komentare (0)

/ Povezano

/ Najnovije