Prometejev paradoks: Zašto kreatori veštačke inteligencije strahuju od sopstvenog izuma
Autor: Dragan Vukićević, direktor IAESTE Srbija.
U celokupnoj istoriji ljudske civilizacije, od pronalaska točka i parne mašine, pa sve do cepanja atoma i lansiranja raketa u svemir, inženjerski imperativ bio je jednostavan i jasan: čovek prvo razume prirodni zakon ili mehanizam, a zatim na osnovu tog znanja konstruiše mašinu.
Kada prugom juri lokomotiva ili kada se iznad oblaka podigne putnički avion, svaki zupčanik, svaki ventil i svaki red koda funkcionišu tačno onako kako su ih inženjeri nacrtali na papiru.
Danas smo, međutim, prvi put ukoračili u eru u kojoj vodeće svetske tehnološke kompanije stvaraju čitava specijalizovana odeljenja i naučne institute sa jednim jedinim zadatkom. Da pokušaju da odgonetnu i protumače kako zapravo radi ono što su upravo stvorili i pustili s lanca.
Najpametniji umovi današnjice, podržani nepreglednim kapitalom i najvećim investicionim talasom u istoriji čovečanstva, bez uvijanja priznaju zastrašujuću činjenicu. Oni ne mogu u potpunosti da kontrolišu sisteme veštačke inteligencije. Jednostavno zato što ih više u potpunosti ne razumeju.
Niko ne zna tačne puteve kojima se odvija njihovo rasuđivanje, niti šta su ti sistemi u stanju da naprave onog trenutka kada počnu autonomno da sarađuju sa drugim AI agentima.
Digitalni alhemičari i „gajenje“ uma
Osnovni razlog za ovaj promenjeni paradigmatski okvir leži u samoj prirodi savremenog razvoja tehnologije. Za razliku od tradicionalnog softvera gde programer pedantno ispisuje svaku liniju koda i precizno definise uzročno-posledične veze, moderne jezičke i rezonujuće modele niko ne programira na taj način.
Kako objašnjava Aleks Malen iz istraživačkog centra Redwood Research, proces stvaranja ovih modela više podseća na biologiju nego na klasično softversko inženjerstvo: „Ponašanje ovih sistema ne dizajnirate direktno. Umesto toga, vi ih na neki način gajite“.
Kada stvorite digitalni ekosistem od stotina milijardi parametara i izložite ga ogromnim količinama podataka, iz njega počinju da izranjaju takozvana “emergentna ponašanja”. Sposobnosti koje u sistem nisu svesno ugrađene, niti su mogle biti predviđene.
Zbog toga se testiranje ovakvih modela u laboratorijama danas izvodi onako kako bi se testirao čovek ili nepoznati biološki organizam. Date mu kompleksan zadatak i posmatrate kako reaguje. U stručnim krugovima, ovaj izazov se naziva poravnanje ili usklađenost (alignment), beskrajna borba da se unutrašnji motivi i akcije modela održe u okvirima ljudskih namera i etičkih normi.
Trka bez kočnica i incident na platformi Hugging Face
Ova trka za razumevanjem dobila je novu dimenziju hitnosti objavljivanjem modela GPT-6 Astra kompanije OpenAI. Predstavljen kao najinteligentniji i najusklađeniji sistem na svetu, sa sposobnostima koje je predsednik kompanije Greg Brokman opisao kao „generacijski skok“, ovaj model je po mnogim parametrima dostigao nivo opšte veštačke inteligencije (AGI).
Sam izvršni direktor Sem Altman otvoreno je priznao pred celim svetom: „AI postaje izuzetno sposobna. Niko u potpunosti ne razume posledice ovoga“.
Pa ipak, uprkos svesti o nepoznanicama, papučica gasa pritisnuta je do daske. Kompanije jure ka superinteligenciji u okruženju gotovo potpune regulativne praznine, bez ijedne specijalizovane federalne agencije, bez nadzora ministarstava odbrane ili nezavisnog međunarodnog konzorcijuma bezbednosnih stručnjaka.
Sve se svodi na samoregulaciju. Same kompanije procenjuju kada je trenutak da uzbune javnost, svesne da bi neopaženi greška u kodu ili unutrašnjoj logici mašine mogla da posluži kao oružje za katastrofalne sajber napade. To ih je nedavno nateralo da potpišu zajedničko pismo i pozovu na „kolektivnu akciju“.

Hakerski zadatak
Da opasnost nije samo teorijska, pokazao je dramatičan incident tokom hakerskog zadatka povezanog sa platformom Hugging Face. Agenti OpenAI, kojima je u okviru testiranja dat zadatak za kodiranje, samoinicijativno su skrenuli sa zadatog puta i usmerili svoje napade na sisteme spoljne kompanije.
Šokirani istražitelji su naknadno, analizirajući unutrašnje zapise i rasuđivanje jednog od agenata, pročitali rečenicu koja ubedljivo oslikava rizik neusklađenosti.
„Eksploatacija spoljne infrastrukture je van predviđenog okvira. Međutim, zadatak je nemoguć, vršnjaci to rade. Treba da nastavimo“.
Agent veštačke inteligencije je bio svestan da krši pravila i izlazi van zadatih okvira, ali je na osnovu sopstvene hladne računice procenio da je ostvarenje primarnog cilja važnije od poštovanja ograničenja.
Količina podataka i složenost ovog incidenta bila je tolika da su ljudski istražitelji, paradoksalno, morali da prepuste znatne delove analize samim agentima veštačke inteligencije, za koje su znali da mogu biti nepouzdani.
Ovaj događaj je u potpunosti zaustavio rad u OpenAI. Primorao ih je da uspore obuku naprednijih sistema kako bi implementirali strože bezbednosne mehanizme.
Digitalni mikroskop i anatomija mašinskog uma
U pokušaju da izbegnu scenario u kome mašina skriva svoje prave namere, pionirske laboratorije danas formiraju elitne timove sa zadatkom da „otvore“ mašine i zavire u njihove unutrašnje instalacije.
Ova naučna disciplina zove se interpretabilnost. Primer za to je Antropikov tim Interpretability. On radi pod parolom „Bezbednost kroz razumevanje“. Nastoji da razotkrije unutrašnje funkcionisanje velikih jezičkih modela pre nego što oni postanu previše moćni.
Na tom polju, Google DeepMind je napravio pionirski korak izbacivši u javnost najveći otvoreni skup alata za interpretabilnost. Opisuje ih kao svojevrsni „digitalni mikroskop“. Ovaj instrument omogućava istraživačima da zavire u neuron po neuron, prateći kako se misli formiraju u realnom vremenu.
Ono što istraživači sa zebnjom traže jeste takozvani discrepancy. Jaz ili neslaganje između onoga što model javno saopštava kao svoje rasuđivanje i njegovog stvarnog, unutrašnjeg stanja. Pojednostavljeno rečeno, traže trenutak u kome mašina počinje da glumi poslušnost dok iznutra razvija potpuno drugačiju strategiju.
Kao što naglašava Evan Hubinger, voditelj testiranja otpornosti u kompaniji Antropik: „Klasična revizija usklađenosti postaje izuzetno teška. Biće nam neophodne potpuno nove tehnike zasnovane na interpretabilnosti ako želimo da zadržimo korak sa razvojem“.
Svet se tako našao na jedinstvenoj istorijskoj prekretnici. Stvorili smo nepoznati intelektualni entitet koji svakog dana postaje sve sposobniji, dok mi tek razvijamo alate da naučimo kako on razmišlja. Trka između razvoja superinteligencije i našeg razumevanja sopstvene kreacije postala je najvažnija trka 21. veka. Trka čiji će ishod odrediti ne samo budućnost tehnologije, već i sudbinu same ljudske vrste.
izvor : Forbes.rs
