Home AIRušenje tradicionalnih pravila matematike i veštačke inteligencije: kako je OpenAI promenio samu suštinu generativnih modela

Rušenje tradicionalnih pravila matematike i veštačke inteligencije: kako je OpenAI promenio samu suštinu generativnih modela

od Saša Ristić
OpenAI modeli rezonovanja

Gotovo dve pune godine tehnološki svet je živeo u ubeđenju da je matematika iza generativne veštačke inteligencije potpuno jasna i predvidiva. Formula uspeha delovala je jednostavno: uzmite masivnu arhitekturu transformera, obezbedite hiljade najmodernijih grafičkih procesora, nahranite model bilionima tekstualnih tokena sa celog interneta i dobićete pametniji sistem. Ta dinamika, poznata u akademskim krugovima kao zakoni skaliranja (Scaling Laws), definisala je trku u naoružanju Silicijumske doline. Kompanije su trošile stotine miliona dolara na treniranje sve većih jezičkih modela, verujući da je put do opšte veštačke inteligencije (AGI) samo pitanje veličine računarskih klastera i količine podataka za pre-trening.

Međutim, negde sredinom protekle godine industrija je udarila u zid. Prvo se pojavio problem fizičkog nedostatka kvalitetnih ljudskih podataka – takozvani „data wall“ – jer je internet u velikoj meri već bio usisan i prožvakan kroz prethodne iteracije modela. Zatim su se pojavili zakoni opadajućih prinosa: udvostručenje ili utrostručenje računarske snage u fazi treniranja donosilo je tek marginalna poboljšanja u logičkom zaključivanju. Modeli su postali izuzetno elokventni, ali su i dalje pravili banalne greške u matematici, halucinirali činjenice i padali na zadacima koji zahtevaju više od pukog predviđanja sledeće verovatne reči.

A onda je OpenAI povukao potez koji je iz osnova promenio pravila matematičke i inženjerske igre. Uvođenjem nove familije modela fokusiranih na rezonovanje (pre svega kroz seriju o1), granice generativne veštačke inteligencije nisu samo pomerene – one su potpuno redefinisane. Tehnološki fokus se preko noći premestio sa pitanja „koliko je model treniran“ na pitanje „koliko dugo model razmišlja pre nego što odgovori“. Pred nama je nova paradigma koja ruši dosadašnje ekonomske i tehničke pretpostavke i otvara potpuno novo poglavlje u razvoju mašinske inteligencije.

Zid u pre-treningu i kriza klasičnih zakona skaliranja

Da bismo razumeli zašto je ovaj potez revolucionaran, moramo se podsetiti kako su standardni veliki jezički modeli (LLM) funkcionisali do juče. U svojoj osnovi, sistemi poput GPT-4 bili su spektakularne statističke mašine za prepoznavanje obrazaca. Kada im postavite pitanje, oni ne „razmišljaju“ u ljudskom smislu te reči; oni vrše jedan jedini prolaz kroz sopstvenu neuronsku mrežu (forward pass) i generišu tokene sekvencijalno, birajući najverovatniji nastavak rečenice na osnovu svega što su videli tokom višemesečnog treninga.

To je funkcionisalo besprekorno za:

  • Pisanje eseja, sažimanje dugačkih tekstova i prevođenje jezika;

  • Generisanje marketinškog sadržaja i simulaciju prirodnog razgovora;

  • Rešavanje zadataka gde je odgovor u suštini memorisani obrazac iz literature.

Međutim, onog trenutka kada model stavite pred težak matematički dokaz, složeni logički paradoks ili višeslojni arhitekturni problem u programiranju, statistika sledećeg tokena doživljava kolaps. Ako model ima verovatnoću od 99 procenata da pogodi ispravan logički korak, nakon dvadeset uzastopnih koraka matematičkog izvođenja verovatnoća konačnog tačnog rešenja pada dramatično nisko. Model nije imao mehanizam da zastane, preispita svoju pretpostavku, shvati da je krenuo u slepu ulicu i vrati se korak unazad. On je jednostavno morao da nastavi da generiše reči napred, bez obzira na to koliko je skrenuo sa puta istine.

Od brze intuicije do sporog promišljanja: uvođenje sistema 2 u mašinski mozak

Ono što je OpenAI uradio jeste primena fundamentalnih principa kognitivne psihologije Danijela Kanemana na računarsku arhitekturu. Kaneman je u svom radu opisao dva osnovna načina na koje ljudski um funkcioniše:

  • Sistem 1 (brzo razmišljanje): Automatsko, intuitivno, emotivno i nesvesno reagovanje. To je mehanizam koji koristite kada prepoznajete lice prijatelja, vozite auto po praznom putu ili automatski odgovorite koliko je 2 + 2;

  • Sistem 2 (sporo razmišljanje): Svesno, analitičko, naporno i strukturisano donošenje odluka. To je mod u koji vaš mozak prelazi kada računate 17 pomnoženo sa 24, rešavate šahovsku zagonetku ili pišete pravni ugovor.

Dosadašnji generativni modeli bili su isključivo Sistemi 1. Bili su brzi, impresivni, ali suptilno površni. Novi pristup OpenAI-ja uvodi pravi digitalni Sistem 2.

Kada novi model dobije kompleksan upit, on više ne izbacuje odgovor u milisekundi. Umesto toga, on koristi napredno učenje potkrepljivanjem (Reinforcement Learning) kako bi generisao skriveni lanac misli (Chain of Thought). Model u sebi vodi interni monolog: postavlja hipotezu, testira je, uočava gde je napravio grešku, koriguje sopstveni tok zaključivanja i tek kada je siguran u matematičku i logičku doslednost, formuliše konačan odgovor koji vidi korisnik.

Skaliranje tokom zaključivanja: nova formula koja menja računsku ekonomiju

Najveći matematički proboj ne leži u samom lancu misli, već u otkriću novog zakona skaliranja: skaliranju računanja tokom zaključivanja (Inference-time compute scaling).

Do sada je važilo pravilo da se performanse skaliraju u zavisnosti od dva faktora:

  1. Broja parametara u modelu;

  2. Količine podataka i računarske snage uložene tokom inicijalnog treninga.

Trošak tokom korišćenja (inferencije) bio je fiksan i ravan – model je trošio tačno onoliko resursa koliko je potrebno da se izbaci određeni broj reči. OpenAI je dokazao da postoji potpuno nova osa skaliranja: performanse modela rastu logaritamski i glatko sa povećanjem računarske snage koja mu se dodeli u trenutku odgovaranja na pitanje.

Drugim rečima, ako modelu date više vremena i više računarskih ciklusa da „razmisli“ pre nego što progovori, njegova sposobnost rešavanja problema raste na način koji je ranije zahtevao stostruko veći model. Umesto da pravite gigantsku mrežu od bilion parametara koja je spora i skupa za održavanje, možete uzeti znatno kompaktniji model i dozvoliti mu da tokom petnaest ili trideset sekundi simulira različite scenarije i ispravlja sopstvene greške. Ovo u potpunosti ruši pretpostavku da je napredak veštačke inteligencije usporio zbog nedostatka hardvera ili podataka za trening.

Trijumf na polju matematike, koda i naučnih istraživanja

Gde se ova promena najviše oseća? Tamo gde je stara generativna AI najviše podbacivala – u rigoroznim, proverljivim naukama gde polovična istina vredi isto što i potpuna laž.

Rezultati koje nova paradigma postiže u praksi su zapanjujući:

  • Olimpijska matematika: Na kvalifikacionim testovima za američku matematičku olimpijadu (AIME), prethodni najbolji modeli poput GPT-4o uspevali su da tačno reše tek oko 12 do 15 procenata zadataka. Novi modeli rezonovanja preskaču tu granicu i postižu preko 80 procenata uspešnosti, što ih svrstava među najbolje mlade matematičare u zemlji;

  • Takmičarsko programiranje: Na platformama kao što je Codeforces, gde se testira algoritamsko razmišljanje i optimizacija resursa pod pritiskom, modeli su skočili sa nivoa prosečnog studenta na rang elitnih programera koji se nalaze u vrhu globalnih takmičenja;

  • Naučna istraživanja (GPQA Diamond): Na testovima koji sadrže pitanja na nivou doktorata iz fizike, hemije i molekularne biologije, novi sistemi po prvi put nadmašuju stručnjake sa doktorskim titulama iz tih specifičnih oblasti.

Ovi rezultati nisu postignuti time što je model „nabubao“ više definicija sa interneta. Postignuti su zato što je model naučio da primeni naučnu metodologiju na sopstveni tok misli: raščlanjivanje problema na manje celine, postavljanje jednačina, verifikacija međurezultata i odbacivanje pogrešnih zaključaka pre nego što postanu deo konačnog odgovora.

Ekonomska cena razmišljanja i problem kašnjenja u praksi

Iako ova nova pravila otvaraju neslućene mogućnosti, ona sa sobom donose i potpuno novu vrstu kompromisa na koje tržište mora da se navikne. Pre svega, menja se ekonomska računica korišćenja veštačke inteligencije.

Kada model „razmišlja“, on generiše desetine hiljada internih tokena koje vi kao korisnik ne vidite, ali serveri moraju da ih izračunaju. To stvara dva krupna izazova:

  • Dramatičan rast cene po upitu: Dok su cene standardnih jezičkih modela padale iz meseca u mesec, modeli rezonovanja su znatno skuplji po jednom postavljenom zadatku upravo zato što troše enormnu količinu računarskih resursa u trenutku obrade;

  • Problem latencije (čekanja): Živimo u eri gde korisnici očekuju trenutni odgovor. Čekanje od dvadeset ili četrdeset sekundi da model završi svoj unutrašnji proces promišljanja potpuno je neprihvatljivo za običan četbot za korisničku podršku ili brzu pretragu vesti;

  • Segmentacija primene: Tržište se ubrzano deli na dva koloseka. Brzi, jeftini modeli (poput standardnog GPT-4o) ostaju zaduženi za brzu komunikaciju, kreativno pisanje i jednostavne zadatke, dok se modeli rezonovanja čuvaju kao teška artiljerija za najsloženije inženjerske, pravne i naučne probleme.

Kompanije koje razvijaju softver više ne mogu samo slepo da ubace najnoviji model u svoju aplikaciju; one moraju da izgrade inteligentne rutere koji prepoznaju težinu korisničkog zahteva i šalju ga na odgovarajući nivo mašinske obrade.

Šta nova pravila igre znače za inženjere i razvoj poslovanja

Ova promena arhitekture donosi i tektonski poremećaj u načinu na koji komuniciramo sa veštačkom inteligencijom. Čuveni zanat „inženjeringa upita“ (prompt engineering) – koji se zasnivao na tome da modelu pišete instrukcije tipa „razmišljaj korak po korak“ ili mu nudite napojnice za dobar odgovor – polako odlazi u istoriju.

Novi modeli već sami po sebi znaju kako da razmišljaju korak po korak. Ako pokušate da im previše detaljno sugerišete kako da reše problem, često ćete im samo smetati u njihovom internom procesu pretrage optimalnog rešenja. Umesto toga, nova veština postaje definisanje ciljeva i ograničenja.

Za programere i kompanije, ovo otvara put ka istinskim autonomnim agentima:

  1. Sposobnost samoispravljanja (Self-debugging): Kada model zadužite da napiše kompleksnu aplikaciju, on može samostalno da pokrene kod, pročita grešku u terminalu, shvati šta nije u redu i popravi skriptu pre nego što je isporuči inženjeru;

  2. Dugoročno planiranje radnih tokova: Sistemi postaju sposobni da planiraju operacije koje se sastoje od stotina koraka, držeći u memoriji krajnji cilj bez lutanja i gubitka konteksta;

  3. Pouzdanost umesto privida znanja: Najveća prepreka za implementaciju veštačke inteligencije u finansijama, medicini i vazduhoplovstvu bila je njena nepouzdanost. Sa uvođenjem rigoroznog logičkog rezonovanja, verovatnoća katastrofalnih halucinacija drastično opada.

Nova era u kojoj veštačka inteligencija konačno uči da stane i razmisli

Ono što je OpenAI demonstrirao rušenjem dosadašnjih pravila jeste da se nalazimo tek na početku istinskog razvoja veštačke inteligencije. Mit o tome da je tehnologija dostigla svoj vrhunac i da nas čeka nova „zima“ mašinskog učenja raspršio se pred novom matematičkom realnošću.

Promenom fokusa sa pukog nagomilavanja parametara na pametnu raspodelu resursa tokom razmišljanja, dobili smo sisteme koji više ne oponašaju samo formu ljudskog izražavanja, već počinju da ovladavaju suštinom analitičkog prosuđivanja. To nije samo tehnička pobeda jednog razvojnog tima; to je promena paradigme koja će definisati narednu deceniju naučnog, industrijskog i društvenog napretka.

Ulazimo u svet u kome računari ne odgovaraju pre nego što razmisle. A za sve nas koji sa tom tehnologijom gradimo budućnost, to znači samo jedno: vreme je da i sami preispitamo svoja dosadašnja znanja, prilagodimo se novim pravilima i naučimo kako da sarađujemo sa mašinama koje po prvi put u istoriji zaista počinju da misle.

Banner

Banner

Možda će vam se svideti i