Home AIKako da naterate ChatGPT i Claude da pišu savršen srpski jezik (bez „hrvatizama“ i čudnih prevoda)

Kako da naterate ChatGPT i Claude da pišu savršen srpski jezik (bez „hrvatizama“ i čudnih prevoda)

Konkretni sistem promptovi, podešavanja sistemskih uputstava i lingvistički trikovi koji transformišu veštačku inteligenciju u vrhunskog srpskog kopirajtera.

od itn
ChatGPT i Claude na srpskom

Key takeaways:

  • Veštačka inteligencija meša srpski, hrvatski i bosanski jezik zbog balansiranosti uvodnih podataka u trenirnim bazama poput Common Crawl-a i specifičnosti podrečničke tokenizacije (subword tokenization).

  • Tipični AI tekst na srpskom prepoznaje se po leksičkom curenju (osigurati, tvrtka, također, pogreška), engleskim sintaksičkim kalkovima i preteranoj upotrebi pasiva.

  • Problem se trajno rešava podešavanjem sistemskih uputstava (Custom Instructions u ChatGPT-u ili System Prompts u Claude-u) uz strogo definisane lingvističke restrikcije.

  • U ovom vodiču donosimo spisak gotovih promptova za kopiranje, Few-Shot primere i inženjerske metode koje AI primoravaju da generiše tečan, prirodan i ekavski srpski jezik.

Svako ko je prosumeobarem tri teksta generisana preko alata kao što su ChatGPT ili Claude na srpskom jeziku, poznaje taj specifičan osećaj nelagode. Tekst na prvi pogled deluje gramatički ispravno, ali pod prstima i u ušima zvuči potpuno „drveno“, robotski i strano.

U jednom pasusu AI koristi izraz obezbediti, a već u sledećem pređe na osigurati. Koristi također umesto takođe, pogreška umesto greška, ili doslovno prevodi engleske sintaksičke konstrukcije pa dobijemo rečenice poput: „U konačnici, važno je napomenuti kako ovaj sustav vrši optimizaciju…“

Ovakav izlaz nije samo estetski problem. Za marketing agencije, portal, vlasnike biznisa i autore sadržaja, ovakav tekst je instant indikator neprofesionalizma koji čitaoci prepoznaju u sekundi.

Srećom, veštačka inteligencija nije „glupa“ – ona je samo statistički model koji ide linijom najmanjeg otpora. Uz pravilno razumevanje načina na koji LLM (Large Language Model – veliki jezički model) obrađuje južnoslovenske jezike i primenu preciznih sistemskih komandi, možete natkriliti ove dečije bolesti i od ChatGPT-a ili Claude-a dobiti tekst koji zvuči kao da ga je napisao vrhunski srpski kopirajter.

ChatGPT i Claude na srpskomAnatomija problema: zašto veštačka inteligencija uopšte meša južnoslovenske jezike

Da bismo naterali model da piše kako želimo, moramo prvo razumeti tehnički uzrok problema. Dva su glavna razloga zašto AI meša srpski, hrvatski i bosanski jezik:

1. Neuravnoteženost skupova podataka za treniranje (Training Datasets)

Modeli poput GPT-4o kompanije OpenAI ili Claude 3.5 Sonnet kompanije Anthropic trenirani su na stotinama terabajta tekstualnih podataka sa interneta. Najveći deo tog korpusa dolazi iz projekata kao što je Common Crawl.

U ranim fazama indeksiranja interneta, sadržaj na hrvatskom i bosanskom jeziku na određenim web portalima i Wikipediji bio je volumetrijski obimniji i strukturno sređeniji u odnosu na digitalizovani sadržaj na srpskom ekavskom izgovoru. Kako su srpski, hrvatski, bosanski i crnogorski jezik u lingvističkom smislu deo istog štokavskog dijasistema sa ogromnim preklapanjem u vokabularu, algoritam ih unutar svoje vektorske baze posmatra kao jedan hibridni regionalni jezik.

Kada od modela tražite da piše na „srpskom“, on zahvata tokene iz cele te regionalne grupe. Ako mu ne date stroga ograničenja, algoritam bira reči koje imaju najveću statističku učestalost u njegovom trening skupu – a to su vrlo često hrvatske varijante ili administrativni kalkovi.

2. Problem tokenizacije (Subword Tokenization)

Pravilno razumevanje tokenizacije ključno je za razumevanje ograničenja AI-ja. Dok engleske reči model deli tako da jedan token predstavlja skoro celu reč, srpski jezik (naročito kada se koristi ćirilica ili složeni padežni oblici) biva iseckan na sitne podrečničke tokene (subwords).

Engleski:  "Optimization"  ---> [Optimization] (1-2 tokena)
Srpski:    "Optimizacija"  ---> [Optim][iza][cija] (3+ tokena)

Zbog većeg utroška tokena po reči i manje zastupljenosti u korpusu, model češće pravi matematičke kompromise i skloni je „curenju“ reči iz srodnih jezika koje u memoriji stoje tik uz tražene pojmove.

Tipične greške u „AI srpskom“ i kako ih lingvistički identifikovati

Da biste mogli da konfigurišete filtere u promptu, morate tačno znati šta eliminišete. Greške koje AI pravi na srpskom jeziku delimo u tri grupe:

A) Leksičko curenje (Upotreba leksike iz hrvatskog ili bosanskog standarda)

Ovo su reči koje prosto ne pripadaju prirodnom ekavskom srpskom govoru u svakodnevnoj ili poslovnoj komunikaciji:

  • Leksički hrvatizmi: također (takođe), pogreška (greška), tvrtka (firma/kompanija), sveučilište (univerzitet), tjedan (nedelja/sedmica), sustav (sistem), vlastiti (sopstveni/svoj), korištenje (korišćenje), uvjet (uslov), prije (pre).

  • Glagol „osigurati“: AI masovno koristi osigurati u kontekstu obezbediti ili osigurati uslove. U srpskom jeziku „osigurati“ se primarno odnosi na osiguravajuće društvo ili fizičko osiguranje, dok se za pružanje uslova koristi obezbediti ili osigurati samo u specifičnim pravnim tekstovima.

B) Engleski sintaksički kalkovi (Doslovno prevođenje strukture rečenice)

Ovo je opasnije od pojedinačnih pogrešnih reči jer čini da ceo tekst zvuči neprirodno i naporno za čitanje.

  • Preterana upotreba pasiva: Engleski jezik obožava pasiv („The file was processed by the system“). AI to prevodi kao: „Fajl je bio procesiran od strane sistema“. Prirodan srpski jezik koristi aktiv: „Sistem je obradio fajl“.

  • Fraza „Kako bi se…“: AI skoro svaku rečenicu namere počinje sa „Kako bi se osiguralo da…“ ili „Kako bi poboljšali…“. U srpskom je neuporedivo prirodnije reći: „Da biste obezbedili…“ ili „Radi poboljšanja…“.

  • Nominalizacija (Glagolske imenice umesto glagola): AI piše „Vršimo proces vršenja optimizacije“, umesto jednostavnog glagola „Optimizujemo“.

C) Veštački „AI leksikon“ (Klišei koje čovek retko koristi)

AI ima omiljene reči koje ubacuje u praktično svaki tekst: ključno je napomenuti, u konačnici, revolucionarno, neuporedivo, otključajte potencijal, u današnjem dinamičnom svetu.

ChatGPT i Claude na srpskomTrajno rešenje: podešavanje Custom Instructions i System Prompts

Da ne biste pri svakom upitu morali iznova da pišete istoriju lingvistike, i ChatGPT i Claude nude opcije za trajno pamćenje sistemskih pravila.

Gde uneti pravila?

  • U ChatGPT-u: Idite na podešavanja profila (Settings) > Custom Instructions (ili Customize ChatGPT). U polje „How would you like ChatGPT to respond?“ ubacite sistemsko uputstvo.

  • U Claude-u: Koristite opciju Projects i ubacite pravila u Project Instructions, ili postavite System Prompt ako koristite Claude API ili klasičan interfejs.

+-------------------------------------------------------------------+
|               ARHITEKTURA SISTEMSKOG UPUTSTVA (SYSTEM PROMPT)     |
+-------------------------------------------------------------------+
|  1. DEFINISANJE JEZIKA I DIJALEKTA                                |
|     - Standardni srpski jezik, ekavica, ćirilica/latinica.       |
+-------------------------------------------------------------------+
                                  |
                                  v
+-------------------------------------------------------------------+
|  2. NEGATIVNI FILTERI (ZABRANJENE REČI I STRUKTURE)               |
|     - Lista hrvatizama, zabrana pasiva, zabrana AI klišea.        |
+-------------------------------------------------------------------+
                                  |
                                  v
+-------------------------------------------------------------------+
|  3. PRAVILA STILA I TONAK                                         |
|     - Aktivne rečenice, dinamičan ton, prirodne fraze.            |
+-------------------------------------------------------------------+

Master kod za kopiranje: Sistemsko uputstvo za savršen srpski jezik

Kopirajte i zalepite sledeći tekst direktno u vaša sistemska podešavanja:

Sistemsko uputstvo za model:

„Ti si vrhunski lingvista, kopirajter i redaktor specijalizovan za standardni srpski jezik. Tvoj primarni zadatak je da generišeš tekstove isključivo na besprekornom srpskom jeziku (ekavski izgovor).

Strogo se pridržavaj sledećih pravila:

  1. Pravilo ekavice i leksike:

    • Piši isključivo na ekavici (npr. pre, posle, rešenje, vreme, uslov).

    • STROGO ZABRANJENE REČI (Hrvatizmi i regionalizmi): zabranjeno je koristiti reči kao što su: također, pogreška, tvrtka, sveučilište, tjedan, sustav, korištenje, vlastiti, prije, uvjet, tijekom, napraviti (u kontekstu uraditi ili kreirati).

    • Umesto osigurati, koristi obezbediti ili osigurati samo kada se radi o osiguranju (polisa/fizičko osiguranje).

    • Umesto sustav, koristi sistem. Umesto tvrtka, koristi firma, kompanija ili preduzeće.

  2. Sintaksa i stil (Srbizacija strukture):

    • Izbegavaj doslovno prevođenje engleskih konstrukcija.

    • Izbegavaj pasivne rečenice (npr. nemoj pisati „kod je napisan od strane programera“, već „programer je napisao kod“).

    • Smanji upotrebu fraze „kako bi se“. Umesto „kako bi osigurali“, piši „da biste obezbedili“ ili „radi obezbeđivanja“.

    • Koristi kratke, jasne i dinamične rečenice. Piši prirodnim i direktnim tonom.

  3. Eliminacija AI klišea:

    • ZABRANJENO je počinjati tekstove frazama: „U današnjem dinamičnom svetu…“, „U eri digitalne transformacije…“, „Ključno je napomenuti…“.

    • ZABRANJENE reči: revolucionarno, otključajte potencijal, u konačnici, nadalje.

Ako razumeš ova pravila, odgovaraj na sva naredna pitanja primenjujući ovaj lingvistički standard bez odstupanja.“

Operativni promptovi za svakodnevni rad (Plug-and-Play primeri)

Pored sistemskih uputstava, način na koji oblikujete pojedinačne zahteve (operational prompts) diktira kvalitet konačnog teksta. Evo nekoliko proverenih šablona za specifične zadatke.

1. Prompt za prevođenje sa engleskog na prirodan srpski jezik

Kada prevodite stručne ili marketinške tekstove sa engleskog, AI po automatizmu pravi kalkove. Koristite ovaj prompt:

Prompt za prevođenje:

„Prevedi sledeći tekst sa engleskog na standardni srpski jezik (ekavica). Nemoj raditi doslovan prevod reč po reč. Prevedi kontekst i smisao tako da tekst zvuči potpuno prirodno, kao da je izvorno napisan na srpskom od strane domaćeg stručnjaka.

Primenila sledeća pravila:

  • Konvertuj sve engleske pasivne konstrukcije u srpski aktiv.

  • Izbegavaj reči poput ‘također’, ‘tjedan’, ‘sustav’, ‘osigurati’ (koristi ‘obezbediti’).

  • Stručne IT termine (npr. cloud, framework, pipeline, prompts) ostavi na engleskom ili napiši u zagradi srpski prevod ako postoji prirodan izraz.

Tekst za prevod:

[OVDE ZALEPITE ENGLESKI TEKST]“

2. Prompt za lekturu i „srbizaciju“ već postojećeg AI teksta

Ako već imate tekst koji zvuči „drveno“ ili sumnjate da u njemu ima hrvatizama, pošaljite ga na dekontaminaciju ovim promptom:

Prompt za lekturu:

„Oradi kompletnu lingvističku i stilsku lekturu sledećeg teksta.

Tvoj zadatak je da:

  1. Pronađeš i izbaciš sve hrvatizme (npr. također, pogreška, korištenje, uvjet, osigurati u pogrešnom kontekstu).

  2. Prepraviš sve neprirodne rečenične sklopove i predugačke pasivne konstrukcije u tečan, dinamičan srpski jezik na ekavici.

  3. Izbaciš sve generičke AI kliše rečenice.

  4. Prikažeš mi konačan, očišćen tekst, a ispod navedeš kratku listu reči koje si izmenio radi učenja.

Tekst za obradu:

[OVDE ZALEPITE SUMNJIVI TEKST]“

ChatGPT i Claude na srpskomNapredna inženjerska tehnika: Few-Shot Prompting (Učenje na primerima)

Jedna od najmoćnijih metoda u inženjeringu promptova (Prompt Engineering) jeste Few-Shot Prompting. Ova tehnika se oslanja na pravilo da je modelima mnogo lakše da kopiraju obrazac iz primera nego da tumače samo apstraktna pravila.

Umesto da model samo učite pravila, u prompt mu ubacite 2 do 3 primera „Lošeg (AI) prevoda“ i vašeg „Idealanog (Ljudskog) prevoda“.

Primer Few-Shot strukture:

Prompt sa primerima:

„Želim da pišeš tekstove o tehnologiji. Evo primera kako želim da rečenice budu strukturirane:

Primer 1:

❌ Loše (AI stil): U konačnici, važno je napomenuti kako ovaj sustav osigurava brzu obradu podataka od strane servera.

✅ Dobro (Srpski prirodni stil): Na kraju, najvažnije je to što ovaj sistem omogućava da server obradi podatke u delu sekunde.

Primer 2:

❌ Loše (AI stil): Tvrtka je donijela odluku o korištenju novih alata kako bi se povećala produktivnost.

✅ Dobro (Srpski prirodni stil): Kompanija je odlučila da uvede nove alate da bi povećala produktivnost timova.

Primenjujući tačno ovakav stil, ton i leksiku, napiši pasus na temu: [UNESITE TEMU].“

Kada model vidi ovu definisanu razliku, stopa leksičkih grešaka opada za preko 90%, jer ste mu praktično redefinisali sledeći najverovatniji token unutar njegove neuronske mreže.

Razlike između ChatGPT-a i Claude-a u obradi srpskog jezika

Iako oba modela koriste slične koncepte, njihovo ponašanje na srpskom jeziku se razlikuje zbog arhitekture i načina finog podešavanja (Fine-tuning).

+-------------------------------------------------------------------+
|               UPOREDNA ANALIZA MODELA NA SRPSKOM JEZIKU           |
+-------------------------------------------------------------------+
|  ChatGPT (GPT-4o / GPT-4)                                         |
|  - Češće pati od leksičkog curenja (hrvatizama).                 |
|  - Zahteva stroža zabranjujuća pravila (Negative Constraints).    |
|  - Bolje se bori sa strukturiranim tabelama i kodom.             |
+-------------------------------------------------------------------+
                                  |
                                  v
+-------------------------------------------------------------------+
|  Claude (Claude 3.5 Sonnet)                                       |
|  - Znatno bolja sintetika teksta i prirodniji stil.              |
|  - Prirodnije shvata kontekst bez preteranog usmeravanja.        |
|  - Izvanredno izbegava pasiv i piše bogatijim vokabularom.       |
+-------------------------------------------------------------------+

ChatGPT (GPT-4o)

GPT-4o je izuzetno brz i matematički precizan, ali ima jaču tendenciju da upadne u „šablonski“ stil pisanja. Skloni je izmišljanju reči kada izgubi kontekst i češće ubacuje hrvatizme iz Common Crawl baze. Kod ChatGPT-a moraju se primenjivati negativni filteri – eksplicitno mu morate reći šta NE SME da radi.

Claude (Claude 3.5 Sonnet)

Claude 3.5 Sonnet se trenutno smatra apsolutnim šampionom za pisanje i stilizaciju teksta na južnoslovenskim jezicima. Njegova interpretacija nijansi u jeziku je znatno naprednija. Claude izuzetno dobro razume stilistička uputstva i retko kada koristi reči poput također ako mu u prvom promptu naglasite da piše na ekavici.

Detaljnije uporedne testove različitih AI modela i njihove primene u razvoju softvera i kreiranju sadržaja možete pročitati u našim analizama na ITNetwork.rs.

Pogled u budućnost: da li ćemo dobiti AI koji nativno razume srpski jezik?

Trenutno stanje u kom moramo da primenjujemo složene inženjerske trikove da bismo AI naterali da govori čist srpski jezik predstavlja tranzicionu fazu. Kakva je perspektiva u narednim godinama?

1. Suvereni regionalni LLM modeli (Sovereign AI)

Širom sveta raste svest o tome da globalni modeli velikih američkih i kineskih korporacija maršalizuju manje jezike i brišu njihove lingvističke specifičnosti. U regionu već postoje inicijative za kreiranje otvorenih modela finije podešenih na čisto srpskim tekstualnim korpusima.

Projekti koji uzimaju otvorene modele poput Llama 3 ili Mistral i vrše njihovo dosledno fino podešavanje (fine-tuning) na pažljivo očišćenoj literaturi, novinskim arhivama i stručnim radovima na ekavici, pokazuju izvanredne rezultate. Takvi modeli od starta generišu autentičan jezik bez potrebe za obimnim sistemskim uputstvima.

2. RAG i lokalne baze znanja (Retrieval-Augmented Generation)

Kompanije u Srbiji sve više implementiraju RAG sisteme. Umesto da se oslanjaju samo na opšte znanje modela, AI se povezuje sa internim bazama dokumenata koje su napisane na besprekornom srpskom jeziku. Algoritam tada preuzima stil, terminologiju i sintaksu iz dostavljenih dokumenata, čime se leksičke greške eliminišu u samom korenskom procesu generisanja odgovora.

Rečnik izmena: brzi šalabahter za lekturu

Da biste lakše proverili generisani tekst, evo brzog pregleda najčešćih AI reči i njihovih adekvatnih zamena u srpskom standardu:

AI generisana reč (Izbegavati) Pravilna zamena u srpskom ekavskom standardu
Također Takođe
Pogreška Greška
Tvrtka Firma, kompanija, preduzeće
Sustav Sistem
Tjedan Nedelja, sedmica
Sveučilište Univerzitet, fakultet
Korištenje Korišćenje, upotreba
Uvjet Uslov
Prije Pre
Tijekom Tokom, za vreme
Vlastiti Sopstveni, svoj
Osigurati (u kontekstu pružanja) Obezbediti, omogućiti
U konačnici Na kraju, naposletku
Nadalje Pored toga, dalje

ChatGPT i Claude na srpskomZaključak: Kontrola je u vašim rukama

Veštačka inteligencija je izuzetan alat za ubrzavanje pisanja, istraživanje i analizu, ali ona nema svest o lingvističkom identitetu niti osećaj za stil. Ona je onakva kakve joj instrukcije date.

Ukoliko se oslonite na podrazumevana podešavanja i generičke zahteve, dobićete tekst koji miriše na lažni prevod i narušava vaš autoritet. Međutim, ako odvojite pet minuta da podesite Custom Instructions, ubacite nekoliko jasnih zabrana i primenite tehnike sa primerima, ChatGPT i Claude postaće vaši najefikasniji asistenti koji pišu čist, tečan i besprekoran srpski jezik.

Primenite ova pravila već u narednom razgovoru sa AI modelom – razlika u kvalitetu teksta biće vidljiva već od prve rečenice.

Banner

Banner

Možda će vam se svideti i