Artiklid

Eesti keel maksab AI-s rohkem — ja siin on tõestus

Sama mõte, kolm keelt, kolm väga erinevat arvet. Mõõtsime ise üle: eesti keel kulutab umbes poolteist korda rohkem tokeneid kui inglise keel.

2 min lugemistKeskmineAI äris
Eesti keel maksab AI-s rohkem — ja siin on tõestus

Kui sa oled kunagi mõelnud, miks AI-teenused tunduvad eesti keeles kiiremini piiri ette jooksvat, siis see ei ole sinu peas. See on mõõdetav.

Katse#

Võtsime ühe ja sama mõtte kolmes keeles — sama sisu, sama pikk, ainult keel erinev — ja lasksime selle läbi o200k_base kodeeringu, mida kasutavad GPT-4o ja GPT-5.

Keel Tokeneid Tähti tokeni kohta Suhe
Eesti 65 3,26 1,44×
English 45 5,00 1,00×
Русский 48 4,40 1,07×

Sama sisu. Kolm väga erinevat arvet.

Miks nii on#

Tokeniseerija ei ole keelte suhtes neutraalne. Ta õpetati välja andmestiku peal, kus inglise keelt oli kordades rohkem kui kõiki teisi keeli kokku. Sagedased inglise sõnad said oma tokeni. Eesti sõnad, mida treeningandmetes nägi harva, lõigatakse tükkideks.

Lisaks on eesti keel liitsõnade ja käänete keel. „Kontekstiaknast“ ei ole masina jaoks üks asi — see on mitu tükki, mis pannakse iga kord uuesti kokku.

Mida see praktikas tähendab#

Arve on suurem. Kui su rakendus töötleb eestikeelset teksti, kulub sama töö peale umbes 40–45% rohkem tokeneid kui ingliskeelse teksti puhul. Sama mudel, sama ülesanne, suurem arve.

Kontekstiaken saab varem täis. 128 000 tokeni suurune aken mahutab eesti keeles umbes kolmandiku võrra vähem teksti. Pikk dokument, mis inglise keeles mahub ära, võib eesti keeles mitte mahtuda.

Vastused jäävad lühemaks. Kui väljundi pikkus on tokenites piiratud, saad eesti keeles vähem sisu kui inglise keeles.

Ja vene keel?#

Siin on üllatus: vene keel ei kannata sama probleemi all. Vanemates kodeeringutes oli kirillitsa tõesti kallis, aga o200k_base käsitleb seda hästi — 1,07× inglise keele suhtes, sisuliselt võrdne.

See on ka põhjus, miks me seda artiklit venekeelsena veidi teistmoodi kirjutame: seal ei ole see probleem.

Mida sellega teha#

Kui kulu on tähtis, on mõned praktilised võtted: hoia süsteemiprompt inglise keeles, ka kui vestlus käib eesti keeles; ära lase mudelil pikki eestikeelseid tekste asjatult korrata; ja kui töötled suuri dokumendihulki, arvesta eelarvesse see 40% juurde.

Arvud selles artiklis ei ole kuskilt maha kirjutatud — need arvutatakse iga kord, kui see leht ehitatakse. Sama katse saad ise järele teha tokeniseerijas.

Seotud artiklid