Статьи
Почему эстонский в AI дороже русского и английского
Один и тот же смысл, три языка, три очень разных счёта. Мы измерили сами: эстонский тратит примерно в полтора раза больше токенов, а русский почти не уступает английскому.

Существует распространённое убеждение, что кириллица в AI дорогая. Когда-то это было правдой. Сегодня — уже нет, и это стоит проверить на цифрах.
Эксперимент#
Мы взяли один и тот же смысл на трёх языках — одинаковое содержание, одинаковая длина, различается только язык — и прогнали через кодировку o200k_base, которую используют GPT-4o и GPT-5.
| Язык | Токенов | Символов на токен | Отношение |
|---|---|---|---|
| Eesti | 65 | 3,26 | 1,44× |
| English | 45 | 5,00 | 1,00× |
| Русский | 48 | 4,40 | 1,07× |
Русский язык больше не дорогой#
В старых кодировках вроде cl100k_base кириллица действительно разбивалась мелко и обходилась заметно дороже. В o200k_base словарь вырос почти вдвое, и русские слова получили свои токены. Разница с английским — около семи процентов. На практике это незаметно.
А вот эстонский — дорогой#
Эстонский тратит примерно на 44% больше токенов, чем английский, на том же содержании. Причины две: в обучающих данных эстонского было мало, и это язык сложных слов и падежей — «kontekstiaknast» для машины не одна вещь, а несколько кусков.
Что это значит на практике#
Если вы работаете в Эстонии и обрабатываете тексты на обоих языках, полезно понимать: русскоязычный поток обойдётся примерно как англоязычный, эстонский — заметно дороже. При больших объёмах документов эту разницу стоит закладывать в бюджет.
Цифры в этой статье не переписаны откуда-то — они пересчитываются каждый раз при сборке страницы. Тот же эксперимент можно повторить самому в токенизаторе.

