Статьи

Почему эстонский в AI дороже русского и английского

Один и тот же смысл, три языка, три очень разных счёта. Мы измерили сами: эстонский тратит примерно в полтора раза больше токенов, а русский почти не уступает английскому.

1 мин чтенияСреднийAI в бизнесе
Почему эстонский в AI дороже русского и английского

Существует распространённое убеждение, что кириллица в AI дорогая. Когда-то это было правдой. Сегодня — уже нет, и это стоит проверить на цифрах.

Эксперимент#

Мы взяли один и тот же смысл на трёх языках — одинаковое содержание, одинаковая длина, различается только язык — и прогнали через кодировку o200k_base, которую используют GPT-4o и GPT-5.

Язык Токенов Символов на токен Отношение
Eesti 65 3,26 1,44×
English 45 5,00 1,00×
Русский 48 4,40 1,07×

Русский язык больше не дорогой#

В старых кодировках вроде cl100k_base кириллица действительно разбивалась мелко и обходилась заметно дороже. В o200k_base словарь вырос почти вдвое, и русские слова получили свои токены. Разница с английским — около семи процентов. На практике это незаметно.

А вот эстонский — дорогой#

Эстонский тратит примерно на 44% больше токенов, чем английский, на том же содержании. Причины две: в обучающих данных эстонского было мало, и это язык сложных слов и падежей — «kontekstiaknast» для машины не одна вещь, а несколько кусков.

Что это значит на практике#

Если вы работаете в Эстонии и обрабатываете тексты на обоих языках, полезно понимать: русскоязычный поток обойдётся примерно как англоязычный, эстонский — заметно дороже. При больших объёмах документов эту разницу стоит закладывать в бюджет.

Цифры в этой статье не переписаны откуда-то — они пересчитываются каждый раз при сборке страницы. Тот же эксперимент можно повторить самому в токенизаторе.

Похожие статьи