Токенизация
EN · TokenizationТокенизация — разбиение текста на единицы (токены), с которыми работает модель; определяет длину контекста и стоимость.Определение на английскомThe process of converting raw text into tokens—the smallest units an AI model processes. Tokenizers split words, subwords, and punctuation into integer IDs that the model understands. Tokenization determines how much text fits in a context window, how much inference costs (pricing is per-token), and can affect multilingual performance since non-English languages often require more tokens per word. Understanding tokenization helps teams estimate operating costs and optimize prompt length for their agents.
Пример
Предложение «AI agents automate workflows» в большинстве моделей — примерно 5 токенов. Статья поддержки на 1 000 слов — около 1 300 токенов. При $3 за миллион входных токенов обработка такой статьи стоит $0,004 — но 10 000 статей в день складываются в $40 в день.
Часто задаваемые вопросы
- Почему разные модели токенизируют текст по-разному?
- У каждого семейства моделей свой токенизатор, обученный на своих данных. Модели GPT используют BPE-токенизатор, Claude — собственный вариант, open-source модели часто — SentencePiece. Один и тот же текст даёт разное число токенов в разных моделях — что влияет на сравнение стоимости и использование контекстного окна.
- Влияет ли токенизация на неанглийские языки?
- Да, существенно. Большинство токенизаторов обучены в основном на английском, поэтому английские слова эффективно отображаются в токены. Китайский, японский, корейский, арабский и хинди часто требуют в 2–4 раза больше токенов на слово, увеличивая и стоимость, и расход контекста. У некоторых новых моделей многоязычная токенизация улучшена.