Что такое Токенизация
Разбиение текста на токены для обработки моделью
Токенизация — это процесс разбиения текста на отдельные единицы (токены) для последующей обработки языковой моделью или NLP-системой.
Типы токенизации
- Пословная — разбиение по пробелам и пунктуации
- Подсловная (BPE) — разбиение на частотные подстроки
- Символьная — каждый символ как отдельный токен
- SentencePiece — языко-независимая токенизация
Почему важна токенизация
- Определяет словарь модели
- Влияет на качество обработки редких слов
- Определяет стоимость API-запросов (по токенам)
- Влияет на скорость обработки
Примеры токенов
- "привет" → ["при", "вет"] (BPE)
- "machine learning" → ["machine", " learning"] (GPT)
- "日本語" → ["日本", "語"] или ["日", "本", "語"]
Популярные токенизаторы
- tiktoken (OpenAI) — для GPT моделей
- SentencePiece — Google, независимый от языка
- Byte-Level BPE — работает с байтами
- WordPiece — BERT и производные