SupraTok: Cross-Boundary Tokenization for Enhanced Language Model Performance
2508.11857v1
cs.CL, cs.AI, cs.LG
2025-08-19
Авторы:
Andrei-Valentin Tănase, Elena Pelican
Резюме на русском
## Контекст
Токенизация является основополагающим, но значительно менее изученным аспектом естественного языкового процессинга. Несмотря на то, что модели языковых моделей делают значительные прорывы, стратегии токенизации остаются статичными и неэффективными. Они часто оптимизируются для конкретных моделей или задач, что приводит к убыткам в универсальной обработке текста. Эта проблема сочетается с необходимостью лучшего понимания семантических связей в текстах, чтобы улучшить эффективность и точность моделей. Мы предлагаем SupraTok, многофазную токенизационную архитектуру, которая переосмысливает subword segmentation, предлагая новый подход к обнаружению и обработке семантических единиц.
## Метод
SupraTok использует три основных инновации:
1. **Cross-Boundary Pattern Learning**: Это новый подход, оптимизирующий поиск семантических единиц, которые могут простираться за границы подблоков. Это позволяет SupraTok выделять "сверхслова" (superwords) — компактные, семантически целостные композиции, которые обладают более высокой степенью сжатия.
2. **Entropy-Driven Data Curation**: Мы вводим метод, оптимизирующий качество тестового корпуса с помощью сложности выражений. Это позволяет SupraTok более эффективно идентифицировать и сгруппировать слова, которые естественно встречаются вместе в тексте.
3. **Multi-Phase Curriculum Learning**: Мы разработали многоэтапный подход к обучению, который уменьшает возможность переобучения и обеспечивает стабильность сходимости при обучении.
SupraTok расширяет Byte-Pair Encoding (BPE), предлагая "сверхслова", которые сохраняют внутреннюю семантическую целостность внутри слов и увеличивают эффективность сжатия.
## Результаты
Мы провели эксперименты с SupraTok на 38 языках, оценивая его эффективность по сравнению с двумя текущими токенизаторами: OpenAI 200k и Google Gemma 3. SupraTok показал следующие результаты:
- 31% улучшение в токенизации на английском языке (5,91 символов за токен против 4,51 для OpenAI и 2,63 для Gemma 3).
- 30% улучшение на 256k-vocabulary Gemma 3 tokenizer.
- 8,4% улучшение в HellaSWAG и 9,5% в MMLU без изменений в модели.
Эти результаты показали, что SupraTok не только эффективнее в токенизации, но и может способствовать улучшению производительности моделей с широким спектром задач.
## Значимость
SupraTok может быть применен в различных областях, где эффективная обработка языка является ключевой задачей, включая машинный перевод, синтез речи и генерацию произвольных текстов. Такие улучшения в токенизации могут привести к существенным повышениям скорости обработки и эффективности моделей. Это также открывает пути для
Abstract
Tokenization remains a fundamental yet underexplored bottleneck in natural
language processing, with strategies largely static despite remarkable progress
in model architectures. We present SupraTok, a novel tokenization architecture
that reimagines subword segmentation through three innovations: cross-boundary
pattern learning that discovers multi-word semantic units, entropy-driven data
curation that optimizes training corpus quality, and multi-phase curriculum
learning for stable convergence. Our approach extends Byte-Pair Encoding by
learning "superword" tokens, coherent multi-word expressions that preserve
semantic unity while maximizing compression efficiency. SupraTok achieves 31%
improvement in English tokenization efficiency (5.91 versus 4.51 characters per
token) compared to OpenAI's o200k tokenizer and 30% improvement over Google's
Gemma 3 tokenizer (256k vocabulary), while maintaining competitive performance
across 38 languages. When integrated with a GPT-2 scale model (124M parameters)
trained on 10 billion tokens from the FineWeb-Edu dataset, SupraTok yields 8.4%
improvement on HellaSWAG and 9.5% on MMLU benchmarks without architectural
modifications. While these results are promising at this scale, further
validation at larger model scales is needed. These findings suggest that
efficient tokenization can complement architectural innovations as a path to
improved language model performance.
Ссылки и действия
Дополнительные ресурсы: