Волна ИИПодписаться
← Назад
Инструменты

Gigatoken: Rust-токенизатор, который кодирует текст со скоростью 24,5 ГБ/с — в 989 раз быстрее HuggingFace

23.07.2026 · marktechpost.com ↗

Марсель Рёд, аспирант Стэнфорда, выпустил под лицензией MIT Rust-библиотеку Gigatoken — BPE-токенизатор, который на 144-ядерном AMD EPYC 9565 (два сокета) кодирует корпус GPT-2 объёмом 11,9 ГБ со скоростью 24,53 ГБ/с. Это в 989 раз быстрее HuggingFace Tokenizers (24,8 МБ/с) и в 681 раз быстрее OpenAI tiktoken (36,0 МБ/с). На Apple M4 Max (16 ядер) скорость достигает 8,79 ГБ/с — 1268× быстрее HuggingFace и 140× быстрее tiktoken, а на потребительском AMD Ryzen 7 9800X3D — 6,27 ГБ/с (106× и 68× соответственно).

Gigatoken поддерживает 23 семейства токенизаторов: GPT-2, GPT-OSS, Llama 3/4, Qwen 2/3.6, DeepSeek V3/R1/V4, GLM 4/5, Kimi K2, Nemotron 3, Phi-4, OLMo 2/3, ModernBERT, Gemma и Mistral. Доступен в двух режимах: совместимости (через обёртку HuggingFace или tiktoken — точное совпадение вывода, но скорость падает до 200–300× из-за накладных расходов Python) и нативном (Rust читает файлы напрямую, именно здесь получены рекордные показатели).

Библиотека написана на 66% Rust и 33% Python, версия 0.9.0 опубликована на PyPI, установка одной командой pip install gigatoken. В репозитории есть интерактивный просмотрщик бенчмарков: можно переключать CPU, смотреть историю оптимизаций и оценивать время обработки своего корпуса. Проект доказывает, что токенизация — узкое место, которое стоит профайлить, и что его можно ускорить на три порядка.

Источник: marktechpost.com
← Все новости AI Wave