在大语言模型(LLM)的迭代与训练过程中,数据预处理扮演着至关重要的角色。近日,一种名为 Gigatoken 的新型 BPE(字节对编码)Tokenizer 引发了科技圈的广泛关注。这是一款基于 Rust 编写的开源工具,其惊人的性能表现令人咋舌:在特定的硬件配置下,它能够以每秒 24.53 GB 的速度处理文本编码,这一速度比目前业界广泛使用的 HuggingFace Tokenizers 快了整整 989 倍。
BPE Tokenizer 作为现代大模型(如 GPT 系列、BERT 等)的核心组件,负责将人类可读的文本转换为模型能够理解的数字序列。这一过程看似简单,但在处理海量数据时,其计算开销却不容小觑。在传统的训练流程中,CPU 往往需要先完成繁琐的 Tokenization 工作,然后才能将数据传递给 GPU 进行模型训练。如果 Tokenization 过程过于耗时,就会导致 GPU 处于空闲等待状态,从而极大地降低了整体的训练效率。
Gigatoken 的出现,正是为了打破这一性能瓶颈。根据发布在 MarkTechPost 的详细测试报告,Gigatoken 在 AMD EPYC 9565 处理器(拥有 144 个核心)的强大算力支持下,将 GPT-2 模型的 Tokenization 速度推向了新的高度。面对基准测试中已经使用了 Rust 多线程优化的 HuggingFace Tokenizers,Gigatoken 依然展现出了压倒性的性能优势,提速幅度高达 989 倍;即便与 OpenAI 使用的 tiktoken 相比,其性能也领先了 681 倍。
值得注意的是,Gigatoken 的性能提升并非依赖于对底层 BPE 合并循环的激进优化,而是源于其独特的架构设计。其核心亮点在于一个手写的 SWAR(SIMD Within A Register)Pretokenizer 以及高效的预 Token 缓存机制。通过这种特殊的预处理方式,Gigatoken 能够更高效地处理字符级别的操作,从而在源头减少了后续合并循环的计算负担。这种“降维打击”式的优化策略,展示了 Rust 语言在底层系统编程中的极致性能潜力。
作为一款 MIT 许可证的开源项目,Gigatoken 的问世无疑为 AI 基础设施的建设者提供了极具价值的工具。对于需要处理超大规模语料库的企业和研究机构而言,更快的 Tokenization 意味着更短的训练周期和更低的计算成本。在追求模型精度的同时,如何优化基础设施以提升吞吐量,已成为 AI 工程师们关注的焦点。Gigatoken 的成功案例表明,通过精妙的算法设计和高性能语言的结合,我们有望在 AI 训练的各个环节实现更高效的资源利用。
参考资料: MarkTechPost – Meet Gigatoken: A Rust BPE Tokenizer that Encodes Text at 24.53 GB/s, up to 989x Faster than HuggingFace Tokenizers
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/07/23/meet-gigatoken-a-rust-bpe-tokenizer-that-encodes-text-at-24-53-gb-s-up-to-989x-faster-than-huggingface-tokenizers/