GigaToken:~1000倍更快的语言模型分词
Hacker News2026年7月22日 17:20
~1000倍速度比HuggingFace的分词器更快,可以直接替代。以GB/s的速度对您的文本数据进行分词!请注意,HF分词器和tiktoken已经在运行多线程Rust!什么是GigaToken?GigaToken是最快的语言建模分词器。它支持广泛的CPU硬件以及几乎所有常用的分词器。安装方法:pip install gigatoken 使用方法:GigaToken可以与其自己的API一起使用,或在兼容模式下与HuggingFace Tokenizers或Tiktoken结合使用。兼容模式(最简单):import gigatoken as gt # 对现有HuggingFace分词器使用的最小修改(兼容模式) hf_tokenizer = ... tokenizer = gt.Tokenizer(hf_tokenizer).as_hf() # tokenizer可以在与hf_tokenizer相同的上下文中使用 tokens = tokenizer.encode_batch([
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡