GitHub 雷达
首次出现 88 天前

huggingface/tokenizers

1. 提供当今最常用的高性能分词器(如 BPE、WordPiece、Unigram 等),兼顾研究与生产环境需求。 2. 核心采用 Rust 实现极致速度与灵活性,并提供 Python、Node.js、Ruby 等多语言绑定,方便集成。 3. 支持秒级 GB 文本分词、训练与完整预处理(截断、填充、对齐跟踪),特别适合大规模 NLP 任务和需要快速迭代的生产系统。

近 7 日
+20
累计 Star
10.9k
Fork
1,150
近 30 日
+56
Star 趋势 · 8 个采集点
+1%
6 月 23 日7 月 18 日
语言Rust
分类AI/机器学习
最近提交7 月 18 日
创建时间11 月 2 日
首次收录6 月 23 日 · 自动扫描
README 摘要
1. 提供当今最常用的高性能分词器(如 BPE、WordPiece、Unigram 等),兼顾研究与生产环境需求。 2. 核心采用 Rust 实现极致速度与灵活性,并提供 Python、Node.js、Ruby 等多语言绑定,方便集成。 3. 支持秒级 GB 文本分词、训练与完整预处理(截断、填充、对齐跟踪),特别适合大规模 NLP 任务和需要快速迭代的生产系统。
中文摘要由 AI 生成,仅供参考。
在 GitHub 打开