返回 GitHub 雷达在 GitHub 打开
huggingface/tokenizers
42 天前首次出现未被群岛收录1. 提供当今最常用的高性能分词器(如 BPE、WordPiece、Unigram 等),兼顾研究与生产环境需求。 2. 核心采用 Rust 实现极致速度与灵活性,并提供 Python、Node.js、Ruby 等多语言绑定,方便集成。 3. 支持秒级 GB 文本分词、训练与完整预处理(截断、填充、对齐跟踪),特别适合大规模 NLP 任务和需要快速迭代的生产系统。
Rust创建于 2019 年 11 月最近提交 2026 年 7 月
累计 Star
10.9k
近 7 日新增
+20
近 30 日新增
+56
Fork
1,150
Star 趋势
共 8 个采集点 · 近 30 日 +562026-06-232026-07-18
项目介绍
由 AI 摘自仓库 README1. 提供当今最常用的高性能分词器(如 BPE、WordPiece、Unigram 等),兼顾研究与生产环境需求。
2. 核心采用 Rust 实现极致速度与灵活性,并提供 Python、Node.js、Ruby 等多语言绑定,方便集成。
3. 支持秒级 GB 文本分词、训练与完整预处理(截断、填充、对齐跟踪),特别适合大规模 NLP 任务和需要快速迭代的生产系统。
仓库信息
Topics
#bert#gpt#language-model#natural-language-processing#natural-language-understanding#nlp#transformers
来自雷达
该项目由雷达自动扫描 GitHub 发现,含 Star 增速、提交活跃度与分类标签,中文摘要由 AI 生成。