← 返回资讯
产品发布 @vllm_project

vLLM集成fastokens:开源Rust分词器兼容DeepSeek、Qwen等模型

fastokens由CrusoeAI与NVIDIA AI Dynamo联合开发,采用BPE算法,可大幅缓解长上下文推理(agentic AI、RAG、多轮对话)中CPU分词的性能瓶颈,现通过--to…

查看原文
TL;DR · 产品解读

vLLM 集成 Crusoe AI/NVIDIA 联合开发的 Rust 分词器 fastokens,通过 BPE 算法在长上下文推理中显著降低 CPU 分词开销,兼容 DeepSeek、Qwen 等主流开源模型。

深度解读

产品是什么

fastokens 是由 Crusoe AINVIDIA AI Dynamo 联合开发的高性能开源 Rust 分词器,采用 BPE(Byte Pair Encoding)算法实现。作为 vLLM 的可选后端(通过 --tokenizer 参数指定),它专为解决长上下文推理场景下的 CPU 分词瓶颈而设计。

解决什么问题

agentic AIRAG(检索增强生成)和多轮对话等长上下文场景中,分词(tokenization)是高频 CPU 操作。传统 Python 实现(如 Hugging Face tokenizers)在高并发下容易成为吞吐量瓶颈——分词速度跟不上 GPU 生成速度,造成资源空转。

fastokens 的核心价值在于:将分词这一计算密集型任务从 Python 生态迁移到 Rust,利用 Rust 的零成本抽象和 SIMD 加速,实现 数量级的延迟降低。官方数据显示,在处理长 prompt(数千 token)时,分词阶段耗时可压缩至原来的几分之一。

<
未登录访客
SMARTFLOW PRO

继续阅读深度解读 + 编辑加注

下方还有 3-5 段深度分析 + Vincent 编辑加注 + 可点击信源,仅 Pro 会员可见

加入机智流 PRO →

¥99 / 季 · 每周 1 篇深度研报 · 飞书+微信群双通道

已是 Pro 但仍被提示?联系反馈

参考来源
  1. vLLM 官方推文 · 2026-05-29
  2. fastokens GitHub 仓库 · 2026-05-29
  3. vLLM 文档 - 分词器后端 · 2026-05-29
本解读由 AI 自动生成 · 模板:产品解读 · 仅供参考,请以原文为准。