ITADN
lightseekorg/tokenspeed
lightseekorg/tokenspeed · 文件 下载 ZIP
文件最后提交记录最后更新时间
README.md
以下内容由 AI 翻译,如有问题请点此提交 issue 反馈

TokenSpeed: Tokens at the speed of light

TokenSpeed 是一款光速 LLM 推理引擎,专为智能体工作负载设计,具备 TensorRT-LLM 级别的性能和 vLLM 级别的可操作性。我们的目标是成为生产环境中智能体工作负载性能最强的推理引擎。

核心组件:

  • 建模层:采用本地 SPMD 设计,通过静态编译器根据模块边界放置注解生成集合通信,用户无需手写并行逻辑。
  • 调度器:C++ 控制平面和 Python 执行平面。请求生命周期、KV 缓存所有权和重叠时序被编码为有限状态机,并通过类型系统在编译时强制实施安全的 KV 资源重用。
  • 内核:可插拔的分层内核系统,具有可移植的公共 API 和集中式注册表,包含针对智能体工作负载在 Blackwell 上最快的 MLA(多头潜在注意力)实现之一。
  • 入口点:集成 SMG 的 AsyncLLM,用于低开销的 CPU 端请求处理。

新闻

  • [2026/08] TokenSpeed 加入 PyTorch 生态系统
  • [2026/07] Kimi K3 首日支持:在主流平台上通过 TokenSpeed 实现前沿模型赋能。[博客]
  • [2026/07] TML Inkling 首日支持:在 NVIDIA 和 AMD 上通过 TokenSpeed 实现 FP4 推理。[博客]
  • [2026/06] 深入解析 TokenSpeed-Kernel 的设计与优化。[博客]
  • [2026/05] 🚀 TokenSpeed 在 Qwen3.5-397B-A17B 上针对智能体工作负载实现 580 TPS。[博客]
  • [2026/05] TokenSpeed 正式发布——一款面向智能体工作负载的极速 LLM 推理引擎。[博客]

博客与演讲

如需查看 LightSeek Foundation 的技术博客、会议演讲和工程文章,请访问 LightSeek 博客

性能对比

TokenSpeed vs. TensorRT-LLM Pareto curves on agentic workload (Kimi K2.5, B200)

文档

从这里开始:

引用

@misc{tokenspeed2026,
  author       = {{TokenSpeed Team}},
  title        = {{TokenSpeed}: A Speed-of-Light {LLM} Inference Engine},
  year         = {2026},
  howpublished = {\url{https://github.com/lightseekorg/tokenspeed}}
}