InferenceX™, 开源持续推理标准与研究平台 / Open Source Continuous Inference Standard and Research Platform
中文 | English
深受 OpenAI、Meta、Microsoft、Oracle 等万亿美元级 Token 工厂运营者,以及 PyTorch Foundation、vLLM、SGLang、Tri Dao 等机器学习社区的信赖
新闻
- [2026/06] 🔥 MiniMax M3: 自 Day 0 起持续进行基准测试 dashboard
- [2026/04] 🔥 DeepSeek V4 Pro 1.6T: 自 Day 0 起持续进行基准测试 article, dashboard
- [2026/03] 🔥 Qwen3.5 397B: 自 Day 0 起持续进行基准测试 dashboard
- [2026/03] 新增 Kimi K2.5(与 Kimi 2.7-Code 架构相同)、GLM5(与 GLM5.1 架构相同)以及 MiniMax M2.5(与 MiniMax M2.7 架构相同) dashboard
- [2026/02] GB300 NVL72: 已加入 InferenceX 并持续进行基准测试 SGLang Maintainer Lmsys Blog
- [2026/02] 🔥 InferenceX v2 发布 — NVIDIA Blackwell 对比 AMD 对比 Hopper article
- [2025/10] 🔥 InferenceX(原 InferenceMAX)v1 发布 article
引言
InferenceX™(原 InferenceMAX)是一个推理性能研究平台,致力于持续分析并基准测试全球最流行的开源推理框架,这些框架被主要的 token 工厂和模型用于实时跟踪真实性能。随着这些软件栈的改进,InferenceX™ 以近实时方式捕捉其进展,提供推理性能进步的实时指标。一个 开源 实时仪表板 可免费公开访问,地址为 https://inferencex.com/。
[!IMPORTANT] 仅 SemiAnalysisAI/InferenceX 仓库包含官方 InferenceX™ 结果,所有其他 fork 和仓库均为非官方。非官方仓库中的基准测试配置以及机器/云的质量可能存在差异,从而导致基准测试结果不佳。非官方版本必须明确标注为“非官方”。 Fork 不得移除此免责声明
为什么?
InferenceX™ 是一个开源项目,采用 Apache2 许可证,旨在以与软件生态系统本身相同的快速速度发展,是一个自动化基准测试,旨在应对这一挑战。
LLM 推理性能由两大支柱驱动:硬件和软件。虽然硬件创新通过每年发布新的 GPU/XPU 和新系统推动性能的阶梯式飞跃,但软件每天都在演进,在这些阶梯式飞跃之上提供持续的性能提升。速度就是护城河 🚀
像 SGLang、vLLM、TensorRT-LLM、CUDA、ROCm 这样的 AI 软件通过内核级优化、分布式推理策略和调度创新来实现性能的持续改进,这些创新在可能仅相隔几天的增量发布中提升了性能的帕累托前沿。
这种软件进步的速度带来了一个挑战:在固定时间点进行的基准测试很快就会过时,无法代表使用最新软件包所能达到的性能。
官方支持的硬件
| SKU | 状态 |
|---|---|
| GB300 NVL72 | ✅ |
| GB200 NVL72 | ✅ |
| MI355X | ✅ |
| B300 | ✅ |
| B200 | ✅ |
| MI325X | ✅ |
| MI300X | ✅ |
| H200 | ✅ |
| H100 | ✅ |
| TPUv7x Ironwood Ghostfish | 即将推出 🔜 |
| MI455 UALoE72 | 即将推出 🔜 |
| Vera Rubin NVL72 | 即将推出 🔜 |
| Rubin NVL8 | 即将推出 🔜 |
| 来自硬件供应商 #1 的芯片 #1 | 即将推出 🔜 |
| 来自硬件供应商 #1 的芯片 #2 | 即将推出 🔜 |
| 来自硬件供应商 #2 的芯片 #1 | 即将推出 🔜 |
| 来自硬件供应商 #3 的芯片 #1 | 即将推出 🔜 |
| 来自硬件供应商 #4 的芯片 #1 | 即将推出 🔜 |
贡献
欢迎提交 PR!有关 PR 审查流程的更多详情,请参阅 CONTRIBUTING.md,以及 PR 审查清单 和合并流程。
致谢与支持者
感谢 Lisa Su 和 Anush Elangovan 为这个免费且开源的项目提供 MI355X 和 CDNA3 GPU。我们想感谢众多 AMD 贡献者,感谢他们的积极响应,以及在 AMD GPU 上进行调试、优化和性能验证的工作。 我们同样感谢 Jensen Huang 和 Ian Buck 通过提供 GB200 NVL72 机架(通过 OCI)和 B200 GPU 来支持这一开源项目。感谢来自 NVIDIA 推理团队和 NVIDIA Dynamo 团队的众多 NVIDIA 贡献者。
我们还想感谢 SGLang、vLLM 和 TensorRT-LLM 的维护者,感谢他们构建了世界级的软件栈并将其开源给全世界。 最后,我们感谢 Crusoe、CoreWeave、Nebius、TensorWave、Oracle 和 TogetherAI 通过提供计算资源支持开源创新,使这一切成为可能。
完整的支持者列表及引言:https://inferencex.semianalysis.com/quotes