生产级机器学习精选
本仓库包含一份精选的开源库列表,这些库将帮助你部署、监控、版本管理、扩展和保障生产级机器学习的安全性 🚀
你可以通过关注此 GitHub 仓库,获取每月新增生产级机器学习库的摘要 通过 releases 🤩
此外,我们提供了一个 搜索工具包,帮助你快速浏览工具链。
本页各章节快速链接
为列表做出贡献
请在提交 PR 时查阅我们的 CONTRIBUTING.md 要求,以帮助我们保持列表的整洁和最新 - 感谢社区对其稳步增长的持续支持 🚀
10 分钟视频概览
| This 10 minute video provides an overview of the motivations for machine learning operations as well as a high level overview on some of the tools in this repo. This newer video covers the an updated 2024 version of the state of MLOps. |
|
想要接收此仓库及其他进展的定期更新?
| 您可以订阅 Machine Learning Engineer 通讯。加入超过 70,000 名机器学习专业人士和爱好者,每周获取关于生产级机器学习的精选文章和教程。 |
|
| 也请查看 Awesome Production GenAI 列表,我们旨在整理一份精选的开源库列表,用于部署、监控、版本控制和扩展您的生成式人工智能应用和系统。 |
|
Main Content
AutoML
-
AIDE
- AIDE 是一个开源的 ML 工程智能体,使用树搜索算法自主探索、实现和评估机器学习任务的解决方案策略。
-
AutoGluon
- 基于流行的机器学习库(Scikit-Learn, LightGBM, CatBoost, PyTorch, MXNet),为表格、图像和文本数据提供自动化的特征、模型和超参数选择。
-
Autokeras
- 基于 "Auto-Keras: Efficient Neural Architecture Search with Network Morphism" 的 Keras AutoML 库。
-
auto-sklearn
- 用于自动化 sklearn 算法和超参数调优的框架。
-
Ax
- Ax 是一个易于访问的通用平台,用于理解、管理、部署和自动化自适应实验。
-
BoTorch
- BoTorch 是一个基于 PyTorch 构建的贝叶斯优化库。
-
EvalML
- EvalML 是一个 AutoML 库,使用特定领域的目标函数来构建、优化和评估机器学习管道。
-
Feature Engine
- Feature-engine 是一个 Python 库,包含多个用于为机器学习模型工程化特征的转换器。
-
Featuretools
- 一个用于自动化特征工程的开源框架。
-
FLAML
- FLAML 是一个用于自动化机器学习与调优的快速库。
-
HEBO
- 一套开源超参数优化框架,包括在超参数调优任务上经过测试的 NeurIPS 2020 Black-Box Optimisation Challenge 获胜方案。
-
Katib
- 一个基于 Kubernetes 的超参数调优和神经架构搜索系统。
-
keras-tuner
- Keras Tuner 是一个易于使用、可分发的超参数优化框架,解决了执行超参数搜索的痛点。Keras Tuner 使定义搜索空间并利用内置算法找到最佳超参数值变得简单。
-
Optuna
- Optuna 是一个自动超参数优化软件框架,专为机器学习设计。
-
OSS Vizier
- OSS Vizier 是一个基于 Python 的黑盒优化和研究服务,是首批设计用于大规模工作的超参数调优服务之一。
-
Perpetual
- 一种无需超参数优化的梯度提升机,具有一个简单的预算参数来控制模型复杂度。
-
TPOT
- 自动化 sklearn 管道创建(包括特征选择、预处理器等)。
-
tsfresh
- 从时间序列中自动提取相关特征。
计算与通信优化
-
Accelerate
- Accelerate 仅精确抽象与多 GPU/TPU/混合精度相关的样板代码,而保持代码其余部分不变。
-
Adapters
- Adapters 是一个用于参数高效和模块化迁移学习的统一库。
-
BitBLAS
- BitBLAS 是一个支持 GPU 上混合精度 BLAS 操作的库
-
Cache-DiT
- Cache-DiT 构建于 Diffusers 之上,支持几乎所有 DiTs,提供混合缓存加速(DBCache、TaylorSeer、SCM 等)以及全面的并行优化,包括上下文并行、张量并行和混合 2D/3D 并行,并兼容编译、CPU 卸载和量化。
-
Colossal-AI
- 一个面向大模型时代的统一深度学习系统,帮助用户高效快速地部署大型 AI 模型的训练和推理。
-
Composer
- Composer 是一个 PyTorch 库,使您能够以更低成本、更高精度更快地训练神经网络。
-
CuDF
- 基于 Apache Arrow 列式内存格式构建,cuDF 是一个用于加载、连接、聚合、过滤以及以其他方式操作数据的 GPU DataFrame 库。
-
CuML
- cuML 是一套实现了机器学习算法和数学原语函数的库,其 API 与其他 RAPIDS 项目兼容。
-
CuPy
- 一个在 CUDA 上实现的 NumPy 兼容的多维数组库。CuPy 由核心多维数组类 cupy.ndarray 及其上的众多函数组成。
-
DEAP
- 一个用于快速原型设计和测试想法的新型进化计算框架。它旨在使算法显式化,数据结构透明化。它与 multiprocessing 和 SCOOP 等并行化机制完美协作。
-
DeepEP
- DeepEP 是一个专为混合专家模型(Mixture-of-Experts, MoE)和专家并行(EP)定制的通信库。它提供高吞吐量和低延迟的 all-to-all GPU 内核,也称为 MoE dispatch 和 combine。该库还支持低精度操作,包括 FP8。
-
DGL
- DGL 是一个易于使用、高性能且可扩展的 Python 包,用于图上的深度学习。
-
DLRover
- DLRover 使大型 AI 模型的分布式训练变得简单、稳定、快速且绿色。
-
Dask
- 用于 Pandas 和 NumPy 计算的分布式并行处理框架。
-
DeepSpeed
- DeepSpeed 是一个深度学习优化库,使分布式训练和推理变得简单、高效且有效。
-
FlagGems
- FlagGems 是一个用 OpenAI Triton 实现的高性能通用算子库。它基于一组后端无关的内核,旨在加速多种硬件平台上的 LLM 训练和推理。
-
Flashlight
- 一个由 Facebook AI Research 以及 Torch、TensorFlow、Eigen 和 Deep Speech 的创作者完全使用 C++ 编写的快速、灵活的机器学习库。
-
Flax
- 专为灵活性而设计的 JAX 神经网络库和生态系统。
-
GPUStack
- GPUStack 是一个用于运行 AI 模型的开源 GPU 集群管理器。
-
Hivemind
- PyTorch 中的去中心化深度学习。
-
Horovod
- Uber 的用于 TensorFlow、Keras 和 PyTorch 的分布式训练框架。
-
Jax
- Python+NumPy 程序的可组合变换:微分、向量化、JIT 到 GPU/TPU 等。
-
Kompute
- 一个极速、轻量级且支持手机的 Vulkan 计算框架,专为高级 GPU 数据处理用例优化。
-
Lava
- Lava 是一个用于开发神经形态硬件架构应用程序的开源框架。
-
Liger Kernel
- Liger Kernel 是一组专为 LLM 训练设计的 Triton 内核。
-
LightGBM
- LightGBM 是一个使用基于树的学习算法的梯度提升框架。
-
MLX
- MLX 是一个用于 Apple 芯片上机器学习的数组框架。
-
Modin
- 通过更改一行代码来加速您的 Pandas 工作流。
-
NVIDIA TensorRT
- TensorRT 是一个用于 NVIDIA GPU 和深度学习加速器的高性能推理 C++ 库。
-
Nevergrad
- Nevergrad 是一个无梯度优化平台。
-
Norse
- Norse 旨在利用受生物启发的神经组件的优势,这些组件是稀疏且事件驱动的——这与人工神经网络存在根本区别。
-
Numba
- 用于 Python 数组和数值函数的编译器。
-
Optimum
- Optimum 是 Transformers 和 Diffusers 的扩展,提供一组优化工具,使模型能够在目标硬件上以最高效率进行训练和运行,同时保持易用性。
-
PEFT
- 参数高效微调(PEFT)方法能够在不微调模型所有参数的情况下,高效地将预训练语言模型(PLMs)适配到各种下游应用。
-
PaddlePaddle
- PaddlePaddle 是一个用于执行大规模深度网络训练的框架,使用分布在数百个节点上的数据源。
-
PyG
- PyG (PyTorch Geometric) 是一个基于 PyTorch 构建的库,用于轻松编写和训练图神经网络(GNNs),适用于与结构化数据相关的广泛应用。
-
PyTorch Lightning
- PyTorch Lightning 在多个 GPU 和 TPU 上预训练、微调和部署 AI 模型,无需更改代码。
-
PyTorch
- PyTorch 是一个用于开发和训练基于神经网络的深度学习模型的库。
-
Ray
- Ray 是一个灵活、高性能的机器学习分布式执行框架。
-
SetFit
- SetFit 是一个高效且无需提示(prompt-free)的框架,用于对 Sentence Transformers 进行少样本微调。
-
Sonnet
- Sonnet 是一个构建在 TensorFlow 2 之上的库,旨在为机器学习研究提供简单、可组合的抽象。
-
Streaming
- 一个用于高效神经网络训练的数据流库。
-
TensorFlow
- TensorFlow 是一个领先的库,专为开发和部署最先进的机器学习应用而设计。
-
ThunderKittens
ThunderKittens 是一个框架,旨在简化在 CUDA 中编写快速深度学习内核的过程。
-
TorchOpt
- TorchOpt 是一个基于 PyTorch 构建的高效可微优化库。
-
Triton
- Triton 是一种用于编写高效自定义深度学习原语的语言和编译器。Triton 的目标是提供一个开源环境,以便以比 CUDA 更高的生产力编写快速代码,同时比现有的其他 DSL 具有更高的灵活性。
-
Vaex
Vaex 是一个高性能的 Python 库,用于处理惰性 Out-of-Core DataFrames(类似于 Pandas),以可视化和探索大型表格数据集。Vaex 使用内存映射、零内存复制策略和惰性计算以实现最佳性能(不浪费内存)。
-
Vowpal Wabbit
Vowpal Wabbit 是一个机器学习系统,它通过在线学习、哈希、allreduce、reductions、learning2search、主动学习和交互式学习等技术推动机器学习的前沿发展。
-
XGBoost
- XGBoost 是一个优化的分布式梯度提升库,旨在高效、灵活且可移植。
-
YDF
- YDF (Yggdrasil Decision Forests) 是一个用于训练、评估、解释和部署随机森林、梯度提升决策树、CART 和孤立森林模型的库。
-
bitsandbytes
- Bitsandbytes 库是 CUDA 自定义函数的轻量级 Python 封装,特别是 8 位优化器、矩阵乘法 (LLM.int8()) 以及 8 位和 4 位量化函数。
-
einops
- 灵活且强大的张量操作,用于编写可读且可靠的代码。
-
scikit-learn
- Scikit-learn 是一个强大的机器学习库,提供用于数据访问、数据准备和统计模型构建的多种模块。
-
snnTorch
- snnTorch 是一个基于脉冲神经网络的深度学习和在线学习库。
-
torchdistill
- torchdistill 提供了各种最先进的知识蒸馏方法,并允许您通过编辑声明式 yaml 配置文件而不是 Python 代码来轻松设计(新的)实验。
-
torchkeras
The torchkeras library is a simple tool for training neural network in pytorch jusk in a keras style.
-
veScale
- veScale is a PyTorch native LLM training framework.
-
yellowbrick
- yellowbrick is a matplotlib-based model evaluation plots for scikit-learn and other machine learning libraries.
数据标注与合成
-
Argilla
- Argilla 帮助领域专家和数据团队在更短的时间内构建更好的 NLP 数据集。
-
cleanlab
- 用于数据驱动 AI 的 Python 库。可以自动:查找错误标记的数据、检测异常值、估算多标注者数据集的共识 + 标注者质量、建议下一步最适合(重新)标记的数据。
-
COCO Annotator
- 用于目标检测、定位和关键点的基于 Web 的图像分割工具
-
CVAT
- CVAT(计算机视觉标注工具)是 OpenCV 的基于 Web 的标注工具,适用于计算机算法的视频和图像。
-
Doccano
- 面向人类的开源文本标注工具,提供情感分析、命名实体识别和机器翻译功能。
-
Gretel Synthetics
- Gretel Synthetics 是一个用于结构化和非结构化文本的合成数据生成器,具有差分隐私学习功能。
-
Label Studio
- 具有标准化输出格式的多领域数据标记和标注工具。
-
LightlyStudio
- 一个用于整理、标注和管理视觉数据集(图像和视频)的开源工具。支持基于嵌入的自动选择、标注以及边界框和分割的自动标记。
-
NeMo Curator
- NeMo Curator 是一个用于高效大语言模型数据整理的 GPU 加速框架。
-
refinery
- 数据科学家用于扩展、评估和维护自然语言数据的开源选择。
-
SDV
- Synthetic Data Vault (SDV) 是一个合成数据生成生态系统,由一系列库组成,允许用户轻松学习单表、多表和时间序列数据集,以便后续生成具有与原始数据集相同格式和统计特性的新合成数据。
-
Semantic Segmentation Editor
- Hitachi 的开源工具,用于标注相机和 LIDAR 数据。
-
synthcity
- synthcity 是一个用于生成和评估合成表格数据的库。
-
TabGAN
- 使用 GANs (CTGAN)、Diffusion Models 和 LLMs 进行合成表格数据生成,具备对抗性过滤、隐私指标和 sklearn 集成。
-
ViPE
- ViPE 是一个空间 AI 工具,用于从原始视频中注释相机位姿和稠密深度图。
-
YData Synthetic
- YData Synthetic 是一个利用最先进的生成模型来生成合成表格数据和时间序列数据的包。
数据管道
-
Apache Airflow
- 使用 Python 构建的数据管道框架,包含调度器、DAG 定义以及用于可视化的 UI。
-
Apache Nifi
- Apache NiFi 专为数据流而设计。它支持高度可配置的数据路由、转换和系统中介逻辑的有向图。
-
Apache Oozie
- 用于 Hadoop 作业的工作流调度器。
-
Argo Workflows
- Argo Workflows 是一个开源的容器原生工作流引擎,用于在 Kubernetes 上编排并行作业。Argo Workflows 实现为 Kubernetes CRD(自定义资源定义)。
-
Couler
- 用于在不同工作流引擎(如 Argo Workflows、Tekton Pipelines 和 Apache Airflow)上构建和管理机器学习工作流的统一接口。
-
DataTrove
- DataTrove 是一个用于在超大规模下处理、过滤和去重文本数据的库。
-
Dagster
- 用于机器学习、分析和 ETL 的数据编排器。
-
DBT
- 用于在数据仓库内部运行转换的 ETL 工具。
-
Genie
- 用于接口连接并触发基于 Hadoop 的系统中的作业执行的作业编排引擎。
-
Hamilton
- Hamilton 是一个用于定义数据流的微编排框架。可在任何 Python 运行环境中运行(例如 jupyter、fastAPI、spark、ray、dask)。在不知不觉中引入软件工程最佳实践。可用于定义特征工程转换、端到端模型管道以及 LLM 工作流。它与宏观编排系统(例如 kedro、luigi、airflow、dbt 等)相辅相成,因为它替代了这些宏观任务内部的代码。附带一个可自托管的 UI,用于捕获血缘关系与来源、执行遥测与数据摘要,并构建自动填充的目录;既可用于开发环境,也可用于生产环境。
-
Instill VDP
- Instill VDP(Versatile Data Pipeline)旨在简化从开始到完成的数据处理管道。
-
Instructor
- Instructor 使从 GPT-3.5、GPT-4、GPT-4-Vision 等 LLM 以及开源模型中获取 JSON 等结构化数据变得轻而易举。
-
Kedro
- Kedro 是一个工作流开发工具,帮助您构建健壮、可扩展、可部署、可复现且带版本控制的数据管道。
-
Luigi
- Luigi 是一个 Python 模块,帮助您构建复杂的批处理作业管道,处理依赖解析、工作流管理、可视化等。
-
Metaflow
- 一个让数据科学家轻松构建和管理实际数据科学项目的框架。
-
Pachyderm
- 基于 Kubernetes 构建的开源分布式处理框架,主要专注于动态构建生产级机器学习流水线 - (视频).
-
Ploomber
- 构建数据流水线的最快方式。迭代开发,随处部署。
-
Pixeltable
– 提供声明式、增量式数据基础设施的开源 Python 库,用于构建和管理多模态 AI 工作负载。
-
Prefect Core
- 一种工作流管理系统,可轻松为您的数据流水线添加重试、日志记录、动态映射、缓存、故障通知等语义。
-
SeqIO
- SeqIO 是一个用于处理序列数据的库,以便将其输入下游序列模型。
-
Snakemake
- 用于可复现且可扩展数据分析的工作流管理系统。
-
Towhee
- 使用一个或多个 ML 模型生成嵌入向量的通用机器学习流水线。
-
unstructured
- unstructured 简化并优化了 LLM 的数据处理工作流,摄取并预处理图像和文本文档,例如 PDF、HTML、Word 文档等。
-
ZenML
- ZenML 是一个可扩展的开源 MLOps 框架,用于创建可复现的 ML 流水线,重点在于自动化元数据跟踪、缓存以及与许多其他工具的集成。
数据科学笔记本
-
Apache Zeppelin
- 基于 Web 的笔记本,支持使用 SQL、Scala 等进行数据驱动的交互式数据分析以及协作文档。
-
Deepnote
- Deepnote 是 Jupyter 的直接替代品,采用 AI 优先设计、流畅的 UI、新的代码块以及原生数据集成。在本地使用您喜欢的 IDE 运行 Python、R 和 SQL,然后扩展到 Deepnote 云端以实现实时协作、Deepnote 智能体以及可部署的数据应用。
-
Jupyter Notebooks
- 用于可复现开发的 Web 界面 Python 沙箱环境
-
Marimo
- 响应式 Python 笔记本——运行可复现实验,作为脚本执行,作为应用部署,并使用 git 进行版本控制。
-
Papermill
- Papermill 是一个用于参数化笔记本并像 Python 脚本一样执行它们的库。
-
Polynote
- Polynote 是一个实验性的多语言笔记本环境。目前,它支持 Scala 和 Python(带或不带 Spark)、SQL 以及 Vega。
-
RMarkdown
- rmarkdown 包是基于 Pandoc 的下一代 R Markdown 实现。
-
Stencila
- Stencila 是一个用于创建、协作和共享数据驱动内容的平台。内容透明且可复现。
-
Voilà
- Voilà 将 Jupyter 笔记本转换为独立的 Web 应用程序,例如可用作仪表板。
-
.NET Interactive
- .NET Interactive 将 .NET 的强大功能嵌入到您的交互式体验中。
数据存储优化
-
AIStore
- AIStore 是一个轻量级对象存储系统,具备随着每个新增存储节点线性扩展的能力,并特别专注于 PB 级深度学习。
-
Alluxio
- 一个虚拟分布式存储系统,弥合计算框架与存储系统之间的差距。
-
Apache Arrow
- 与 Pandas、基于 Hadoop 的系统等兼容的内存中列式数据表示。
-
Apache Druid
- 一个高性能实时分析数据库。请参阅此文章]进行介绍。
-
Apache Hudi
- Hudi 是一个事务性数据湖平台,将核心仓库和数据库功能直接引入数据湖。Hudi 非常适合流式工作负载,并且允许创建高效的增量批处理管道。支持流行的查询引擎,包括 Spark、Flink、Presto、Trino、Hive 等。更多信息请见此处]。
-
Apache Iceberg
- Iceberg 是一种符合 ACID 规范的高性能格式,专为巨大的分析表(包含数十 PB 的数据)而构建,它将 SQL 表的可靠性和简单性带入大数据,同时使 Spark、Trino、Flink、Presto、Hive 和 Impala 等引擎能够安全地同时处理相同的表。更多信息请见此处]。
-
Apache Ignite
- 一个以内存为中心的分布式数据库、缓存和处理平台,面向事务型、分析型和流式工作负载,在 PB 级规模下提供内存级速度 - 演示.
-
Apache Parquet
- 一种与 Pandas、基于 Hadoop 的系统等兼容的磁盘列式数据表示格式..
-
Apache Pinot
- 一个实时分布式 OLAP 数据存储。关于大数据开源 OLAP 系统(ClickHouse、Druid 和 Pinot)的对比见此处.
-
Casibase
- Casibase 是一个类似 LangChain 的 RAG(检索增强生成)知识库,具备 Web UI 和企业级 SSO 功能。
-
Chroma
- Chroma 是一个开源的嵌入数据库。
-
ClickHouse
- ClickHouse 是一个开源的列式数据库管理系统。
-
Delta Lake
- Delta Lake 是一个存储层,为 Apache Spark 和其他大数据引擎带来可扩展的 ACID 事务支持。
-
EdgeDB
- Gel 通过现代数据模型、图查询、Auth 和 AI 解决方案等,为 Postgres 注入强大动力。
-
GPTCache
- GPTCache 是一个用于为大语言模型查询创建语义缓存的库。
-
InfluxDB
用于指标、事件和实时分析的可扩展数据存储。
-
Milvus
Milvus 是一个云原生、开源的向量数据库,旨在管理由机器学习模型和神经网络生成的嵌入向量。
-
Marqo
Marqo 是一个端到端的向量搜索引擎。
-
pgvector
pgvector 有助于 Postgres 的向量相似度搜索。
-
PostgresML
PostgresML 是 PostgreSQL 的一个机器学习扩展,允许您使用 SQL 查询对文本和表格数据进行训练和推理。
-
Redis
Redis 是一个开源的内存数据存储,支持向量相似度搜索,使其适用于语义搜索和推荐系统等 AI/ML 应用。
-
Safetensors
一种简单、安全的张量存储和分发方式。
-
TimescaleDB
一个开源的时间序列 SQL 数据库,针对快速摄取和复杂查询进行了优化,打包为 PostgreSQL 扩展 - (Video).
-
Weaviate
- 一个低延迟的向量搜索引擎(GraphQL, RESTful),开箱即用地支持不同的媒体类型。模块包括语义搜索、问答、分类、可定制模型(PyTorch/TensorFlow/Keras)等。
-
Zarr
- Python 实现的分块、压缩的 N 维数组,专为并行计算设计。
数据流处理
-
Apache Beam
Apache Beam 是用于批处理和流处理的统一编程模型。
-
Apache Flink
- 具有强大流处理和批处理能力的开源流处理框架。
-
Apache Kafka
- 用于构建输入和输出存储在 kafka 集群中的应用和微服务的 Kafka 客户端库。
-
Apache Samza
- 分布式流处理框架。它使用 Apache Kafka 进行消息传递,并使用 Apache Hadoop YARN 提供容错、处理器隔离、安全性和资源管理。
-
Apache Spark
- 使用 apache spark 框架作为后端,支持有状态 exactly-once 语义的流微批处理。
-
Bytewax
- 构建在 Rust 引擎之上的灵活 Python 中心有状态流处理框架。
-
FastStream
- 一个现代的、与 broker 无关的 Python 流处理框架,支持 Apache Kafka、RabbitMQ 和 NATS 协议,受 FastAPI 启发,易于与其他 Web 框架集成。
-
MOA
- MOA (Massive Online Analysis) 是一个用于大数据流挖掘的开源框架。
-
MosaicML Streaming
- 从云存储快速、确定性地流式传输大型数据集,用于分布式模型训练。
-
RisingWave
- 一个分布式 SQL 流式数据库,统一了流处理和低延迟服务,非常适合构建和提供在线机器学习的特征。
-
TensorStore
- 用于读写大型多维数组的库。
部署与服务
-
Agenta
- Agenta 为整个 LLMOps 工作流提供端到端工具:构建(LLM 游乐场、评估)、部署(提示词和配置管理)以及(LLM 可观测性和追踪)。
-
AirLLM
- AirLLM 优化了推理内存使用,允许 70B 大语言模型在单张 4GB GPU 卡上运行推理,无需量化、蒸馏和剪枝。
-
AITemplate
- AITemplate (AIT) 是一个 Python 框架,将深度神经网络转换为 CUDA (NVIDIA GPU) / HIP (AMD GPU) C++ 代码,以实现极速推理服务。
-
BentoML
- BentoML 是一个用于高性能 ML 模型服务的开源框架。
-
BISHENG
- BISHENG 是一个开放的 LLM 应用 devops 平台,专注于企业场景。
-
DeepDetect
- 由 Jolibrain 维护的、用 C++ 编写的 TensorFlow、XGBoost 和 Cafe 模型的机器学习生产服务器。
-
Dynamo
- NVIDIA Dynamo 是一个高吞吐量、低延迟的推理框架,专为在多节点分布式环境中服务生成式 AI 和推理模型而设计。
-
exo
- exo 帮助你在家里使用日常设备运行你的 AI 集群。
-
Genkit
- Genkit 是一个用于使用熟悉的代码中心模式构建 AI 驱动应用的开源框架。Genkit 使开发、集成和测试具有可观测性和评估的 AI 功能变得容易。
-
GoModel
- GoModel 是一个用 Go 编写的自托管 AI 网关,它通过 OpenAI、Anthropic、Gemini、Groq、xAI、Ollama 及其他提供商暴露统一的 OpenAI 兼容 API,并支持路由、用量跟踪、速率限制和护栏。
-
Inference
- 一个快速、生产就绪的计算机视觉推理服务器,支持部署许多流行的模型架构和微调模型。使用 Inference,您可以在自己的硬件上使用 Docker 部署 YOLOv5、YOLOv8、CLIP、SAM 和 CogVLM 等模型。
-
Infinity
- Infinity 是一个高吞吐量、低延迟的 REST API,用于提供文本嵌入、重排序模型和 clip 服务。
-
IPEX-LLM
- IPEX-LLM 是一个 PyTorch 库,用于在 Intel CPU 和 GPU(例如带有 iGPU 的本地 PC、Arc、Flex 和 Max 等独立 GPU)上以极低延迟运行 LLM。
-
LiteLLM
- LiteLLM 是一个 Python SDK 和代理服务器(LLM 网关),用于以 OpenAI 格式调用 100 多个 LLM API - Bedrock、Azure、OpenAI、VertexAI、Cohere、Anthropic、Sagemaker、HuggingFace、Replicate、Groq。
-
LiteRT
- LiteRT(前身为 TensorFlow Lite)是 Google 的高性能运行时,用于设备端 AI 推理,支持在移动、嵌入式和边缘设备上部署机器学习模型。
-
LiteRT-LM
- LiteRT-LM 是 Google 的生产就绪、高性能推理框架,用于在边缘设备上部署大语言模型,支持 Android、iOS、Web、桌面和 IoT 的跨平台支持。
-
LitServe
- LitServe 是一个基于 FastAPI 构建的灵活 AI 模型服务引擎。它支持针对模型、智能体、多模态系统、RAG 和复杂 ML 管道的自定义推理引擎。
-
Jina-serve
- Jina-serve 是一个用于构建和部署通过 gRPC、HTTP 和 WebSockets 进行通信的 AI 服务的框架。
-
Kiln
- Kiln 是一个用于微调 LLM 模型、生成合成数据以及协作处理数据集的 OSS 工具。
-
KServe
- KServe 提供了一个 Kubernetes 自定义资源定义,用于提供预测性和生成式 ML 服务。
-
KTransformers
- KTransformers 是一个用于体验前沿 LLM 推理优化的灵活框架。
-
Langtrace
- Langtrace 是一个开源的、基于 Open Telemetry 的 LLM 应用端到端可观测性工具,为流行的 LLMs、LLM 框架、vectorDBs 等提供实时追踪、评估和指标。
-
Lepton AI
- LeptonAI Python 库允许您轻松地通过 Python 代码构建 AI 服务。
-
LightLLM
- LightLLM 是一个基于 Python 的 LLM(大语言模型)推理和服务框架,以其轻量级设计、易于扩展和高性能而著称。
-
llama.cpp
- llama.cpp 是一个开源软件库,可对 Llama 等各种大语言模型执行推理。
-
llmfit
- 一款终端工具,可根据系统的 RAM、CPU 和 GPU 为 LLM 模型调整合适的大小。检测您的硬件,从质量、速度、适配度和上下文维度对每个模型进行评分,并告诉您哪些模型实际上能在您的机器上良好运行。
-
LMCache
- LMCache 是一个高性能的 KV 缓存层,用于加速 LLM 推理。
-
LMDeploy
- LMDeploy 是一个用于压缩、部署和提供 LLM 服务的工具包。
-
LM Studio
- LM Studio 是一个用于在计算机本地部署 LLM 模型的工具,即使是在配置相对较低的机器上,只要满足最低要求即可。
-
LocalAI
- LocalAI 是一个即插即用的 REST API,兼容 OpenAI API 规范,用于本地推理。
-
MindsDB
- MindsDB 是一个平台,可实时从您的数据库、向量存储和应用数据中创建、提供和微调模型。
-
mini-sglang
- mini-sglang 是一个轻量级且高效的大语言模型服务框架。
-
MLRun
- MLRun 是一个开放的 MLOps 框架,用于在其生命周期内快速构建和管理持续 ML 和生成式 AI 应用程序。
-
MLServer
- 一个用于您的机器学习模型的推理服务器,支持多种框架、多模型服务等功能。
-
Model Runner
- Docker Model Runner 使使用 Docker 管理、运行和提供 AI 模型变得轻而易举,支持直接从 Docker Hub 或任何符合 OCI 标准的注册表拉取的 LLM 及其他 AI 模型。
-
Mosec
- 一个由 Rust 驱动的多阶段流水线模型服务器,提供动态批处理等更多功能。作为微服务实现和部署极其简单。
-
nano-vllm
- nano-vllm 是一个从零开始构建的轻量级 vLLM 实现,提供快速的离线推理,并采用前缀缓存、张量并行和 CUDA 图等优化技术。
-
nndeploy
- 一个易用且高性能的 AI 部署框架。
-
Nuclio
- 一个专注于数据、I/O 和计算密集型工作负载的高性能“无服务器”框架。它与流行的数据科学工具(如 Jupyter 和 Kubeflow)深度集成;支持多种数据和流式数据源;并支持在 CPU 和 GPU 上执行。
-
OpenLLM
- OpenLLM 允许开发者通过单条命令将任何开源 LLM(Llama 3.1、Qwen2、Phi3 等)或自定义模型作为 OpenAI 兼容 API 运行。
-
OpenVINO
- OpenVINO 是一个用于优化和部署 AI 推理的开源工具包。
-
Open WebUI
- Open WebUI 是一个可扩展、功能丰富且用户友好的自托管 AI 平台,旨在完全离线运行。它支持 Ollama 和 OpenAI 兼容 API 等多种 LLM 运行器,并内置用于 RAG 的推理引擎,使其成为一种强大的 AI 部署解决方案。
-
OptiLLM
- OptiLLM 是一个兼容 OpenAI API 的优化推理代理,实现了 20 多种最先进的技术,可显著提升 LLM 在推理任务上的准确性和性能——无需进行任何模型训练或微调。
-
PowerInfer
- PowerInfer 是一个利用激活局部性的 CPU/GPU LLM 推理引擎,适用于您的设备。
-
Prompt2Model
- Prompt2Model 是一个系统,它接收自然语言任务描述(类似于用于 ChatGPT 等 LLM 的提示词),以训练一个有利于部署的小型专用模型。
-
RamaLama
- RamaLama 是一个开源工具,通过 OCI 容器简化 AI 模型的本地使用和推理服务,无需配置主机系统。
-
RunAnywhere
- RunAnywhere 是一个生产就绪的 SDK,用于在 iOS、Android、React Native 和 Flutter 上设备端运行 AI 模型(LLM、语音转文本、文本转语音)——实现私密、离线且快速的移动 AI 应用。
-
Seldon Core
- 用于在 Kubernetes 中部署和 机器学习模型的开源平台 - (视频).
-
SGLang
- SGLang 是一个用于大型语言模型和视觉语言模型的高速服务框架。
-
SIE
- 用于嵌入、重排序和提取的开源推理服务器和生产集群。涵盖稠密、稀疏、多向量、视觉、重排序器和提取器的 85+ 个预配置模型。附带 Helm、KEDA 自动扩缩容、Grafana 仪表板和 Terraform。
-
SkyPilot
- SkyPilot 是一个在任何云平台上运行 LLM、AI 和批处理任务的框架,提供最大的成本节省、最高的 GPU 可用性和托管执行。
-
Tensorflow Serving
- 通过 grpc 协议提供 Tensorflow 模型服务的高性能框架,能够处理每核每秒 10 万请求。
-
text-generation-inference
- 大语言模型文本生成推理。
-
TorchServe
- TorchServe 是一个灵活且易于使用的 PyTorch 模型服务工具。
-
torchtune
- torchtune 是一个 PyTorch 库,用于轻松编写、后训练和实验 LLM。
-
Transformer Lab
- Transformer Lab 是一个开源 LLM 工作区,用于在本地跨推理引擎和平台微调、评估、导出和测试模型。
-
Triton Inference Server
- Triton 是一个高性能的开源服务软件,用于在 GPU 和 CPU 上部署来自任何框架的 AI 模型,同时最大化利用率。
-
Vercel AI
- Vercel AI 是一个 TypeScript 工具包,旨在帮助您使用 Next.js、React、Svelte、Vue 等流行框架以及 Node.js 等运行时构建 AI 驱动的应用程序。
-
Vespa
- 在任意规模下,于服务时对向量、张量、文本和结构化数据进行搜索、推理和组织。
-
vLLM
- vLLM 是一个面向 LLM 的高吞吐量且内存高效的推理和服务引擎。
评估与监控
-
AlpacaEval
- AlpacaEval 是一个用于指令遵循语言模型的自动评估器。
-
ANN-Benchmarks
- ANN-Benchmarks 是一个用于近似最近邻算法搜索的基准测试环境。
-
ARES
- ARES 是一个用于自动评估检索增强生成 (RAG) 模型的框架。
-
BEIR
- BEIR 是一个包含多样化 IR 任务的异构基准。它还在基准内提供了一个通用且易于使用的框架,用于评估基于 NLP 的检索模型。
-
Code Generation LM Evaluation Harness
- Code Generation LM Evaluation Harness 是一个用于评估代码生成模型的框架。
-
COMET
- COMET 是一个用于机器学习评估的开源框架。
-
C-Eval
- C-Eval 是一个用于基础模型的综合中文评估套件。
-
Deepchecks
- Deepchecks 是一个全面的开源解决方案,满足您所有的 AI 和 ML 验证需求,使您能够彻底测试从研究到生产的数据和模型。
-
DeepEval
- DeepEval 是一个易于使用的开源 LLM 应用评估框架。
-
DomainBed
- DomainBed 是一个包含用于域泛化的基准数据集和算法的测试套件
-
EvalAI
- EvalAI 是一个用于大规模评估和比较 AI 算法的开源平台。
-
Evalchemy
- Evalchemy 是一个用于评估后训练语言模型的统一且易于使用的工具包。
-
EvalPlus
- EvalPlus 是一个用于 LLM4Code 的稳健评估框架,具备扩展的 HumanEval+ 和 MBPP+ 基准测试、效率评估(EvalPerf)以及安全、可扩展的评估工具包。
-
Evals
- Evals 是一个用于评估 OpenAI 模型的框架,也是一个开源的基准测试注册表。
-
EvalScope
- EvalScope 是一个精简且可定制的框架,用于高效的大模型评估和性能基准测试。
-
Evaluate
- Evaluate 是一个库,使评估和比较模型以及报告其性能变得更加简单和标准化。
-
Evidently
- Evidently 是一个开源框架,用于评估、测试和监控基于 ML 和 LLM 的系统。
-
Future AGI
- 一个开源的、可自托管的端到端智能体工程和优化平台,统一了 LLM 和 AI 智能体应用的追踪、评估、模拟、数据集、网关和护栏。
-
GAOKAO-Bench
- GAOKAO-Bench 是一个评估框架,使用中国高考(GAOKAO)题目作为数据集,以评估大模型的语言理解和逻辑推理能力。
-
Giskard
- Giskard 是一个开源 Python 库,可自动检测 AI 应用中的性能、偏见和安全问题。
-
guidellm
- guidellm 是一个用于大语言模型推理系统的基准测试和性能评估工具。
-
Harbor
- Harbor 是一个用于评估和优化智能体及语言模型的框架,支持在容器环境中进行并行实验,并内置基准测试和环境管理功能。
-
HumanEval
- HumanEval 是一个使用带有单元测试的 Python 编程问题来评估代码生成模型功能正确性的基准测试。
-
Helicone
- Helicone 是一个一体化的开源 LLM 开发者平台。
-
HELM
- HELM (Holistic Evaluation of Language Models) 提供了用于语言模型整体评估的工具,包括标准化数据集、用于各种模型的统一 API、多样化的指标、r 和公平性扰动、提示构建框架以及用于统一模型访问的代理服务器。
-
Inspect
- Inspect 是一个用于大语言模型评估的框架。
-
IsaacLab-Arena
- IsaacLab-Arena 是 NVIDIA Isaac Lab 的一个开源扩展,用于可组合的环境创建和大规模机器人策略评估。
-
JiWER
- JiWER 是一个简单且快速的 python 包,用于评估自动语音识别系统。
-
Laminar
- Laminar 是一个开源平台,用于追踪、评估、标注和分析 AI 产品的 LLM 数据。
-
Langfuse
- Langfuse 是一个用于基于 LLM 的应用程序的可观测性与分析解决方案。
-
LangTest
- LangTest 是一个用于 NLP 模型的综合评估工具包。
-
Language Model Evaluation Harness
- Language Model Evaluation Harness 是一个用于在大量不同评估任务上测试生成式语言模型的框架。
-
LangWatch
- LangWatch 是 DSPy 的可视化界面,也是一个完整的 LLM Ops 平台,用于监控、实验、测量和改进 LLM 管道,采用公平代码分发模式。
-
Latitude
- Latitude 是一个用于 AI 智能体可观测性的开源平台,支持语义追踪搜索和问题跟踪。
-
LightEval
- LightEval 是一个轻量级的 LLM 评估套件。
-
LLMPerf
- LLMPerf 是一个用于评估 LLM API 性能的工具。
-
lmms-eval
- lmms-eval 是一个精心打造的评估框架,用于对 LMM 进行一致且高效的评估。
-
Melting Pot
- Melting Pot 是一套用于多智能体强化学习的测试场景。
-
Meta-World
- Meta-World 是一个用于元强化学习和多任务学习的开源模拟基准,包含 50 个不同的机器人操作任务。
-
mir_eval
- mir_eval 是一个 Python 库,提供了一种透明、标准化且直接的方式来评估音乐信息检索系统。
-
MLPerf Inference
- MLPerf Inference 是一套用于衡量系统在多种部署场景下运行模型速度的基准测试套件。
-
Massive Text Embedding Benchmark
- Massive Text Embedding Benchmark (MTEB) 是一个综合评估框架,用于评估文本嵌入模型在多种任务和语言上的性能,涵盖 8 个嵌入任务、58 个数据集和 112 种语言。
-
NannyML
- NannyML 是一个库,允许你在无法访问目标值的情况下估计部署后的模型性能,检测数据漂移,并将数据漂移警报智能地关联回模型性能的变化。
-
OGB
- The Open Graph Benchmark (OGB) 是一组用于图机器学习的基准数据集、数据加载器和评估器。
-
Ollama Grid Search
- Ollama Grid Search 自动化了为特定用例选择最佳模型、提示词或推理参数的过程,允许你遍历它们的组合并直观地检查结果。
-
onWatch
- onWatch 是一个轻量级的 Go CLI,可实时跟踪多个提供商(Anthropic Pro/Max Plans, Codex, Gemini CLI, Synthetic, Z.ai, GitHub Copilot, MiniMax Coding/Token Plan, Antigravity, OpenRouter)的 AI API 配额使用情况,并提供消耗速率预测、历史使用图表和按周期跟踪功能。
-
OpenCompass
- OpenCompass 是一个 LLM 评估平台,支持 50 多个数据集上的多种模型(LLaMA、LLaMa2、ChatGLM2、ChatGPT、Claude 等)。
-
OpenLIT
- OpenLIT 是一个开源 AI 工程平台,通过可观测性、监控、护栏、评估和无缝集成来简化 LLM 工作流。
-
OpenLLMetry
- OpenLLMetry 通过性能监控、执行跟踪和调试功能,为开发者提供对大型语言模型应用的深入洞察。


