onejune2018/Awesome-LLM-Eval · 文件 下载 ZIP
文件最后提交记录最后更新时间
README.md
以下内容由 AI 翻译,如有问题请点此提交 issue 反馈
Awesome-LLM-Eval:一个精选列表,涵盖工具、数据集/基准、演示、排行榜、论文、文档和模型,主要用于大语言模型的评估,以及探索生成式人工智能的边界和极限。
这是我们综述的官方项目:Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap。
注意: 由于我们无法实时更新 arXiv 论文,请参阅此仓库以获取最新更新,论文可能会稍后更新。我们也欢迎任何 pull request 或 issues 来帮助我们改进这项工作。您的贡献将在 致谢 中被提及。
如果您觉得我们的综述有用,请引用我们的论文:
@misc{wang2025llmevalroadmap,
title={Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap},
author={Jun Wang and Ninglun Gu and Kailai Zhang and Zijiao Zhang and Yelun Bao and Jin Yang and Xu Yin and Liwei Liu and Yihuan Liu and Pengyong Li and Gary G. Yen and Junchi Yan},
year={2025},
eprint={2508.18646},
archivePrefix={arXiv},
primaryClass={cs.AI},
url={https://arxiv.org/abs/2508.18646},
}

目录

新闻
- [2025/08/20] 我们添加了 Anthropomorphic-Taxonomy 章节。
- [2024/04/26] 我们添加了 Inference-Speed 章节。
- [2024/02/26] 我们添加了 Coding-Evaluation 章节。
- [2024/02/08] 我们添加了来自 Huggingface 的 lighteval 工具。
- [2024/01/15] 我们添加了 CRUXEval、DebugBench、OpenFinData 和 LAiW。
- [2023/12/20] 我们添加了 RAG-Evaluation 章节。
- [2023/11/15] 我们添加了 Instruction-Following-Evaluation 和 LLMBar,用于评估 LLM 的指令遵循能力。
- [2023/10/20] 我们添加了用于 LLM 智能体评估的 SuperCLUE-Agent。
- [2023/09/25] 我们添加了来自 Colossal-AI 的 ColossalEval。
- [2023/09/22] 我们添加了 LeaderboardFinder 章节。
- [2023/09/20] 我们添加了来自 CLUEbenchmark 的 DeepEval、FinEval 和 SuperCLUE-Safety。
- [2023/09/18] 我们添加了来自 Shanghai AI Lab 的 OpenCompass。
- [2023/08/03] 我们添加了新的中文 LLM:Baichuan 和 Qwen。
- [2023/06/28] 我们添加了 AlpacaEval 和多个工具。
- [2023/04/26] 我们发布了包含多个基准测试的 V0.1 评估列表。
Anthropomorphic-Taxonomy
典型智商 (IQ)-通用智能评估基准
| 名称 | 年份 | 任务类型 | 机构 | 评估重点 | 数据集 | 链接 |
|---|---|---|---|---|---|---|
| MMLU-Pro | 2024 | 多选知识 | TIGER-AI-Lab | 细微推理,更少噪声 | MMLU-Pro | link |
| DyVal | 2024 | 动态评估 | Microsoft | 数据污染,复杂度控制 | DyVal | link |
| PertEval | 2024 | 通用 | USTC | 知识容量 | PertEval | link |
| LV-Eval | 2024 | 长文本问答 | Infinigence-AI | 长度可变性,事实性 | 11 个子集 | link |
| LLM-Uncertainty-Bench | 2024 | NLP 任务 | Tencent | 不确定性量化 | 5 个 NLP 任务 | link |
| CommonGen-Eval | 2024 | 生成 | AI2 | 常识 | CommonGen-lite | link |
| MathBench | 2024 | 数学 | Shanghai AI Lab | 理论与实践问题解决 | 多种 | link |
| AIME | 2024 | 数学 | MAA | 美国数学邀请赛 | 多种 | link |
| FrontierMath | 2024 | 数学 | Epoch AI | 原创、具有挑战性的数学问题 | 多种 | link |
| FELM | 2023 | 事实性 | HKUST | 事实性 | 847 个问题 | link |
| Just-Eval-Instruct | 2023 | 通用 | AI2 Mosaic | 有用性、可解释性 | 多种 | link |
| MLAgentBench | 2023 | 机器学习研究 | snap-stanford | 端到端机器学习任务 | 15 个任务 | link |
| UltraEval | 2023 | 通用 | OpenBMB | 轻量级、灵活、快速 | 多种 | link |
| FMTI | 2023 | 透明度 | Stanford | 模型透明度 | 100 个指标 | link |
| BAMBOO | 2023 | 长文本 | RUCAIBox | 长文本建模 | 10 个数据集 | link |
| TRACE | 2023 | 持续学习 | 复旦大学 | 持续学习 | 8 个数据集 | link |
| ColossalEval | 2023 | 通用 | Colossal-AI | 统一评估 | 多种 | link |
| LLMEval² | 2023 | 通用 | AlibabaResearch | 广泛且深入的评估 | 2,553 个样本 | link |
| BigBench | 2023 | 通用 | 知识、语言、推理 | 多种 | link | |
| LucyEval | 2023 | 通用 | Oracle | 成熟度评估 | 多种 | link |
| Zhujiu | 2023 | 通用 | IACAS | 综合评估 | 51 个任务 | link |
| ChatEval | 2023 | 聊天 | THU-NLP | 类人评估 | 多种 | link |
| FlagEval | 2023 | 通用 | THU | 主观与客观评分 | 多种 | link |
| AlpacaEval | 2023 | 通用 | tatsu-lab | 自动评估 | 多种 | link |
| GPQA | 2023 | 通用 | NYU | 研究生级别防谷歌问答 | 多种 | link |
| MuSR | 2023 | 推理 | Zayne Sprague | 基于叙事的推理 | 756 | link |
| FreshQA | 2023 | 知识 | FreshLLMs | 当前世界知识 | 599 | link |
| AGIEval | 2023 | 通用 | Microsoft | 以人为中心的推理 | NA | link |
| SummEdits | 2023 | 通用 | Salesforce | 不一致性检测 | 6,348 | link |
| ScienceQA | 2022 | 推理 | UCLA | 科学推理 | 21,208 | link |
| e-CARE | 2022 | 推理 | HIT | 可解释因果性 | 21,000 | link |
| BigBench Hard | 2022 | 推理 | BigBench | 具有挑战性的子任务 | 6,500 | link |
| PlanBench | 2022 | 推理 | ASU | 动作规划 | 11,113 | link |
| MGSM | 2022 | 数学 | 10种语言的小学数学问题 | Various | link | |
| MATH | 2021 | 数学 | UC Berkeley | 数学问题求解 | Various | link |
| GSM8K | 2021 | 数学 | OpenAI | 多样化的小学数学应用题 | Various | link |
| SVAMP | 2021 | 数学 | Microsoft | 算术推理 | 1,000 | link |
| SpartQA | 2021 | 推理 | MSU | 文本空间问答 | 510 | link |
| MLSUM | 2020 | General | Thomas Scialom | 新闻摘要 | 535,062 | link |
| Natural Questions | 2019 | Language, Reasoning | 基于搜索的问答 | 300,000 | link | |
| ANLI | 2019 | Language, Reasoning | Facebook AI | 对抗性推理 | 169,265 | link |
| BoolQ | 2019 | Language, Reasoning | 二元问答 | 16,000 | link | |
| SuperGLUE | 2019 | Language, Reasoning | NYU | 高级 GLUE 任务 | NA | link |
| DROP | 2019 | Language, Reasoning | UCI NLP | 段落级推理 | 96,000 | link |
| HellaSwag | 2019 | Language, Reasoning | AI2 | 常识推理 | 59,950 | link |
| Winogrande | 2019 | Language, Reasoning | AI2 | 代词消歧 | 44,000 | link |
| PIQA | 2019 | Language, Reasoning | AI2 | 物理交互问答 | 18,000 | link |
| HotpotQA | 2018 | 语言, 推理 | HotpotQA | 可解释性问答 | 113,000 | link |
| GLUE | 2018 | 语言, 推理 | NYU | 基础自然语言理解任务 | NA | link |
| OpenBookQA | 2018 | 语言, 推理 | AI2 | 开放书本考试 | 12,000 | link |
| SQuAD2.0 | 2018 | 语言, 推理 | Stanford University | 不可回答问题 | 150,000 | link |
| ARC | 2018 | 语言, 推理 | AI2 | AI2 推理挑战 | 7,787 | link |
| SWAG | 2018 | 语言, 推理 | AI2 | 对抗性常识 | 113,000 | link |
| CommonsenseQA | 2018 | 语言, 推理 | AI2 | 常识推理 | 12,102 | link |
| RACE | 2017 | 语言, 推理 | CMU | 考试风格问答 | 100,000 | link |
| SciQ | 2017 | 语言, 推理 | AI2 | 众包科学 | 13,700 | link |
| TriviaQA | 2017 | 语言, 推理 | AI2 | 远程监督 | 650,000 | link |
| MultiNLI | 2017 | 语言, 推理 | NYU | 跨体裁蕴含 | 433,000 | link |
| SQuAD | 2016 | 语言, 推理 | Stanford University | 基于维基百科的问答 | 100,000 | link |
| LAMBADA | 2016 | 语言, 推理 | CIMEC | 话语上下文 | 12,684 | link |
| MS MARCO | 2016 | 语言, 推理 | Microsoft | 基于搜索的问答 | 1,112,939 | link |
典型专业商数(PQ)- 专业能力评估基准
| 领域 | 名称 | 机构 | 任务范围 | 独特贡献 | 链接 |
|---|---|---|---|---|---|
| BLURB | Mindrank AI | 六项多样化的 NLP 任务,十三个数据集 | 所有任务的宏平均分数 | link | |
| Seismometer | Epic | 使用本地数据和工作流 | 患者人口统计信息、临床干预措施和结果 | link | |
| 医疗健康 | Medbench | OpenMEDLab | 强调科学严谨性和公平性 | 来自医学考试和报告的 40,041 个问题 | link |
| GenMedicalEval | E | 16 个专业,3 个训练阶段,6 个临床场景 | 开放式指标和自动化评估模型 | link | |
| PsyEval | SJTU | 涵盖三个维度的六个子任务 | 面向心理健康大语言模型的定制化基准测试 | link | |
| Fin-Eva | Ant Group | 财富管理、保险、投资研究 | 兼顾工业界与学术界的金融评估 | link | |
| Finance | FinEval | SUFE-AIFLM-Lab | 金融、经济、会计领域的多项选择题问答 | 专注于高质量评估问题 | link |
| OpenFinData | Shanghai AI Lab | 多场景金融任务 | 首个综合性金融评估数据集 | link | |
| FinBen | FinAI | 涵盖23项金融任务的35个数据集 | 归纳推理、定量推理 | link | |
| LAiW | Sichuan University | 13项基础法律NLP任务 | 将法律NLP能力划分为三大核心能力 | link | |
| Legal | LawBench | Nanjing University | 法律实体识别、阅读理解 | 真实世界任务,“弃权率”指标 | link |
| LegalBench | 斯坦福大学 | 涵盖六种法律推理类型的162项任务 | 促进跨学科对话 | link | |
| LexEval | 清华大学 | 组织不同任务的法学认知能力 | 更大的法律评估数据集,考察伦理问题 | link | |
| SPEC5G | 普渡大学 | 安全相关的文本分类与摘要 | 5G协议分析自动化 | link | |
| 电信 | TeleQnA | 华为(巴黎) | 通用电信咨询 | 电信相关问题的熟练度 | link |
| OpsEval | 清华大学 | 有线网络运维、5G、数据库运维 | 聚焦AIOps,评估熟练度 | link | |
| TelBench | SK Telecom | 数学建模、开放式问答、代码生成 | 电信领域的综合评估 | link | |
| TelecomGPT | 阿联酋 | 电信数学建模、开放式问答与代码任务 | 电信领域的综合评估 | link | |
| Linguistic | 女王大学 | 多种以语言为中心的任务 | 零样本评估 | link | |
| TelcoLM | Orange | 多项选择题问卷 | 领域特定数据(8亿个词元,8万条指令) | link | |
| ORAN-Bench-13K | GMU | 多项选择题 | 开放无线接入网(O-RAN) | link | |
| Open-Telco Benchmarks | GSMA | 多种以语言为中心的任务 | 零样本评估 | link | |
| FullStackBench | ByteDance | 代码编写、调试、代码审查 | 包含最新的 Stack Overflow 问答 | link | |
| 编程 | StackEval | Prosus AI | 11个真实场景,16种语言 | 在多样化且实用的编程环境中进行评估 | link |
| CodeBenchGen | Various Institutions | 基于执行的代码生成任务 | 随规模和复杂度扩展的基准测试 | link | |
| HumanEval | 华盛顿大学 | 严格测试 | 评估生成代码正确性的更严格协议 | link | |
| APPS | 加利福尼亚大学 | 来自竞技平台的编程挑战 | 在测试用例上检查生成代码的问题解决能力 | link | |
| MBPP | Google Research | 源自各种来源的编程问题 | 多样化的编程任务 | link | |
| ClassEval | 清华大学 | 类级别代码生成 | 手工编写,面向对象编程概念 | link | |
| CoderEval | 北京大学 | 实用代码生成 | 为描述的问题生成功能性代码补丁的能力 | link | |
| MultiPL-E | 普林斯顿大学 | 神经代码生成 | 对神经代码生成模型进行基准测试 | link | |
| CodeXGLUE | 微软 | 代码智能 | 涵盖广泛任务:代码-代码、文本-代码、代码-文本和文本-文本 | link | |
| EvoCodeBench | 北京大学 | 演化代码生成基准 | 与真实世界代码仓库对齐,随时间演化 | link |
典型情商(EQ)对齐能力评估基准
| 名称 | 年份 | 任务类型 | 机构 | 类别 | 数据集 | 链接 |
|---|---|---|---|---|---|---|
| DiffAware | 2025 | 偏见 | Stanford | 一般偏见 | 8 个数据集 | link |
| CASE-Bench | 2025 | 安全 | Cambridge | 情境感知安全 | CASE-Bench | link |
| Fairness | 2025 | 公平性 | PSU | 分配公平性 | - | - |
| HarmBench | 2024 | 安全 | UIUC | 对抗性行为 | 510 | link |
| SimpleQA | 2024 | 安全 | OpenAI | 事实性 | 4,326 | link |
| AgentHarm | 2024 | 安全 | BEIS | 恶意智能体任务 | 110 | link |
| StrongReject | 2024 | 安全 | dsbowen | 攻击抵抗 | n/a | link |
| LLMBar | 2024 | 指令 | Princeton | 指令遵循 | 419 个实例 | link |
| AIR-Bench | 2024 | 安全 | Stanford | 监管对齐 | 5,694 | link |
| TrustLLM | 2024 | 通用 | TrustLLM | 可信度 | 30+ | link |
| RewardBench | 2024 | 对齐 | AIAI | 人类偏好 | RewardBench | link |
| EQ-Bench | 2024 | 情感 | Paech | 情商 | 171 个问题 | link |
| Forbidden | 2023 | 安全 | CISPA | 越狱检测 | 15,140 | link |
| MaliciousInstruct | 2023 | 安全 | Princeton | 恶意意图 | 100 | link |
| SycophancyEval | 2023 | 安全 | Anthropic | 观点对齐 | n/a | link |
| DecodingTrust | 2023 | 安全 | UIUC | 可信度 | 243,877 | link |
| AdvBench | 2023 | Safety | CMU | 对抗攻击 | 1,000 | link |
| XSTest | 2023 | Safety | Bocconi | 安全越界 | 450 | link |
| OpinionQA | 2023 | Safety | tatsu-lab | 人口统计对齐 | 1,498 | link |
| SafetyBench | 2023 | Safety | THU | 内容安全 | 11,435 | link |
| HarmfulQA | 2023 | Safety | declare-lab | 有害话题 | 1,960 | link |
| QHarm | 2023 | Safety | vinid | 安全采样 | 100 | link |
| BeaverTails | 2023 | Safety | PKU | 红队测试 | 334,000 | link |
| DoNotAnswer | 2023 | Safety | Libr-AI | 安全机制 | 939 | link |
| AlignBench | 2023 | Alignment | THUDM | 对齐、可靠性 | Various | link |
| IFEval | 2023 | Instruction | 指令遵循 | 500 Prompts | link | |
| ToxiGen | 2022 | Safety | Microsoft | 毒性检测 | 274,000 | link |
| HHH | 2022 | Safety | Anthropic | 人类偏好 | 44,849 | link |
| RedTeam | 2022 | Safety | Anthropic | 红队测试 | 38,921 | link |
| BOLD | 2021 | Bias | Amazon | 生成中的偏见 | 23,679 | link |
| BBQ | 2021 | Bias | NYU | 社会偏见 | 58,492 | link |
| StereoSet | 2020 | Bias | McGill | 刻板印象检测 | 4,229 | link |
| ETHICS | 2020 | Ethics | Berkeley | 道德判断 | 134,400 | link |
| ToxicityPrompt | 2020 | Safety | AllenAI | 毒性评估 | 99,442 | link |
| CrowS-Pairs | 2020 | Bias | NYU | Stereotype Measurement | 1,508 | link |
| SEAT | 2019 | Bias | Princeton | Encoder Bias | n/a | link |
| WinoGender | 2018 | Bias | UMass | Gender Bias | 720 | link |
工具
| Name | Organization | Website | Description |
|---|---|---|---|
| prometheus-eval | prometheus-eval | prometheus-eval | PROMETHEUS 开放评估专用语言模型,比其前代更强大。它能够紧密模拟人类和 GPT-4 的判断。此外,它可以处理直接评估和成对排序两种格式,并可与用户定义的评估标准配合使用。在四个直接评估基准和四个成对排序基准上,PROMETHEUS 2 在所有受测的开源评估语言模型中,与人类评估者和专有语言模型实现了最高的相关性和一致性(2024-05-04)。 |
| athina-evals | athina-ai | athina-ai | Athina-ai 是一个开源库,提供即插即用的预设评估以及用于编写和运行评估的模块化、可扩展框架。它通过评估驱动开发帮助工程师系统性地提高其大型语言模型的可靠性和性能。Athina-ai 提供了一套评估驱动开发系统,克服了传统工作流的局限性,支持快速实验,并提供具有一致指标的自定义评估器。 |
| LeaderboardFinder | Huggingface | LeaderboardFinder | LeaderboardFinder 帮助您为特定场景找到合适的排行榜,是一个排行榜的排行榜(2024-04-02)。 |
| LightEval | Huggingface | lighteval | LightEval 是由 Hugging Face 开发的一个用于评估大型语言模型(LLMs)的轻量级框架。最初,它被设计为内部工具,用于评估 Hugging Face 近期发布的大语言模型数据处理库 datatrove 和大语言模型训练库 nanotron,现已开源供社区使用和改进。LightEval 的主要特性包括:(1) 轻量级设计,易于使用和集成;(2) 支持多种任务和模型的评估套件;(3) 兼容在 CPU 或 GPU 上进行评估,并与 Hugging Face 的加速库(Accelerate)以及 Nanotron 等框架集成;(4) 支持分布式评估,这对于评估大型模型尤为有用;(5) 适用于 Open LLM Leaderboard 上的所有基准测试;以及 (6) 可定制性,允许用户添加新的指标和任务以满足特定的评估需求 (2024-02-08)。 |
| LLM Comparator | LLM Comparator | 一种用于比较和评估大型语言模型(LLMs)的可视化分析工具。与传统的人工评估方法相比,该工具提供了一种可扩展的自动化比较评估方法。它利用另一个 LLM 作为评估器,以展示模型之间的质量差异并提供这些差异的原因。通过交互式表格和摘要可视化,LLM Comparator 帮助用户理解模型在特定情境下表现良好或不佳的原因,以及模型响应之间的定性差异。该工具由 Google 研究人员和工程师合作开发,已在 Google 内部广泛使用,在三个月内(2024-02-16)吸引了超过 400 名用户并评估了超过 1,000 个实验。 | |
| Arthur Bench | Arthur-AI | Arthur Bench | Arthur Bench 是一款旨在比较和分析大语言模型(LLMs)性能的开源评估工具。它支持多种评估任务,包括问答、摘要、翻译和代码生成,并提供关于 LLM 在这些任务中性能的详细报告。Arthur Bench 的主要功能和优势包括:(1) 模型比较,支持评估不同供应商、版本和训练数据集的 LLM;(2) 提示词和超参数评估,评估不同提示词对 LLM 性能的影响,并通过各种超参数设置测试对模型行为的控制;(3) 任务定义和模型选择,允许用户定义特定的评估任务,并从一系列受支持的 LLM 模型中选择评估目标;(4) 参数配置,允许用户调整提示词和超参数以精细控制 LLM 行为;(5) 自动化评估工作流,简化评估任务的执行;以及 (6) 应用场景,如模型选择与验证、预算与隐私优化,以及将学术基准转化为实际性能评估。此外,它提供全面的评分指标,支持本地和云端版本,并鼓励社区协作和项目开发 (2023-10-06)。 |
| llm-benchmarker-suite | FormulaMonks | llm-benchmarker-suite | 该开源项目旨在解决 LLM 基准测试中的碎片化和模糊性问题。该套件提供了一套结构化的方法论、一系列多样化的基准测试以及工具包,以简化 LLM 性能的评估。通过提供一个通用平台,该项目旨在促进 NLP 领域的协作、透明度和高质量研究。 |
| autoevals | braintrust | autoevals | AutoEvals 是一个 AI 模型输出评估工具,利用最佳实践快速轻松地评估 AI 模型输出。它集成了多种自动评估方法,支持自定义评估提示词和自定义评分器,并简化了模型输出的评估流程。Autoevals 针对各种主观任务(包括事实核查、安全性等)采用了模型评分评估。其中许多评估改编自 OpenAI 出色的 evals 项目,但以一种灵活的方式实现,允许用户调整提示词并调试输出。 |
| EVAL | OPENAI | EVAL | EVAL 是 OpenAI 开发的一款用于评估大型语言模型(LLMs)的工具。它可以测试模型在不同任务和数据集上的性能及泛化能力。 |
| lm-evaluation-harness | EleutherAI | lm-evaluation-harness | lm-evaluation-harness 是由 EleutherAI 开发用于评估大型语言模型(LLMs)的工具。它可以测试模型在不同任务和数据集上的性能与泛化能力。 |
| lm-evaluation | AI21Labs | lm-evaluation | 评估并复现 Jurassic-1 技术论文的结果,目前支持通过 AI21 Studio API 和 OpenAI 的 GPT-3 API 运行任务。 |
| OpenCompass | Shanghai AI Lab | OpenCompass | OpenCompass 是一个一站式大模型评估平台。其主要特性包括:开源且可复现的评估方案;覆盖五大领域、包含 50 多个数据集和约 30 万道题目以评估模型能力的全面能力维度;支持 20 多个 Hugging Face 和 API 模型;通过一行代码任务拆分和分布式评估实现分布式高效评估,使万亿参数模型可在数小时内完成全面评估;支持零样本、少样本和思维链评估等多种评估范式,并提供标准或对话式提示模板,以轻松激发模型的峰值性能。 |
| 来自 Phase AI 的大语言模型评估与工作流框架 | wgryc | phasellm | Phase AI 提供的用于评估和管理 LLM 的框架,帮助用户选择合适的模型、数据集和指标,并对结果进行可视化和分析。 |
| LLM 评估基准 | FreedomIntelligence | LLMZoo | LLMZoo 是由 FreedomIntelligence 开发的 LLM 评估基准,包含多个领域和任务的数据集、指标以及带有结果的预训练模型。 |
| 语言模型整体评估(HELM) | Stanford | HELM | HELM 是由斯坦福研究团队提出的 LLM 综合评估方法,考虑了模型语言能力、知识、推理、公平性和安全性等多个方面。 |
| 用于问答的轻量级评估工具 | Langchain | auto-evaluator | auto-evaluator 是由 Langchain 开发的用于评估问答系统的轻量级工具。它可以自动生成问题和答案,并计算模型准确率、召回率和 F1 分数等指标。 |
| PandaLM | WeOpenML | PandaLM | PandaLM 是由 WeOpenML 开发的用于自动化和可复现评估的 LLM 评估工具。它允许用户根据需求和偏好选择合适的数据集、指标和模型,并生成报告和图表。 |
| FlagEval | Tsinghua University | FlagEval | FlagEval 是由清华大学开发的 LLM 评估平台,提供多种任务和数据集,以及在线测试、排行榜和分析功能。 |
| AlpacaEval | tatsu-lab | alpaca_eval | AlpacaEval 是由 tatsu-lab 开发的 LLM 评估工具,能够跨多种语言、领域和任务测试模型,并提供可解释性、鲁棒性和可信度指标。 |
| Prompt flow | Microsoft | promptflow | 由 Microsoft 设计的一套开发工具,旨在简化基于 LLM 的 AI 应用的端到端开发周期,涵盖从构思、原型设计、测试和评估到生产部署和监控的全过程。它使提示工程更加简便,并支持开发产品级 LLM 应用。 |
| DeepEval | mr-gpt | DeepEval | DeepEval 是一个易于使用的开源 LLM 评估框架。类似于 Pytest,但专门用于 LLM 输出的单元测试,它结合最新研究,基于 G-Eval、幻觉、答案相关性、RAGAS 等指标评估 LLM 输出,利用在本地机器上运行的 LLM 及其他多种 NLP 模型进行评估。 |
| CONNER | Tencent AI Lab | CONNER | CONNER 是一个综合性的大模型知识评估框架,旨在从事实性、相关性、连贯性、信息量、有用性和有效性六个关键维度,对生成的信息进行系统且自动化的评估。 |
数据集或基准测试
通用
| Name | Organization | Website | Description |
|---|---|---|---|
| MMLU-Pro | TIGER-AI-Lab | MMLU-Pro | MMLU-Pro 是 MMLU 数据集的改进版本。MMLU 长期以来一直是多项选择题知识数据集的参考标准。然而,近期研究表明,该数据集包含噪声(部分问题无法回答)且过于简单(由于模型能力的演进和污染程度的增加)。MMLU-Pro 提供十个选项而非四个,要求对更多问题进行推理,并经过专家审查以减少噪声。其质量更高,挑战性更强,优于原始版本。MMLU-Pro 减少了提示词变化对模型性能的影响,这是其前身 MMLU 的一个常见问题。研究表明,使用“思维链”推理的模型在该新基准上表现更好,这表明 MMLU-Pro 更适合评估 AI 的细微推理能力。(2024-05-20) |
| TrustLLM 基准 | TrustLLM | TrustLLM | TrustLLM 是一个用于评估大语言模型可信度的基准。它涵盖了可信度的六个维度,并包含超过 30 个数据集,以全面评估 LLM 的功能能力,范围从简单的分类任务到复杂的生成任务。每个数据集都呈现独特的挑战,并已对 16 个主流 LLM(包括商业和开源模型)进行了基准测试。 |
| DyVal | Microsoft | DyVal | 人们已对 LLM 庞大训练语料库中潜在的数据污染问题提出了担忧。此外,当前基准测试的静态性质和固定复杂度可能无法充分衡量 LLM 不断演进的能力。DyVal 是一种用于动态评估 LLM 的通用且灵活的协议。借助有向无环图的优势,DyVal 动态生成具有可控复杂度的评估样本。它已为数学、逻辑推理和算法问题等推理任务创建了具有挑战性的评估集。从 Flan-T5-large 到 GPT-3.5-Turbo 和 GPT-4 的各种 LLM 均已接受评估。实验表明,LLM 在 DyVal 生成的不同复杂度的样本上表现更差,凸显了动态评估的重要性。作者还分析了失败案例以及不同提示方法的结果。此外,DyVal 生成的样本不仅可作为评估集,还有助于通过微调来增强 LLM 在现有基准测试上的性能。(2024-04-20) |
| RewardBench | AIAI | RewardBench | RewardBench 是一个用于语言模型奖励模型的评估基准,旨在评估各种模型的优缺点。它揭示了现有模型在推理和指令遵循方面仍存在显著不足。它包含一个 Leaderboard、Code 和 Dataset (2024-03-20)。 |
| LV-Eval | Infinigence-AI | LVEval | LV-Eval 是一个长文本评估基准,包含五个长度层级(16k、32k、64k、128k 和 256k),最大文本测试长度为 256k。LV-Eval 的平均文本长度为 102,380 个字符,最小/最大文本长度为 11,896/387,406 个字符。LV-Eval 主要由两种类型的评估任务组成:单跳问答和多跳问答,涵盖中文和英文的 11 个子数据集。在其设计过程中,LV-Eval 引入了三项关键技术:混淆事实插入(CFI)以增强挑战性,关键词和短语替换(KPR)以减少信息泄露,以及基于答案关键词(AK)的评估指标(结合答案关键词和词黑名单)以提高评估结果的客观性 (2024-02-06)。 |
| LLM-Uncertainty-Bench | Tencent | LLM-Uncertainty-Bench | 引入了一种新的 LLM 基准方法,纳入了不确定性量化。基于对九个 LLM 在五个代表性 NLP 任务上的测试,发现:I) 更准确的 LLM 可能表现出更低的确定性;II) 更大规模的 LLM 可能比小模型表现出更大的不确定性;III) 指令微调往往会增加 LLM 的不确定性。这些发现强调了在 LLM 评估中包含不确定性的重要性 (2024-01-22)。 |
| Psychometrics Eval | Microsoft Research Asia | Psychometrics Eval | Microsoft Research Asia 提出了一种基于心理测量学的 AI 通用评估方法,旨在解决传统评估方法在预测能力、信息量和测试工具质量方面的局限性。该方法借鉴心理测量学理论,识别 AI 的关键心理构念,设计针对性测试,并应用项目反应理论进行精确评分。它还引入了信度和效度的概念,以确保评估的可靠性和准确性。该框架将心理测量学方法扩展到评估 AI 处理未知复杂任务的表现,但也面临诸如区分 AI“个体”与“群体”、应对提示敏感性以及评估人类与 AI 构念差异等开放性问题 (2023-10-19)。 |
| CommonGen-Eval | AllenAI | CommonGen-Eval | 一项使用 CommonGen-lite 数据集评估 LLM 的研究,采用 GPT-4 进行评估并比较不同模型的性能,结果列于排行榜(2024-01-04)。 |
| felm | HKUST | felm | FELM 是一个用于评估大型语言模型事实评估能力的元基准。该基准包含 847 个问题,涵盖五个不同领域:世界知识、科学/技术、写作/推荐、推理和数学。对应每个领域的提示词从各种来源收集,包括 TruthfulQA 等标准数据集、GitHub 仓库等在线平台、ChatGPT 生成的提示词或作者起草的提示词。对于每个响应,采用片段级别的细粒度注释,包括参考链接、识别出的错误类型以及注释者提供的这些错误背后的原因(2023-10-03)。 |
| just-eval | AI2 Mosaic | just-eval | 一种基于 GPT 的评估工具,用于对 LLM 进行多方面且可解释的评估,能够评估有用性、清晰度、事实性、深度和参与度等方面(2023-12-05)。 |
| EQ-Bench | EQ-Bench | EQ-Bench | 一个用于评估语言模型情商的基准测试,包含 171 个问题(相比 v1 版本的 60 个),并采用新的评分系统,能更好地区分模型之间的性能差异 (2023-12-20)。 |
| CRUXEval | MIT CSAIL | CRUXEval | CRUXEval 是一个用于评估代码推理、理解和执行的基准测试。它包含 800 个 Python 函数及其输入-输出对,测试输入预测和输出预测任务。许多在 HumanEval 上表现良好的模型在 CRUXEval 上表现不佳,凸显了提升代码推理能力的必要性。最佳模型 GPT-4 结合思维链 (CoT),在输入预测和输出预测任务上的 pass@1 得分分别为 75% 和 81%。该基准测试揭示了开源模型与闭源模型之间的差距。GPT-4 未能完全通过 CRUXEval,这为其局限性及改进方向提供了见解 (2024-01-05)。 |
| MLAgentBench | snap-stanford | MLAgentBench | MLAgentBench 是一套用于评估 AI 研究智能体的端到端机器学习(ML)研究任务集。这些智能体旨在基于给定的数据集和 ML 任务描述,自主开发或改进 ML 模型。每个任务都代表一个交互环境,直接反映了人类研究人员所遇到的情况。智能体可以读取可用文件,在计算集群上运行多个实验,并分析结果以实现指定的研究目标。具体而言,它包含 15 个多样化的 ML 工程任务,可以通过尝试不同的 ML 方法、数据处理、架构和训练过程来完成(2023-10-05)。 |
| AlignBench | THUDM | AlignBench | AlignBench 是一个用于评估中文大语言模型对齐性能的综合且多维度的基准测试。它构建了一个人在回路的数据创建过程,以确保数据的动态更新。AlignBench 采用基于规则的多维度模型评估方法(LLM-as-Judge),并结合思维链(CoT)生成对模型响应的多维度分析和最终综合得分,从而增强评估的可靠性和可解释性(2023-12-01)。 |
| UltraEval | OpenBMB | UltraEval | UltraEval 是一个开源的基础模型能力评估框架,提供轻量级且易于使用的评估系统,支持主流大模型的性能评估。其主要特性包括:(1) 轻量级且用户友好的评估框架,设计直观,依赖最少,部署简便,并具有良好的可扩展性以适应各种评估场景;(2) 灵活多样的评估方法,采用统一的提示模板和丰富的评估指标,支持自定义;(3) 高效快速的推理部署,支持多种模型部署方案,包括 torch 和 vLLM,并支持多实例部署以加速评估过程;(4) 透明开放的排行榜,由社区驱动,提供公开可访问、可追溯且可复现的评估结果,以确保透明度;以及 (5) 官方权威的评估数据,使用广泛认可的官方数据集,以保证评估的公平性和标准化,确保结果的可比性和可复现性 (2023-11-24)。 |
| IFEval | google-research | Instruction Following Eval | 遵循自然语言指令是大语言模型的核心能力。然而,对该能力的评价缺乏标准化:人工评估成本高、速度慢且缺乏客观可复现性,而基于 LLM 的自动化评估可能会受到评估者 LLM 能力或局限性的偏见影响。为了解决这些问题,Google 的研究人员推出了 Instruction Following Evaluation (IFEval),这是一个简单且可复现的基准,聚焦于一组“可验证指令”,例如“写超过 400 个字”和“至少提及 AI 关键词 3 次”。IFEval 识别了 25 个此类可验证指令,并构建了大约 500 个提示,每个提示包含一个或多个可验证指令 (2023-11-15)。 |
| LLMBar | princeton-nlp | LLMBar | LLMBar 是一个具有挑战性的元评估基准,旨在测试 LLM 评估者识别遵循指令输出的能力。它包含 419 个实例,每个实例由一个指令和两个输出组成:一个忠实且正确地遵循了该指令,另一个则偏离了该指令。每个实例还包含一个黄金标签,指示哪个输出在客观上更好 (2023-10-29)。 |
| HalluQA | 复旦大学,上海人工智能实验室 | HalluQA | HalluQA 是一个中文大语言模型幻觉评估基准,包含 450 个数据点,其中包括 175 个误导性条目、69 个高难度误导性条目和 206 个基于知识的条目。每个问题平均标注了 2.8 个正确和错误的答案。为了增强 HalluQA 的可用性,作者设计了一种基于 GPT-4 的评估方法。具体而言,将幻觉标准和正确答案作为指令输入 GPT-4,由其评估模型的回答是否包含幻觉。 |
| FMTI | 斯坦福大学 | FMTI | 基础模型透明度指数(FMTI)从数据、计算资源和劳动力等 100 项指标中评估开发者在模型训练和部署过程中的透明度。对 10 家公司旗舰模型的评估显示,平均透明度得分仅为 37/100,表明仍有巨大的改进空间。 |
| ColossalEval | Colossal-AI | ColossalEval | Colossal-AI 的一个项目,提供统一的评估工作流,使用传统指标和 GPT 辅助评估来评估语言模型在公共数据集或自定义数据集上的表现。 |
| LLMEval²-WideDeep | Alibaba Research | LLMEval² | 构建为最大且最具多样性的英语 LLM 评估者评测基准,包含 15 项任务、8 种能力和 2,553 个样本。实验结果表明,更宽的网络(涉及许多评审者)配合两层结构(一轮讨论)表现最佳,将 Kappa 相关系数从 0.28 提升至 0.34。WideDeep 也被用于辅助评估中文 LLM,将评估过程加速 4.6 倍,并降低成本 60%。 |
| Aviary | Ray Project | Aviary | 支持在单一位置与各种大型语言模型(LLM)进行交互。支持直接比较不同模型的输出、按质量进行排名,以及获取成本和延迟估算。它特别支持托管在 Hugging Face 上的模型,并且在许多情况下也支持 DeepSpeed 推理加速。 |
| Do-Not-Answer | Libr-AI | Do-Not-Answer | 一个旨在以低成本评估 LLM 安全机制的开源数据集。它由负责的语言模型不应响应的提示组成。除了人工标注外,它还实现了基于模型的评估,其中经过 6 亿次微调的类 BERT 评估器取得了与人类和 GPT-4 相当的结果。 |
| LucyEval | Oracle | LucyEval | 中文大语言模型成熟度评估——LucyEval 可以客观测试模型能力的各个方面,识别模型不足之处,帮助设计师和工程师更准确地调整和训练模型,助力大语言模型向更高智能迈进。 |
| Zhujiu | 中国科学院自动化研究所 | Zhujiu | 涵盖七个能力维度和 51 项任务;采用三种互补的评估方法;提供全面的中文基准测试及英文评估能力。 |
| ChatEval | THU-NLP | ChatEval | ChatEval 旨在简化生成文本的人工评估过程。针对不同的文本片段,ChatEval 中的角色(由硕士生扮演)可以自主讨论细微差别和差异,并根据其指定角色提供判断。 |
| FlagEval | 智源/清华 | FlagEval | 由智源出品,结合主观和客观评分,提供大语言模型评分排名。 |
| InfoQ 综合大语言模型评估 | InfoQ | InfoQ 评估 | 面向中文的排名:ChatGPT > 文心一言 > Claude > 星火。 |
| 思维链评估 | 姚富 | COT 评估 | 包含 GSM8k 和 MATH 复杂问题的排名。 |
| Z-Bench | 真格基金 | Z-Bench | 表明国内中文模型的可编程性相对较低,模型之间的性能差异极小。ChatGLM 的两个版本显示出显著改进。 |
| CMU 聊天机器人评估 | CMU | zeno-build | 在对话训练场景中,排名显示 ChatGPT > Vicuna > 其他模型。 |
| lmsys-arena | Berkeley | lmsys Ranking | 采用 Elo 评分机制,排名显示 GPT4 > Claude > GPT3.5 > Vicuna > 其他模型。 |
| Huggingface Open LLM Leaderboard | Huggingface | HF Open LLM Leaderboard | 由 Huggingface 组织,该排行榜评估多个主流开源 LLM。评估重点为四个数据集:AI2 Reasoning Challenge、HellaSwag、MMLU 和 TruthfulQA,主要以英语为主。 |
| AlpacaEval | tatsu-lab | AlpacaEval | 开源模型排行榜,基于 LLM 自动评估,Vicuna、OpenChat 和 WizardLM 位居前列。 |
| Chinese-LLM-Benchmark | jeinlee1991 | llm-benchmark | 中文 LLM 能力评估排名,涵盖百度文心一言、ChatGPT、阿里通义千问、科大讯飞星火以及 Belle 和 ChatGLM6B 等开源模型。提供能力得分排名及原始模型输出结果。 |
| Open LLM Leaderboard | HuggingFace | Leaderboard | 由 HuggingFace 组织,评估多个主流开源 LLM。评估主要聚焦于四个数据集:AI2 Reasoning Challenge、HellaSwag、MMLU 和 TruthfulQA,主要以英语为主。 |
| Stanford Question Answering Dataset (SQuAD) | Stanford NLP Group | SQuAD | 评估模型在阅读理解任务上的表现。 |
| 多体裁自然语言推理(MultiNLI) | 纽约大学、DeepMind、Facebook AI Research、Allen Institute for AI、Google AI Language | MultiNLI | 评估模型在不同文本体裁中理解句子关系的能力。 |
| LogiQA | 清华大学和微软亚洲研究院 | LogiQA | 评估模型的逻辑推理能力。 |
| HellaSwag | 华盛顿大学和 Allen Institute for AI | HellaSwag | 评估模型的推理能力。 |
| The LAMBADA Dataset | 特伦托大学和 Bruno Kessler 基金会 | LAMBADA | 评估模型预测段落最后一个单词的能力,反映长期理解能力。 |
| CoQA | 斯坦福 NLP 组 | CoQA | 评估模型在对话场景中理解文本段落并回答一系列相互关联问题的能力。 |
| ParlAI | Facebook AI Research | ParlAI | 评估模型在准确率、F1 分数、困惑度(模型预测序列中下一个单词的能力)、人工评估(相关性、流畅性和连贯性)、速度和资源利用率、鲁棒性(在噪声输入、对抗攻击或数据质量变化等不同条件下的模型性能)以及泛化能力方面的表现。 |
| 语言可解释性工具 (LIT) | LIT | 提供一个平台,用于基于用户定义的指标评估模型,分析模型的优势、劣势以及潜在偏差。 | |
| 对抗性自然语言推理 (ANLI) | Facebook AI Research, New York University, Johns Hopkins University, University of Maryland, Allen Institute for AI | Adversarial NLI (ANLI) | 评估模型的鲁棒性、泛化能力、推理解释能力、一致性以及资源效率(内存使用、推理时间和训练时间)。 |
领域
| 名称 | 机构 | 领域 | 网址 | 简介 |
|---|---|---|---|---|
| Seismometer | Epic | 医疗保健 | seismomete | Seismometer 是一款面向医疗保健领域的 AI 模型性能评估工具,提供标准化评估标准,帮助基于本地数据和工作流做出决策。它支持对模型性能进行持续监控。尽管可用于任何领域的模型,但其设计重点在于医疗保健 AI 模型的验证,因为本地验证需要交叉参考患者数据(如人口统计信息、临床干预措施和患者结局)与模型性能。 (2024-05-22) |
| Medbench | OpenMEDLab | Healthcare | medbench | MedBench 致力于为中国医疗大模型构建科学、公平、严谨的评测体系与开放平台。基于权威医学标准,持续更新并维护高质量医学数据集,以全面、多维度地量化模型在各医学维度的能力。MedBench 包含 40,041 道题目,源自真实考试习题及多科室医学报告。其由四个核心部分组成:中国医师资格考试、住院医师规范化培训考试、主治医师资格考试,以及涵盖检查、诊断与治疗的真实临床病例。(2023-12-20) |
| Fin-Eva | 蚂蚁集团,上海财经大学 | 金融 | Fin-Eva | Fin-Eva 1.0 版本由蚂蚁集团和上海财经大学联合发布,涵盖财富管理、保险、投资研究等多个金融场景以及金融专业学科,共计超过 13,000 道评估题目。蚂蚁的数据来源包括各业务领域的数据和公开互联网数据。经过数据脱敏、文本聚类、语料筛选和数据改写等流程后,结合金融专家的评审构建数据集。上海财经大学的数据来源主要基于相关领域权威考试的真题和模拟题,遵循知识大纲的要求。蚂蚁部分涵盖金融认知、金融知识、金融逻辑、内容生成和安全合规五大能力,包含 33 个子维度和 8,445 道评估题目;上海财经大学部分涵盖金融、经济、会计和证书四大领域,包括 34 个不同学科的 4,661 道题目。Fin-Eva 1.0 版本采用固定答案的选择题,并配有相应的指令,使模型能够以标准格式输出(2023-12-20) |
| GenMedicalEval | SJTU | Healthcare | GenMedicalEval | 1. 大规模综合性能评估:GenMedicalEval 构建了总计超过 100,000 条医疗评估数据,涵盖 16 个主要科室、3 个医生培训阶段、6 个医疗临床应用场景,基于来自顶级医院的超过 40,000 道医学考试真题和超过 55,000 份患者病历。该数据集从医学基础知识、临床应用和安全标准等方面,全面评估大模型在真实医疗复杂场景中的整体性能,弥补了现有评估基准未能覆盖医疗实践中许多实际挑战的不足。 2. 深入的多维度场景评估:GenMedicalEval 整合了医生的临床笔记和医学影像资料,围绕检查、诊断和治疗等关键医疗场景,构建了一系列多样化且主题丰富的生成式评估问题。这为模拟真实临床环境的开放式诊断过程提供了对现有基于问答的评估的有力补充。 3. 创新的开放式评估指标和自动化评估模型:为了解决开放式生成任务缺乏有效评估指标的挑战,GenMedicalEval 采用先进的结构化提取和术语对齐技术,构建了一种创新的生成式评估指标体系。该系统能够准确衡量生成答案的医学知识准确性。此外,它基于自建知识库训练了一个医学自动评估模型,该模型与人工评估具有高度相关性。该模型提供多维度的医学评分及评估理由。其特点包括无数据泄露且可控,相较于 GPT-4 (2023-12-08) 等其他模型具有独特优势 |
| OpenFinData | 上海人工智能实验室 | 金融 | OpenFinData | OpenFinData 是由上海人工智能实验室发布的基于 "OpenCompass" 框架的首个全场景金融评测数据集,包含六个模块和十九个金融任务维度,覆盖多层次数据类型和多样化金融场景。每条数据均源自实际金融业务场景 (2024-01-04) |
| LAiW | 四川大学 | 法律 | LAiW | 从法律视角和可行性出发,LAiW 将法律 NLP 能力划分为三大能力,共计 13 个基础任务:(1) 法律 NLP 基础能力:评估法律基础任务、NLP 基础任务和法律信息提取的能力,包括法律条款推荐、要素识别、命名实体识别、司法要点摘要和案件识别,共五个基础任务;(2) 法律基础应用能力:评估大模型在法律领域的基础应用能力,包括争议焦点挖掘、案例匹配、刑事判决预测、民事判决预测和法律问答,共五个基础任务;(3) 法律复杂应用能力:评估大模型在法律领域的复杂应用能力,包括司法推理生成、案件理解和法律咨询,共三个基础任务 (2023-10-08) |
| LawBench | 南京大学 | 法律 | LawBench | LawBench 经过精心设计,旨在精确评估大语言模型的法律能力。在设计测试任务时,它模拟了司法认知的三个维度,并选取了 20 项任务来评估大模型的能力。与仅包含多项选择题的某些现有基准相比,LawBench 包含了更多与真实世界应用紧密相关的任务类型,例如法律实体识别、阅读理解、犯罪金额计算和咨询。LawBench 认识到,当前大模型的安全策略可能导致模型拒绝回答某些法律查询或在理解指令时遇到困难,从而导致缺乏回应。因此,LawBench 开发了一项独立的评估指标——“弃权率”,以衡量模型拒绝提供答案或未能正确理解指令的频率。研究人员在 LawBench 上评估了 51 个大语言模型的性能,其中包括 20 个多语言模型、22 个中文模型和 9 个法律专用大语言模型(2023-09-28) |
| PsyEval | SJTU | Psychological | PsyEval | 在心理健康研究中,大语言模型(LLMs)的使用正受到越来越多的关注,尤其是它们在疾病检测方面的显著能力。研究人员定制设计了首个针对心理健康领域的全面基准,以系统评估 LLMs 在该领域的能力。该基准包含覆盖三个维度的六个子任务,以全面评估 LLMs 在心理健康方面的能力。已为每个子任务设计了相应的简洁提示词,并对八个先进的大语言模型进行了全面评估(2023-11-15) |
| PPTC | Microsoft, PKU | Office | PPTC | PPTC 是一个用于测试大模型在 PPT 生成方面能力的基准,包含 279 个涵盖不同主题的多轮对话以及涉及多模态操作的数百条指令。研究团队还提出了 PPTX-Match 评估系统,该系统基于预测文件而非标签 API 序列来评估大语言模型是否已完成指令。因此,它支持各种由 LLM 生成的 API 序列。目前,PPT 生成面临三个主要挑战:多轮对话中的错误累积、处理长 PPT 模板以及多模态感知问题(2023-11-04) |
| LLMRec | Alibaba | Recommendation | LLMRec | 已对主流 LLM(如 ChatGPT、LLaMA、ChatGLM 等)在五个推荐相关任务上进行了基准测试,包括评分预测、序列推荐、直接推荐、解释生成和评论摘要。此外,还研究了监督微调在增强 LLM 指令遵循能力方面的有效性 (2023-10-08) |
| LAiW | Dai-shen | Legal | LAiW | 针对法律大语言模型的快速发展,提出了首个基于法律能力的中文法律大语言模型基准。法律能力分为三个层级:基础法律自然语言处理能力、基础法律应用能力和复杂法律应用能力。第一阶段评估已完成,重点评估基础法律自然语言处理能力。评估结果显示,尽管某些法律大语言模型的表现优于其基础模型,但与 ChatGPT 相比仍存在差距 (2023-10-25) |
| OpsEval | Tsinghua University | AIOps | OpsEval | OpsEval 是一个面向大型语言模型的综合任务导向型 AIOps 基准测试,评估 LLM 在三个关键场景中的熟练程度:有线网络运维、5G 通信运维和数据库运维。这些场景涉及不同的能力层级,包括知识回忆、分析思维和实际应用。该基准包含 7,200 道选择题和问答题,支持英语和中文(2023-10-02) |
| SWE-bench | princeton-nlp | Software | SWE-bench | SWE-bench 是一个用于评估大型语言模型在从 GitHub 收集的真实软件问题上表现的基准。给定一个代码仓库和一个问题,语言模型的任务是生成一个可以解决所描述问题的补丁 |
| BLURB | Mindrank AI | Healthcare | BLURB | BLURB 包含一个基于 PubMed 的生物医学自然语言处理应用综合基准测试,以及一个用于跟踪社区进展的排行榜。BLURB 由六个多样化的任务和十三个公开可用的数据集组成。为避免过度强调拥有大量可用数据集的任务(例如命名实体识别 NER),BLURB 报告所有任务的宏平均值作为主要分数。BLURB 排行榜与模型无关;任何能够使用相同的训练和开发数据生成测试预测的系统都可以参与。BLURB 的主要目标是降低参与生物医学自然语言处理的门槛,并帮助加速这一对社会和人类产生积极影响的重要领域的进展 |
| SmartPlay | microsoft | Gaming | SmartPlay | SmartPlay 是一个为易用性而设计的大型语言模型(LLM)基准,提供多种游戏用于测试 |
| FinEval | SUFE-AIFLM-Lab | Finance | FinEval | FinEval:一个涵盖金融、经济、会计和证书等领域的高质量选择题集合 |
| GSM8K | OpenAI | Mathematics | GSM8K | GSM8K 是一个包含 8.5K 个高质量、语言多样化的 elementary school 数学应用题的数据集。GSM8K 将其划分为 7.5K 个训练问题和 1K 个测试问题。这些问题需要 2 到 8 个步骤来解决,解决方案主要涉及执行一系列基本算术运算(+ - / *)以得出最终答案 |
RAG-评估
| 名称 | 机构 | URL | 简介 |
|---|---|---|---|
| BERGEN | NAVER | BERGEN | BERGEN:一个专注于问答(QA)的 RAG 系统基准测试库,旨在增强对 RAG 管道中各组件影响的理解与比较。它通过 HuggingFace 简化了新数据集和模型的可复现性与集成。BERGEN(BEnchmarking Retrieval-augmented GENeration)是一个用于基准测试 RAG 系统的库,专注于问答(QA)。不一致的基准测试在比较方法以及理解 RAG 管道中各组件的影响方面构成了主要挑战。BERGEN 旨在借助 HuggingFace 简化新数据集和模型的可复现性与集成(2024-05-31) |
| CRAG | Meta Reality Labs | CRAG | CRAG 是一个 RAG 基准,包含近 4,500 个 QA 对和模拟 API,涵盖广泛的领域和问题类型,以激励研究人员提高 QA 系统的可靠性和准确性。它是一个包含 4,409 个问答对和模拟 API 的事实性问答基准,用于模拟网络搜索和知识图谱(KG)搜索。CRAG 旨在涵盖五个领域和八个问题类别中的多样化问题,反映从热门到长尾的实体流行度差异,以及从年到秒的时间动态变化(2024-06-07) |
| raga-llm-hub | RAGA-AI | raga-llm-hub | raga-llm-hub 是一个用于语言和学习模型(LLMs)的综合评估工具包。凭借 100 多项精心设计的评估指标,它是最全面的平台,使开发者和组织能够有效评估和比较 LLMs,并为 LLM 和检索增强生成(RAG)应用建立基本的安全保障。这些测试评估了相关性和理解力、内容质量、幻觉、安全性和偏见、上下文相关性、保障措施以及漏洞扫描等多个方面,同时提供了一系列基于指标的测试以进行定量分析(2024-03-10) |
| ARES | Stanford | ARES | ARES 是一个用于检索增强生成系统的自动评估框架,由三个组件组成:(1) 一组带有标注的查询-文档-答案三元组,用于对上下文相关性、答案忠实度和/或答案相关性等评估标准进行人工偏好验证。至少应有 50 个示例,但最好有数百个。(2) 一小部分用于对系统中上下文相关性、答案忠实度和/或答案相关性进行评分的示例。(3) 大量由您的 RAG 系统生成的未标注查询-文档-答案三元组,用于评分。ARES 的训练过程包括三个步骤:(1) 从特定领域的段落中生成合成查询和答案。(2) 微调 LLM 评估器 |