AI 评测
Promptfoo 提示词测试
⭐ 25k+ GitHub Stars
测试和评估 LLM 输出及提示词质量
DeepEval LLM 单元测试
⭐ 18k+ GitHub Stars
LLM 输出和 RAG 管线的单元测试框架
Ragas RAG 评估
⭐ 15k+ GitHub Stars
RAG 管线的评估框架
LM 评估框架
⭐ 14k+ GitHub Stars
NLP 任务上评估语言模型的标准框架
Phoenix AI 可观测
⭐ 11k+ GitHub Stars
LLM 追踪与评估的 AI 可观测平台
Evidently 模型监控
⭐ 7.8k+ GitHub Stars
机器学习与 LLM 监控和评估平台
ToolBench 工具调用基准
⭐ 5.7k+ GitHub Stars
训练和评估 LLM 使用 16000+ API 工具的基准
AgentBench 智能体评测
⭐ 3.7k+ GitHub Stars
评估 LLM 作为自主智能体能力的基准
TruLens LLM 追踪评估
⭐ 3.5k+ GitHub Stars
LLM 应用的评估和追踪框架
OSWorld 操作系统基准
⭐ 3.1k+ GitHub Stars
评估 AI 智能体完成电脑任务的基准
PromptTools 提示词测试
⭐ 3.0k+ GitHub Stars
提示词测试和实验的开源工具集
ChainForge 提示词对比
⭐ 3.0k+ GitHub Stars
批量测试 LLM 提示词和链的可视化工具
WebArena 网页任务基准
⭐ 1.6k+ GitHub Stars
评估网页导航智能体的真实基准
AI 模型评测工具:13 个开源评估框架:常见问题
AI模型评测有哪些推荐的?
本页收录的 13 个项目都是开源免费方案,可按 GitHub 星标排序挑选,或者按你的具体场景选合适的。