EvalScope 安装与使用说明
EvalScope 安装与使用说明一、项目简介EvalScope 是由魔搭社区ModelScope打造的一站式大模型评测框架支持全面的评测基准内置 MMLU、C-Eval、GSM8K 等 200 评测基准多模态支持LLM、VLM、Embedding、Reranker、AIGC 等推理性能测试TTFT、TPOT、吞吐量等指标交互式报告WebUI 可视化界面支持多维度模型对比二、安装步骤2.1 环境要求Python 3.10Windows / Linux / macOSGPU 环境推荐用于本地模型评测2.2 创建虚拟环境# 创建虚拟环境python-mvenv venv# 激活虚拟环境Windows PowerShell.\venv\Scripts\Activate.ps1# 激活虚拟环境Linux/macOSsourcevenv/bin/activate2.3 安装依赖# 切换到 evalscope 源码目录cdevalscope# 安装核心依赖使用清华镜像加速pipinstall-rrequirements/framework.txt-ihttps://pypi.tuna.tsinghua.edu.cn/simple --prefer-binary# 安装额外依赖可选pipinstalltorch accelerate-ihttps://pypi.tuna.tsinghua.edu.cn/simple --prefer-binary2.4 配置项目路径重要由于 editable install 模式在 Windows 下存在 namespace package 问题需要通过.pth文件配置# 创建 .pth 文件指向项目源码目录echoE:\project\evalscope\evalscopeE:\project\evalscope\venv\Lib\site-packages\evalscope.pth2.5 验证安装# 验证模块路径应输出 __init__.py 的路径而非 Nonepython-cimport evalscope; print(evalscope.__file__)# 验证注册表所有数值应大于 0python-cimport evalscope; from evalscope.api.registry import BENCHMARK_REGISTRY, MODEL_APIS, METRIC_REGISTRY, AGGREGATION_REGISTRY; print(Benchmarks:, len(BENCHMARK_REGISTRY), Model APIs:, len(MODEL_APIS), Metrics:, len(METRIC_REGISTRY), Aggregators:, len(AGGREGATION_REGISTRY))三、快速开始3.1 方式一命令行评测# 评测本地模型自动从 ModelScope 下载evalscopeeval\--modelQwen/Qwen2.5-0.5B-Instruct\--datasetsgsm8k arc\--limit5# 评测 OpenAI API 兼容的在线模型evalscopeeval\--modelyour-model-name\--api-url$OPENAI_API_BASE_URL\--api-key$OPENAI_API_KEY\--eval-type openai_api\--datasetsgsm8k\--limit53.2 方式二Python 代码创建demo1.pyfromevalscope.runimportrun_task task_cfg{model:Qwen/Qwen2.5-0.5B-Instruct,datasets:[gsm8k,arc],limit:5}run_task(task_cfgtask_cfg)运行python demo1.py E:\project\evalscope\venv\Scripts\python.exe E:\project\evalscope\demo1.py3.3 方式三配置文件创建config.yamlmodel:Qwen/Qwen2.5-0.5B-Instructmodel_args:revision:masterprecision:torch.float16datasets:-gsm8k-arcgeneration_config:max_tokens:2048temperature:0.7limit:5运行python-cfrom evalscope.run import run_task; run_task(task_cfgconfig.yaml)四、配置说明4.1 核心参数参数说明默认值model模型名称ModelScope 或 HuggingFace 地址无datasets评测数据集列表如[gsm8k, arc, mmlu]无limit每个数据集评测样本数用于快速测试无eval_type评测类型llm_ckpt本地模型、openai_apiAPI 模型llm_ckptwork_dir输出目录./outputs/{timestamp}4.2 模型参数task_cfg{model:Qwen/Qwen2.5-0.5B-Instruct,model_args:{revision:master,precision:torch.float16,device_map:auto},generation_config:{max_tokens:2048,temperature:0.7,top_p:0.95,do_sample:False}}4.3 数据集参数task_cfg{dataset_args:{gsm8k:{few_shot_num:4,few_shot_random:False,subset_list:[main]}}}五、支持的数据集5.1 LLM 基准部分数据集类型描述gsm8k数学推理Grade School Math 8Karc科学问答AI2 Reasoning Challengemmlu多任务Massive Multitask Language Understandingceval中文评测Chinese Evaltruthful_qa真实性Truthful QAhumaneval代码生成HumanEval Code5.2 VLM 基准部分数据集类型描述mmmu多模态MMMU Benchmarkai2d图表理解AI2D Diagram Understandingmathvista数学视觉MathVistavqav2视觉问答VQA v2.05.3 查看全部支持的数据集python-cimport evalscope; from evalscope.api.registry import BENCHMARK_REGISTRY; print(sorted(BENCHMARK_REGISTRY.keys()))六、评测结果6.1 输出目录结构outputs/20260728_100401/ ├── configs/ │ └── task_config.yaml # 任务配置 ├── reports/ │ ├── Qwen2.5-0.5B-Instruct/ │ │ ├── gsm8k.json # 数据集报告 │ │ └── arc.json │ └── report.html # 可视化 HTML 报告 └── predictions/ └── Qwen2.5-0.5B-Instruct/ └── gsm8k_main_preds.json # 预测结果6.2 示例输出gsm8k report table: ┌───────────────────────┬───────────┬──────────┬──────────┬───────┬─────────┬─────────┐ │ Model │ Dataset │ Metric │ Subset │ Num │ Score │ Cat.0 │ ├───────────────────────┼───────────┼──────────┼──────────┼───────┼─────────┼─────────┤ │ Qwen2.5-0.5B-Instruct │ gsm8k │ mean_acc │ main │ 5 │ 0.4 │ default │ └───────────────────────┴───────────┴──────────┴──────────┴───────┴─────────┴─────────┘6.3 启动可视化服务# 安装服务依赖pipinstallevalscope[service]# 启动服务evalscopeservice访问http://127.0.0.1:9000查看可视化报告。七、常见问题Q1: Benchmark ‘gsm8k’ not found原因evalscope/__init__.py未被执行导致注册表为空。解决方案使用.pth文件配置方式详见 2.4 节。Q2: litellm 安装失败缺少 Rust解决方案使用预编译版本pipinstalllitellm1.55.0 --prefer-binary-ihttps://pypi.tuna.tsinghua.edu.cn/simpleQ3: editdistance 编译错误解决方案安装预编译替代包pipinstalleditdistance-sQ4: 模型下载速度慢解决方案配置 ModelScope 镜像pipinstallmodelscope-ihttps://pypi.tuna.tsinghua.edu.cn/simple设置环境变量exportMODEL_SCOPE_ENDPOINThttps://www.modelscope.cnQ5: CUDA 内存不足解决方案task_cfg{model_args:{device_map:auto,load_in_4bit:True# 或 load_in_8bit}}八、进阶功能8.1 性能压测# 单模型性能测试evalscope perf--modelQwen/Qwen2.5-0.5B-Instruct--concurrency124# 多模型对比evalscope perf--modelQwen/Qwen2.5-0.5B-Instruct Qwen/Qwen2.5-7B-Instruct8.2 竞技场模式模型对战evalscope arena\--model-list Qwen/Qwen2.5-0.5B-Instruct Qwen/Qwen2.5-7B-Instruct\--datasetsgsm8k\--limit108.3 Agent 评测evalscopeeval\--modelQwen/Qwen2.5-0.5B-Instruct\--datasetsgsm8k\--agent-config{strategy: function_calling}\--limit5九、参考文档官方文档支持的数据集列表参数说明自定义数据集指南十、项目结构evalscope/ ├── evalscope/ # 核心代码 │ ├── benchmarks/ # 评测基准适配器 │ ├── models/ # 模型 API 接口 │ ├── metrics/ # 评测指标 │ ├── evaluator/ # 评测执行器 │ ├── report/ # 报告生成 │ ├── run.py # 主入口 │ └── config.py # 配置管理 ├── requirements/ # 依赖文件 ├── docs/ # 文档 ├── tests/ # 测试 └── pyproject.toml # 项目配置

相关新闻

为什么你的AI模型在PDB数据上准确率92%,却在真实先导化合物优化中全军覆没?(药化专家闭门复盘实录)

为什么你的AI模型在PDB数据上准确率92%,却在真实先导化合物优化中全军覆没?(药化专家闭门复盘实录)

更多请点击: https://kaifayun.com 第一章:为什么你的AI模型在PDB数据上准确率92%,却在真实先导化合物优化中全军覆没?(药化专家闭门复盘实录) 幻觉精度的根源:PDB ≠ 药物化学现实 PDB结构数…

2026/7/29 19:12:18阅读更多 →
[特殊字符] OpenClaw(Clawd)完整安装教程:从零搭建你的专属 AI 助手

[特殊字符] OpenClaw(Clawd)完整安装教程:从零搭建你的专属 AI 助手

前言 最近有个开源 AI 助手彻底火出圈了——OpenClaw(曾用名 ClawdBot / Moltbot)。截至 2026 年 1 月,它的 GitHub 星数飙到 4.2 万,fork 数超 5800,全球有 1200 多名开发者主动参与贡献,单日最高新增 2.…

2026/7/29 19:12:18阅读更多 →
大型前端项目的目录结构演进:从 feature-based 到 domain-driven 的架构变迁

大型前端项目的目录结构演进:从 feature-based 到 domain-driven 的架构变迁

大型前端项目的目录结构演进:从 feature-based 到 domain-driven 的架构变迁 目录结构是前端架构的物理映射。一个混乱的目录结构意味着混乱的模块边界、混乱的依赖关系、混乱的团队分工。本文梳理三个阶段的目录结构演进路径,从传统的 type-based 到 fe…

2026/7/29 19:12:18阅读更多 →
Cindy安全与隐私保护:开源AI助手如何保障你的数据安全

Cindy安全与隐私保护:开源AI助手如何保障你的数据安全

Cindy安全与隐私保护:开源AI助手如何保障你的数据安全 【免费下载链接】cindy Consider it done. The open-source AI agent that works out of the box 想到,就能做到。开源、开箱即用的 AI Agent。 项目地址: https://gitcode.com/gh_mirrors/cind/…

2026/7/29 22:50:40阅读更多 →
多品种、小批量农业机械生产,首件检验如何更快完成?

多品种、小批量农业机械生产,首件检验如何更快完成?

多型号农业机械提高首件检验效率的关键,是把每个型号的CAD模型、检查位置和检验步骤预先固化为数字化检查项目,首件下线后直接在生产现场完成CAD与实物比对,再将关键尺寸和疑点位置转入精密测量。安宝特拓影农业机械AR视觉质检方案基于Visome…

2026/7/29 22:50:40阅读更多 →
Prometheus数据模型详解:掌握多维度指标监控的秘诀

Prometheus数据模型详解:掌握多维度指标监控的秘诀

Prometheus数据模型详解:掌握多维度指标监控的秘诀 【免费下载链接】docs Prometheus documentation: content and static site generator 项目地址: https://gitcode.com/gh_mirrors/docs21/docs Prometheus作为开源监控系统的佼佼者,其核心优势…

2026/7/29 22:50:40阅读更多 →
TediCross新手入门:5分钟快速部署跨平台聊天机器人

TediCross新手入门:5分钟快速部署跨平台聊天机器人

TediCross新手入门:5分钟快速部署跨平台聊天机器人 【免费下载链接】TediCross Bot which bridges Telegram chats with Discord channels 项目地址: https://gitcode.com/gh_mirrors/te/TediCross TediCross是一款强大的跨平台聊天机器人,能够无…

2026/7/29 22:50:40阅读更多 →
SmoothLife中的卷积核与傅里叶变换:让模拟速度提升100倍的关键技术

SmoothLife中的卷积核与傅里叶变换:让模拟速度提升100倍的关键技术

SmoothLife中的卷积核与傅里叶变换:让模拟速度提升100倍的关键技术 【免费下载链接】SmoothLife Continuous Domain Game of Life in Python with Numpy 项目地址: https://gitcode.com/gh_mirrors/smo/SmoothLife SmoothLife是一个基于Python和Numpy实现的连…

2026/7/29 22:50:40阅读更多 →
React Styleguide Generator高级技巧:使用选项卡展示多个组件示例

React Styleguide Generator高级技巧:使用选项卡展示多个组件示例

React Styleguide Generator高级技巧:使用选项卡展示多个组件示例 【免费下载链接】react-styleguide-generator Easily generate a good-looking styleguide by adding some documentation to your React project. 项目地址: https://gitcode.com/gh_mirrors/re/…

2026/7/29 22:48:40阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/29 9:47:45阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/29 7:00:19阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/29 7:58:51阅读更多 →
28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“! 在构建复杂的 Agent 系统时,我们经常会遇到这样的场景:Agent 正在执行一个多步骤的任务,比如“下单购买商品”,但执行到一半时,我们…

2026/7/29 0:01:46阅读更多 →
自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

近日,国际专注开放式技术研发的声学品牌Nank南卡,正式官宣实力艺人曾舜晞担任品牌代言人。消息一经发出便轰动全网。为什么耳机品牌不选择流量明星、老牌歌手?而且是选择曾舜晞?让我们一起来探索一下!比起短期的流量&a…

2026/7/29 0:01:46阅读更多 →
【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:01:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/28 20:22:24阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/29 4:31:51阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/29 14:26:42阅读更多 →