全网最全面的 DeepEval从入门到精通教程 - DeepEval 5分钟快速入门
文章目录DeepEval 5分钟快速入门安装创建您的首次测试运行DeepEval 5分钟快速入门本快速入门指南将引导您在几分钟内完成从安装 DeepEval 到首次成功评估的整个过程。您将创建一个小型测试用例选择一个指标然后运行它deepeval test run。完成本快速入门指南后您应该能够使用测试用例、指标和deepeval test run.当您想要评估人工智能代理或其内部组件时请添加跟踪功能。了解数据集、合成数据、集成和 Confident AI 平台的下一步发展方向。安装在新建的虚拟环境中运行pip install -U deepevaldeepevalDeepEval会在本地环境中运行评估。要将测试报告集中存储在云端请使用 Confident AI 这是一个 AI 质量平台具备可观测性、评估和监控功能DeepEval 可与其原生集成deepeval login您的浏览器仅负责身份验证。登录或创建帐户后请返回终端输入您的姓名和组织确认预填的初始项目名称或选择您现有的项目之一。DeepEval 会自动创建并保存一个专用的项目 API 密钥。对于 CI 或其他非交互式环境请传递一个现有的密钥deepeval login --api-key ...。配置环境变量DeepEval 会自动加载环境文件在导入时优先级现有进程环境 -.env.local-.env选择退出设置DEEPEVAL_DISABLE_DOTENV1更多env设置信息请点击 此处查看。# quickstart cp .env.example .env.local # then edit .env.local (ignored by git)创建您的首次测试运行创建一个测试文件来运行你的第一个端到端评估。fromdeepevalimportassert_testfromdeepeval.modelsimportOllamaModelfromdeepeval.test_caseimportLLMTestCase,SingleTurnParamsfromdeepeval.metricsimportAnswerRelevancyMetric,GEval# 使用本地 Ollama 模型进行评估llm_modelOllamaModel(modelqwen3:0.6b)deftest_correctness():test_caseLLMTestCase(inputWhat is your return policy?,actual_outputYoure eligible for a free full refund within 30 days of purchase.,expected_outputYoure eligible for a free full refund within 30 days of purchase.,)answer_relevancy_metricAnswerRelevancyMetric(threshold0.5,modelllm_model,)correctness_metricGEval(nameCorrectness,criteriaDetermine if the actual output is correct based on the expected output.,evaluation_params[SingleTurnParams.ACTUAL_OUTPUT,SingleTurnParams.EXPECTED_OUTPUT,],modelllm_model,)assert_test(test_case,[answer_relevancy_metric,correctness_metric])执行结果(2 durations 0.005s hidden.Use-vv to show these durations.)1 passed,3 warnings in 12.37s Test Results ┏━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━┳━━━━━━━━━━━━━━━━━━━━━┳━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━┳━━━━━━━━┳━━━━━━━━━━━━━━━━━━━━━━┓ ┃ Test case ┃ Metric ┃ Score ┃ Status ┃ Overall Success Rate ┃ ┡━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━╇━━━━━━━━━━━━━━━━━━━━━╇━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━╇━━━━━━━━╇━━━━━━━━━━━━━━━━━━━━━━┩ │ test_correctness │ │ │ │ 100.0% │ │ │ Answer Relevancy │ 0.67(threshold0.5,evaluation modelqwen3:0.6b(Ollama),reasonThe score is 0.67 │ PASSED │ │ │ │ │ because there is one irrelevant statement in the actual output that does not address │ │ │ │ │ │ the input question aboutreturnpolicy.,errorNone)│ │ │ │ │ Correctness[GEval]│ 1.0(threshold0.5,evaluation modelqwen3:0.6b(Ollama),reasonThe output matches │ PASSED │ │ │ │ │ the expected output exactly in content and structure.No errors or inconsistencies │ │ │ │ │ │ were found,and there are no additional details present.The score is 10 as it │ │ │ │ │ │ reflects strong alignment with the evaluation steps.,errorNone)│ │ │ │ Note: Use Confident AI with DeepEval to analyze failed test casesformore details │ │ │ │ │ └────────────────────────────────────────────────────────────────────────────────────┴─────────────────────┴──────────────────────────────────────────────────────────────────────────────────────┴────────┴──────────────────────┘ ⚠ WARNING: No hyperparameters logged.» Log hyperparameters to attribute prompts and models to your test runs. ✓ Evaluation completed !(time taken: 12.58s|token cost: None)» Test Results(1 total tests): » Pass Rate: 100.0%|Passed: 1|Failed: 0 » Want to share evals with your team,or a placeforyour test cases to live? ❤️ » Rundeepeval viewto analyze and save testing results on Confident AI.恭喜您的测试用例应该已经通过✅ 让我们来分析一下发生了什么。input 模拟用户输入actual_output 是应用程序根据此输入应输出内容的占位符。expected_output 代表给定的理想答案inputGEval是由提供的研究支持的指标deepeval用于以类似人类的准确度评估 LLM 输出的任何自定义指标。在这个例子中指标是基于所提供的criteria数据的正确性但并非所有指标都需要数据。actual_outputexpected_outputexpected_output所有指标分数范围为 0 - 1阈threshold0.5值最终决定你的测试是否通过。

相关新闻

2026-07-26:将数组转换为交替质数数组的最少操作次数。用go语言,给定一个整数数组 `nums`,你需要通过最少的操作次数,把它变成满足特定规律的数组。 规律是: - 数组中所有索引为偶数的位

2026-07-26:将数组转换为交替质数数组的最少操作次数。用go语言,给定一个整数数组 `nums`,你需要通过最少的操作次数,把它变成满足特定规律的数组。 规律是: - 数组中所有索引为偶数的位

2026-07-26:将数组转换为交替质数数组的最少操作次数。用go语言,给定一个整数数组 nums,你需要通过最少的操作次数,把它变成满足特定规律的数组。 规律是:数组中所有索引为偶数的位置,最终的值必须是质数。…

2026/7/26 2:29:52阅读更多 →
TI MibSPI DMA配置详解:从寄存器解析到实战调试

TI MibSPI DMA配置详解:从寄存器解析到实战调试

1. 项目概述与核心价值在嵌入式开发,尤其是基于TI Hercules或C2000系列MCU的项目中,处理高速、连续的SPI数据流是个绕不开的挑战。想象一下,你的系统需要从多个传感器通过SPI轮询数据,或者向一个高分辨率显示屏持续刷新帧缓存&…

2026/7/26 2:29:52阅读更多 →
人已经用 WorkBuddy 找工作拿了面试,你还在一份份手工改简历

人已经用 WorkBuddy 找工作拿了面试,你还在一份份手工改简历

文章目录别人已经用 WorkBuddy 找工作拿了面试,你还在一份份手工改简历1\. 先别急着投,看看自己到底适合什么2\. 岗位太多,不要再一页页刷3\. 简历不是写得漂亮,是让对方看见你能干什么4\. 投得一多,先做张表救命5\. 面…

2026/7/26 2:29:52阅读更多 →
DeepSeek R1训练框架解析与工程实践

DeepSeek R1训练框架解析与工程实践

1. DeepSeek R1 训练框架深度解析去年初DeepSeek R1论文在《Nature》发表时,业内普遍认为这只是一个阶段性成果展示。没想到时隔一年,团队竟然将原本22页的论文扩充至86页,完整披露了从模型架构到训练细节的全套技术方案。这种开放程度在业界…

2026/7/26 8:45:01阅读更多 →
BFO算法优化BP神经网络的风电功率预测方法

BFO算法优化BP神经网络的风电功率预测方法

1. 风电功率预测与BP神经网络优化背景风电功率预测是新能源领域的关键技术之一。准确预测风电功率对于电网调度、电力市场交易和风电场运营都具有重要意义。然而,风电功率受风速、风向、温度等多种因素影响,具有高度非线性和随机性特征,这使得…

2026/7/26 8:45:01阅读更多 →
宏智树AI写作平台:论文全周期智能解决方案实测

宏智树AI写作平台:论文全周期智能解决方案实测

1. 学术写作工具的革命性升级作为一名经历过本科、硕士到博士论文折磨的过来人,我深知学术写作过程中选题迷茫、文献混乱、格式崩溃的痛苦。直到上个月实验室师弟推荐了宏智树AI写作平台,实测三周后彻底颠覆了我对学术辅助工具的认知——这可能是目前唯一…

2026/7/26 8:45:01阅读更多 →
C++实现Windows自动化脚本:keybd_event与SendMessage原理与应用

C++实现Windows自动化脚本:keybd_event与SendMessage原理与应用

1. 项目概述:从“按键精灵”到自动化脚本的底层实现很多朋友在接触Windows自动化时,都听说过“按键精灵”这类工具。它们能模拟键盘鼠标操作,自动完成重复性任务,比如游戏挂机、办公软件批量操作等。但你是否想过,这些…

2026/7/26 8:45:01阅读更多 →
AI求职代理如何通过NLP技术重构求职体验

AI求职代理如何通过NLP技术重构求职体验

1. 从工具到代理人:AI如何重构求职体验作为一名经历过三次求职周期的互联网老兵,我深知传统求职流程的痛苦。每天机械地刷新招聘平台,逐条阅读JD,调整简历关键词,发送千篇一律的招呼语...这些重复劳动占据了求职者70%以…

2026/7/26 8:45:01阅读更多 →
5分钟搞定C++开发环境:小熊猫Dev-C++让编程学习更简单

5分钟搞定C++开发环境:小熊猫Dev-C++让编程学习更简单

5分钟搞定C开发环境:小熊猫Dev-C让编程学习更简单 【免费下载链接】Dev-CPP A greatly improved Dev-Cpp 项目地址: https://gitcode.com/gh_mirrors/dev/Dev-CPP 对于许多想要学习C编程的新手来说,最大的障碍往往不是编程语言本身,而…

2026/7/26 8:43:01阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/26 0:01:28阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/26 0:01:28阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/26 0:01:28阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/26 0:01:28阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/26 0:01:28阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/26 0:01:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/25 23:03:25阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/25 19:03:04阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/25 19:03:04阅读更多 →