吴恩达Agent教程学习记录(一)
通识概念Introduction to Agentic Workflows一、什么是智能体LLM大语言模型主要执行单任务运行比如写一篇文章他直接给你生成好但如果要写出一篇高质量文章往往会经历调研写作回头检查所以我们可以将这些环节拆分成不同任务分别由专门的模块或智能体负责。这样虽然会消耗更多 Token 和时间但通常能够获得更完整、更可靠的结果。吴恩达老师的课里面没有提到的一点就是如果LLM本身够强它可以自主执行调研到写作再到审查的这一个流程的那为什么还要智能体的。关键在于Agent 解决的不是“LLM 会不会完成这些步骤”而是如何把这些能力组织成一个稳定、可重复、可持续执行的系统。LLM 决定思考、判断和内容生成的能力Agent 则负责流程控制、工具调用、状态记录以及根据中间结果进行调整。因此一次性的调研写作任务强 LLM 配合搜索等工具通常已经足够而对于流程固定、任务复杂、需要多轮反馈、长期运行或错误恢复的工作Agent 才能体现出更明显的价值。这是举例的一个定制化多智能体工作流可以看到它是安排多个agent执行不同分工共同完成最终任务二、自主性程度吴老师的Agentic Workflows并不执着于区分什么才是“真正的智能体”而是把智能体性看作一个从低自主到高自主的连续谱。这张图是智能体的自主性低自主系统的步骤、工具和执行顺序基本都由开发者预先设定LLM 主要负责生成搜索词、摘要或文章内容因此它也可以被称为“引入 LLM 的工作流”。半自主智能体则可以根据中间结果做出部分决策例如在预定义工具中选择搜索网页、新闻或论文并判断应当读取网页还是解析 PDF。高度自主智能体拥有更大的决策空间能够自主规划任务决定执行步骤甚至临时编写函数或创建新工具。在写黑洞文章的例子中上半部分属于低自主工作流系统先让 LLM 生成搜索关键词再按照固定步骤调用网页搜索和网页读取工具最后由 LLM 撰写文章。下半部分具有更高的自主性因为 LLM 会参与信息源选择、资料筛选和文章反思修改。但它所使用的工具仍然是预先提供的所以我认为更准确地说说法是它属于半自主或较高自主性的 Agentic Workflow而不是完全高度自主的智能体。这是GPT给出的他认为的排序主要是从工作流到Agent的进化过程三、智能体的优势1.多种应用场景下表现更优图片是自主性工作流一个显著的效果提升左边两个点是GPT3.5和GPT4在代码正确率上是48%和67%但是当接入自主性工作流的时候最差的框架也使能力高于GPT4而GPT4接入后也获得了更高的分数所以可以看到agent其实能放大LLM的能力。2.并行处理一些人类原本需要顺序完成的任务就比如这个还是写论文的三个LLM写关键词抓取三个网页然后读取内容相当于能够同时并行处理9个网页内容但人类做研究的是可能需要挨个顺序读下来这9个。3.智能体工作流的模块化设计方便更新工具还是上边那个例子比如你可以替换工具把网页换成新闻更换搜索引擎来实现从不同类型整理信息这就是它模块化设计带来的便利四、智能体应用也是跟之前一条线这个就是说智能体应用难度在企业中有固定流程的事情往往会更容易去构建智能体比如智能客服去告诉顾客当前库存它是有标准流程的比如调用关键词进数据库搜索生成回复文本人工审核这类工作会更容易去搭建智能体。更难的一种所有步骤实现不是有标准化步骤智能体可能需要边执行边规划并且解决问题包括多模态也比纯文本要不可靠一点。五、任务分解在构建智能体时最重要的不是先决定使用几个 Agent而是先理解任务在现实中是如何完成的并将整个过程拆解为若干可执行、可检查的环节。对于每个环节需要判断它能否由 LLM 直接完成是否需要调用搜索、数据库或其他 API如果现有方法无法解决就可以参考人在处理这类问题时会采取什么步骤再决定是继续拆解任务还是引入新的工具、数据或人工审核。当某个环节效果不理想时应重点拆解这个瓶颈。例如一个文章写作智能体在完成网页搜索后直接让 LLM 生成全文结果通常不够稳定。此时可以进一步将写作拆分为资料整理、生成大纲、分段写作、内容评审和修改完善等步骤。这样虽然会增加调用次数和 Token 消耗但中间结果更加明确、可检查最终内容通常也更完整但是任务拆解不是越细越好而是要拆到每一步都能稳定执行、结果可以验证为止。在搭建智能体时可以将整个系统看成由多个构建模块组成。首先是模型模块除了负责理解、推理和文本生成的 LLM还可以接入语音识别、图像分析、PDF 解析等专用模型。其次是工具模块包括调用 API 获取实时数据或执行外部操作通过数据库和 RAG 检索信息以及通过代码执行完成计算、数据分析和文件处理。设计智能体时需要根据每个子任务选择合适的模块适合语言理解和决策的交给 LLM适合专业感知或转换的交给专用模型需要访问外部世界的调用 API 或检索工具需要精确计算和批量处理的则使用代码执行。六、智能体AI评估智能体构建者的评估能力会直接影响系统的开发效率和最终效果。本节主要介绍智能体评估的基本思路。在开发开始前应先确定最核心的成功标准但很多具体问题只有在观察实际输出后才能发现因此评估通常是一个边开发、边测试、边补充指标的迭代过程。例如智能体生成营销文本时可能频繁贬低竞争对手这时可以编写代码统计特定竞品名称或负面表达出现的次数形成可量化的客观指标。对于内容质量、表达自然度等难以直接用代码衡量的问题可以使用人工评审或 LLM-as-judge。评测 LLM 需要配合明确的评分标准和示例。单纯让模型进行 1—5 分的绝对打分可能不够稳定因此后续还可以采用合格与否判断、成对比较等方式。智能体评估可以从两个层面进行一是端到端评估判断系统最终是否完成任务二是组件级评估分别检查检索、筛选、写作等单个环节的输出质量。此外还需要查看智能体的执行轨迹和中间结果从而定位错误究竟发生在哪个步骤。评估与错误分析不是最后才进行的验收环节而是贯穿智能体开发全过程的核心能力。七、智能体设计模式智能体工作流四个关键设计模式是反思工具使用规划和多智能体写作。1.反思反思是一种常见的 AI 工作流设计方法。例如一个模型生成代码或文本后可以再设置一个评审环节让模型检查其中的问题、潜在风险和改进空间然后将评审意见返回给生成模型进行修改。我平时撰写项目申请材料时也会先让一个模型完成初稿再让另一个模型以评审专家的身份进行严格审查。但是视频没有讲到的事情是反思并不是次数越多越好。我本人在实际使用过程中经常会有写项目申请表的需求我会让GPT写好之后交由Deepseek进行找问题我把Deepseek的人设确定为一名评审专家。但是会发现反思轮次过多可能导致内容越来越冗余、保守和防御性过强。例如在电气相关项目申请中模型经过多轮风险审查后可能不断增加防触电、安全防护等内容使这些内容在全文中占比过高反而削弱项目的核心创新。这是因为当我们不断要求模型寻找缺点时它往往会继续提出问题即使当前版本已经基本满足要求也可能为了完成“找缺点”的指令而勉强挖掘新的风险。经过多轮修改后文本可能逐渐偏离原始目标创新性表达也可能被不断削弱。因此反思工作流需要设置明确的评价标准和停止条件。评审的目的不是无限寻找问题而是判断内容是否满足真实性、完整性、相关性和表达质量等要求。当关键问题已经解决继续反思带来的收益低于修改成本时就应停止迭代。2.工具使用这个就很好理解了就是之前我们一直举例的网页读取就是其中一个工具通过调用不同的工具来使LLM完成更多任务比如发邮件OCR文本识别或者写代码等等。3.规划规划就是让LLM自己决定要执行的流程比如调用什么工具执行什么操作等等这类智能体通常更难控制但也更有可扩展性。这是课里面举的例子生成一张同样姿势的女孩读书照片再用语音描述。一个会自主规划的Agent会先读取动作然后生成再读取图像生成语音描述。4.多智能体协同就是说让每个智能体专精一件事情共同完成一个任务比如现在很多的一人公司就可以安排不同智能体来干不同的活比如专门审计专门开发专门测试的等等。

相关新闻

Unity高性能碰撞检测:基于Burst与Job System的SAT算法优化实践

Unity高性能碰撞检测:基于Burst与Job System的SAT算法优化实践

1. 项目概述:当碰撞检测成为性能瓶颈在Unity里做3D项目,尤其是那些有大量动态物体、复杂物理交互的游戏或仿真应用,碰撞检测的性能往往是决定体验上限的关键。你可能会发现,当场景里同时有几百个物体在运动时,帧率就开…

2026/7/30 5:58:00阅读更多 →
SK海力士营收创纪录仍未达预期,股价跌18%引发AI泡沫破裂担忧

SK海力士营收创纪录仍未达预期,股价跌18%引发AI泡沫破裂担忧

SK海力士业绩亮眼,股价却暴跌18%尽管SK海力士公布了创纪录的净利润和营收,但由于未能达到人工智能热潮所引发的极高预期,其股价最多下跌了18%。业绩未达预期,加剧AI泡沫破裂担忧这样的业绩表现无助于缓解投资者对人工智能泡沫即将…

2026/7/30 5:58:00阅读更多 →
Python AttributeError: ‘str‘ object has no attribute ‘get‘ 深度解析与根治方案

Python AttributeError: ‘str‘ object has no attribute ‘get‘ 深度解析与根治方案

1. 项目概述:一个看似简单的错误背后“AttributeError: ‘str‘ object has no attribute ‘get‘”,这个错误信息对于任何一位使用Python进行开发的工程师来说,都绝不陌生。它就像一个老朋友,时不时在你最意想不到的时候冒出来&a…

2026/7/30 5:56:00阅读更多 →
S7-1200五轴伺服系统PLC控制方案与调试技巧

S7-1200五轴伺服系统PLC控制方案与调试技巧

1. 项目概述:五轴伺服系统的PLC控制方案去年为某精密加工设备设计的这套S7-1200五轴控制系统,经历了从方案论证到现场调试的全过程。相比传统单轴控制,五轴联动的核心难点在于如何实现各轴运动的精确同步,以及如何处理多轴间的耦合…

2026/7/30 7:14:53阅读更多 →
FreeRTOS任务机制解析:从并发模型到嵌入式多任务实战

FreeRTOS任务机制解析:从并发模型到嵌入式多任务实战

1. 项目概述:从裸机思维到RTOS思维的跨越如果你是从51单片机或者STM32的HAL库裸机开发转过来的,第一次接触FreeRTOS,最大的困惑可能不是某个API怎么用,而是“我为什么要用RTOS?”以及“任务到底是个什么东西&#xff1…

2026/7/30 7:14:53阅读更多 →
CNN卷积神经网络原理与工程实践详解

CNN卷积神经网络原理与工程实践详解

1. CNN卷积神经网络算法原理解析第一次接触卷积神经网络(CNN)是在2015年的一个图像分类项目上。当时用传统方法处理10万张商品图片分类,准确率死活卡在75%上不去。后来尝试了LeNet-5这个经典的CNN模型,准确率直接飙到92%,从此彻底改变了我对计…

2026/7/30 7:14:53阅读更多 →
安卓设备运行Linux桌面环境:Proot+Debian+XFCE实战指南

安卓设备运行Linux桌面环境:Proot+Debian+XFCE实战指南

1. 项目概述:当安卓遇上桌面级操作系统 手里拿着一台安卓手机或平板,除了刷视频、玩游戏、处理文档,你有没有想过让它干点更“硬核”的活儿?比如,运行一个完整的、带图形界面的电脑操作系统,像在PC上一样敲…

2026/7/30 7:14:53阅读更多 →
Node.js+Vue构建高性能超市会员系统实战

Node.js+Vue构建高性能超市会员系统实战

1. 项目背景与核心价值超市会员系统作为零售行业的基础设施,已经从简单的积分管理演变为集客户分析、精准营销、库存联动于一体的核心业务中枢。传统PHP或JavaEE架构的会员系统在面对现代超市高频促销活动、实时积分结算、多终端接入等需求时,往往显得笨…

2026/7/30 7:14:53阅读更多 →
AI写作精准控制:三步法提升提示词工程效果

AI写作精准控制:三步法提升提示词工程效果

1. 为什么AI写作总是不尽如人意?每次输入"写一篇关于XX的文章",得到的要么是泛泛而谈的套话,要么就是离题万里的内容?这其实是因为大多数人把AI当成了"自动写作机",而忽略了它本质上是个需要精确调…

2026/7/30 7:12:53阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/29 9:47:45阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/29 7:00:19阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/29 7:58:51阅读更多 →
3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 [特殊字符]

3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 [特殊字符]

3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 🚀 【免费下载链接】TrollInstallerX A TrollStore installer for iOS 14.0 - 16.6.1 项目地址: https://gitcode.com/gh_mirrors/tr/TrollInstallerX 你是否曾经因为iOS系统的严格…

2026/7/30 0:00:58阅读更多 →
[GESP202606 四级] 扫雷

[GESP202606 四级] 扫雷

B4557 [GESP202606 四级] 扫雷 https://www.luogu.com.cn/problem/B4557 中国计算机学会(CCF)2026年6月C四级讲解——扫雷 https://www.bilibili.com/video/BV1MCMg6AEXR/ B4557 [GESP202606 四级] 扫雷 https://www.bilibili.com/video/BV1ZKTj6ZEVh/ 2…

2026/7/30 0:00:58阅读更多 →
Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/30 0:00:58阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/30 0:27:26阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/30 4:47:18阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/29 14:26:42阅读更多 →