Agentic AI实战:从原理到代码实现(基于Gemini 1.5)
# Agentic AI实战从原理到代码实现基于Gemini 1.5## 1. 背景从“被动回答”到“主动执行”2026年AI领域最显著的变化并非ChatGPT的又一次升级而是**自主智能体Agentic AI**从实验室走向了企业生产环境。传统AI如聊天机器人是“反应式”的你给一个Prompt它返回一个回答。但Agentic AI是“主动式”的你给它一个**目标**它自己规划、执行、纠错调用工具数据库、API、浏览器、代码执行器甚至与其他Agent协作最终完成复杂多步骤任务。根据Zentric Solutions的行业报告2026年已有超过40%的财富500强企业在供应链、客户服务、IT运维等场景部署了Agent系统。例如一个采购Agent可以自动完成“搜索供应商→比价→谈判→下单→追踪物流→更新ERP”的全流程而人力只需审批最终订单。那么作为开发者我们如何亲手搭建一个Agent本文将以**Google Gemini 1.5**作为推理核心结合LangChain框架构建一个可自主完成“信息检索数据分析报告生成”的Agent并剖析其背后的架构原理。## 2. 技术原理Agent的四层架构一个成熟的Agent系统通常包含四个核心组件| 层 | 组件 | 示例 ||------|------|------|| 推理层 | LLM大语言模型 | Gemini 1.5 Pro || 行动层 | 工具集Tools | 搜索、计算、代码执行、数据库Query || 记忆层 | 短期/长期记忆 | 对话历史窗口、向量数据库 || 编排层 | 规划与执行引擎 | ReAct、Plan-and-Execute、Multi-Agent |**核心机制**LLM作为“大脑”接收用户目标后通过**ReActReasoning Acting**循环不断推理下一步动作。每步推理输出一个思考Thought和一个动作Action执行动作后获得观察Observation再继续推理直到任务完成。**版本号**本文使用Gemini 1.52024年发布支持100万token上下文原生多模态其长上下文能力非常适合Agent的轨迹记录。## 3. 实践用LangChain Gemini 1.5构建一个自主Agent### 3.1 环境准备python# 需要安装langchain, langchain-google-genai, python-dotenv# 版本要求langchain 0.3.0, langchain-google-genai 1.0.0import osfrom dotenv import load_dotenvload_dotenv()# 设置Gemini API Keyos.environ[GOOGLE_API_KEY] your-gemini-api-keyfrom langchain_google_genai import ChatGoogleGenerativeAIfrom langchain.agents import create_react_agent, AgentExecutorfrom langchain.tools import Tool, toolfrom langchain import hubfrom langchain_community.tools import DuckDuckGoSearchRun**关键版本说明**- Gemini 1.5 Pro2024年8月发布支持 gemini-1.5-pro 模型最大输出8192 tokens上下文窗口100万。- LangChain 0.3.x 引入了新的Agent基类与1.5兼容。### 3.2 定义工具集Agent需要“手”去执行动作。我们定义三个工具Web搜索、代码执行器安全沙箱、数学计算。python# 工具1Web搜索使用DuckDuckGosearch DuckDuckGoSearchRun()web_search_tool Tool(nameweb_search,funcsearch.run,description搜索互联网获取最新信息输入为搜索查询词)# 工具2Python代码执行安全沙箱使用ipythonfrom langchain_experimental.tools import PythonREPLToolpython_repl PythonREPLTool()code_exec_tool Tool(namepython_code_executor,funcpython_repl.run,description执行Python代码用于数据分析、计算等。输入为合法的Python代码字符串)# 工具3简单计算器避免LLM直接计算错误tooldef calculator(expression: str) - str:一个安全的数学计算器接收如 3.14 * 5 的表达式try:import math# 仅允许基本运算防止注入allowed set(0123456789.-*/() )if not all(c in allowed for c in expression):return Error: invalid charactersreturn str(eval(expression, {__builtins__: {}}, {math: math}))except Exception as e:return fError: {str(e)}tools [web_search_tool, code_exec_tool, calculator]### 3.3 初始化LLM 创建Agentpython# 使用Gemini 1.5 Pro温度设为0.1以保证确定性llm ChatGoogleGenerativeAI(modelgemini-1.5-pro,temperature0.1,max_output_tokens4096,convert_system_message_to_humanTrue # 重要Gemini的system message处理)# 从LangChain Hub拉取ReAct提示模板新版prompt hub.pull(hwchase17/react)# 创建Agentagent create_react_agent(llmllm,toolstools,promptprompt)# 创建Executor设置verboseTrue查看思考过程agent_executor AgentExecutor(agentagent,toolstools,verboseTrue,max_iterations10, # 防止无限循环handle_parsing_errorsTrue)### 3.4 运行任务让Agent自动完成一个调研报告我们给Agent一个目标**“查询2026年全球AI Agent市场规模并结合Python计算年平均增长率最后生成一份简短Markdown报告。”**pythonquery 请完成以下任务1. 搜索2026年全球AI Agent市场规模数据需要具体数值如X亿美元。2. 假设2023年市场规模为50亿美元计算2023-2026年的复合年增长率CAGR。3. 将结果整理成Markdown格式的报告包含标题、数据来源、计算过程。response agent_executor.invoke({input: query})print(\n最终输出\n, response[output])### 3.5 运行过程示例部分 Entering new AgentExecutor chain...Thought: 我需要先搜索2026年AI Agent市场规模。Action: web_searchAction Input: 2026 global AI agent market sizeObservation: 根据MarketsandMarkets报告2026年全球AI Agent市场规模预计达到287亿美元...Thought: 得到2026年数据为287亿美元。现在用Python计算CAGR。Action: python_code_executorAction Input:pythonimport mathinitial 50 # 2023年单位亿美元final 287 # 2026年years 3cagr (final/initial) ** (1/years) - 1print(fCAGR {cagr*100:.2f}%)Observation: CAGR 79.34%Thought: 现在可以生成Markdown报告。Final Answer:# AI Agent市场规模分析报告2023-2026## 数据来源- 2023年基准50亿美元行业共识- 2026年预测287亿美元MarketsandMarkets, 2026## 复合年增长率CAGR计算过程CAGR (287/50)^(1/3) - 1 ≈ 79.34%## 结论AI Agent市场正处于爆发期三年增长近5倍CAGR高达79.34%。 Finished chain.最终输出markdown# AI Agent市场规模分析报告2023-2026## 数据来源- 2023年基准50亿美元行业共识- 2026年预测287亿美元MarketsandMarkets, 2026## 复合年增长率CAGR计算过程CAGR (287/50)^(1/3) - 1 ≈ 79.34%## 结论AI Agent市场正处于爆发期三年增长近5倍CAGR高达79.34%。## 4. 架构深度解析为什么Gemini 1.5适合做Agent### 4.1 超长上下文窗口Agent在执行过程中会产生大量轨迹Thought/Action/Observation循环Gemini 1.5的**100万token上下文**意味着- 可以容纳数百步的推理历史无需频繁压缩。- 支持多轮工具调用上下文保持不会丢失之前的搜索结果。### 4.2 原生多模态Gemini 1.5不仅能处理文本还能同时理解图片、视频、音频。这意味着Agent可以- 读取PDF中的图表如财务报告截图。- 解析网页截图中的表格。- 后续扩展让Agent“看”UI界面进行操作。### 4.3 低成本与低延迟相比GPT-4Gemini 1.5 Pro的API价格约为前者的1/3且延迟更低首token 0.5秒以内。对于需要频繁调用LLM的Agent系统成本优势显著。## 5. 企业级部署注意事项### 5.1 安全沙箱上述代码中的PythonREPLTool直接执行任意代码存在安全风险。生产环境应使用**Docker沙箱**或**云函数**隔离执行。例如python# 使用gVisor或Firecracker微VMimport subprocessdef safe_exec(code: str) - str:result subprocess.run([docker, run, --rm, python:3.10-slim, python, -c, code],capture_outputTrue, textTrue, timeout30)return result.stdout result.stderr### 5.2 错误恢复与重试Agent可能会陷入死循环或输出非法JSON。LangChain的handle_parsing_errorsTrue会在解析失败时自动重试。更稳健的做法是pythonagent_executor AgentExecutor(max_retries2,early_stopping_methodgenerate, # 超时后让LLM直接生成最终答案...)### 5.3 多Agent协作当任务复杂时可以引入**OrchestratorSubAgent**模式。例如用Gemini 1.5作为主控分配子任务给专门负责“搜索”、“计算”、“写报告”的子Agent。LangChain的MultiAgent类和AutoGen框架都支持此模式。## 6. 总结与展望2026年Agentic AI不再是概念而是开发者触手可及的生产力工具。通过本文的实践你已经掌握了- 使用Gemini 1.5 LangChain构建自主Agent的完整流程。- 工具定义、ReAct循环、记忆管理的核心原理。- 企业级部署的安全与性能要点。**下一步可以探索的方向**- 将Agent接入Slack/钉钉实现7×24小时自动化客服。- 使用CrewAI构建多Agent团队模拟供应链管理。- 结合RAG检索增强生成让Agent拥有企业私有知识库。Agentic AI的竞争才刚刚开始谁能率先构建出可靠、可扩展的Agent系统谁就能在2026年的数字化转型中占据先机。---**参考文献**- Zentric Solutions, Agentic AI: How Autonomous AI Agents Are Transforming Business Operations in 2026, 2026-01-08.- Google Gemini 1.5 Technical Report, 2024.- LangChain v0.3.0 Documentation, 2025.

相关新闻

【JAVA毕设源码分享】基于spring boot的调查问卷系统的设计与实现(程序+文档+代码讲解+一条龙定制)

【JAVA毕设源码分享】基于spring boot的调查问卷系统的设计与实现(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/27 0:56:36阅读更多 →
Three.js Web3 可视化场景库:DeFi 资金流、NFT 画廊与 DAO 网络的统一渲染模式

Three.js Web3 可视化场景库:DeFi 资金流、NFT 画廊与 DAO 网络的统一渲染模式

Three.js Web3 可视化场景库:DeFi 资金流、NFT 画廊与 DAO 网络的统一渲染模式 一、引言 Three.js 的 UI 可以区分信息密度和美感,却不需要牺牲简单性。Web3 前端长期处于功能性压倒美学性的阶段,但如果可视化做得好,它能够显著提…

2026/7/27 0:56:36阅读更多 →
48-程序员场景-技术笔记与代码管理

48-程序员场景-技术笔记与代码管理

48 程序员场景:技术笔记与代码管理 300个代码片段和50个项目的记忆 阿栋是一个全栈开发者,React和Node.js都有三年经验。他最大的烦恼不是写代码,而是——记不住。 “你有没有这种经历?半年前写过一个很优雅的递归函数,现在要用的时候却想不起来怎么写。或者在Stack Ov…

2026/7/27 0:54:35阅读更多 →
从清北人才竞争看全球学术生态构建与顶尖人才流动

从清北人才竞争看全球学术生态构建与顶尖人才流动

前几天,一则关于丘成桐先生邀请王虹、邓煜两位青年数学家回国任教的消息,在学术圈内外引起了不小的波澜。消息本身并不复杂,但背后那句“清北斗了20年竟发现对手不是彼此”的判断,却戳中了许多人对国内顶尖高校人才生态的长期观察…

2026/7/27 2:30:51阅读更多 →
基于YOLOv8的蘑菇智能检测系统开发实践

基于YOLOv8的蘑菇智能检测系统开发实践

1. 项目概述:基于YOLOv8的蘑菇智能检测系统作为一名长期从事计算机视觉应用的开发者,我最近完成了一个实用型项目——基于YOLOv8的蘑菇种类检测系统。这个项目最初源于野外考察时的实际需求:如何快速区分可食用蘑菇与有毒品种。传统的人工鉴别…

2026/7/27 2:30:51阅读更多 →
Ohnrscript:基于JavaScript语法的系统编程语言与HTTP Unikernel实践

Ohnrscript:基于JavaScript语法的系统编程语言与HTTP Unikernel实践

最近在探索系统级编程语言时,发现了一个很有意思的项目——Ohnrscript。这个语言采用了我们熟悉的 JavaScript 语法,却能够编译成高效的机器码,还内置了 HTTP unikernel 功能。对于习惯了 JavaScript 但又需要系统级性能的开发者来说&#xf…

2026/7/27 2:30:51阅读更多 →
AI驱动的企业应收账款智能风控系统设计与实践

AI驱动的企业应收账款智能风控系统设计与实践

1. 项目背景与核心挑战应收账款管理一直是企业财务部门的痛点。我在为多家制造业企业提供财务系统咨询时发现,超过70%的财务总监最头疼的问题就是应收账款风险。传统的人工评估方式就像用算盘处理大数据——财务人员需要手动整理客户付款记录、行业报告、财务报表等…

2026/7/27 2:30:51阅读更多 →
3分钟掌握BOTW存档编辑器:终极游戏自定义工具指南

3分钟掌握BOTW存档编辑器:终极游戏自定义工具指南

3分钟掌握BOTW存档编辑器:终极游戏自定义工具指南 【免费下载链接】BOTW-Save-Editor-GUI A Work in Progress Save Editor for BOTW 项目地址: https://gitcode.com/gh_mirrors/bo/BOTW-Save-Editor-GUI 你是否曾为《塞尔达传说:旷野之息》中武器…

2026/7/27 2:30:51阅读更多 →
Oracle c asm单机OPatch补丁报错“checkSystemCommandAvailable“ failed.

Oracle c asm单机OPatch补丁报错“checkSystemCommandAvailable“ failed.

Oracle c asm单机OPatch补丁报错"checkSystemCommandAvailable" failed. 深度解析与解决 作为一名数据库运维人员,你一定经历过打补丁时遇到各种“妖魔鬼怪”的报错。今天我们要聊的是一个在Oracle 12c、19c等版本(尤其是单机ASM环境&#xff…

2026/7/27 2:28:51阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/27 1:14:34阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/27 1:14:52阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/27 1:14:56阅读更多 →
SPI实战指南:从时钟模式到寄存器配置,解决嵌入式通信难题

SPI实战指南:从时钟模式到寄存器配置,解决嵌入式通信难题

1. 项目概述:从寄存器手册到实战指南 如果你手头有一份类似德州仪器(TI)TMS320x240xA系列DSP的SPI模块技术手册,看着里面密密麻麻的寄存器位定义、时序图和公式,是不是感觉头大?这份资料虽然权威&#xff0…

2026/7/27 0:00:24阅读更多 →
【JAVA毕设源码分享】基于springboot的水果购物管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

【JAVA毕设源码分享】基于springboot的水果购物管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/27 0:00:24阅读更多 →
2007-2023年各市区县生态文明建设示范区DID

2007-2023年各市区县生态文明建设示范区DID

数据简介 自改革开放以来,我国依赖高投入、高资源消耗和高污染等传统发展模式实现了经济短期内的快速增长, 然而这也导致了严重的生态环境危机。因此,国家有力于推动企业高质量经济发展,协同生态保护的方针,从而从201…

2026/7/27 0:00:24阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/25 23:03:25阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/26 19:05:21阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/26 19:05:21阅读更多 →