python爬虫基础实战案例
文章目录1 实战一爬取豆瓣Top250图书信息目标分析完整代码2 实战二批量下载图片关键技巧多线程加速下载3 实战三爬取表格数据并存入Excel安装依赖爬取天气历史数据4 完整项目知乎热榜数据采集下面通过几个经典案例把前面的知识串联起来。包含三类实战项目静态页面爬取、图片批量下载、表格数据提取与存储。每个案例都有完整代码可以直接运行。1 实战一爬取豆瓣Top250图书信息豆瓣图书是学习爬虫的经典案例页面结构清晰适合练习CSS选择器和数据存储。目标分析目标爬取豆瓣Top250图书的书名、作者、评分、出版信息、评价人数保存为CSV文件。打开F12分析页面结构每本书在div.item容器中书名在span.title中评分在span.rating_num中作者和出版信息在p标签中翻页链接在a标签URL参数为?start0,25,50...完整代码importrequestsfrombs4importBeautifulSoupimportcsvimporttimeimportrandomdefget_headers():返回伪装请求头return{User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36,Accept-Language:zh-CN,zh;q0.9}defparse_book_list(html):解析单页图书列表soupBeautifulSoup(html,lxml)books[]foriteminsoup.select(div.item):# 书名有时会有副标题title_tagsitem.select(span.title)titletitle_tags[0].text.strip()iftitle_tagselse未知# 评分rating_tagitem.select_one(span.rating_num)ratingrating_tag.text.strip()ifrating_tagelse0# 评价人数inq_tagitem.select_one(span.inq)inqinq_tag.text.strip()ifinq_tagelse# 作者/出版信息info_tagitem.select_one(div.bd p)infoinfo_tag.text.strip().replace(\n, )ifinfo_tagelse# 排名rank_tagitem.select_one(em)rankrank_tag.textifrank_tagelsebooks.append({rank:rank,title:title,rating:rating,inq:inq,info:info})returnbooksdefcrawl_douban_books():爬取豆瓣图书Top250all_books[]base_urlhttps://book.douban.com/top250forstartinrange(0,250,25):urlf{base_url}?start{start}print(f爬取第{start//251}页:{url})try:responserequests.get(url,headersget_headers(),timeout10)response.raise_for_status()booksparse_book_list(response.text)all_books.extend(books)print(f本页提取{len(books)}本书)exceptExceptionase:print(f爬取失败:{e})# 随机延时 1-3 秒避免被封time.sleep(random.uniform(1,3))returnall_booksdefsave_to_csv(books,filenamedouban_books.csv):保存为CSV文件ifnotbooks:print(没有数据可保存)returnwithopen(filename,w,encodingutf-8-sig,newline)asf:fieldnames[rank,title,rating,inq,info]writercsv.DictWriter(f,fieldnamesfieldnames)writer.writeheader()writer.writerows(books)print(f已保存{len(books)}条数据至{filename})if__name____main__:bookscrawl_douban_books()save_to_csv(books)# 打印前5条预览forbookinbooks[:5]:print(f[{book[rank]}]{book[title]}-{book[rating]}分)2 实战二批量下载图片批量下载图片是爬虫的常见需求。这个案例演示如何下载图片并保存到本地。关键技巧图片是二进制数据需要用response.content获取而不是response.text。importrequestsimportosimporttimeimportrandomfrompathlibimportPathfromurllib.parseimporturlparsedefdownload_image(url,save_path,headersNone):下载单张图片try:responserequests.get(url,headersheaders,timeout15,streamTrue)response.raise_for_status()# 检查是否是图片类型content_typeresponse.headers.get(Content-Type,)ifimagenotincontent_type:print(f不是图片类型:{content_type})returnFalse# 从URL中获取文件名parsed_urlurlparse(url)filenameos.path.basename(parsed_url.path)ifnotfilenameor.notinfilename:filenamefimage_{int(time.time())}.jpg# 保存图片full_pathos.path.join(save_path,filename)withopen(full_path,wb)asf:forchunkinresponse.iter_content(chunk_size8192):f.write(chunk)file_sizeos.path.getsize(full_path)print(f下载成功:{filename}({file_size/1024:.1f}KB))returnTrueexceptExceptionase:print(f下载失败{url}:{e})returnFalsedefbatch_download_images(image_urls,save_dirimages):批量下载图片# 创建保存目录Path(save_dir).mkdir(parentsTrue,exist_okTrue)headers{User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64),Referer:https://example.com# 防盗链处理}success_count0fail_count0fori,urlinenumerate(image_urls,1):print(f[{i}/{len(image_urls)}] 下载:{url[:60]}...)ifdownload_image(url,save_dir,headers):success_count1else:fail_count1# 下载间隔time.sleep(random.uniform(0.5,1.5))print(f\n下载完成: 成功{success_count}张失败{fail_count}张)# 使用示例先爬取图片URL列表再批量下载defget_image_urls_from_page(page_url):从页面中提取图片URLheaders{User-Agent:Mozilla/5.0 ...}responserequests.get(page_url,headersheaders)soupBeautifulSoup(response.text,lxml)image_urls[]forimginsoup.select(div.gallery img):srcimg.get(src)orimg.get(data-src,)ifsrcandsrc.startswith(http):image_urls.append(src)returnimage_urls# 主流程# page_url https://example.com/gallery# urls get_image_urls_from_page(page_url)# batch_download_images(urls, save_dirdownloaded_images)多线程加速下载当图片数量多时单线程速度太慢。可以用多线程并发下载。fromconcurrent.futuresimportThreadPoolExecutor,as_completeddefbatch_download_with_threads(image_urls,save_dirimages,max_workers5):多线程批量下载Path(save_dir).mkdir(parentsTrue,exist_okTrue)headers{User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64)}defdownload_task(args):idx,urlargsreturndownload_image(url,save_dir,headers)taskslist(enumerate(image_urls,1))success0withThreadPoolExecutor(max_workersmax_workers)asexecutor:future_to_url{executor.submit(download_task,task):taskfortaskintasks}forfutureinas_completed(future_to_url):idx,urlfuture_to_url[future]try:iffuture.result():success1exceptExceptionase:print(f任务异常:{e})print(f多线程下载完成:{success}/{len(image_urls)})3 实战三爬取表格数据并存入Excel很多网站有表格形式的数据比如排行榜、统计数据等。这个案例演示如何完整爬取这类数据。安装依赖pipinstallopenpyxl pandas爬取天气历史数据importrequestsfrombs4importBeautifulSoupimportpandasaspdfromdatetimeimportdatetimedefcrawl_table_data(url,table_selectortable): 通用表格数据爬取函数 headers{User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36}responserequests.get(url,headersheaders,timeout10)response.encodingutf-8soupBeautifulSoup(response.text,lxml)tablesoup.select_one(table_selector)ifnottable:print(f未找到表格:{table_selector})returnNone# 提取表头headers_rowtable.select(tr:first-child th)ifnotheaders_row:headers_rowtable.select(thead tr th)columns[th.text.strip()forthinheaders_row]# 提取数据行rows[]fortrintable.select(tbody tr):cellstr.select(td)ifcells:row_data[cell.text.strip()forcellincells]rows.append(row_data)ifnotcolumnsornotrows:print(表格数据为空)returnNone# 转换为DataFramedfpd.DataFrame(rows,columnscolumns)returndfdefsave_to_excel(df,filenametable_data.xlsx,sheet_name数据):保存到Excel支持格式美化withpd.ExcelWriter(filename,engineopenpyxl)aswriter:df.to_excel(writer,sheet_namesheet_name,indexFalse)# 获取worksheet对象进行格式调整wswriter.sheets[sheet_name]# 自动调整列宽forcolumninws.columns:max_length0col_lettercolumn[0].column_letterforcellincolumn:ifcell.value:max_lengthmax(max_length,len(str(cell.value)))ws.column_dimensions[col_letter].widthmin(max_length4,30)print(f已保存到{filename})# 多页表格数据爬取defcrawl_multi_page_table(base_url,total_pages,page_parampage):多页表格数据爬取all_data[]forpageinrange(1,total_pages1):urlf{base_url}?{page_param}{page}print(f爬取第{page}页...)dfcrawl_table_data(url)ifdfisnotNone:df[来源页码]page all_data.append(df)importtime time.sleep(1)ifall_data:resultpd.concat(all_data,ignore_indexTrue)print(f共爬取{len(result)}条数据)returnresultreturnNone4 完整项目知乎热榜数据采集importrequestsimportjsonimportcsvfromdatetimeimportdatetimedefcrawl_zhihu_hot(): 爬取知乎热榜接口版本比解析HTML更稳定 # 知乎热榜接口api_urlhttps://www.zhihu.com/api/v3/feed/topstory/hot-lists/totalheaders{User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36,Referer:https://www.zhihu.com/hot,Accept:application/json}params{limit:50,desktop:true}responserequests.get(api_url,headersheaders,paramsparams,timeout10)ifresponse.status_code!200:print(f请求失败:{response.status_code})return[]dataresponse.json()hot_listdata.get(data,[])results[]forrank,iteminenumerate(hot_list,1):targetitem.get(target,{})results.append({排名:rank,标题:target.get(title,),热度:item.get(detail_text,),回答数:target.get(answer_count,0),关注数:target.get(follower_count,0),链接:fhttps://www.zhihu.com/question/{target.get(id,)},采集时间:datetime.now().strftime(%Y-%m-%d %H:%M)})returnresultsdefsave_hot_list(data,filenameNone):ifnotfilename:filenamefzhihu_hot_{datetime.now().strftime(%Y%m%d_%H%M)}.csvwithopen(filename,w,encodingutf-8-sig,newline)asf:writercsv.DictWriter(f,fieldnamesdata[0].keys())writer.writeheader()writer.writerows(data)print(f已保存{len(data)}条热榜数据至{filename})if__name____main__:hot_datacrawl_zhihu_hot()ifhot_data:save_hot_list(hot_data)print(f\n当前热榜前10:)foriteminhot_data[:10]:print(f[{item[排名]}]{item[标题]}-{item[热度]})以上三个案例覆盖了静态爬虫的核心场景。注意在实际使用时需要添加适当的请求延时遵守网站robots.txt规则不要爬取隐私数据。下一章进入爬虫的进阶领域动态网页爬取。

相关新闻

DVD视频备份与MP4格式转换全指南

DVD视频备份与MP4格式转换全指南

1. 从DVD到数字存储:视频备份与格式转换全指南每次整理家里的DVD收藏时,总担心这些珍贵的影像资料会因为碟片老化而消失。上周我就遇到一张十年前的家庭录像DVD无法读取的情况,这促使我系统研究了DVD视频备份的方案。把DVD内容转存到硬盘并转…

2026/7/23 3:29:06阅读更多 →
企业私有化大模型平台CSGHub架构与落地实践

企业私有化大模型平台CSGHub架构与落地实践

1. 企业私有化大模型平台的战略价值在数字化转型浪潮中,企业级AI基础设施正从"能用"向"可控"演进。CSGHub这类私有化大模型平台的核心价值在于,它让企业摆脱了公有云服务的黑箱限制,实现了从数据预处理、模型训练到推理服…

2026/7/23 3:29:06阅读更多 →
用Markdown编辑器

用Markdown编辑器

这里写自定义目录标题 欢迎使用Markdown编辑器新的改变功能快捷键合理的创建标题,有助于目录的生成如何改变文本的样式插入链接与图片如何插入一段漂亮的代码片生成一个适合你的列表创建一个表格设定内容居中、居左、居右SmartyPants 创建一个自定义列表如何创建一个…

2026/7/23 3:29:06阅读更多 →
[计算机科学]大数据硬件架构与软件架构概览

[计算机科学]大数据硬件架构与软件架构概览

大数据硬件架构与软件架构概览本文从工程视角系统介绍大数据平台的硬件架构与软件架构。内容涵盖计算、存储、网络及加速等硬件层次,以及分布式存储、资源管理、数据处理引擎和访问服务等软件层次,并结合典型工作负载分析关键设计取舍。文档篇幅超过四页…

2026/7/23 4:53:17阅读更多 →
远程排查 Web 系统问题:如何导出 HAR 文件协助定位

远程排查 Web 系统问题:如何导出 HAR 文件协助定位

远程排查 Web 系统问题:如何导出 HAR 文件协助定位适用场景:线上偶发报错、接口超时、页面白屏、登录异常、支付/下单卡住等 适用浏览器:Chrome、Edge(推荐最新正式版) 目标:让用户按步骤导出 HAR&#xff…

2026/7/23 4:53:17阅读更多 →
C++ Vector核心原理与性能优化实战指南

C++ Vector核心原理与性能优化实战指南

1. 项目概述:为什么C Vector是每个开发者必须掌握的核心技能?如果你刚开始接触C,或者已经写了一些简单的控制台程序,那么“容器”这个概念对你来说可能既熟悉又陌生。你或许用过数组,知道它固定大小的限制,…

2026/7/23 4:53:17阅读更多 →
[计算机科学]大数据分布式文件系统与开源生态概览

[计算机科学]大数据分布式文件系统与开源生态概览

大数据分布式文件系统与开源生态概览本文从工程实践视角,对大数据平台中的分布式文件系统及其相关开源生态进行系统性梳理。内容涵盖典型架构模式、关键设计权衡、与计算和资源管理层的集成方式,并通过若干示意图和表格帮助读者形成整体认知。文中示例仅…

2026/7/23 4:53:17阅读更多 →
2026企业知识库排行出炉,不同场景适配推荐

2026企业知识库排行出炉,不同场景适配推荐

本次企业知识库排行规则说明近年来企业数智化转型进程加快,企业知识库作为盘活内部资料、沉淀业务经验、统一知识口径的核心工具,市场需求持续攀升,但各类产品能力参差不齐,企业选型缺乏清晰的参考标准。本次排行基于公开实测、官…

2026/7/23 4:53:17阅读更多 →
企业AI应用困境:流程与灵活如何平衡?TokenX以“大管流程,小放智能”破局!

企业AI应用困境:流程与灵活如何平衡?TokenX以“大管流程,小放智能”破局!

企业智能体要真正用起来,既要有清楚的流程,也要给 AI 足够的发挥空间。聊聊 TokenX 的做法:Pipeline in the large, Agentic in the small。 前几篇我们聊了可信判断 AI,也把它放进银行信贷资料审核里,看了一遍 AI 如何…

2026/7/23 4:51:16阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/23 0:56:31阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/23 0:56:31阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 0:56:31阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:00:28阅读更多 →
从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:28阅读更多 →
油泥处理设备哪里能买到

油泥处理设备哪里能买到

油泥处理设备哪里有?这是许多从事油田、炼化、清罐业务的从业者最关心的问题。根据河南三丰环保设备有限公司的行业经验,选购油泥处理设备的核心在于设备能否适配当地环保法规与原料特性,而非单纯看价格。该公司总经理王钦田先生指出&#xf…

2026/7/23 0:00:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/22 22:56:18阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/22 18:55:50阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/22 18:55:50阅读更多 →