网页爬虫基础:HTML结构与CSS/XPath选择器详解
1. 网页抓取的本质理解HTML结构刚接触爬虫的新手最容易犯的错误就是直接开始写代码却对要抓取的对象一无所知。就像猎人不知道猎物长什么样厨师不认识食材的特性。我们首先要搞清楚你要抓的到底是什么HTML超文本标记语言是构成网页的骨架。每个网页本质上都是一个HTML文档它用标签tag来定义内容的结构和含义。比如h1表示一级标题p表示段落a表示超链接。这些标签像乐高积木一样通过嵌套组合构成了我们看到的网页。重要提示现代网页很多内容是通过JavaScript动态加载的直接查看网页源代码可能看不到完整内容。这时需要借助开发者工具Chrome按F12的Elements面板来查看最终渲染的DOM结构。1.1 HTML文档的基本结构一个典型的HTML文档是这样的结构!DOCTYPE html html langzh-CN head meta charsetUTF-8 title示例页面/title /head body div idcontent h1 classtitle主标题/h1 p这是一个段落文本/p ul li列表项1/li li列表项2/li /ul /div /body /html关键点解析!DOCTYPE html声明文档类型html是根元素lang属性指定语言head包含元信息不会显示在页面中body包含所有可见内容标签可以嵌套形成父子关系标签可以有属性如id,class1.2 为什么需要选择器当我们要从复杂的HTML中提取特定数据时就需要定位到目标元素。就像在人群中找人你可以说找穿红衣服的人相当于CSS选择器也可以说从门口进来左转第三排第二个人相当于XPath选择器就是帮我们精确描述要抓取哪个元素的工具。没有选择器我们只能获取整个HTML文档无法提取其中的特定数据。2. CSS选择器精准定位的利器CSS选择器最初是为样式表设计的但因为其简洁直观的语法成为了爬虫中最常用的元素定位方式之一。2.1 基础选择器类型元素选择器直接按标签名选择p /* 选择所有p元素 */类选择器通过class属性选择.title /* 选择classtitle的元素 */ID选择器通过id属性选择#content /* 选择idcontent的元素 */属性选择器通过其他属性选择[href] /* 选择有href属性的元素 */ [typesubmit] /* 选择typesubmit的元素 */2.2 组合选择器通过组合基础选择器可以实现更精确的定位后代选择器空格分隔div p /* 选择div内的所有p元素不限层级 */子元素选择器分隔div p /* 只选择div的直接子p元素 */相邻兄弟选择器分隔h1 p /* 选择紧接在h1后的p元素 */通用兄弟选择器~分隔h1 ~ p /* 选择h1后面的所有同级p元素 */2.3 伪类选择器伪类选择器可以根据元素的状态或位置进行选择a:hover /* 鼠标悬停时的链接 */ li:nth-child(2) /* 选择第二个li元素 */ p:first-child /* 选择作为第一个子元素的p */实战技巧在Chrome开发者工具中可以使用$(css选择器)快速测试选择器是否有效。比如在Console输入$(h1.title)可以检查是否能选中目标元素。3. XPath更强大的路径定位语言XPathXML Path Language是一种用于在XML和HTML文档中导航和选择节点的语言。相比CSS选择器XPath功能更强大语法也更灵活。3.1 XPath基础语法节点选择/从根节点开始//从当前节点选择匹配的节点不考虑位置.当前节点..父节点示例/html/body/div /* 选择从根开始的精确路径 */ //div[idcontent] /* 选择任意位置的id为content的div */3.2 谓语Predicates谓语用于查找特定节点或包含特定值的节点写在方括号中//ul/li[1] /* 选择第一个li元素 */ //a[href] /* 选择有href属性的a元素 */ //p[contains(text(),Python)] /* 选择文本包含Python的p元素 */3.3 通配符和运算符*匹配任何元素节点*匹配任何属性节点|合并多个路径的结果and,or逻辑运算//div[classarticle or classpost] /* 选择class为article或post的div */3.4 轴Axes轴定义了与当前节点的关系//div/child::p /* 选择div的子p元素 */ //span/parent::div /* 选择span的父div元素 */ //h1/following-sibling::p /* 选择h1后面的同级p元素 */经验分享在Chrome开发者工具中右键元素 - Copy - Copy XPath可以快速获取元素的XPath但自动生成的XPath通常不够健壮容易因页面微小改动而失效建议手动编写更简洁通用的XPath。4. 选择器实战对比与应用场景4.1 CSS选择器 vs XPath特性CSS选择器XPath语法简洁度⭐⭐⭐⭐⭐⭐⭐⭐功能强大程度⭐⭐⭐⭐⭐⭐⭐⭐文本内容匹配有限支持:contains已废弃完全支持text(), contains()浏览器兼容性完全支持完全支持性能通常更快稍慢上手难度简单较复杂4.2 如何选择优先使用CSS选择器当元素有明确的class或id时CSS选择器更简洁直观使用XPath的情况需要根据文本内容定位时需要复杂路径导航如父节点、祖先节点时需要条件组合查询时4.3 实际案例解析假设我们要抓取以下HTML中的商品信息div classproduct-list div classproduct h3a href/product/1Python编程入门/a/h3 p classprice¥59.00/p div classrating span classstars⭐⭐⭐⭐⭐/span span(128评价)/span /div /div !-- 更多商品... -- /divCSS选择器方案# 商品标题 titles response.css(.product h3 a::text).getall() # 商品价格 prices response.css(.product .price::text).getall() # 评价数量需要提取括号内数字 ratings response.css(.product .rating span:nth-child(2)::text).re(r\((\d)评价\))XPath方案# 商品标题 titles response.xpath(//div[classproduct]/h3/a/text()).getall() # 商品价格 prices response.xpath(//p[classprice]/text()).getall() # 评价数量 ratings response.xpath(//div[classrating]/span[contains(text(), 评价)]/text()).re(r\((\d)评价\))4.4 选择器编写技巧尽量使用唯一的属性优先选择id或独特的class避免使用可能重复的标签名避免过于脆弱的选择器不要依赖绝对路径或固定位置如div[3]利用浏览器工具验证在开发者工具的Console中用$x(xpath)或$(css)测试考虑性能越具体的选择器通常性能越好处理动态属性有些class是动态生成的可以用contains或starts-with匹配部分值5. 常见问题与调试技巧5.1 选择器失效的常见原因元素是动态加载的页面通过JavaScript异步加载内容初始HTML中没有解决方案使用Selenium等工具或分析AJAX请求iframe嵌套目标元素在iframe中解决方案先切换到iframe上下文属性值变化class或id包含随机字符串解决方案使用部分匹配contains(class, product)网页结构变化网站改版导致选择器失效解决方案编写更健壮的选择器定期维护爬虫5.2 调试工具与方法Scrapy Shellscrapy shell url # 然后可以交互式测试选择器 response.css(selector).get()浏览器开发者工具Elements面板查看完整DOM结构Console面板测试CSS/XPath选择器Network面板分析数据请求打印中间结果print(response.text[:500]) # 查看部分HTML print(response.css(selector).get()) # 检查选择结果5.3 性能优化建议避免使用//开头的XPath这会搜索整个文档性能较差缓存选择器结果重复使用已解析的选择器限制提取范围先选择父元素再在子范围内查找使用更高效的选择器ID选择器最快复杂选择器较慢5.4 反爬虫应对策略设置合理的请求头headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) ..., Accept-Language: zh-CN,zh;q0.9 }添加请求延迟DOWNLOAD_DELAY 2 # 2秒延迟使用代理IP需谨慎合法使用# 在settings.py中 PROXY http://proxy_ip:port处理Cookie和Session# 在Request中传递cookies yield scrapy.Request(url, cookies{key: value})在实际项目中我通常会先花时间仔细分析网页结构编写多个备选选择器方案然后通过Scrapy Shell交互测试选择最稳定高效的方案。记住一个健壮的爬虫不在于代码有多复杂而在于对目标网站的理解有多深入。

相关新闻

终极鼠标轨迹分析:用MouseTracks深度挖掘你的数字行为模式

终极鼠标轨迹分析:用MouseTracks深度挖掘你的数字行为模式

终极鼠标轨迹分析:用MouseTracks深度挖掘你的数字行为模式 【免费下载链接】MouseTracks Track and display mouse, keyboard and gamepad information for different applications. 项目地址: https://gitcode.com/gh_mirrors/mo/MouseTracks 想要真正了解你…

2026/8/3 1:31:15阅读更多 →
终极指南:如何用Yelp数据集示例三步开启你的数据分析之旅

终极指南:如何用Yelp数据集示例三步开启你的数据分析之旅

终极指南:如何用Yelp数据集示例三步开启你的数据分析之旅 【免费下载链接】dataset-examples Samples for users of the Yelp Academic Dataset 项目地址: https://gitcode.com/gh_mirrors/da/dataset-examples 想要探索真实商业数据却不知从何下手&#xff…

2026/8/3 1:31:15阅读更多 →
3分钟搞定网站整站下载:Website-downloader 终极指南

3分钟搞定网站整站下载:Website-downloader 终极指南

3分钟搞定网站整站下载:Website-downloader 终极指南 【免费下载链接】Website-downloader 💡 Download the complete source code of any website (including all assets). [ Javascripts, Stylesheets, Images ] using Node.js 项目地址: https://g…

2026/8/3 1:31:15阅读更多 →
【机器学习】DBSCAN聚类算法——原理、参数调优与实战

【机器学习】DBSCAN聚类算法——原理、参数调优与实战

DBSCAN聚类算法:从原理到参数调优实战简介一、DBSCAN 相关概念核心概念图解核心术语详解算法实现流程二、DBSCAN 的 API核心参数说明三、案例分析1. 导入所需库2. 数据读取与标准化3. 数据准备4. DBSCAN 参数调优5. 确定最佳参数并输出结果总结关键参数调优建议简介…

2026/8/3 2:48:11阅读更多 →
Unity3D MMORPG手游战斗系统架构设计与C#实战解析

Unity3D MMORPG手游战斗系统架构设计与C#实战解析

1. 项目概述:为什么MMORPG战斗系统是手游成败的关键在手游开发领域,尤其是MMORPG这个红海赛道,战斗系统的好坏几乎直接决定了产品的生死。它不仅仅是玩家与游戏世界交互的核心,更是承载付费、社交、策略和长期留存的关键模块。一个…

2026/8/3 2:48:11阅读更多 →
Unity动画进阶:Parent Constraints实现动态装备绑定与平滑切换

Unity动画进阶:Parent Constraints实现动态装备绑定与平滑切换

1. 项目概述:从父子关系到约束关系的思维跃迁如果你是一个Unity动画师或者技术美术,肯定对“父子关系”(Parenting)这个操作熟得不能再熟了。把一把剑拖到角色的手上,让它成为手骨骼的子物体,这是最直接、最…

2026/8/3 2:48:11阅读更多 →
AI实验自动化调度框架:基于成本感知的智能GPU资源管理

AI实验自动化调度框架:基于成本感知的智能GPU资源管理

1. 项目概述:当AI实验遇上“电费焦虑”如果你也搞过深度学习,尤其是需要长时间训练模型或者跑大量对比实验,那对下面这个场景肯定不陌生:盯着屏幕上的训练进度条,心里盘算着这次实验要跑多久,然后目光不自觉…

2026/8/3 2:48:11阅读更多 →
通义千问多模态能力赋能菜鸟无人分拣站:实时图像语义理解落地细节首度公开(含SDK调用密钥配置清单)

通义千问多模态能力赋能菜鸟无人分拣站:实时图像语义理解落地细节首度公开(含SDK调用密钥配置清单)

更多请点击: https://intelliparadigm.com 第一章:通义千问多模态能力赋能菜鸟无人分拣站:实时图像语义理解落地细节首度公开(含SDK调用密钥配置清单) 在菜鸟物流杭州萧山智能分拣中心,通义千问Qwen-VL模型…

2026/8/3 2:48:11阅读更多 →
阿里云盘自动签到脚本:告别手动操作,智能管理云存储空间

阿里云盘自动签到脚本:告别手动操作,智能管理云存储空间

阿里云盘自动签到脚本:告别手动操作,智能管理云存储空间 【免费下载链接】QLScriptPublic 青龙面板脚本公共仓库 企鹅交流1021185005 项目地址: https://gitcode.com/GitHub_Trending/ql/QLScriptPublic 阿里云盘作为主流的云存储服务&#xff0c…

2026/8/3 2:44:10阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/3 0:29:53阅读更多 →
限时公开!某头部SaaS公司内部AI模板工厂架构文档(含5类行业模板源码+性能压测报告)

限时公开!某头部SaaS公司内部AI模板工厂架构文档(含5类行业模板源码+性能压测报告)

更多请点击: https://intelliparadigm.com 第一章:AI模板批量生成的核心价值与落地全景 AI模板批量生成正从实验性工具演进为现代软件工程的关键基础设施。它通过语义理解、上下文感知与结构化约束,将重复性高、模式明确的代码/文档/配置生成…

2026/8/3 0:33:53阅读更多 →
如何快速找回消失的网页:Web Archives浏览器扩展终极指南

如何快速找回消失的网页:Web Archives浏览器扩展终极指南

如何快速找回消失的网页:Web Archives浏览器扩展终极指南 【免费下载链接】web-archives Browser extension for viewing archived and cached versions of web pages, available for Chrome, Edge and Safari 项目地址: https://gitcode.com/gh_mirrors/we/web-a…

2026/8/3 0:20:37阅读更多 →
3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南 【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。…

2026/8/3 0:00:32阅读更多 →
[具身智能-181]:PC+服务器+具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构

[具身智能-181]:PC+服务器+具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构

PC服务器具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构一、前言:具身智能需要“混合算力闭环系统”传统人工智能依赖云端静态数据集训练,不具备物理交互能力,无法适应真实世界的不确定性。具身智能(Embodied…

2026/8/3 0:00:32阅读更多 →
[具身智能-181]:大分布式通信模型对比:看懂为什么 DDS 是 ROS2 底层通信最优解

[具身智能-181]:大分布式通信模型对比:看懂为什么 DDS 是 ROS2 底层通信最优解

前言构建机器人、具身智能这类分布式实时系统,通信底座直接决定整套系统的实时性、容错性、组网能力。分布式领域长期存在 4 类经典通信架构:点对点模式、Broker 中间代理模式、广播模式、以数据为中心(DDS)模式。很多开发者疑惑&…

2026/8/3 0:00:32阅读更多 →
无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理 【免费下载链接】lossless-cut The swiss army knife of lossless video/audio editing 项目地址: https://gitcode.com/gh_mirrors/lo/lossless-cut 在数字媒体创作领域,视频编辑处理的质量损…

2026/8/3 2:32:59阅读更多 →
AI辅助本科论文写作:8大工具评测与高效使用指南

AI辅助本科论文写作:8大工具评测与高效使用指南

1. 本科生论文写作的AI辅助现状本科毕业论文是每个大学生必须跨越的一道坎。记得我当年写论文时,光是文献检索就花了整整两周时间,打印的参考文献堆满了半个书桌。如今AI技术的发展为学术写作带来了革命性变化,合理使用这些工具可以节省80%以…

2026/8/3 2:33:01阅读更多 →
如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手 【免费下载链接】ticket-purchase 大麦自动抢票,支持人员、城市、日期场次、价格选择 项目地址: https://gitcode.com/GitHub_Trending/ti/ticket-purchase 还在为抢不到热门演唱会门票…

2026/8/3 2:33:04阅读更多 →