小红书数据采集终极指南:5分钟快速掌握Python自动化工具
小红书数据采集终极指南5分钟快速掌握Python自动化工具【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs想要轻松获取小红书公开数据进行内容分析和市场研究吗xhs项目为你提供了一个简单高效的Python解决方案。这个开源工具封装了小红书Web端的请求接口让你能够以编程方式访问笔记、用户、搜索等数据无需手动操作网页。无论你是数据分析师、内容创作者还是产品经理都能通过这个工具快速获取所需的小红书数据为你的决策提供有力支持。为什么选择小红书数据采集工具在当今社交媒体分析领域小红书已经成为不可忽视的内容平台。传统的网页爬虫开发需要处理复杂的反爬机制和频繁的接口变更而xhs工具帮你解决了这些痛点功能特点传统方法xhs工具接口稳定性需要频繁维护封装官方接口稳定性高反爬处理手动处理验证码、签名自动签名验证机制数据完整性可能缺失字段完整的数据结构开发效率数天到数周几分钟上手维护成本持续投入开源社区维护重要提示本工具仅用于学习和研究目的请遵守小红书平台的使用条款不要对网站造成压力或进行未经授权的活动。快速开始5分钟上手小红书数据采集安装步骤超简单首先确保你已安装Python 3.7或更高版本然后只需要一行命令pip install xhs如果你想要最新版本可以直接从Git仓库安装pip install githttps://gitcode.com/gh_mirrors/xh/xhs获取必要的认证信息要使用这个工具你需要准备两个关键信息Cookie- 从小红书网站获取的登录凭证签名函数- 处理请求签名的函数别担心这些听起来复杂其实很简单Cookie可以通过浏览器开发者工具获取而签名函数项目已经提供了示例。第一个采集脚本让我们写一个最简单的示例获取单篇笔记的详细信息from xhs import XhsClient # 初始化客户端 cookie 你的小红书cookie xhs_client XhsClient(cookie) # 获取笔记详情 note_id 6505318c000000001f03c5a6 note_data xhs_client.get_note_by_id(note_id) print(f笔记标题{note_data.get(title, 无标题)}) print(f作者{note_data.get(user, {}).get(nickname, 匿名)}) print(f点赞数{note_data.get(likes, 0)})核心功能深度解析1. 笔记数据获取 小红书数据采集工具提供了多种获取笔记数据的方式按ID获取单篇笔记# 获取指定ID的笔记 note xhs_client.get_note_by_id(笔记ID) # 获取笔记中的图片URL from xhs import help image_urls help.get_imgs_url_from_note(note)获取用户发布的笔记列表# 获取用户的所有笔记 user_notes xhs_client.get_user_notes(用户ID, page1)按关键词搜索笔记# 搜索美妆相关的笔记 search_results xhs_client.get_note_by_keyword( keyword美妆, page1, sortgeneral # 排序方式general(综合)、time(时间) )2. 用户信息分析 了解创作者信息对于内容分析至关重要# 获取用户基本信息 user_info xhs_client.get_user_info(用户ID) print(f用户名{user_info[nickname]}) print(f粉丝数{user_info[fans]}) print(f获赞数{user_info[likes]}) print(f笔记数{user_info[notes]})3. 内容分类浏览 ️工具内置了多种内容分类让你可以按兴趣领域获取内容from xhs import FeedType # 获取穿搭类内容 fashion_notes xhs_client.get_home_feed(FeedType.FASION) # 获取美食类内容 food_notes xhs_client.get_home_feed(FeedType.FOOD) # 获取旅行类内容 travel_notes xhs_client.get_home_feed(FeedType.TRAVEL)支持的内容分类包括穿搭FASION美食FOOD彩妆COSMETICS影视MOVIE职场CAREER情感EMOTION家居HOURSE游戏GAME旅行TRAVEL健身FITNESS实际应用场景案例场景1竞品内容分析假设你是一家美妆品牌的市场人员想了解竞品在小红书上的表现import pandas as pd from datetime import datetime, timedelta def analyze_competitor_content(competitor_id, days30): 分析竞品最近30天的内容表现 all_notes [] current_page 1 while True: notes xhs_client.get_user_notes(competitor_id, pagecurrent_page) if not notes: break # 过滤最近30天的笔记 cutoff_date datetime.now() - timedelta(daysdays) recent_notes [ note for note in notes if datetime.fromtimestamp(note[time]/1000) cutoff_date ] all_notes.extend(recent_notes) current_page 1 # 创建数据分析表 df pd.DataFrame(all_notes) # 计算关键指标 avg_likes df[likes].mean() avg_comments df[comments].mean() avg_shares df[shares].mean() return { total_notes: len(df), avg_likes: round(avg_likes, 2), avg_comments: round(avg_comments, 2), avg_shares: round(avg_shares, 2), best_performing: df.loc[df[likes].idxmax()] }场景2热门话题追踪追踪特定话题的热度变化发现内容趋势def track_topic_trend(keyword, days7): 追踪话题7天内的热度变化 daily_data {} for i in range(days): date datetime.now() - timedelta(daysi) date_str date.strftime(%Y-%m-%d) # 搜索当天相关笔记 results xhs_client.get_note_by_keyword( keywordkeyword, page1, sorttime ) daily_data[date_str] { total_notes: len(results), avg_likes: sum(n[likes] for n in results) / max(len(results), 1), top_note: max(results, keylambda x: x[likes]) if results else None } return daily_data常见问题与解决方案Q1: 如何获取有效的CookieA: 登录小红书网页版后按F12打开开发者工具在Network标签中找到任意请求复制Request Headers中的Cookie字段即可。Q2: 遇到签名失败错误怎么办A: 签名失败通常是因为签名函数配置问题。项目提供了完整的签名示例你可以参考 example/basic_usage.py 中的实现。Q3: 请求频率有限制吗A: 为了避免对小红书服务器造成压力建议添加适当的请求间隔如1-3秒避免短时间内大量请求同一接口使用代理IP轮换如果需要大量采集Q4: 数据采集的合法性如何A: 请务必注意仅采集公开数据不要用于商业侵权用途遵守robots.txt协议尊重用户隐私Q5: 如何保存采集的数据A: 建议使用以下格式保存数据import json import csv # 保存为JSON格式 with open(notes.json, w, encodingutf-8) as f: json.dump(notes_data, f, ensure_asciiFalse, indent2) # 保存为CSV格式 import pandas as pd df pd.DataFrame(notes_data) df.to_csv(notes.csv, indexFalse, encodingutf-8-sig)进阶使用技巧1. 错误处理与重试机制from xhs.exception import DataFetchError, IPBlockError import time def safe_get_note(note_id, max_retries3): 安全获取笔记带重试机制 for attempt in range(max_retries): try: return xhs_client.get_note_by_id(note_id) except (DataFetchError, IPBlockError) as e: if attempt max_retries - 1: raise wait_time 2 ** attempt # 指数退避 print(f请求失败{wait_time}秒后重试...) time.sleep(wait_time)2. 批量处理与进度显示from tqdm import tqdm def batch_process_notes(note_ids): 批量处理笔记显示进度条 results [] for note_id in tqdm(note_ids, desc处理笔记): try: note xhs_client.get_note_by_id(note_id) results.append(note) time.sleep(1) # 避免请求过快 except Exception as e: print(f处理笔记 {note_id} 失败: {e}) return results3. 数据清洗与格式化def clean_note_data(raw_note): 清洗和格式化笔记数据 cleaned { note_id: raw_note.get(id, ), title: raw_note.get(title, ).strip(), author: raw_note.get(user, {}).get(nickname, ), publish_time: datetime.fromtimestamp( raw_note.get(time, 0) / 1000 ).strftime(%Y-%m-%d %H:%M:%S), likes: raw_note.get(likes, 0), comments: raw_note.get(comments, 0), shares: raw_note.get(shares, 0), collects: raw_note.get(collects, 0), tags: [tag.get(name, ) for tag in raw_note.get(tag_list, [])], image_count: len(raw_note.get(images, [])), video_url: raw_note.get(video, {}).get(url, ) if raw_note.get(video) else } # 计算互动率 total_interactions cleaned[likes] cleaned[comments] cleaned[shares] cleaned[interaction_rate] round(total_interactions / max(cleaned[likes], 1), 4) return cleaned最佳实践建议数据采集策略分时段采集避免在高峰时段集中请求增量更新只采集新增或更新的内容数据验证定期检查数据完整性和准确性备份机制定期备份已采集的数据性能优化优化方向具体措施预期效果请求优化合并相似请求减少请求次数30%缓存策略本地缓存已获取数据降低重复请求50%并发控制合理设置并发数提升采集速度2-3倍错误恢复实现断点续采避免重复工作合规使用指南✅可以做的采集公开的笔记数据进行研究分析用于个人学习和小规模项目遵守平台的robots.txt规则❌禁止做的大规模商业数据采集侵犯用户隐私对服务器造成压力违反平台用户协议资源与支持官方文档项目的完整API文档可以在 docs/source/xhs.rst 找到包含了所有类和方法的详细说明。示例代码项目提供了丰富的示例代码帮助你快速上手example/basic_usage.py - 基础使用示例example/login_qrcode.py - 二维码登录示例example/basic_sign_server.py - 签名服务器示例核心源码如果你想深入了解实现原理可以查看核心源码xhs/core.py - 主要功能实现xhs/help.py - 辅助函数测试用例项目包含完整的测试用例确保代码质量tests/test_xhs.py - 主要功能测试tests/test_help.py - 辅助函数测试总结小红书数据采集工具为你提供了一个强大而灵活的数据获取方案。通过这个工具你可以快速获取小红书平台的公开数据深度分析内容趋势和用户行为自动化处理重复的数据采集任务构建应用基于小红书数据的分析系统记住技术只是工具如何使用它才是关键。始终将合规性和道德考量放在首位用技术创造价值而不是问题。希望这个工具能帮助你在小红书数据分析的道路上走得更远、更稳如果你在使用过程中遇到问题或者有改进建议欢迎参与项目的开发和讨论。开源社区的力量能让这个工具变得更加强大和完善。【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

XCOM2模组管理终极指南:AML启动器完全教程

XCOM2模组管理终极指南:AML启动器完全教程

XCOM2模组管理终极指南:AML启动器完全教程 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…

2026/7/29 23:20:53阅读更多 →
SmoothLife扩展指南:如何自定义规则集与参数优化

SmoothLife扩展指南:如何自定义规则集与参数优化

SmoothLife扩展指南:如何自定义规则集与参数优化 【免费下载链接】SmoothLife Continuous Domain Game of Life in Python with Numpy 项目地址: https://gitcode.com/gh_mirrors/smo/SmoothLife SmoothLife是一个基于Python和Numpy实现的连续域生命游戏&…

2026/7/29 23:18:53阅读更多 →
用adsb_deku打造个人航空监控系统:硬件选型与软件配置全攻略

用adsb_deku打造个人航空监控系统:硬件选型与软件配置全攻略

用adsb_deku打造个人航空监控系统:硬件选型与软件配置全攻略 【免费下载链接】adsb_deku ✈️ Rust ADS-B decoder tui radar application 项目地址: https://gitcode.com/gh_mirrors/ad/adsb_deku adsb_deku是一款基于Rust开发的ADS-B信号解码工具&#xf…

2026/7/29 23:18:53阅读更多 →
终极象棋AI助手:3步掌握Vin象棋智能连线工具

终极象棋AI助手:3步掌握Vin象棋智能连线工具

终极象棋AI助手:3步掌握Vin象棋智能连线工具 【免费下载链接】VinXiangQi Xiangqi syncing tool based on Yolov5 / 基于Yolov5的中国象棋连线工具 项目地址: https://gitcode.com/gh_mirrors/vi/VinXiangQi Vin象棋是一款基于Yolov5深度学习技术的专业级中国…

2026/7/30 0:33:01阅读更多 →
XXMI Launcher:一站式游戏模组管理终极指南,轻松管理原神、星穹铁道等热门游戏

XXMI Launcher:一站式游戏模组管理终极指南,轻松管理原神、星穹铁道等热门游戏

XXMI Launcher:一站式游戏模组管理终极指南,轻松管理原神、星穹铁道等热门游戏 【免费下载链接】XXMI-Launcher Modding platform for GI, HSR, WW and ZZZ 项目地址: https://gitcode.com/gh_mirrors/xx/XXMI-Launcher 还在为管理不同游戏的模组…

2026/7/30 0:33:01阅读更多 →
X-AnyLabeling:一站式AI智能标注解决方案,让数据标注效率提升10倍

X-AnyLabeling:一站式AI智能标注解决方案,让数据标注效率提升10倍

X-AnyLabeling:一站式AI智能标注解决方案,让数据标注效率提升10倍 【免费下载链接】X-AnyLabeling Open-source AI-assisted annotation platform for images, videos, text, and multimodal data. 项目地址: https://gitcode.com/gh_mirrors/xa/X-Any…

2026/7/30 0:33:01阅读更多 →
translate.js:5分钟实现企业级网站国际化的革命性自动化解决方案

translate.js:5分钟实现企业级网站国际化的革命性自动化解决方案

translate.js:5分钟实现企业级网站国际化的革命性自动化解决方案 【免费下载链接】translate AI i18n, Two lines of js realize automatic html translation. No need to change the page, no language configuration file, no API key, SEO friendly! 项目地址:…

2026/7/30 0:33:01阅读更多 →
小白程序员必看:收藏!如何避免被AI大模型供应商“套牢”?

小白程序员必看:收藏!如何避免被AI大模型供应商“套牢”?

本文探讨了AI模型供应商如何通过价格、工具链嵌入和中断依赖等方式绑定客户。文章指出,企业需警惕对单一模型的过度依赖,并介绍了微软、阿里等企业的应对策略,如自研模型和多模型路由。建议程序员了解这些策略,避免未来被供应商“…

2026/7/30 0:33:01阅读更多 →
私有化部署,企业 AI 定制绕不开的安全底线

私有化部署,企业 AI 定制绕不开的安全底线

# 私有化部署,企业 AI 定制绕不开的安全底线## 引言一家制造业企业的 CIO 在评估 AI 定制方案时,问了一个很直接的问题:我们的生产数据、客户数据、工艺参数,能不能不出公司。供应商说可以用云端方案,成本低、上线快。…

2026/7/30 0:31:01阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/29 9:47:45阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/29 7:00:19阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/29 7:58:51阅读更多 →
3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 [特殊字符]

3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 [特殊字符]

3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 🚀 【免费下载链接】TrollInstallerX A TrollStore installer for iOS 14.0 - 16.6.1 项目地址: https://gitcode.com/gh_mirrors/tr/TrollInstallerX 你是否曾经因为iOS系统的严格…

2026/7/30 0:00:58阅读更多 →
[GESP202606 四级] 扫雷

[GESP202606 四级] 扫雷

B4557 [GESP202606 四级] 扫雷 https://www.luogu.com.cn/problem/B4557 中国计算机学会(CCF)2026年6月C四级讲解——扫雷 https://www.bilibili.com/video/BV1MCMg6AEXR/ B4557 [GESP202606 四级] 扫雷 https://www.bilibili.com/video/BV1ZKTj6ZEVh/ 2…

2026/7/30 0:00:58阅读更多 →
Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/30 0:00:58阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/30 0:27:26阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/29 4:31:51阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/29 14:26:42阅读更多 →