news 2026/8/22 2:09:59

小红书数据采集完整指南:用 xhs 三步拿到笔记、评论与用户数据

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
小红书数据采集完整指南:用 xhs 三步拿到笔记、评论与用户数据

小红书数据采集完整指南:用 xhs 三步拿到笔记、评论与用户数据

【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs

每晚盯着竞品品牌的新品笔记:逐条打开、手动记下点赞和收藏数、再翻评论区看用户吐槽,忙完一晚上快过完了。开源工具 xhs 把小红书 Web 端请求封装成 Python 接口:想取什么,调用对应方法,笔记、评论、用户数据都能拿到。

📦 项目速览:这个小红书数据采集工具能干什么

xhs 是基于小红书 Web 端请求封装的开源爬虫,在 PyPI 上发布,一条命令就能装好。初始化客户端后,你只需要调用对应方法就能拿到结构化数据,不用自己啃签名算法。

  • 核心接口全封装:笔记详情、用户资料、主页推荐、关键词搜索,公开数据一次拿全
  • 多级评论支持:一级评论、子评论都能取,讨论现场完整还原,口碑分析不用靠猜
  • 交互功能内置:点赞、收藏、关注、发评论都支持,一套接口"读"和"写"都管
  • 两种签名方案:纯 Python 签名与浏览器模拟签名任选,防伪算法不用自己研究
  • 文档示例齐全:basic、crawl、creator 三份文档(docs/basic.rst、docs/crawl.rst、docs/creator.rst),example 目录还有多份可直接运行的脚本

🚀 半小时跑通:安装步骤与配置方法

第一步:安装依赖

需要 Python 3.7 及以上版本。除了 xhs 本体,还要装 playwright 和浏览器内核,用来模拟浏览器生成签名:

pip install xhs pip install playwright playwright install

第二步:准备"入场券"(Cookie)

小红书接口每次请求都要求带 x-s 签名,相当于给请求盖上的"防伪章";同时还得带上你自己的登录 Cookie,也就是"入场券"。在已登录的小红书网页版里打开浏览器开发者工具,从请求头里复制 Cookie,确认a1web_sessionwebId三个字段都在,缺一个都跑不起来。

第三步:运行第一个示例

example/basic_usage.py 是最佳起点,把文件里的 cookie 换成你自己的,运行python example/basic_usage.py,就能打印出指定笔记的完整 JSON——标题、正文、点赞、收藏、评论数、图片链接全在里面。想自己调接口,核心就这几行:

from xhs import XhsClient client = XhsClient(cookie="your_cookie", sign=sign) note = client.get_note_by_id("笔记ID", "xsec_token")

跑通之后,去 docs/crawl.rst 里对着接口清单挑功能就行。

🎯 核心功能与适用场景

关键词搜索:怎么查一个选题的热度

定内容方向之前,先看看市场。get_note_by_keyword()按关键词搜笔记,支持按热度、时间排序;再配合get_note_by_id()拉出每篇的详情,标题和封面套路就摸清了,动手之前心里已有底。适合内容创作者、新媒体小编做选题调研。

竞品监控:怎么盯住对手的更新数据

想知道对手多久发一篇、哪类内容最容易爆。get_user_info()拿用户资料,get_user_notes()批量拉取笔记列表,get_user_all_notes()自动翻页。按天定时跑一遍,对手的更新节奏和内容规律就一目了然。适合品牌运营、电商从业者。

评论挖掘:怎么把整条评论区拿下来

评论区才是最真实的口碑现场。get_note_comments()取一级评论,get_note_sub_comments()往下钻子评论,get_note_all_comments()一次自动拉完。这是你零成本能拿到的最真实的产品反馈。适合做产品口碑分析、用户画像研究的团队。

⚠️ 常见报错与避坑

  • 签名失败了怎么办?浏览器签名偶发抽风,示例已内置重试逻辑,直接重跑即可;总不行就把页面加载后的等待时间调长一点,也可以改用 xhs.help 内置的纯 Python 签名试试。
  • 提示 IP 风控或封禁?高频请求最容易触发风控,请求之间加上几秒间隔,慢一点反而更稳。
  • 多账号共用签名服务?进阶用法是把签名部署成独立服务(见 example/basic_sign_server.py),多账号共用时务必让各账号 Cookie 里的a1 保持一致,否则会一直签名报错。
  • 合规提醒:只采集公开可访问的数据,不给目标网站施压,遵守法律法规与平台规则;项目为个人学习用途的开源作品,使用风险请自行评估。

让代码替你做重复劳动,你的精力留给业务本身。运行git clone https://gitcode.com/gh_mirrors/xh/xhs拿到源码,今晚就能跑通 example 里的第一个示例。

【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/22 2:07:44

Contextor:专为LLM优化的Python代码仓库结构分析工具

这次我们来看一个专门为 Python 代码仓库分析设计的 LLM 工具:Contextor。它的核心目标非常明确——在利用大语言模型(LLM)进行代码理解、重构或生成时,极大地节省用于描述项目结构的上下文令牌(Tokens)。对…

作者头像 李华
网站建设 2026/8/22 2:07:40

AI图表生成工具Outline /show-me功能部署与集成实践指南

这次我们来看一个来自 HumanLayer 的 Outline 项目,它最近发布了一个名为/show-me的新功能。这个功能的核心目标很直接:让你用自然语言描述一个想法,它就能自动生成对应的图表、流程图或示意图。对于需要快速将概念可视化的开发者、产品经理或…

作者头像 李华
网站建设 2026/8/22 2:03:46

Perplexity Computer邮件任务:AI视觉驱动的工作流自动化实践

上周,我正为一个跨时区的项目焦头烂额。团队在海外,我需要快速汇总几个不同来源的行业报告,提炼出关键数据点,然后整理成一份清晰的邮件摘要,发给国内的决策层。这听起来简单,但实际操作起来,你…

作者头像 李华
网站建设 2026/8/22 2:03:08

医疗AI安全实战:基于零信任与gVisor沙箱构建自主智能体防护架构

1. 项目概述:当自主AI进入医疗,我们如何构建“零信任”的牢笼?最近和几个在医疗科技公司做架构的朋友聊天,大家不约而同地提到了同一个焦虑点:AI Agent(智能体)正在快速渗透到诊疗辅助、影像分析…

作者头像 李华
网站建设 2026/8/22 2:00:38

如何评价河南粉笔双师线下班?

全面拆解模式、优势与适配人群摘要:河南粉笔双师线下班,是面向河南国省考考生打造的本土化 OMO备考产品,把郑州基地同款头部师资、本地化教研、线上线下双维度督学服务落地各地市,兼顾名师教学、线下学习氛围与高性价比&#xff0…

作者头像 李华
网站建设 2026/8/22 1:57:43

magnetW 磁力搜索:把 26 个资源站装进同一个搜索框

magnetW 磁力搜索:把 26 个资源站装进同一个搜索框 【免费下载链接】magnetW [已失效,不再维护] 项目地址: https://gitcode.com/gh_mirrors/ma/magnetW 找一部老电影、一份教材,你是不是也经历过这样的循环:打开一个站点搜…

作者头像 李华