MediaCrawler 多平台爬虫:7 个平台从扫码到落库的完整指南
【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler
MediaCrawler 是一款多平台爬虫工具,覆盖小红书、抖音、快手、B 站、微博、贴吧、知乎的公开笔记、视频、帖子与评论采集。如果你刚接触数据采集,不想从零啃签名逆向,可以从这里起步。
它帮你解决了什么
自己写爬虫,第一关通常不是发请求,而是登录态:扫两次码就失效、签名参数还要逆向,数据最后散落在各处不好用。MediaCrawler 的思路是把登录态留在浏览器里直接复用,绕开了逆向环节;采集结果统一写成 jsonl 或存进数据库,数据库模式自带去重,同一个关键词跑第二遍不会重复入库。
🚀 三步跑起来
环境准备其实就三步,前两件事各一条命令搞定。
- 拉代码:
git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler - 装依赖(需要预装 uv 和 Node.js ≥16):
cd MediaCrawler && uv sync - 打开 config/base_config.py 改好平台和关键词,再执行
uv run main.py --platform xhs --lt qrcode --type search,按终端提示扫码即可。
默认走 CDP 模式,连接你本机的 Chrome(在chrome://inspect页面开启远程调试),省去安装 Playwright 浏览器驱动这一步。
💡 上手两个典型场景
最常见的需求是"看看某个关键词下大家在聊什么"。以小红书为例:把PLATFORM设为xhs,KEYWORDS填入词(英文逗号分隔),CRAWLER_MAX_NOTES_COUNT控制抓多少条笔记,评论开关默认是开的,跑完在data目录就能拿到笔记和一级评论的 jsonl 文件。
反过来,如果手里已经有确定的抖音视频链接,就把链接贴进 config/dy_config.py 里的DY_SPECIFIED_ID_LIST,用--type detail启动。这个列表兼容完整链接、短链甚至纯视频 ID 几种写法。
其余能力一句话带过:指定创作者主页的 creator 模式、评论词云图、把结果导成 Excel 都可以直接开;不想敲命令的话,项目自带 WebUI 可视化界面,能在浏览器里配置参数并看运行日志。
⚠️ 避坑与进阶
踩坑基本集中在三处。一是扫码总是验证失败:先确认用的是 CDP 模式(ENABLE_CDP_MODE默认开启),真实 Chrome 环境加已有登录态,比裸浏览器抗风控得多;量大时把ENABLE_IP_PROXY打开,在IP_PROXY_PROVIDER_NAME里选提供商,proxy/ 目录下的代码会自动取 IP 并轮换。
二是数据格式不合用:SAVE_DATA_OPTION在 jsonl、sqlite、mysql、excel 之间切,数据库存储带去重,Excel 会在爬取结束时一次性刷盘。三是看不到进度:终端日志会逐条打印平台、内容 ID 和标题,WebUI 里也有对应的日志面板,对着日志排查卡在哪一步即可。
适合做社媒选题调研、竞品内容分析,或者单纯想搞清楚"浏览器自动化爬虫"整套是怎么搭起来的朋友,改很少的配置就能跑通关键词、扫码、抓评论、落库这条链路。遇到具体问题,建议先翻 docs/ 目录,代理用法、数据存储和常见问题都有现成说明。
【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考