
MediaCrawler 快速上手指南3 步跑通 7 平台社媒数据采集【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 是一款开源的多平台自媒体数据采集工具覆盖小红书、抖音、快手、B 站、微博、贴吧、知乎 7 个平台支持关键词、指定帖子、创作者主页三种采集方式能拿到帖子内容与评论数据适合想低成本获取社媒公开数据做分析的新手。本文按从 0 跑通采集、再把数据用起来的主线走完整流程。 先弄清三个让你犹豫的问题这一节不动环境先消除多数人看到爬虫时最担心的三件事。为什么不用做 JS 逆向多数爬虫项目的门槛在接口签名——平台请求参数经过加密手写逆向耗时且容易失效。MediaCrawler 绕开了这一步基于 Playwright浏览器自动化库把登录态存在浏览器上下文里签名参数通过浏览器内的 JS 表达式直接获取。你只需像普通用户一样扫码登录一次后续请求复用这份状态。登录态怎么保持默认配置开启了 CDP 模式ENABLE_CDP_MODE True程序直接连你本机正在使用的 Chrome版本需 144 以上复用真实的 Cookie 和浏览历史比新启动一个干净浏览器更难被平台风控识别。只有切回标准 Playwright 模式ENABLE_CDP_MODE False时才需要预先执行uv run playwright install安装浏览器驱动。数据存在哪里默认以 JSONL 格式追加写入data/目录。存储格式可用--save_data_option切换支持 jsonl、csv、json、excel、sqlite、mysql、postgres 共 7 种数据量上来后存数据库能获得去重能力。⏱️ 装好环境并跑通首次采集目标拿到第一批数据。前置依赖只有三样——Python 包管理器 uv、Node.js 16 以上抖音和知乎的签名计算靠它执行 JS 脚本、最新版 Chrome。先克隆仓库并进入项目目录git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler接着安装全部 Python 依赖uv sync然后开启 Chrome 远程调试地址栏输入chrome://inspect/#remote-debugging勾选 Allow remote debugging for this browser instance看到Server running at: 127.0.0.1:9222即就绪。最后跑第一条采集命令用小红书 App 扫弹出的二维码完成登录uv run main.py --platform xhs --lt qrcode --type searchdata/目录下出现 JSONL 文件说明首跑成功。️ 改好关键参数选定采集模式所有可调项集中在 config/base_config.py每个参数都有中文注释首次使用只需要盯住下面三处。三个必改参数参数控制什么初始值KEYWORDS关键词搜索词多个词用英文逗号分隔示例词编程副业,编程兼职需换成你自己的CRAWLER_MAX_NOTES_COUNT单次采集的帖子数量上限15CRAWLER_MAX_SLEEP_SEC每次请求之间的休眠秒数2三种采集模式选一种模式由--type决定各自交付的内容不同关键词搜索--type search拿到命中关键词的帖子及其评论需要填KEYWORDS指定帖子--type detail拿到某个帖子的详情与评论需要在各平台配置中填帖子 ID 列表如XHS_SPECIFIED_ID_LIST、BILI_SPECIFIED_ID_LIST创作者主页--type creator拿到某创作者的公开内容与评论需要填创作者 ID。也可以启动可视化界面不想敲命令的话开两个终端分别起后端和前端第二个先cd webui即可在浏览器里配置参数、看实时日志、预览并导出数据。uv run uvicorn api.main:app --port 8080 --reloadnpm run dev建议先用一个平台的 search 模式跑通确认数据文件里的字段完整再扩展其他模式。 给长期采集配好代理池短频快的小任务用自己的 IP 就够了连续跑几个小时时建议启用代理否则本机 IP 受限的风险会明显上升。内置代理池支持快代理、豌豆 HTTP 两类服务商也支持填自己的静态代理地址实现代码在 proxy/ 目录。启用只需两步把ENABLE_IP_PROXY改为True在IP_PROXY_PROVIDER_NAME选服务商kuaidaili/wandouhttp/static再到对应服务商后台开通 IP 提取接口。启动后程序从服务商拉取 IP、存入 Redis 建池请求失败时自动换下一个可用 IP服务商开通后提取密钥要通过环境变量填入由 proxy/providers/ 下的服务商配置类读取选型经验低频试用选免费额度即可长期项目选独享或隧道类产品避免与他人共享 IP 被连带封禁流程细节见 代理使用文档。 从关键词监控到词云把数据用起来的两种方式以跟踪某产品口碑为例把KEYWORDS设为产品名打开ENABLE_GET_COMMENTS与ENABLE_GET_SUB_COMMENTS抓全一级与二级评论。之后有两条用法快速看讨论集中在哪把ENABLE_GET_WORDCLOUD设为True项目直接生成评论词云图自定义词组写进CUSTOM_WORDS停用词维护在 docs/hit_stopwords.txt方法见 词云图使用配置做精细分析切换 Excel 导出多工作表、带格式做情感归类或存数据库做反复查询。先用小批量数据试一次词云确认评论字段正确再扩大采集量。 处理高频故障并记住三条使用边界现象 → 先查哪里现象先查哪里抖音/知乎报execjs缺少;Node.js 未安装或版本低于 16小红书扫码后一直卡滑块没连真实浏览器删除项目根目录brower_data缓存后重新登录playwright 30 秒超时本机网络或代理问题检查外网连通性提示连不上 9222 端口Chrome 未运行、远程调试未勾选或版本低于 144之前能跑现在失效账号触发风控调低频率或删除brower_data换账号重新登录更多问题在 常见问题文档 里逐条解答。三条使用边界用途项目许可为非商业学习仅采集公开信息遵守目标平台服务条款与 robots 协议频率默认 2 秒休眠、并发 1 已是保守设置不建议再调激进隐私评论里可能出现他人手机号、住址等信息落库和分享前先脱敏数据仅用于分析。日常维护记住两点Chrome 保持最新版登录态过期时优先用 CDP 复用已有登录而不是反复重扫。 资源入口克隆仓库即可开始git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler仓库内常用文档数据存储指南7 种存储格式的使用示例代理使用文档各服务商的开通与配置步骤词云图使用配置词云生成与自定义词组配置常见问题报错与故障的逐条解答。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考