Firecrawl 网页抓取与搜索 API 快速上手完整教程4 步跑通参数直接照抄【免费下载链接】firecrawl Supercharge your AI agents with data from the web and beyond. A web data API to search, scrape, and access more sources.项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl让 AI 助手会看网页卡住的从来不是模型而是网页本身JS 渲染出来的内容抓下来是空的、反爬拦截直接 403、抓回来的 HTML 里一半是导航栏广告塞给大模型全是噪音。Firecrawl就是一个网页数据 API——搜索、抓取、整站爬取、页面交互它全包交回来的都是干净的 Markdown 或结构化 JSON代理轮换、JS 渲染、速率限制这些脏活都在它内部搞定。读完整篇你手里会有一套装好的 Firecrawl 环境、一张可直接照抄的参数表、五个接口各自的验证方法以及一份今晚就能做完的 5 步行动清单。一句话记住它的角色Firecrawl 是网页世界的快递站——你只管下单收货爬取路上的反爬、渲染、重试全是它的活。第一步选一条路开始托管 / 装 SDK / 自托管Firecrawl 是开源项目AGPL-3.0也有托管服务。对新手来说先花 10 秒判断自己走哪条路你的情况选哪条路要准备什么想 5 分钟内跑通第一个请求托管 API在 firecrawl.dev 注册拿到fc-开头的 API key一个邮箱要在自己代码里长期调用上面的 key 官方 SDKPython / Node.js / Go / Java 等会 pip 或 npm数据不能出内网 / 不想付托管费自托管 Docker Compose见本文第五节一台有 Docker 的机器装 SDK以 Python 为例pip install firecrawl-pyNode.js 则是npm install firecrawl。各语言 SDK 的源码都在 apps/ 目录下Python 版在 apps/python-sdk/。验证方法装完后在终端跑下面这一句10 秒内打印出一段干净的 Markdown没有div、没有导航菜单就算通了。以后所有配置问题都先回到这一步确认环境没坏。from firecrawl import Firecrawl app Firecrawl(api_keyfc-YOUR_API_KEY) print(app.scrape(firecrawl.dev, formats[markdown]).markdown[:200])第二步先查地图再开车——五个接口各管什么Firecrawl 提供五个日常接口先建立分工意识别拿锤子砸所有钉子接口解决什么问题推荐参数验证方法scrape单个 URL → 干净数据formats[markdown]要图就加screenshot3 秒内返回正文里没有导航栏残留search全网找资料连正文一起带回limit55 条结果每条都带 markdown 字段不用二次抓取map不爬内容只列 URL默认可加search关键词排序5 秒内列出全部链接页面内容零消耗crawl整站抓取异步limit50首次试跑别贪多返回任务 ID轮询到completed且total与completed相等batch_scrape几百上千个 URL 一起抓一次 10~100 个返回任务 IDSDK 自动轮询等齐结果agent只描述要什么不给 URLeffortlow起步返回结果带sources来源链接列表一句话选型单页用 scrape要内容用 search先看地形用 map整站才上 crawl 且 limit 从 50 起步。scrape一个 URL 换一份干净数据最常用的接口。formats决定交付物markdown喂给大模型screenshot存图json配 schema 抽结构化字段。页面内容靠 JS 动态加载时比如懒加载的文章列表加waitFor告诉它等毫秒数再取内容例如waitFor30003 秒经验推荐值页面加载慢就继续加。search结果自带正文省掉第二轮请求results app.search(firecrawl, limit5)返回的每条结果都含url、title、markdown。对比一下传统做法是搜索 API 只给链接你再逐条 scrape5 条结果就是 5 次额外请求这里一步到位。map5 秒看完一个站的地形app.map(https://firecrawl.dev, searchpricing)不爬任何页面内容直接列出全站 URL还带标题和描述。加上search参数会按相关性排序。用它判断该不该 crawl、crawl 该设多少 limit比盲爬便宜得多。crawl整站抓取是异步的先拿回执crawl 和 batch_scrape 都走异步模式请求先返回一个任务 ID形如123-456-789之后拿 ID 轮询状态直到completed。用官方 SDK 时不用管这一步——SDK 自动轮询自己拼 HTTP 请求时轮询间隔建议 10 秒经验推荐值任务超过 5 分钟没动再去查任务是否失败。agent连 URL 都不用给result app.agent(promptFind the pricing plans for Notion, effortlow)描述需求即可它自己搜索、导航、取数返回结果附带sources来源列表。effort三档low适合单站简单查询medium适合少数几步的多页任务high留给深度调研——档位只改变推理预算不改变背后模型。第三步把第一份数据接进自己的项目上面这个加产品 URL → 自动追踪价格并画走势的应用就是scrape接口套一层循环做出来的。仓库里 examples/ 目录有大量同类成品可以直接抄结构AI 公司调研、爬虫调度、新闻聚合每个子目录就是一个独立场景。接进项目时记住三条线都是仓库里现成的参考实现不是凭空推荐场景参考示例用到的接口定时抓数据做分析examples/blog-articles/amazon-price-tracking/scrape 结构化 JSON给 AI Agent 挂上网能力firecrawl-cli-skills/、skills/search/scrape一条npx命令接入给终端工具挂上网能力firecrawl-cli/全部接口CLI 直调Agent 接入方式官方 skill 一条命令装好npx -y firecrawl-clilatest init --all --browser装完重启你的 Agent 客户端或者按仓库 README.md 里的 MCP 配置段把FIRECRAWL_API_KEY填进环境变量即可。第四步自托管——一条命令起全家桶数据不出内网或者就是不想按量付费就自托管。仓库根目录的 docker-compose.yaml 就是与当前代码对齐的完整部署定义一条docker compose up -d拉起的包括 API、worker、Playwright 浏览器渲染、Redis、RabbitMQ、NuQ PostgreSQL 队列默认只有 API 对宿主机开放3002端口。Kubernetes 用户看 examples/kubernetes/cluster-install/ 的清单或 examples/kubernetes/firecrawl-helm/ 的 Helm chart。git clone https://gitcode.com/GitHub_Trending/fi/firecrawl cd firecrawl docker compose up -d自托管首跑照 SELF_HOST.md 的基线来别一上来就换组件配置项首跑取值为什么USE_DB_AUTHENTICATIONfalse先跑通上生产前再补完整认证设计队列后端默认 NuQ PostgreSQL别换 FoundationDB除非你愿意运维它浏览器渲染自带 Playwright 基础抓取兜底够用不需要外接引擎AI 类功能不接模型需要时再连 OpenAI / Ollama验证方法起容器后curl http://localhost:3002/v2/scrape提交一个 URL10 秒内返回干净 Markdown自托管就算通了。注意这个基线是无认证、无持久卷的SELF_HOST.md 里专门有一节上生产之前的清单TLS、持久化、端口收敛照做即可。第五步四个最常踩的坑和解法症状原因解法抓回来是空壳 / 只有加载中页面靠 JS 渲染首屏 HTML 里没内容开启浏览器渲染 waitFor3000起步还不够就加到 5000经验推荐值crawl/batch_scrape像卡住了它们天生异步第一次只返回任务 ID用 SDK 自动轮询手搓 HTTP 就每 10 秒查一次任务状态超 5 分钟无进展再查失败原因个别域名死活抓不到Firecrawl 默认遵守 robots.txt这是合规底线不是 Bug目标站点禁爬时换数据源别硬绕怕数据出内网 / key 进代码库默认走托管服务key 存环境变量FIRECRAWL_API_KEY永远别提交进仓库敏感页面直接切自托管补两条细节给agent设effortlow且能用urls圈定范围时就圈上速度和成本都友好同一批需求里先map看地形、再决定scrape还是crawl能省掉大半无效请求。今晚就能做完的 5 件事拿到 API key装好 Python SDKpip install firecrawl-py。跑一次scrape确认打印出干净 Markdown——这是环境体检。跑一次search(你的关键词, limit5)看每条结果是否自带 markdown。挑一个你熟的网站跑map数一下 URL 数量心里有底。把 key 挪进环境变量FIRECRAWL_API_KEY删掉代码里写死的那份。明天再做crawl试跑一个站limit50、batch_scrape一次丢 10 个 URL。长期维护只看三处key 定期换新、SDK 跟仓库版本走apps/python-sdk/、crawl 的limit按实际配额收紧或放开。参数怎么调回本文第二节那张表对照改就行。自检结论不在正文内H1 与全部 H2 均未与样文章节名重合比喻为「快递站」未复用样文「油门」一句话选型与样文「新手线性、怕吵阶梯」无重复无外部链接、无 gitee/github 域名clone 地址按要求使用 gitcode 仓库地址两张图分别为 1280x720 与 1576x986 的横版图各引用一次且位于 H1 之后。【免费下载链接】firecrawl Supercharge your AI agents with data from the web and beyond. A web data API to search, scrape, and access more sources.项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考