开源项目
开源项目

firecrawl:把全网网页变成 LLM 能直接吃的干净数据(GitHub 星 16.1 万)

firecrawl/firecrawl(★16.1万、TypeScript、AGPL-3.0、2024-04-15 创建、8/5 仍在 push)是开源的 web context API,search/scrape/interact 三件套把任意网页转成干净 Markdown 或结构化 JSON 喂给 LLM 和 Agent。官方称覆盖 96% 网页、P95 3.4s,一条命令接 Claude Code/MCP。云端起约 $16-19/月,自托管免费但部分能力仅云端。

发布于 2026年8月5日8 分钟阅读
<!-- firecrawl-resource | open-source | firecrawl:把全网网页变成 LLM 能直接吃的干净数据 -->

大模型最缺的不是算力,是干净的上下文。你让 Agent 去查个竞品定价、抓个文档全文,它要么幻觉一通,要么给你一堆带 HTML 标签的乱码。Firecrawl 想解决的就是这一环——把任意网页变成 Markdown 或结构化 JSON,喂给 LLM 和 Agent 直接用。

它是什么

firecrawl(github.com/firecrawl/firecrawl)是一个开源的「web context API」,GitHub 星 16.14 万,fork 9107,主语言 TypeScript,AGPL-3.0 许可证,2024 年 4 月 15 日创建,最近一次 push 就在今天(2026 年 8 月 5 日)。一句话定位:search、scrape、interact 三件套,把全网网页内容转成干净的 Markdown 或结构化数据,让你的 agent 拿来即用。

它和传统爬虫(Scrapy、BeautifulSoup)的区别在于「为 LLM 而生」:输出是 LLM-ready 的 Markdown/JSON,不是原始 HTML;代理、限速、JS 渲染、反爬这些脏活它包了,官方称覆盖 96% 的网页、P95 延迟 3.4 秒(厂商自报,以官网为准)。它既是开源项目,也有托管服务 firecrawl.dev。

核心能力

端点作用
Search搜索全网,直接返回结果页的完整内容
Scrape把任意 URL 转成 Markdown / HTML / 截图 / 结构化 JSON
Interact先 scrape,再用 AI 提示或代码操作页面(点击、滚动、输入、等待)
Agent描述你要什么,AI agent 自己搜、导航、取数,不用给 URL
Crawl一个请求抓整站所有 URL
Map瞬间发现一个站点下的所有 URL
Batch Scrape异步批量抓数千个 URL

另外几个为 agent 设计的点:媒体解析(web 上的 PDF/DOCX 直接抽内容)、Actions(抓取前先点击/滚动/输入/按键)、一条命令接 MCP 客户端或 Claude Code 这类支持 Agent Skills 的 host。

怎么装怎么用

云端最快:去 firecrawl.dev 注册拿 API key(fc- 开头),装 SDK 就能用。Python:

python
from firecrawl import Firecrawl

app = Firecrawl(api_key="fc-YOUR_API_KEY")
result = app.scrape('firecrawl.dev')   # 返回干净 Markdown

cURL:

bash
curl -X POST 'https://api.firecrawl.dev/v2/scrape' \
  -H 'Authorization: Bearer fc-YOUR_API_KEY' \
  -H 'Content-Type: application/json' \
  -d '{"url": "firecrawl.dev"}'

也有 CLI(firecrawl scrape https://firecrawl.dev)。要接 agent,两条路:Skill 或 MCP。

Skill(支持 Claude Code、Antigravity、OpenCode 等 host):

bash
npx -y firecrawl-cli@latest init --all --browser

MCP server(在客户端配置里加):

json
{
  "mcpServers": {
    "firecrawl-mcp": {
      "command": "npx",
      "args": ["-y", "firecrawl-mcp"],
      "env": { "FIRECRAWL_API_KEY": "fc-YOUR_API_KEY" }
    }
  }
}

自托管与定价的坑

Firecrawl 是 AGPL-3.0 开源的,可以自托管,但有几个容易踩的点:

  1. 自托管不等于全功能。开源的是核心引擎,但部分能力(托管代理池、某些 extract 的高级模型)走的是云端,自托管拿不到全部。要「完全自主、数据不出门」得自己补代理和浏览器编排。
  2. AGPL-3.0 的传染性。如果你把 Firecrawl 改了用在网络服务里,AGPL 要求你开放你那部分源码。商用集成前先把这层法务过一遍,别以为「开源 = 随便用」。
  3. 定价是双轨。抓取按 credit 计费(云端付费档起约 $16–19/月,以官网为准),但 AI Extract / Agent 的结构化抽取是另一套按 token 的订阅(约 $89/月起),两套钱。以为月费包打天下的人会超支。
  4. 替代品要先比。如果只要免费自托管,Crawl4AI(完全开源免费)和 fastCRW(单二进制、1 页 1 credit 计费更可预测)都是常见替代。选型前按「要不要 LLM 输出 / 要不要自托管 / 预算」三条轴比一遍。

看法

Firecrawl 命中的是「LLM 应用缺干净 web 数据」这个真需求。它的护城河不是爬虫本身,而是把「代理 + JS 渲染 + 反爬 + LLM-ready 输出 + agent 集成」打包成一个 API,让做 RAG 和 Agent 的人不用再自己造爬虫轮子。16 万星、今天还在 push,说明这个定位踩准了。

它适合两类人:一是做 AI 应用 / Agent、需要实时喂网页数据的开发者;二是需要规模化抓取但不想维护爬虫基础设施的团队。门槛是你得接受要么付云端 credit、要么自己扛自托管的代理和浏览器运维。如果你只是偶尔抓几个页面、又对 LLM 输出没强需求,免费替代(Crawl4AI)可能更划算。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-05

相关文章