开源项目
开源项目

firecrawl:把全网网页变成 LLM 能直接吃的干净数据(GitHub 星 16.1 万)

firecrawl/firecrawl(★16.1万、TypeScript、AGPL-3.0、2024-04-15 创建、8/5 仍在 push)是开源的 web context API,search/scrape/interact 三件套把任意网页转成干净 Markdown 或结构化 JSON 喂给 LLM 和 Agent。官方称覆盖 96% 网页、P95 3.4s,一条命令接 Claude Code/MCP。云端起约 $16-19/月,自托管免费但部分能力仅云端。

发布于 2026年8月5日8 分钟阅读
<!-- firecrawl-resource | open-source | firecrawl:把全网网页变成 LLM 能直接吃的干净数据 -->

大模型最缺的不是算力,是干净的上下文。你让 Agent 去查个竞品定价、抓个文档全文,它要么幻觉一通,要么给你一堆带 HTML 标签的乱码。Firecrawl 想解决的就是这一环——把任意网页变成 Markdown 或结构化 JSON,喂给 LLM 和 Agent 直接用。

它是什么

firecrawl(github.com/firecrawl/firecrawl)是一个开源的「web context API」,GitHub 星 16.14 万,fork 9107,主语言 TypeScript,AGPL-3.0 许可证,2024 年 4 月 15 日创建,最近一次 push 就在今天(2026 年 8 月 5 日)。一句话定位:search、scrape、interact 三件套,把全网网页内容转成干净的 Markdown 或结构化数据,让你的 agent 拿来即用。

它和传统爬虫(Scrapy、BeautifulSoup)的区别在于「为 LLM 而生」:输出是 LLM-ready 的 Markdown/JSON,不是原始 HTML;代理、限速、JS 渲染、反爬这些脏活它包了,官方称覆盖 96% 的网页、P95 延迟 3.4 秒(厂商自报,以官网为准)。它既是开源项目,也有托管服务 firecrawl.dev。

核心能力

端点作用
Search搜索全网,直接返回结果页的完整内容
Scrape把任意 URL 转成 Markdown / HTML / 截图 / 结构化 JSON
Interact先 scrape,再用 AI 提示或代码操作页面(点击、滚动、输入、等待)
Agent描述你要什么,AI agent 自己搜、导航、取数,不用给 URL
Crawl一个请求抓整站所有 URL
Map瞬间发现一个站点下的所有 URL
Batch Scrape异步批量抓数千个 URL

另外几个为 agent 设计的点:媒体解析(web 上的 PDF/DOCX 直接抽内容)、Actions(抓取前先点击/滚动/输入/按键)、一条命令接 MCP 客户端或 Claude Code 这类支持 Agent Skills 的 host。

怎么装怎么用

云端最快:去 firecrawl.dev 注册拿 API key(fc- 开头),装 SDK 就能用。Python:

python
from firecrawl import Firecrawl

app = Firecrawl(api_key="fc-YOUR_API_KEY")
result = app.scrape('firecrawl.dev')   # 返回干净 Markdown

cURL:

bash
curl -X POST 'https://api.firecrawl.dev/v2/scrape' \
  -H 'Authorization: Bearer fc-YOUR_API_KEY' \
  -H 'Content-Type: application/json' \
  -d '{"url": "firecrawl.dev"}'

也有 CLI(firecrawl scrape https://firecrawl.dev)。要接 agent,两条路:Skill 或 MCP。

Skill(支持 Claude Code、Antigravity、OpenCode 等 host):

bash
npx -y firecrawl-cli@latest init --all --browser

MCP server(在客户端配置里加):

json
{
  "mcpServers": {
    "firecrawl-mcp": {
      "command": "npx",
      "args": ["-y", "firecrawl-mcp"],
      "env": { "FIRECRAWL_API_KEY": "fc-YOUR_API_KEY" }
    }
  }
}

自托管与定价的坑

Firecrawl 是 AGPL-3.0 开源的,可以自托管,但有几个容易踩的点:

  1. 自托管不等于全功能。开源的是核心引擎,但部分能力(托管代理池、某些 extract 的高级模型)走的是云端,自托管拿不到全部。要「完全自主、数据不出门」得自己补代理和浏览器编排。
  2. AGPL-3.0 的传染性。如果你把 Firecrawl 改了用在网络服务里,AGPL 要求你开放你那部分源码。商用集成前先把这层法务过一遍,别以为「开源 = 随便用」。
  3. 定价是双轨。抓取按 credit 计费(云端付费档起约 $16–19/月,以官网为准),但 AI Extract / Agent 的结构化抽取是另一套按 token 的订阅(约 $89/月起),两套钱。以为月费包打天下的人会超支。
  4. 替代品要先比。如果只要免费自托管,Crawl4AI(完全开源免费)和 fastCRW(单二进制、1 页 1 credit 计费更可预测)都是常见替代。选型前按「要不要 LLM 输出 / 要不要自托管 / 预算」三条轴比一遍。

看法

Firecrawl 命中的是「LLM 应用缺干净 web 数据」这个真需求。它的护城河不是爬虫本身,而是把「代理 + JS 渲染 + 反爬 + LLM-ready 输出 + agent 集成」打包成一个 API,让做 RAG 和 Agent 的人不用再自己造爬虫轮子。16 万星、今天还在 push,说明这个定位踩准了。

它适合两类人:一是做 AI 应用 / Agent、需要实时喂网页数据的开发者;二是需要规模化抓取但不想维护爬虫基础设施的团队。门槛是你得接受要么付云端 credit、要么自己扛自托管的代理和浏览器运维。如果你只是偶尔抓几个页面、又对 LLM 输出没强需求,免费替代(Crawl4AI)可能更划算。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-05

相关文章

开源项目

Qwen-MM-Plugins 深拆:让任意 agent 原生多模态

QwenLM/Qwen-MM-Plugins(2,908 星、Python、Apache-2.0、2026-07-29 创建、最近 push 2026-09-18,截至 2026-09-19 GitHub API)定位"让任意 agent harness 原生支持多模态":Skill 加 MCP 双层的按需感知插件集,接入 Claude Code、OpenClaw 等主流框架,补上 2026 年 coding agent 看不了音视频的短板。核心判断:它背靠 QwenLM 官方生态位,与 Qwen3.8-Omni-Flash 协同演进,是"模型加工具链"打法的具体落子;Apache-2.0 许可无商用红线,但插件深度绑定千问系模型,换底座时的迁移成本要心里有数。

2026年9月19日8 分钟阅读
开源项目

context-mode 深拆:AI 编程代理的上下文窗口优化

mksglu/context-mode(23,324 星、TypeScript、Elastic License 2.0、2026-02-23 创建、最近 push 2026-09-16,数据截至 2026-09-18 GitHub API)定位"为 AI 编程代理做上下文窗口优化":以 MCP 层沙箱拦截与压缩上下文,配 SQLite/FTS5 知识库与会话连续性设计,覆盖 17 个客户端。核心判断:它切中了长会话膨胀、关键指令被稀释、token 成本随长度上涨三重痛点;但必须如实指出 ELv2 不是 OSI 认证开源,有"不得作托管服务、不得移除许可证声明"两条红线,个人使用无碍,公司引入前要过法务。

2026年9月18日8 分钟阅读