Firecrawl:网页一键变 AI 能用数据,暴涨 16 万 Star(上手教程)

更新于 2026-08-06 14:12# AI# 教程# Agent

Firecrawl:把网页一键变成 AI 能用的数据,暴涨 16 万 Star

做 AI 应用的朋友应该都遇到过同一个麻烦:模型训练用的数据有截止日期,而现实世界每天都在变。想让 Agent 获取最新网页数据,往往只能自己搭爬虫(要解决 JS 渲染、反爬、代理池、数据清洗一堆问题),或者去买网页数据 API(成本高,返回的数据还不能直接用在大模型上)。

今天分享一个我们持续关注的开源项目——Firecrawl。它在 GitHub 上已经涨到 161,883 颗星、9,127 个 Fork,一句话概括:

把任意网页转换成干净的 Markdown 或结构化 JSON,通过一个 API 直接交给 AI 使用。

很多人第一眼会觉得"这不就是爬虫吗"。它要解决的其实不是"抓取网页",而是让网页数据能直接进入 AI 工作流

几个典型的实用场景

给 RAG 系统加上实时网页数据 比如你问"西门子最新推出的是什么产品",模型训练时不知道,但官网已经更新了。以前要重写爬虫、解析网页、清洗数据再导入向量库;现在直接抓官网页面拿到干净 Markdown,就能加进知识库。

批量提取商品、新闻等结构化数据 要分析几个竞品的网站,传统做法是给每个站写 CSS 选择器、XPath、正则,网站一变就得重新维护。Firecrawl 可以直接定义 JSON Schema(如商品名称、价格、评分、库存),返回标准 JSON,不用研究 DOM 结构,只要告诉它"要拿什么"。

让 AI 自己能上网找答案 这是最有趣的新功能:以前必须事先给好网址,现在只要说"整理出 OpenAI 最新模型价格",它就会自动去搜索网页、进站、浏览页面并提取结果——一个真正能"上网"的 Agent。

它是怎么做到的?

抓取层:12 种引擎并发竞速 内置 Playwright、Puppeteer、Chrome CDP 等 12 种抓取引擎,并发启动后自动选最快最稳的,自动处理 JS 渲染、代理轮换、反爬。开发者只要一行 app.scrape("https://example.com"),浏览器启动、页面加载、正文提取全自动。

输出层:LLM 就绪,准确率约 96% 支持 Markdown / HTML / JSON / 截图等格式,拿到即已清洗的正文;可定义 JSON Schema 让工具自动理解网页语义输出结构化数据。questionhighlights 两种模式只返回核心内容,比整页抓取最多省 100 倍 Token。

代理层:从"知道网址"到"知道目标" 不用提前备好 URL,只要说明目的(比如"找到 Notion 最新价格")。内置的 FIRE-1 Web Action Agent 会自动搜索、点击、填表单、提取结果;底层 PDF 解析、链接提取用 Rust NAPI,速度提升 3-5 倍。

怎么上手

Python 用户:

pip install firecrawl-py

网页正文抓取:

from firecrawl import FirecrawlApp
app = FirecrawlApp(api_key="your-api-key")
result = app.scrape_url("https://example.com")
print(result["markdown"])

让 Agent 获取特定信息:

result = app.extract(
    ["https://openai.com", "https://openai.com/pricing"],
    {"prompt": "Extract pricing information for GPT-4 models"}
)

想在 Claude Code(CC)里当 skill 用,在命令行执行:

npx -y firecrawl-cli@latest init --all --browser

适合谁 / 注意事项

  • 正在做 RAG、AI Agent、企业知识库 的开发者最值得试;
  • 项目基于 AGPL-3.0 协议开源(商用请留意该协议要求),源码和文档都在 GitHub 仓库;
  • 不能抓取需要登录的付费内容,并且会遵守 robots.txt——别拿它做不合规的内容搬运。

开源地址: github.com/firecrawl/firecrawl


总结:如果你一直被"爬虫难写、数据 API 贵、网页数据进不了 LLM"这套问题卡住,Firecrawl 值得上手试试——前端渲染、反爬、清洗、结构化一次到位,还能当"能上网的 Agent"用。做 RAG 或知识库的朋友,建议直接收藏。