Skip to main content
浅色主视觉

欢迎使用 Firecrawl

Firecrawl 是一项 API 服务,可接收 URL、进行爬取,并将其转换为干净的 Markdown。我们会爬取所有可访问的子页面,并为每个页面提供干净的 Markdown。无需提供 sitemap。

如何使用?

我们提供托管版的易用 API。你可以在此处找到 playground 和文档。你也可以选择自托管后端。 从以下资源开始: 自托管: 请参考此处的指南。

API Key

要使用 API,你需要在 Firecrawl 注册并获取 API Key。

爬取

用于爬取一个 URL 及其所有可访问的子页面。该操作会提交一个爬取任务,并返回任务 ID 以便查询爬取状态。

安装

用法

如果你不使用 SDK,或更倾向于使用 webhook 或其他轮询方式,可以将 wait_until_done 设置为 false。 这将返回一个 jobId。 对于 cURL,/crawl 始终会返回一个 jobId,可用它来检查抓取状态。

检查爬取任务

用于查看爬取任务的状态并获取其结果。

响应

抓取

要抓取单个 URL,请使用 scrape_url 方法。该方法以 URL 作为参数,返回包含抓取结果的字典。

返回

提取

借助 LLM 提取功能,你可以轻松从任意 URL 提取结构化数据。我们也支持 Pydantic 架构,便于定义数据结构。使用方法如下:

参与贡献

我们欢迎各类贡献!在提交 pull request 之前,请先阅读我们的贡献指南