注意:该集成仍使用 Firecrawl API 的 v0 版本。你可以安装 Python SDK 的 0.0.20 版本,或安装 Node SDK 的 0.0.36 版本。
安装
pip install firecrawl-py==0.0.20 llama_index llama-index llama-index-readers-web
使用方法
使用 Firecrawl 抓取整个网站
from llama_index.readers.web import FireCrawlWebReader
from llama_index.core import SummaryIndex
import os
# 初始化 FireCrawlWebReader 以爬取网站
firecrawl_reader = FireCrawlWebReader(
api_key="<your_api_key>", # 将其替换为你在 https://www.firecrawl.dev/ 获取的实际 API 密钥
mode="scrape", # 在 "crawl" 和 "scrape" 之间选择;用于单页抓取请选择 "scrape"
params={"additional": "parameters"} # 可选的附加参数
)
# 设置环境变量以配置虚拟密钥
os.environ["OPENAI_API_KEY"] = "<OPENAI_API_KEY>"
# 从单个页面 URL 加载文档
documents = firecrawl_reader.load_data(url="http://paulgraham.com/")
index = SummaryIndex.from_documents(documents)
# 将日志级别设置为 DEBUG 以获得更详细的输出
query_engine = index.as_query_engine()
response = query_engine.query("作者在成长过程中做了什么?")
display(Markdown(f"<b>{response}</b>"))
使用 Firecrawl 采集单个页面
from llama_index.readers.web import FireCrawlWebReader
# 使用你的 API 密钥和所需模式初始化 FireCrawlWebReader
firecrawl_reader = FireCrawlWebReader(
api_key="<your_api_key>", # 将其替换为你在 https://www.firecrawl.dev/ 获取的实际 API 密钥
mode="scrape", # 可在 "crawl" 与 "scrape" 之间选择
params={"additional": "parameters"} # 可选的额外参数
)
# 从指定的 URL 加载文档
documents = firecrawl_reader.load_data(url="http://paulgraham.com/worked.html")
index = SummaryIndex.from_documents(documents)
# 将日志级别设置为 DEBUG 以获得更详细的输出
query_engine = index.as_query_engine()
response = query_engine.query("作者在成长过程中做了些什么?")
display(Markdown(f"<b>{response}</b>"))

