注意: この連携は現在も Firecrawl API の v0 版 を使用しています。Python SDK は 0.0.20、Node SDK は 0.0.36 をインストールしてください。
インストール
pip install firecrawl-py==0.0.20 llama_index llama-index llama-index-readers-web
使い方
Firecrawlでウェブサイト全体を収集する
from llama_index.readers.web import FireCrawlWebReader
from llama_index.core import SummaryIndex
import os
# ウェブサイトをクロールするために FireCrawlWebReader を初期化
firecrawl_reader = FireCrawlWebReader(
api_key="<your_api_key>", # https://www.firecrawl.dev/ で取得した実際の API キーに置き換えてください
mode="scrape", # 単一ページのスクレイピングには "crawl" か "scrape" を選択
params={"additional": "parameters"} # 追加パラメータ(任意)
)
# 環境変数に仮想キーを設定
os.environ["OPENAI_API_KEY"] = "<OPENAI_API_KEY>"
# 単一ページの URL からドキュメントを読み込む
documents = firecrawl_reader.load_data(url="http://paulgraham.com/")
index = SummaryIndex.from_documents(documents)
# 詳細な出力のためにログレベルを DEBUG に設定
query_engine = index.as_query_engine()
response = query_engine.query("著者は子どもの頃に何をしていましたか?")
display(Markdown(f"<b>{response}</b>"))
Firecrawl を使って単一ページを収集する
from llama_index.readers.web import FireCrawlWebReader
# APIキーと目的のモードで FireCrawlWebReader を初期化します
firecrawl_reader = FireCrawlWebReader(
api_key="<your_api_key>", # https://www.firecrawl.dev/ で取得した実際のAPIキーに置き換えてください
mode="scrape", # "crawl" または "scrape" を選択
params={"additional": "parameters"} # 任意の追加パラメータ
)
# 指定したURLからドキュメントを読み込みます
documents = firecrawl_reader.load_data(url="http://paulgraham.com/worked.html")
index = SummaryIndex.from_documents(documents)
# より詳細な出力のため、ログレベルをDEBUGに設定します
query_engine = index.as_query_engine()
response = query_engine.query("著者は成長期に何をしていましたか?")
display(Markdown(f"<b>{response}</b>"))

