Skip to main content

Utilisation de Firecrawl avec CrewAI

Firecrawl est intégré à CrewAI, le framework d’orchestration d’agents IA. Cette page présente l’ensemble des outils Firecrawl ajoutés au framework.

Installer les outils Firecrawl dans CrewAI

  • Récupérez une clé API depuis votre tableau de bord firecrawl.dev et définissez-la dans vos variables d’environnement (FIRECRAWL_API_KEY).
  • Installez le SDK Firecrawl ainsi que le package crewai[tools] :

Outils

OutilFirecrawlCrawlWebsite

Exemple

Utilisez FirecrawlScrapeFromWebsiteTool comme suit pour permettre à votre agent de charger des sites web :

Arguments

  • api_key : Facultatif. Spécifie la clé API Firecrawl. Par défaut, utilise la variable d’environnement FIRECRAWL_API_KEY.
  • url : L’URL de base à partir de laquelle démarrer le crawling.
  • page_options : Facultatif.
    • onlyMainContent : Facultatif. Retourne uniquement le contenu principal de la page en excluant les en-têtes, barres de navigation, pieds de page, etc.
    • includeHtml : Facultatif. Inclut le contenu HTML brut de la page. Un champ html sera présent dans la réponse.
  • crawler_options : Facultatif. Options pour contrôler le comportement de crawling.
    • includes : Facultatif. Modèles d’URL à inclure dans le crawl.
    • exclude : Facultatif. Modèles d’URL à exclure du crawl.
    • generateImgAltText : Facultatif. Génère le texte alternatif des images à l’aide de LLMs (nécessite un abonnement payant).
    • returnOnlyUrls : Facultatif. Si true, retourne uniquement les URL sous forme de liste dans le statut du crawl. Remarque : la réponse sera une liste d’URL dans data, et non une liste de documents.
    • maxDepth : Facultatif. Profondeur maximale à crawler. La profondeur 1 correspond à l’URL de base, la profondeur 2 inclut l’URL de base et ses enfants directs, et ainsi de suite.
    • mode : Facultatif. Mode de crawling à utiliser. Le mode fast explore les sites sans sitemap quatre fois plus vite, mais peut être moins précis et ne devrait pas être utilisé sur les sites fortement rendus via JavaScript.
    • limit : Facultatif. Nombre maximal de pages à crawler.
    • timeout : Facultatif. Délai d’expiration en millisecondes pour l’opération de crawling.

OutilFirecrawlScrapeWebsite

Exemple

Utilisez l’outil FirecrawlScrapeWebsiteTool comme suit pour permettre à votre agent de charger des sites web :

Arguments

  • api_key: Optionnel. Spécifie la clé API Firecrawl. Par défaut, la valeur utilisée est la variable d’environnement FIRECRAWL_API_KEY.
  • url: L’URL à scraper.
  • page_options: Optionnel.
    • onlyMainContent: Optionnel. Retourne uniquement le contenu principal de la page en excluant les en-têtes, barres de navigation, pieds de page, etc.
    • includeHtml: Optionnel. Inclut le contenu HTML brut de la page. Renverra une clé html dans la réponse.
  • extractor_options: Optionnel. Options pour l’extraction, via LLM, d’informations structurées à partir du contenu de la page.
    • mode: Le mode d’extraction à utiliser ; prend actuellement en charge llm-extraction.
    • extractionPrompt: Optionnel. Un prompt décrivant quelles informations extraire de la page.
    • extractionSchema: Optionnel. Le schéma des données à extraire.
  • timeout: Optionnel. Délai d’attente, en millisecondes, pour la requête.

Outil de recherche Firecrawl

Exemple

Utilisez FirecrawlSearchTool comme suit pour permettre à votre agent de charger des sites web :

Arguments

  • api_key: Facultatif. Spécifie la clé d’API Firecrawl. La valeur par défaut est la variable d’environnement FIRECRAWL_API_KEY.
  • query: La requête de recherche à utiliser.
  • page_options: Facultatif. Options pour le formatage des résultats.
    • onlyMainContent: Facultatif. Renvoyer uniquement le contenu principal de la page, en excluant les en-têtes, barres de navigation, pieds de page, etc.
    • includeHtml: Facultatif. Inclure le contenu HTML brut de la page. Ajoute une clé html dans la réponse.
    • fetchPageContent: Facultatif. Récupérer le contenu complet de la page.
  • search_options: Facultatif. Options pour contrôler le comportement du crawl.
    • limit: Facultatif. Nombre maximal de pages à crawler.