Skip to main content

Uso de Firecrawl con CrewAI

Firecrawl está integrado con CrewAI, el framework para orquestar agentes de IA. Esta página presenta todas las herramientas de Firecrawl incorporadas al framework.

Instalar Firecrawl Tools dentro de CrewAI

Herramientas

Herramienta FirecrawlCrawlWebsite

Ejemplo

Utiliza FirecrawlScrapeFromWebsiteTool de la siguiente manera para que tu agente cargue sitios web:

Argumentos

  • api_key: Opcional. Especifica la clave de API de Firecrawl. El valor predeterminado es la variable de entorno FIRECRAWL_API_KEY.
  • url: La URL base desde la que comenzar el rastreo.
  • page_options: Opcional.
    • onlyMainContent: Opcional. Devuelve solo el contenido principal de la página, excluyendo encabezados, barras de navegación, pies de página, etc.
    • includeHtml: Opcional. Incluye el contenido HTML sin procesar de la página. Generará una clave html en la respuesta.
  • crawler_options: Opcional. Opciones para controlar el comportamiento del rastreador.
    • includes: Opcional. Patrones de URL que se incluirán en el rastreo.
    • exclude: Opcional. Patrones de URL que se excluirán del rastreo.
    • generateImgAltText: Opcional. Genera texto alternativo para imágenes usando LLMs (requiere un plan de pago).
    • returnOnlyUrls: Opcional. Si es true, devuelve solo las URLs como una lista en el estado del rastreo. Nota: la respuesta será una lista de URLs dentro de data, no una lista de documentos.
    • maxDepth: Opcional. Profundidad máxima de rastreo. La profundidad 1 es la URL base, la profundidad 2 incluye la URL base y sus hijos directos, y así sucesivamente.
    • mode: Opcional. El modo de rastreo a utilizar. El modo rápido (fast) realiza el rastreo 4 veces más rápido en sitios web sin sitemap, pero puede no ser tan preciso y no debería usarse en sitios web fuertemente renderizados con JavaScript.
    • limit: Opcional. Número máximo de páginas a rastrear.
    • timeout: Opcional. Tiempo de espera (en milisegundos) para la operación de rastreo.

Herramienta FirecrawlScrapeWebsite

Ejemplo

Usa FirecrawlScrapeWebsiteTool de la siguiente manera para permitir que tu agente cargue sitios web:

Argumentos

  • api_key: Opcional. Especifica la clave de API de Firecrawl. De forma predeterminada usa la variable de entorno FIRECRAWL_API_KEY.
  • url: La URL que se va a extraer.
  • page_options: Opcional.
    • onlyMainContent: Opcional. Devuelve solo el contenido principal de la página, excluyendo encabezados, barras de navegación, pies de página, etc.
    • includeHtml: Opcional. Incluye el contenido HTML sin procesar de la página. Devolverá una clave html en la respuesta.
  • extractor_options: Opcional. Opciones para la extracción mediante LLM de información estructurada a partir del contenido de la página.
    • mode: El modo de extracción a usar, actualmente admite llm-extraction.
    • extractionPrompt: Opcional. Un prompt que describe qué información extraer de la página.
    • extractionSchema: Opcional. El esquema de los datos que se van a extraer.
  • timeout: Opcional. Tiempo máximo de espera en milisegundos para la solicitud.

FirecrawlSearchTool

Ejemplo

Utiliza FirecrawlSearchTool de la siguiente manera para que tu agente pueda cargar sitios web:

Argumentos

  • api_key: Opcional. Especifica la clave de API de Firecrawl. El valor predeterminado es la variable de entorno FIRECRAWL_API_KEY.
  • query: La cadena de consulta de búsqueda que se utilizará para buscar.
  • page_options: Opcional. Opciones para el formato del resultado.
    • onlyMainContent: Opcional. Devuelve solo el contenido principal de la página, excluyendo encabezados, barras de navegación, pies de página, etc.
    • includeHtml: Opcional. Incluye el contenido HTML sin procesar de la página. Devolverá una clave html en la respuesta.
    • fetchPageContent: Opcional. Obtiene el contenido completo de la página.
  • search_options: Opcional. Opciones para controlar el comportamiento del crawling.
    • limit: Opcional. Número máximo de páginas a rastrear.