Uso de Firecrawl con CrewAI
Instalar Firecrawl Tools dentro de CrewAI
- Obtén una clave de API desde tu panel de firecrawl.dev y configúrala como variable de entorno (
FIRECRAWL_API_KEY). - Instala el SDK de Firecrawl junto con el paquete
crewai[tools]:
Herramientas
Herramienta FirecrawlCrawlWebsite
Ejemplo
Argumentos
api_key: Opcional. Especifica la clave de API de Firecrawl. El valor predeterminado es la variable de entornoFIRECRAWL_API_KEY.url: La URL base desde la que comenzar el rastreo.page_options: Opcional.onlyMainContent: Opcional. Devuelve solo el contenido principal de la página, excluyendo encabezados, barras de navegación, pies de página, etc.includeHtml: Opcional. Incluye el contenido HTML sin procesar de la página. Generará una clavehtmlen la respuesta.
crawler_options: Opcional. Opciones para controlar el comportamiento del rastreador.includes: Opcional. Patrones de URL que se incluirán en el rastreo.exclude: Opcional. Patrones de URL que se excluirán del rastreo.generateImgAltText: Opcional. Genera texto alternativo para imágenes usando LLMs (requiere un plan de pago).returnOnlyUrls: Opcional. Si estrue, devuelve solo las URLs como una lista en el estado del rastreo. Nota: la respuesta será una lista de URLs dentro dedata, no una lista de documentos.maxDepth: Opcional. Profundidad máxima de rastreo. La profundidad 1 es la URL base, la profundidad 2 incluye la URL base y sus hijos directos, y así sucesivamente.mode: Opcional. El modo de rastreo a utilizar. El modo rápido (fast) realiza el rastreo 4 veces más rápido en sitios web sin sitemap, pero puede no ser tan preciso y no debería usarse en sitios web fuertemente renderizados con JavaScript.limit: Opcional. Número máximo de páginas a rastrear.timeout: Opcional. Tiempo de espera (en milisegundos) para la operación de rastreo.
Herramienta FirecrawlScrapeWebsite
Ejemplo
Argumentos
api_key: Opcional. Especifica la clave de API de Firecrawl. De forma predeterminada usa la variable de entornoFIRECRAWL_API_KEY.url: La URL que se va a extraer.page_options: Opcional.onlyMainContent: Opcional. Devuelve solo el contenido principal de la página, excluyendo encabezados, barras de navegación, pies de página, etc.includeHtml: Opcional. Incluye el contenido HTML sin procesar de la página. Devolverá una clavehtmlen la respuesta.
extractor_options: Opcional. Opciones para la extracción mediante LLM de información estructurada a partir del contenido de la página.mode: El modo de extracción a usar, actualmente admitellm-extraction.extractionPrompt: Opcional. Un prompt que describe qué información extraer de la página.extractionSchema: Opcional. El esquema de los datos que se van a extraer.
timeout: Opcional. Tiempo máximo de espera en milisegundos para la solicitud.
FirecrawlSearchTool
Ejemplo
Argumentos
api_key: Opcional. Especifica la clave de API de Firecrawl. El valor predeterminado es la variable de entornoFIRECRAWL_API_KEY.query: La cadena de consulta de búsqueda que se utilizará para buscar.page_options: Opcional. Opciones para el formato del resultado.onlyMainContent: Opcional. Devuelve solo el contenido principal de la página, excluyendo encabezados, barras de navegación, pies de página, etc.includeHtml: Opcional. Incluye el contenido HTML sin procesar de la página. Devolverá una clavehtmlen la respuesta.fetchPageContent: Opcional. Obtiene el contenido completo de la página.
search_options: Opcional. Opciones para controlar el comportamiento del crawling.limit: Opcional. Número máximo de páginas a rastrear.

