Skip to main content
Découvrez comment utiliser les fonctionnalités principales de Firecrawl pour scraper des dépôts, des tickets et de la documentation sur GitHub.
Il existe deux façons d’obtenir des données GitHub avec Firecrawl. Vous pouvez scraper, cartographier ou crawler une URL github.com spécifique (ce que couvre le reste de cette page), ou utiliser la recherche GitHub du Research Index pour découvrir de manière sémantique des tickets, des pull requests, des discussions et des README pertinents sur l’ensemble de GitHub, sans connaître l’URL exacte.

Configuration

Scrape en mode JSON

Extraire des données structurées à partir de dépôts en utilisant des schémas Zod.
Rechercher des dépôts, des tickets ou de la documentation sur GitHub.

Recherche sur GitHub avec le Research Index

Le Research Index de Firecrawl comprend un index GitHub qui recherche sémantiquement parmi les tickets, pull requests, discussions et README de dépôts GitHub publics indexés. Il permet de trouver des détails d’implémentation et des solutions d’ingénierie existantes lorsque vous ne connaissez pas le dépôt ou l’URL exacts.
Vous pouvez également accéder au même index GitHub via le point de terminaison général /search, avec la catégorie github.
Consultez le guide du Research Index pour savoir comment l’utiliser avec Python, cURL, la CLI et MCP.

Scrape

Extraire une seule page GitHub – dépôt, ticket ou fichier.

Map

Découvrez toutes les URL disponibles dans un dépôt ou un site de documentation. Remarque : Map ne renvoie que les URL, sans contenu.

Crawl

Parcourir plusieurs pages d’un dépôt ou d’une documentation.

Extraction par lot

Extraire plusieurs URL GitHub simultanément.

Extraction par lot avec le mode JSON

Extrayez des données structurées à partir de plusieurs dépôts en une seule opération.