Skip to main content
Firecrawl のコア機能を使って、GitHub のリポジトリ、Issue、ドキュメントをスクレイピングする方法を説明します。
Firecrawl で GitHub のデータを取得する方法は 2 つあります。特定の github.com URL をスクレイピング、マッピング、またはクロールする方法 (このページでは以降こちらを説明します) と、Research Index の GitHub 検索を使って、正確な URL がわからなくても GitHub 全体から関連する Issue、プルリクエスト、ディスカッション、README を意味的に探し出す方法です。

セットアップ

JSONモードでスクレイピング

Zod スキーマを使ってリポジトリから構造化データを抽出します。
GitHub 上のリポジトリ、Issue、ドキュメントを検索します。

Research Index で GitHub を検索

Firecrawl の Research Index には GitHub インデックスが含まれており、インデックス化された公開 GitHub Issue、プルリクエスト、ディスカッション、リポジトリの README を意味検索できます。正確なリポジトリや URL がわからない場合に、実装の詳細やエンジニアリング上の先行事例を探すのに役立ちます。
汎用の/searchエンドポイントでも、githubカテゴリを指定すれば、同じGitHubインデックスにアクセスできます。
Python、cURL、CLI、MCPでの使用方法については、Research Index ガイドを参照してください。

Scrape

リポジトリ、Issue、またはファイルなど、1 つの GitHub ページをスクレイピングします。

Map

リポジトリやドキュメントサイト内に存在するすべての利用可能な URL を列挙します。注記: Map はコンテンツを含まない URL のみを返します。

Crawl

リポジトリやドキュメント内の複数ページをクロールします。

バッチスクレイプ

複数の GitHub URL を一括でスクレイプします。

JSONモードでのバッチスクレイプ

複数のリポジトリから構造化データを一括で抽出します。