firecrawl-knowledge-base

Construisez une base de connaissances à partir de contenu web avec Firecrawl. Utilisez-la pour des documents de référence locaux, des segments prêts pour le RAG, des jeux de données de fine-tuning, des miroirs de documentation, des corpus thématiques ou du markdown prêt pour LLM organisé à partir de sources web.

npx skills add https://github.com/firecrawl/firecrawl-workflows --skill firecrawl-knowledge-base

Firecrawl Knowledge Base

Use this to turn URLs or topics into organized LLM-ready content.

Onboarding Interview

Infer the source, goal, depth, and output location from context. If the source and goal are clear, proceed immediately.

Ask at most 1-3 concise questions only if blocked, such as the source URL/topic, whether the output is reference/RAG/training/docs, or training format if training is requested.

Firecrawl Collection Plan

Use Firecrawl map for documentation sites, search for topic-based corpora, scrape pages into markdown, and preserve code examples and tables.

For files, follow the Firecrawl download-style convention:

.firecrawl/
  <hostname>/
    <path>/
      index.md

Parallel Work

If appropriate, use sub-agents or equivalent parallel task runners:

  • one docs section per researcher
  • official docs, tutorials, community discussions, and references by source type
  • source scraping vs chunk generation vs manifest generation

Output Modes

  • Reference: markdown files, index.md, and sources.json.
  • RAG: markdown files plus chunk files and manifest.json.
  • Training: scraped source files plus training-data.jsonl and training-metadata.json.
  • Docs mirror: complete markdown mirror with a table of contents.

Final Deliverable

# Knowledge Base: [Source]

## Summary
[What was collected and why]

## Output Structure
[Files/directories created]

## Coverage
[Sections, source types, counts]

## Usage Notes
[How to use in RAG, docs, training, or agent context]

## Sources
[URLs collected]

## Rerun Inputs
workflow: firecrawl-knowledge-base
source: [url/topic]
goal: [reference/rag/train/docs]
depth: [quick/thorough/exhaustive]
output_dir: [.firecrawl/]

Quality Bar

  • Preserve code examples and formatting.
  • Remove boilerplate navigation where possible.
  • Include source URLs in frontmatter or metadata.

Plus de skills de firecrawl

firecrawl-research-index
firecrawl
Trouvez les articles qui répondent à une requête de recherche avec Firecrawl Research, en utilisant la recherche sémantique, l'expansion sémantique et structurelle, et la vérification dans le corps du texte. Utilisez toujours cette compétence pour toute tâche de recherche d'articles ou de récupération de documents — qu'il s'agisse de consulter un seul article ou un ensemble complet de plusieurs articles.
data-analysisresearchweb-scraping
oracle
firecrawl
Meilleures pratiques pour utiliser l'interface en ligne de commande oracle (invite + regroupement de fichiers, moteurs, sessions et modèles de pièces jointes).
pinecone
firecrawl
Base de données vectorielle gérée pour les applications d'IA en production. Entièrement gérée, mise à l'échelle automatique, avec recherche hybride (dense + sparse), filtrage par métadonnées et espaces de noms.…
wpds
firecrawl
À utiliser lors de la création d'interfaces utilisateur exploitant le WordPress Design System (WPDS) et ses composants, tokens, motifs, etc.
audiocraft-audio-generation
firecrawl
Bibliothèque PyTorch pour la génération audio incluant texte-vers-musique (MusicGen) et texte-vers-son (AudioGen). À utiliser lorsque vous avez besoin de générer de la musique à partir de texte…
skypilot-multi-cloud-orchestration
firecrawl
Orchestration multi-cloud pour les charges de travail ML avec optimisation automatique des coûts. À utiliser lorsque vous devez exécuter des tâches d’entraînement ou par lots sur plusieurs clouds, tirer parti de…
firecrawl-seo-audit
firecrawl
Auditer le SEO d'un site web avec Firecrawl. À utiliser lorsque l'utilisateur demande un audit SEO, une revue des métadonnées et des titres, une analyse du sitemap/de la structure du site, des opportunités de mots-clés, une comparaison des SERP concurrents, ou des recommandations priorisées d'optimisation pour la recherche.
data-analysisresearchweb-scraping
gh-issues
firecrawl
Récupérer les issues GitHub, générer des sous-agents pour implémenter des correctifs et ouvrir des PR, puis surveiller et traiter les commentaires de révision des PR. Utilisation : /gh-issues [owner/repo] [--label…]