firecrawl-knowledge-ingest

Ingérez des bases de connaissances publiques ou authentifiées et des portails de documentation avec le navigateur Firecrawl. Utilisez-le pour les documents lourds en JS, les portails nécessitant une connexion, les centres d'aide paginés, les bases de connaissances de support, ou l'extraction structurée en JSON/markdown à partir de sites de documentation.

npx skills add https://github.com/firecrawl/firecrawl-workflows --skill firecrawl-knowledge-ingest

Firecrawl Knowledge Ingest

Use this when a docs portal needs browser navigation, auth, pagination, or JS rendering.

Onboarding Interview

Infer the portal URL, output format, auth needs, and page limit from context. If the portal is clear, proceed immediately.

Ask at most 1-3 concise questions only if blocked, such as the portal URL, whether authentication is required, or the desired output format.

Firecrawl Collection Plan

Use Firecrawl browser to:

  • open the portal and inspect navigation
  • identify sections, categories, sidebar links, and article URLs
  • follow sidebar navigation, next links, pagination, load-more controls, or search
  • scrape article content as markdown
  • extract metadata such as title, section, last updated date, author, and tags

Try Firecrawl map as a supplement for public URLs, but use browser navigation for auth-gated or JS-heavy content.

Final Deliverable

# Knowledge Ingest: [Portal]

## Summary
[Pages extracted, sections covered, limitations]

## Output
[JSON/markdown/merged file path or content]

## Sections
[Section names and article counts]

## Failed Or Restricted Pages
[Any access/loading issues]

## Sources
[URLs extracted]

## Rerun Inputs
workflow: firecrawl-knowledge-ingest
url: [portal url]
format: [json/markdown/merged]
max_pages: [number]

JSON Shape

Use source, url, extractedAt, totalArticles, and sections[] with article title, url, section, content, and metadata.

Quality Bar

  • Preserve code examples, tables, and formatting.
  • Strip nav chrome, headers, and footers.
  • Track extraction progress and page failures.
  • Respect authentication boundaries.

Plus de skills de firecrawl

oracle
firecrawl
Meilleures pratiques pour utiliser l'interface en ligne de commande oracle (invite + regroupement de fichiers, moteurs, sessions et modèles de pièces jointes).
official
firecrawl-demo-walkthrough
firecrawl
Parcourir les flux clés d'un produit avec le navigateur Firecrawl et produire une présentation structurée UX/produit. Utiliser pour l'inscription, l'intégration, la tarification, la documentation, le tableau de bord, la préparation de démonstration produit, l'analyse UX et l'analyse de l'expérience de première utilisation.
browser-automationofficialresearch
sag
firecrawl
Synthèse vocale ElevenLabs avec une expérience utilisateur de type Mac pour la fonction "say".
official
pinecone
firecrawl
Base de données vectorielle gérée pour les applications d'IA en production. Entièrement gérée, mise à l'échelle automatique, avec recherche hybride (dense + sparse), filtrage par métadonnées et espaces de noms.…
official
sentence-transformers
firecrawl
Cadre pour les embeddings de phrases, textes et images de pointe. Fournit plus de 5000 modèles pré-entraînés pour la similarité sémantique, le clustering et la recherche.…
official
model-merging
firecrawl
Fusionnez plusieurs modèles affinés à l’aide de mergekit pour combiner leurs capacités sans réentraînement. Utilisez lors de la création de modèles spécialisés en mélangeant des modèles spécifiques à un domaine…
official
deepspeed
firecrawl
Conseils d’expert pour l’entraînement distribué avec DeepSpeed - étapes d’optimisation ZeRO, parallélisme de pipeline, FP16/BF16/FP8, Adam 1-bit, attention sparse
official
discord
firecrawl
Opérations Discord via l'outil de message (canal=discord).
official