firecrawl-knowledge-base

Construye una base de conocimiento a partir de contenido web con Firecrawl. Úsalo para documentación de referencia local, fragmentos listos para RAG, conjuntos de datos para ajuste fino, espejos de documentación, corpus temáticos o markdown listo para LLM organizado desde fuentes web.

npx skills add https://github.com/firecrawl/firecrawl-workflows --skill firecrawl-knowledge-base

Firecrawl Knowledge Base

Use this to turn URLs or topics into organized LLM-ready content.

Onboarding Interview

Infer the source, goal, depth, and output location from context. If the source and goal are clear, proceed immediately.

Ask at most 1-3 concise questions only if blocked, such as the source URL/topic, whether the output is reference/RAG/training/docs, or training format if training is requested.

Firecrawl Collection Plan

Use Firecrawl map for documentation sites, search for topic-based corpora, scrape pages into markdown, and preserve code examples and tables.

For files, follow the Firecrawl download-style convention:

.firecrawl/
  <hostname>/
    <path>/
      index.md

Parallel Work

If appropriate, use sub-agents or equivalent parallel task runners:

  • one docs section per researcher
  • official docs, tutorials, community discussions, and references by source type
  • source scraping vs chunk generation vs manifest generation

Output Modes

  • Reference: markdown files, index.md, and sources.json.
  • RAG: markdown files plus chunk files and manifest.json.
  • Training: scraped source files plus training-data.jsonl and training-metadata.json.
  • Docs mirror: complete markdown mirror with a table of contents.

Final Deliverable

# Knowledge Base: [Source]

## Summary
[What was collected and why]

## Output Structure
[Files/directories created]

## Coverage
[Sections, source types, counts]

## Usage Notes
[How to use in RAG, docs, training, or agent context]

## Sources
[URLs collected]

## Rerun Inputs
workflow: firecrawl-knowledge-base
source: [url/topic]
goal: [reference/rag/train/docs]
depth: [quick/thorough/exhaustive]
output_dir: [.firecrawl/]

Quality Bar

  • Preserve code examples and formatting.
  • Remove boilerplate navigation where possible.
  • Include source URLs in frontmatter or metadata.

Más skills de firecrawl

oracle
firecrawl
Mejores prácticas para usar la CLI de oracle (prompt + agrupación de archivos, motores, sesiones y patrones de adjuntar archivos).
official
firecrawl-demo-walkthrough
firecrawl
Recorre los flujos clave de un producto con el navegador Firecrawl y genera un recorrido estructurado de UX/producto. Úsalo para registro, incorporación, precios, documentación, panel de control, preparación de demostraciones de producto, análisis de UX y evaluación de la experiencia de primer uso.
browser-automationofficialresearch
sag
firecrawl
Texto a voz de ElevenLabs con experiencia de usuario tipo say de Mac.
official
pinecone
firecrawl
Base de datos vectorial gestionada para aplicaciones de IA en producción. Completamente gestionada, con escalado automático, búsqueda híbrida (densa + dispersa), filtrado por metadatos y espacios de nombres.…
official
sentence-transformers
firecrawl
Marco para embeddings de última generación de oraciones, texto e imágenes. Proporciona más de 5000 modelos preentrenados para similitud semántica, agrupamiento y recuperación.…
official
model-merging
firecrawl
Fusiona múltiples modelos ajustados usando mergekit para combinar capacidades sin reentrenamiento. Úsalo al crear modelos especializados combinando conocimientos específicos de dominio…
official
deepspeed
firecrawl
Orientación experta para entrenamiento distribuido con DeepSpeed: etapas de optimización ZeRO, paralelismo de tuberías, FP16/BF16/FP8, Adam de 1 bit, atención dispersa
official
discord
firecrawl
Operaciones de Discord a través de la herramienta de mensajes (canal=discord).
official