firecrawl-knowledge-ingest

Ingiere bases de conocimiento públicas o autenticadas y portales de documentación con el navegador Firecrawl. Útil para documentación con mucho JavaScript, portales con inicio de sesión, centros de ayuda paginados, bases de conocimiento de soporte o extracción estructurada de JSON/markdown desde sitios de documentación.

npx skills add https://github.com/firecrawl/firecrawl-workflows --skill firecrawl-knowledge-ingest

Firecrawl Knowledge Ingest

Use this when a docs portal needs browser navigation, auth, pagination, or JS rendering.

Onboarding Interview

Infer the portal URL, output format, auth needs, and page limit from context. If the portal is clear, proceed immediately.

Ask at most 1-3 concise questions only if blocked, such as the portal URL, whether authentication is required, or the desired output format.

Firecrawl Collection Plan

Use Firecrawl browser to:

  • open the portal and inspect navigation
  • identify sections, categories, sidebar links, and article URLs
  • follow sidebar navigation, next links, pagination, load-more controls, or search
  • scrape article content as markdown
  • extract metadata such as title, section, last updated date, author, and tags

Try Firecrawl map as a supplement for public URLs, but use browser navigation for auth-gated or JS-heavy content.

Final Deliverable

# Knowledge Ingest: [Portal]

## Summary
[Pages extracted, sections covered, limitations]

## Output
[JSON/markdown/merged file path or content]

## Sections
[Section names and article counts]

## Failed Or Restricted Pages
[Any access/loading issues]

## Sources
[URLs extracted]

## Rerun Inputs
workflow: firecrawl-knowledge-ingest
url: [portal url]
format: [json/markdown/merged]
max_pages: [number]

JSON Shape

Use source, url, extractedAt, totalArticles, and sections[] with article title, url, section, content, and metadata.

Quality Bar

  • Preserve code examples, tables, and formatting.
  • Strip nav chrome, headers, and footers.
  • Track extraction progress and page failures.
  • Respect authentication boundaries.

Más skills de firecrawl

oracle
firecrawl
Mejores prácticas para usar la CLI de oracle (prompt + agrupación de archivos, motores, sesiones y patrones de adjuntar archivos).
official
firecrawl-demo-walkthrough
firecrawl
Recorre los flujos clave de un producto con el navegador Firecrawl y genera un recorrido estructurado de UX/producto. Úsalo para registro, incorporación, precios, documentación, panel de control, preparación de demostraciones de producto, análisis de UX y evaluación de la experiencia de primer uso.
browser-automationofficialresearch
sag
firecrawl
Texto a voz de ElevenLabs con experiencia de usuario tipo say de Mac.
official
pinecone
firecrawl
Base de datos vectorial gestionada para aplicaciones de IA en producción. Completamente gestionada, con escalado automático, búsqueda híbrida (densa + dispersa), filtrado por metadatos y espacios de nombres.…
official
sentence-transformers
firecrawl
Marco para embeddings de última generación de oraciones, texto e imágenes. Proporciona más de 5000 modelos preentrenados para similitud semántica, agrupamiento y recuperación.…
official
model-merging
firecrawl
Fusiona múltiples modelos ajustados usando mergekit para combinar capacidades sin reentrenamiento. Úsalo al crear modelos especializados combinando conocimientos específicos de dominio…
official
deepspeed
firecrawl
Orientación experta para entrenamiento distribuido con DeepSpeed: etapas de optimización ZeRO, paralelismo de tuberías, FP16/BF16/FP8, Adam de 1 bit, atención dispersa
official
discord
firecrawl
Operaciones de Discord a través de la herramienta de mensajes (canal=discord).
official