firecrawl-knowledge-ingest

Ингрестируйте публичные или аутентифицированные базы знаний и порталы документации с помощью браузера Firecrawl. Используйте для документации с интенсивным использованием JavaScript, порталов с входом по логину, постраничных справочных центров, баз знаний поддержки или структурированного извлечения JSON/markdown с сайтов документации.

npx skills add https://github.com/firecrawl/firecrawl-workflows --skill firecrawl-knowledge-ingest

Firecrawl Knowledge Ingest

Use this when a docs portal needs browser navigation, auth, pagination, or JS rendering.

Onboarding Interview

Infer the portal URL, output format, auth needs, and page limit from context. If the portal is clear, proceed immediately.

Ask at most 1-3 concise questions only if blocked, such as the portal URL, whether authentication is required, or the desired output format.

Firecrawl Collection Plan

Use Firecrawl browser to:

  • open the portal and inspect navigation
  • identify sections, categories, sidebar links, and article URLs
  • follow sidebar navigation, next links, pagination, load-more controls, or search
  • scrape article content as markdown
  • extract metadata such as title, section, last updated date, author, and tags

Try Firecrawl map as a supplement for public URLs, but use browser navigation for auth-gated or JS-heavy content.

Final Deliverable

# Knowledge Ingest: [Portal]

## Summary
[Pages extracted, sections covered, limitations]

## Output
[JSON/markdown/merged file path or content]

## Sections
[Section names and article counts]

## Failed Or Restricted Pages
[Any access/loading issues]

## Sources
[URLs extracted]

## Rerun Inputs
workflow: firecrawl-knowledge-ingest
url: [portal url]
format: [json/markdown/merged]
max_pages: [number]

JSON Shape

Use source, url, extractedAt, totalArticles, and sections[] with article title, url, section, content, and metadata.

Quality Bar

  • Preserve code examples, tables, and formatting.
  • Strip nav chrome, headers, and footers.
  • Track extraction progress and page failures.
  • Respect authentication boundaries.

Больше skills от firecrawl

oracle
firecrawl
Лучшие практики использования oracle CLI (объединение подсказок и файлов, движки, сессии и шаблоны прикрепления файлов).
official
firecrawl-demo-walkthrough
firecrawl
Проведите обзор ключевых потоков продукта с помощью браузера Firecrawl и создайте структурированное описание UX/продукта. Используйте для регистрации, онбординга, ценообразования, документации, панели управления, подготовки демонстрации продукта, анализа UX и анализа первого опыта использования.
browser-automationofficialresearch
sag
firecrawl
ElevenLabs преобразование текста в речь с пользовательским интерфейсом в стиле mac say.
official
pinecone
firecrawl
Управляемая векторная база данных для производственных AI-приложений. Полностью управляемая, с автоматическим масштабированием, гибридным поиском (плотный + разреженный), фильтрацией по метаданным и пространствами имён.
official
sentence-transformers
firecrawl
Фреймворк для современных эмбеддингов предложений, текстов и изображений. Предоставляет более 5000 предварительно обученных моделей для семантического сходства, кластеризации и поиска.…
official
model-merging
firecrawl
Объединение нескольких дообученных моделей с помощью mergekit для комбинирования возможностей без повторного обучения. Используйте при создании специализированных моделей путем смешивания доменно-специфичных…
official
deepspeed
firecrawl
Экспертное руководство по распределенному обучению с DeepSpeed — этапы оптимизации ZeRO, конвейерный параллелизм, FP16/BF16/FP8, 1-битный Adam, разреженное внимание
official
discord
firecrawl
Операции Discord через инструмент сообщений (канал=discord).
official