firecrawl-knowledge-base

Создайте базу знаний из веб-контента с помощью Firecrawl. Используйте для локальной справочной документации, чанков, готовых для RAG, наборов данных для тонкой настройки, зеркал документации, тематических корпусов или размеченного в формате Markdown, готового для LLM, организованного из веб-источников.

npx skills add https://github.com/firecrawl/firecrawl-workflows --skill firecrawl-knowledge-base

Firecrawl Knowledge Base

Use this to turn URLs or topics into organized LLM-ready content.

Onboarding Interview

Infer the source, goal, depth, and output location from context. If the source and goal are clear, proceed immediately.

Ask at most 1-3 concise questions only if blocked, such as the source URL/topic, whether the output is reference/RAG/training/docs, or training format if training is requested.

Firecrawl Collection Plan

Use Firecrawl map for documentation sites, search for topic-based corpora, scrape pages into markdown, and preserve code examples and tables.

For files, follow the Firecrawl download-style convention:

.firecrawl/
  <hostname>/
    <path>/
      index.md

Parallel Work

If appropriate, use sub-agents or equivalent parallel task runners:

  • one docs section per researcher
  • official docs, tutorials, community discussions, and references by source type
  • source scraping vs chunk generation vs manifest generation

Output Modes

  • Reference: markdown files, index.md, and sources.json.
  • RAG: markdown files plus chunk files and manifest.json.
  • Training: scraped source files plus training-data.jsonl and training-metadata.json.
  • Docs mirror: complete markdown mirror with a table of contents.

Final Deliverable

# Knowledge Base: [Source]

## Summary
[What was collected and why]

## Output Structure
[Files/directories created]

## Coverage
[Sections, source types, counts]

## Usage Notes
[How to use in RAG, docs, training, or agent context]

## Sources
[URLs collected]

## Rerun Inputs
workflow: firecrawl-knowledge-base
source: [url/topic]
goal: [reference/rag/train/docs]
depth: [quick/thorough/exhaustive]
output_dir: [.firecrawl/]

Quality Bar

  • Preserve code examples and formatting.
  • Remove boilerplate navigation where possible.
  • Include source URLs in frontmatter or metadata.

Больше skills от firecrawl

oracle
firecrawl
Лучшие практики использования oracle CLI (объединение подсказок и файлов, движки, сессии и шаблоны прикрепления файлов).
official
firecrawl-demo-walkthrough
firecrawl
Проведите обзор ключевых потоков продукта с помощью браузера Firecrawl и создайте структурированное описание UX/продукта. Используйте для регистрации, онбординга, ценообразования, документации, панели управления, подготовки демонстрации продукта, анализа UX и анализа первого опыта использования.
browser-automationofficialresearch
sag
firecrawl
ElevenLabs преобразование текста в речь с пользовательским интерфейсом в стиле mac say.
official
pinecone
firecrawl
Управляемая векторная база данных для производственных AI-приложений. Полностью управляемая, с автоматическим масштабированием, гибридным поиском (плотный + разреженный), фильтрацией по метаданным и пространствами имён.
official
sentence-transformers
firecrawl
Фреймворк для современных эмбеддингов предложений, текстов и изображений. Предоставляет более 5000 предварительно обученных моделей для семантического сходства, кластеризации и поиска.…
official
model-merging
firecrawl
Объединение нескольких дообученных моделей с помощью mergekit для комбинирования возможностей без повторного обучения. Используйте при создании специализированных моделей путем смешивания доменно-специфичных…
official
deepspeed
firecrawl
Экспертное руководство по распределенному обучению с DeepSpeed — этапы оптимизации ZeRO, конвейерный параллелизм, FP16/BF16/FP8, 1-битный Adam, разреженное внимание
official
discord
firecrawl
Операции Discord через инструмент сообщений (канал=discord).
official