firecrawl-parse

Extrahiere und konvertiere effizient die Inhalte jeder lokalen Datei – wie PDF, DOCX, DOC, ODT, RTF, XLSX, XLS oder HTML – in sauberes, gut formatiertes Markdown, das gespeichert wird…

npx skills add https://github.com/firecrawl/firecrawl-codex-plugin --skill firecrawl-parse

firecrawl parse

Turn a local document into clean markdown on disk. Supports PDF, DOCX, DOC, ODT, RTF, XLSX, XLS, HTML/HTM/XHTML.

When to use

  • You have a file on disk (not a URL) and want its text as markdown
  • User drops a PDF/DOCX and asks what it says, or to summarize it
  • Use scrape instead when the source is a URL

Quick start

Always save to .firecrawl/ with -o — parsed docs can be hundreds of KB and blow up context if streamed to stdout. Add .firecrawl/ to .gitignore.

mkdir -p .firecrawl

# File → markdown
firecrawl parse ./paper.pdf -o .firecrawl/paper.md

# AI summary
firecrawl parse ./paper.pdf -S -o .firecrawl/paper-summary.md

# Ask a question about the doc
firecrawl parse ./paper.pdf -Q "What are the main conclusions?" \
  -o .firecrawl/paper-qa.md

Then head, grep, rg etc., or incrementally read the file - don't load the whole thing at once.

Options

OptionDescription
-S, --summaryAI-generated summary
-Q, --query <prompt>Ask a question about the parsed content
-o, --output <path>Output file path — always use this
-f, --format <fmt>markdown (default), html, summary
--timeout <ms>Timeout for the parse job
--timingShow request duration

Tips

  • Quote paths with spaces: firecrawl parse "./My Doc.pdf" -o .firecrawl/mydoc.md.
  • Max upload size: 50 MB per file.
  • Credits: ~1 per PDF page; HTML is 1 flat.
  • Check .firecrawl/ before re-parsing the same file.
  • To check your credit balance (recommended for batch processing and similar workflows), use the firecrawl credit-usage command.

See also

Mehr Skills von firecrawl

firecrawl-research-index
firecrawl
Finden Sie die Paper, die eine Forschungsfrage mit Firecrawl Research beantworten, unter Verwendung von semantischer Suche, semantischer und struktureller Erweiterung sowie In-Text-Verifikation. Verwenden Sie diese Fähigkeit stets für jede Aufgabe zur Literatursuche / Paper-Beschaffung – sowohl für einzelne Paper als auch für vollständige Multi-Paper-Sets.
data-analysisresearchweb-scraping
oracle
firecrawl
Bewährte Verfahren für die Verwendung der oracle CLI (Prompt- und Dateibündelung, Engines, Sitzungen und Dateianhänge-Muster).
pinecone
firecrawl
Verwaltete Vektordatenbank für KI-Produktionsanwendungen. Vollständig verwaltet, automatisch skalierend, mit Hybrid-Suche (dicht + dünnbesetzt), Metadatenfilterung und Namespaces.…
wpds
firecrawl
Verwenden beim Erstellen von Benutzeroberflächen, die das WordPress Design System (WPDS) und seine Komponenten, Tokens, Patterns usw. nutzen.
audiocraft-audio-generation
firecrawl
PyTorch-Bibliothek zur Audioerzeugung, einschließlich Text-zu-Musik (MusicGen) und Text-zu-Geräusch (AudioGen). Verwenden Sie diese, wenn Sie Musik aus Text generieren müssen…
skypilot-multi-cloud-orchestration
firecrawl
Multi-Cloud-Orchestrierung für ML-Workloads mit automatischer Kostenoptimierung. Verwenden Sie dies, wenn Sie Trainings- oder Batch-Jobs über mehrere Clouds hinweg ausführen müssen, nutzen Sie…
firecrawl-seo-audit
firecrawl
Führen Sie eine SEO-Überprüfung einer Website mit Firecrawl durch. Verwenden Sie dies, wenn der Benutzer nach einer SEO-Analyse, einer Überprüfung von Metadaten und Überschriften, einer Sitemap-/Seitenstrukturanalyse, Keyword-Möglichkeiten, einem Vergleich der SERP von Mitbewerbern oder priorisierten Suchoptimierungsempfehlungen fragt.
data-analysisresearchweb-scraping
gh-issues
firecrawl
GitHub-Issues abrufen, Unter-Agenten zur Implementierung von Korrekturen und zum Erstellen von PRs einsetzen, dann PR-Review-Kommentare überwachen und bearbeiten. Verwendung: /gh-issues [owner/repo] [--label…