firecrawl-parse

Extraire et convertir efficacement le contenu de tout fichier local—tel que PDF, DOCX, DOC, ODT, RTF, XLSX, XLS ou HTML—en markdown propre et bien formaté sauvegardé…

npx skills add https://github.com/firecrawl/firecrawl-codex-plugin --skill firecrawl-parse

firecrawl parse

Turn a local document into clean markdown on disk. Supports PDF, DOCX, DOC, ODT, RTF, XLSX, XLS, HTML/HTM/XHTML.

When to use

  • You have a file on disk (not a URL) and want its text as markdown
  • User drops a PDF/DOCX and asks what it says, or to summarize it
  • Use scrape instead when the source is a URL

Quick start

Always save to .firecrawl/ with -o — parsed docs can be hundreds of KB and blow up context if streamed to stdout. Add .firecrawl/ to .gitignore.

mkdir -p .firecrawl

# File → markdown
firecrawl parse ./paper.pdf -o .firecrawl/paper.md

# AI summary
firecrawl parse ./paper.pdf -S -o .firecrawl/paper-summary.md

# Ask a question about the doc
firecrawl parse ./paper.pdf -Q "What are the main conclusions?" \
  -o .firecrawl/paper-qa.md

Then head, grep, rg etc., or incrementally read the file - don't load the whole thing at once.

Options

OptionDescription
-S, --summaryAI-generated summary
-Q, --query <prompt>Ask a question about the parsed content
-o, --output <path>Output file path — always use this
-f, --format <fmt>markdown (default), html, summary
--timeout <ms>Timeout for the parse job
--timingShow request duration

Tips

  • Quote paths with spaces: firecrawl parse "./My Doc.pdf" -o .firecrawl/mydoc.md.
  • Max upload size: 50 MB per file.
  • Credits: ~1 per PDF page; HTML is 1 flat.
  • Check .firecrawl/ before re-parsing the same file.
  • To check your credit balance (recommended for batch processing and similar workflows), use the firecrawl credit-usage command.

See also

Plus de skills de firecrawl

oracle
firecrawl
Meilleures pratiques pour utiliser l'interface en ligne de commande oracle (invite + regroupement de fichiers, moteurs, sessions et modèles de pièces jointes).
official
pinecone
firecrawl
Base de données vectorielle gérée pour les applications d'IA en production. Entièrement gérée, mise à l'échelle automatique, avec recherche hybride (dense + sparse), filtrage par métadonnées et espaces de noms.…
official
sentence-transformers
firecrawl
Cadre pour les embeddings de phrases, textes et images de pointe. Fournit plus de 5000 modèles pré-entraînés pour la similarité sémantique, le clustering et la recherche.…
official
wp-playground
firecrawl
Utiliser pour les workflows WordPress Playground : instances WP jetables rapides dans le navigateur ou localement via @wp-playground/cli (server, run-blueprint, build-snapshot),…
official
wp-plugin-development
firecrawl
À utiliser lors du développement de plugins WordPress : architecture et hooks, activation/désactivation/désinstallation, interface d'administration et API de paramètres, stockage de données, cron/tâches, sécurité…
official
wp-project-triage
firecrawl
À utiliser lorsque vous avez besoin d'une inspection déterministe d'un dépôt WordPress (plugin/thème/thème de blocs/WP core/Gutenberg/site complet) incluant les outils/tests/versions…
official
wp-rest-api
firecrawl
À utiliser lors de la création, de l'extension ou du débogage des points de terminaison/routes de l'API REST WordPress : register_rest_route, classes WP_REST_Controller/controller, schéma/arguments…
official
wp-wpcli-and-ops
firecrawl
À utiliser lors du travail avec WP-CLI (wp) pour les opérations WordPress : recherche-remplacement sécurisé, export/import de base de données, gestion des plugins/thèmes/utilisateurs/contenu, cron, vidage du cache,…
official