e-commerce

Naviguer sur les sites e-commerce pour extraire les produits, les prix, les catégories et les stocks. Gère la pagination, les variantes et les vitrines lourdes en JavaScript.

npx skills add https://github.com/firecrawl/web-agent --skill e-commerce

E-commerce Extraction

General Patterns

  • Check for sitemap.xml first -- many stores list all product URLs
  • Look for /products.json, /api/products, or similar API endpoints before scraping HTML
  • Product listing pages usually paginate: look for ?page=N, ?offset=N, or "Load more" buttons
  • Always check the total count shown on the page vs what you've extracted

Product Data Checklist

  • Name, brand, SKU/ID
  • Price (current, original/compare-at, currency)
  • Variants (size, color, etc.) with per-variant pricing and availability
  • Images (primary + gallery)
  • Description (short + long)
  • Category/breadcrumb path
  • Availability/stock status
  • Ratings and review count

Pagination

  • Check for: next/prev links, page numbers, "showing X of Y" text
  • For infinite scroll: use interact to scroll and load more
  • Keep count: if page says "200 products" and you have 24, keep going

JS-Heavy Sites

  • Use interact for sites that require JavaScript rendering
  • Look for XHR/API calls in the page that return JSON -- often easier than parsing HTML
  • Single-page apps often have internal APIs at predictable paths

Site-specific playbooks are in the sites/ directory

Plus de skills de firecrawl

firecrawl-research-index
firecrawl
Trouvez les articles qui répondent à une requête de recherche avec Firecrawl Research, en utilisant la recherche sémantique, l'expansion sémantique et structurelle, et la vérification dans le corps du texte. Utilisez toujours cette compétence pour toute tâche de recherche d'articles ou de récupération de documents — qu'il s'agisse de consulter un seul article ou un ensemble complet de plusieurs articles.
data-analysisresearchweb-scraping
oracle
firecrawl
Meilleures pratiques pour utiliser l'interface en ligne de commande oracle (invite + regroupement de fichiers, moteurs, sessions et modèles de pièces jointes).
pinecone
firecrawl
Base de données vectorielle gérée pour les applications d'IA en production. Entièrement gérée, mise à l'échelle automatique, avec recherche hybride (dense + sparse), filtrage par métadonnées et espaces de noms.…
wpds
firecrawl
À utiliser lors de la création d'interfaces utilisateur exploitant le WordPress Design System (WPDS) et ses composants, tokens, motifs, etc.
audiocraft-audio-generation
firecrawl
Bibliothèque PyTorch pour la génération audio incluant texte-vers-musique (MusicGen) et texte-vers-son (AudioGen). À utiliser lorsque vous avez besoin de générer de la musique à partir de texte…
skypilot-multi-cloud-orchestration
firecrawl
Orchestration multi-cloud pour les charges de travail ML avec optimisation automatique des coûts. À utiliser lorsque vous devez exécuter des tâches d’entraînement ou par lots sur plusieurs clouds, tirer parti de…
firecrawl-seo-audit
firecrawl
Auditer le SEO d'un site web avec Firecrawl. À utiliser lorsque l'utilisateur demande un audit SEO, une revue des métadonnées et des titres, une analyse du sitemap/de la structure du site, des opportunités de mots-clés, une comparaison des SERP concurrents, ou des recommandations priorisées d'optimisation pour la recherche.
data-analysisresearchweb-scraping
gh-issues
firecrawl
Récupérer les issues GitHub, générer des sous-agents pour implémenter des correctifs et ouvrir des PR, puis surveiller et traiter les commentaires de révision des PR. Utilisation : /gh-issues [owner/repo] [--label…]