parallel-web-extract

Extrahiere Inhalte aus mehreren URLs parallel und tokeneffizient. Verarbeitet Webseiten, Artikel, PDFs und JavaScript-lastige Seiten mit einem einzigen Befehl. Läuft in einem forked-Kontext, um den Token-Overhead im Vergleich zum integrierten WebFetch zu minimieren. Unterstützt die Batch-Extraktion mehrerer URLs mit optionalen Fokus-Zielen. Erfordert die Installation und Authentifizierung von parallel-cli; gibt extrahierte Inhalte als Markdown in eine lokale Datei für Folgeabfragen aus.

npx skills add https://github.com/parallel-web/parallel-agent-skills --skill parallel-web-extract

URL Extraction

Extract content from: $ARGUMENTS

Command

Choose a short, descriptive filename based on the URL or content (e.g., vespa-docs, react-hooks-api). Use lowercase with hyphens, no spaces. Substitute it into the command inline$FILENAME is a placeholder, not a shell variable.

parallel-cli extract "$ARGUMENTS" --json -o "/tmp/$FILENAME.json"

Concrete example:

parallel-cli extract "https://docs.parallel.ai" --json -o "/tmp/parallel-docs.json"

Note: -o always saves JSON. The extension must be .json.

Options if needed:

  • --objective "focus area" to focus extraction on a specific goal (also silences the "neither objective nor search_queries" warning that V1 emits when neither is set)
  • -q "keyword" (repeatable) to prioritize keywords in excerpts
  • --full-content to include the complete page body (for long articles, PDFs, or when excerpts may not capture what you need)
  • --full-content-max-chars N to cap full-content size per result
  • --no-excerpts to strip excerpts when you only want full content

Handling failed extractions

If the response has an errors field, an empty results array, or a 404/timeout for the URL, do NOT fabricate content. Tell the user the extraction failed, surface the upstream status, and suggest:

  • Verifying the URL (the page may have moved)
  • Retrying with --full-content if excerpts came back empty but the page exists
  • Using parallel-cli search to locate the current URL if the page was renamed

Response format

Return content as:

Page Title

Then the extracted content verbatim, with these rules:

  • Keep content verbatim - do not paraphrase or summarize
  • Parse lists exhaustively - extract EVERY numbered/bulleted item
  • Strip only obvious noise: nav menus, footers, ads
  • Preserve all facts, names, numbers, dates, quotes

After the response, mention the output file path (/tmp/$FILENAME.json) so the user knows it's available for follow-up questions.

Setup

If parallel-cli is not found, install and authenticate:

/parallel:parallel-cli-setup

If parallel-cli extract returns 403, tell the user balance is likely required. Offer to run parallel-cli balance get, and if needed ask for explicit confirmation before running parallel-cli balance add <amount_cents>. Then retry the original extract command.

Mehr Skills von parallel-web

parallel-monitor
parallel-web
Kontinuierlich das Web auf Änderungen in einem wiederkehrenden Rhythmus überwachen. Verwenden, wenn der Benutzer darum bittet, etwas zu 'überwachen', 'Änderungen an ... zu verfolgen', 'zu beobachten' oder 'mich zu benachrichtigen, wenn' ...
migrate-to-parallel
parallel-web
Migrieren Sie Exa-, Tavily-, Perplexity- oder Firecrawl-Webdaten-Integrationen vollständig zu den entsprechenden Parallel-Produkten, während das Anwendungsverhalten erhalten bleibt. Verwenden Sie…
parallel-data-enrichment
parallel-web
Massenanreicherung von Unternehmens-, Personen- oder Produktdaten mit webbasierten Feldern wie CEO-Namen, Finanzierungsinformationen und Kontaktdaten. Akzeptiert Inline-JSON-Daten oder CSV-Dateien; gibt angereicherte Ergebnisse als CSV aus. Läuft asynchron mit Fortschrittsverfolgung über Überwachungs-URL und Abfragebefehle. Erfordert das parallel-cli-Tool und Internetzugang; verarbeitet große Datensätze mit konfigurierbaren Timeouts. Unterstützt flexible Feldanfragen durch natürlichsprachliche Absichtsbeschreibungen (z. B. "CEO-Name und Gründungsjahr").
parallel-deep-research
parallel-web
Erschöpfende Recherche mit konfigurierbaren Kompromissen zwischen Tiefe, Latenz und Kosten für komplexe Themen. Drei Prozessor-Stufen (pro-fast, ultra-fast, ultra) von 30 Sekunden bis 25 Minuten, mit Kostensteigerung vom 1- bis 3-fachen des Basiswerts. Asynchrone Ausführung mit Abfrage: Recherche sofort starten, Fortschritt über URL verfolgen, Ergebnisse abrufen, sobald bereit, ohne Blockierung. Ausgaben formatierter Markdown-Bericht und JSON-Metadaten; Zusammenfassung für schnellen Überblick auf stdout ausgegeben. Entwickelt für explizite...
parallel-findall
parallel-web
Entdecken Sie Entitäten (Unternehmen, Personen, Produkte usw.), die einer natürlichsprachlichen Beschreibung entsprechen. Verwenden Sie dies, wenn der Benutzer darum bittet, „alle X zu finden“ oder „jedes Y aufzulisten, das …“ —…
parallel-memory
parallel-web
Rufe frühere Parallel Task-, Monitor- und FindAll-Läufe ab, wenn sie hilfreich sein könnten; entferne Läufe oder lösche den Speicher, wenn darum gebeten wird.
parallel-web-search
parallel-web
Schnelle Websuche nach aktuellen Informationen, Recherche und Faktenfindung im Internet. Führt einzelne objektbasierte Abfragen oder mehrere Stichwortsuche parallel aus und gibt bis zu 10 Ergebnisse mit Auszügen und Metadaten zurück. Unterstützt zeitkritische Filterung über --after-date und domänenspezifische Suchen mit --include-domains. Gibt strukturiertes JSON mit Titeln, URLs, Veröffentlichungsdaten und Auszügen für einfache Analyse und Folgeabfragen aus. Erfordert Inline-Zitate für jede Behauptung unter Verwendung von Markdown...
setup
parallel-web
Richte das Parallel-Plugin ein (CLI installieren)