parallel-web-extract

Extrae contenido de múltiples URLs en paralelo, de manera eficiente en tokens. Maneja páginas web, artículos, PDFs y sitios con mucho JavaScript con un solo comando. Se ejecuta en un contexto bifurcado para minimizar la sobrecarga de tokens en comparación con WebFetch integrado. Admite extracción por lotes de múltiples URLs con objetivos de enfoque opcionales. Requiere instalación y autenticación de parallel-cli; genera el contenido extraído como markdown en un archivo local para consultas posteriores.

npx skills add https://github.com/parallel-web/parallel-agent-skills --skill parallel-web-extract

URL Extraction

Extract content from: $ARGUMENTS

Command

Choose a short, descriptive filename based on the URL or content (e.g., vespa-docs, react-hooks-api). Use lowercase with hyphens, no spaces. Substitute it into the command inline$FILENAME is a placeholder, not a shell variable.

parallel-cli extract "$ARGUMENTS" --json -o "/tmp/$FILENAME.json"

Concrete example:

parallel-cli extract "https://docs.parallel.ai" --json -o "/tmp/parallel-docs.json"

Note: -o always saves JSON. The extension must be .json.

Options if needed:

  • --objective "focus area" to focus extraction on a specific goal (also silences the "neither objective nor search_queries" warning that V1 emits when neither is set)
  • -q "keyword" (repeatable) to prioritize keywords in excerpts
  • --full-content to include the complete page body (for long articles, PDFs, or when excerpts may not capture what you need)
  • --full-content-max-chars N to cap full-content size per result
  • --no-excerpts to strip excerpts when you only want full content

Handling failed extractions

If the response has an errors field, an empty results array, or a 404/timeout for the URL, do NOT fabricate content. Tell the user the extraction failed, surface the upstream status, and suggest:

  • Verifying the URL (the page may have moved)
  • Retrying with --full-content if excerpts came back empty but the page exists
  • Using parallel-cli search to locate the current URL if the page was renamed

Response format

Return content as:

Page Title

Then the extracted content verbatim, with these rules:

  • Keep content verbatim - do not paraphrase or summarize
  • Parse lists exhaustively - extract EVERY numbered/bulleted item
  • Strip only obvious noise: nav menus, footers, ads
  • Preserve all facts, names, numbers, dates, quotes

After the response, mention the output file path (/tmp/$FILENAME.json) so the user knows it's available for follow-up questions.

Setup

If parallel-cli is not found, install and authenticate:

/parallel:parallel-cli-setup

If parallel-cli extract returns 403, tell the user balance is likely required. Offer to run parallel-cli balance get, and if needed ask for explicit confirmation before running parallel-cli balance add <amount_cents>. Then retry the original extract command.

Más skills de parallel-web

parallel-monitor
parallel-web
Rastrear continuamente la web en busca de cambios en una cadencia recurrente. Úsalo cuando el usuario pida 'monitorear', 'rastrear cambios en', 'vigilar' o 'alertarme cuando' algo…
migrate-to-parallel
parallel-web
Migra las integraciones de datos web de Exa, Tavily, Perplexity o Firecrawl por completo a los productos Parallel apropiados mientras se preserva el comportamiento de la aplicación. Usa…
parallel-data-enrichment
parallel-web
Enriquecimiento masivo de datos de empresas, personas o productos con campos obtenidos de la web, como nombres de CEO, financiación e información de contacto. Acepta datos JSON en línea o archivos CSV; genera resultados enriquecidos en CSV. Se ejecuta de forma asíncrona con seguimiento del progreso mediante URL de monitoreo y comandos de sondeo. Requiere la herramienta parallel-cli y acceso a internet; maneja grandes conjuntos de datos con tiempos de espera configurables. Admite solicitudes de campos flexibles mediante descripciones de intención en lenguaje natural (por ejemplo, "nombre del CEO y año de fundación").
parallel-deep-research
parallel-web
Investigación exhaustiva con profundidad, latencia y compensaciones de costos configurables para temas complejos. Tres niveles de procesador (pro-fast, ultra-fast, ultra) que van desde 30 segundos hasta 25 minutos, con escalado de costos de 1x a 3x respecto a la línea base. Ejecución asíncrona con sondeo: inicia la investigación al instante, monitorea el progreso mediante URL, recupera los resultados cuando estén listos sin bloqueo. Las salidas generan un informe en formato markdown y metadatos JSON; el resumen ejecutivo se imprime en stdout para una visión rápida. Diseñado para...
parallel-findall
parallel-web
Descubrir entidades (empresas, personas, productos, etc.) que coincidan con una descripción en lenguaje natural. Usar cuando el usuario pida 'encontrar todos los X' o 'listar cada Y que…' —…
parallel-memory
parallel-web
Recuerda ejecuciones pasadas de Parallel Task, Monitor y FindAll cuando puedan ayudar; desaloja ejecuciones o limpia la memoria cuando se te pida.
parallel-web-search
parallel-web
Búsqueda web rápida para información actual, investigación y verificación de hechos en internet. Ejecuta consultas basadas en un solo objetivo o múltiples búsquedas por palabras clave en paralelo, devolviendo hasta 10 resultados con extractos y metadatos. Admite filtrado sensible al tiempo mediante --after-date y búsquedas específicas por dominio con --include-domains. Genera JSON estructurado con títulos, URL, fechas de publicación y extractos para facilitar el análisis y consultas posteriores. Requiere citas en línea para cada afirmación usando markdown...
setup
parallel-web
Configurar el plugin Parallel (instalar CLI)