parallel-web-extract

Extrai conteúdo de múltiplas URLs em paralelo, de forma eficiente em tokens. Lida com páginas web, artigos, PDFs e sites com muito JavaScript em um único comando. Executa em um contexto bifurcado para minimizar a sobrecarga de tokens em comparação com o WebFetch integrado. Suporta extração em lote de várias URLs com objetivos de foco opcionais. Requer instalação e autenticação do parallel-cli; gera o conteúdo extraído como markdown em um arquivo local para consultas de acompanhamento.

npx skills add https://github.com/parallel-web/parallel-agent-skills --skill parallel-web-extract

URL Extraction

Extract content from: $ARGUMENTS

Command

Choose a short, descriptive filename based on the URL or content (e.g., vespa-docs, react-hooks-api). Use lowercase with hyphens, no spaces. Substitute it into the command inline$FILENAME is a placeholder, not a shell variable.

parallel-cli extract "$ARGUMENTS" --json -o "/tmp/$FILENAME.json"

Concrete example:

parallel-cli extract "https://docs.parallel.ai" --json -o "/tmp/parallel-docs.json"

Note: -o always saves JSON. The extension must be .json.

Options if needed:

  • --objective "focus area" to focus extraction on a specific goal (also silences the "neither objective nor search_queries" warning that V1 emits when neither is set)
  • -q "keyword" (repeatable) to prioritize keywords in excerpts
  • --full-content to include the complete page body (for long articles, PDFs, or when excerpts may not capture what you need)
  • --full-content-max-chars N to cap full-content size per result
  • --no-excerpts to strip excerpts when you only want full content

Handling failed extractions

If the response has an errors field, an empty results array, or a 404/timeout for the URL, do NOT fabricate content. Tell the user the extraction failed, surface the upstream status, and suggest:

  • Verifying the URL (the page may have moved)
  • Retrying with --full-content if excerpts came back empty but the page exists
  • Using parallel-cli search to locate the current URL if the page was renamed

Response format

Return content as:

Page Title

Then the extracted content verbatim, with these rules:

  • Keep content verbatim - do not paraphrase or summarize
  • Parse lists exhaustively - extract EVERY numbered/bulleted item
  • Strip only obvious noise: nav menus, footers, ads
  • Preserve all facts, names, numbers, dates, quotes

After the response, mention the output file path (/tmp/$FILENAME.json) so the user knows it's available for follow-up questions.

Setup

If parallel-cli is not found, install and authenticate:

/parallel:parallel-cli-setup

If parallel-cli extract returns 403, tell the user balance is likely required. Offer to run parallel-cli balance get, and if needed ask for explicit confirmation before running parallel-cli balance add <amount_cents>. Then retry the original extract command.

Mais skills de parallel-web

parallel-monitor
parallel-web
Acompanhe continuamente a web em busca de mudanças em uma cadência recorrente. Use quando o usuário pedir para 'monitorar', 'rastrear mudanças em', 'observar' ou 'me alertar quando' algo…
migrate-to-parallel
parallel-web
Migre integrações de dados web da Exa, Tavily, Perplexity ou Firecrawl completamente para os produtos Parallel apropriados, preservando o comportamento do aplicativo. Use…
parallel-data-enrichment
parallel-web
Enriquecimento em lote de dados de empresas, pessoas ou produtos com campos obtidos da web, como nomes de CEOs, financiamento e informações de contato. Aceita dados JSON inline ou arquivos CSV; gera resultados enriquecidos em CSV. Executa de forma assíncrona com rastreamento de progresso via URL de monitoramento e comandos de polling. Requer a ferramenta parallel-cli e acesso à internet; lida com grandes conjuntos de dados com timeouts configuráveis. Suporta solicitações flexíveis de campos por meio de descrições de intenção em linguagem natural (ex.: "nome do CEO e ano de fundação").
parallel-deep-research
parallel-web
Pesquisa exaustiva com profundidade, latência e compensações de custo configuráveis para tópicos complexos. Três níveis de processamento (pro-fast, ultra-fast, ultra) variando de 30 segundos a 25 minutos, com escalonamento de custo de 1x a 3x da linha de base. Execução assíncrona com polling: inicie a pesquisa instantaneamente, monitore o progresso via URL, recupere os resultados quando estiver pronto sem bloqueio. Saídas formatadas em relatório markdown e metadados JSON; resumo executivo impresso no stdout para visão geral rápida. Projetado para explícito...
parallel-findall
parallel-web
Descubra entidades (empresas, pessoas, produtos, etc.) que correspondam a uma descrição em linguagem natural. Use quando o usuário pedir para 'encontrar todos os X' ou 'listar todos os Y que…' —…
parallel-memory
parallel-web
Lembre-se de execuções passadas de Parallel Task, Monitor e FindAll quando elas puderem ajudar; remova execuções ou limpe a memória quando solicitado.
parallel-web-search
parallel-web
Pesquisa web rápida para informações atuais, pesquisas e verificação de fatos na internet. Executa consultas baseadas em um único objetivo ou múltiplas pesquisas por palavras-chave em paralelo, retornando até 10 resultados com trechos e metadados. Suporta filtragem sensível ao tempo via --after-date e pesquisas específicas de domínio com --include-domains. Gera JSON estruturado com títulos, URLs, datas de publicação e trechos para fácil análise e consultas de acompanhamento. Requer citações inline para cada afirmação usando markdown...
setup
parallel-web
Configurar o plugin Parallel (instalar CLI)