parallel-web-extract

Извлечение содержимого URL. Используется для загрузки любых URL — веб-страниц, статей, PDF-файлов, сайтов с интенсивным использованием JavaScript. Эффективно по токенам: выполняется в форкнутом контексте. Предпочтительнее, чем…

npx skills add https://github.com/parallel-web/parallel-cursor-plugin --skill parallel-web-extract

URL Extraction

Extract content from: $ARGUMENTS

Command

Choose a short, descriptive filename based on the URL or content (e.g., vespa-docs, react-hooks-api). Use lowercase with hyphens, no spaces. Substitute it into the command inline$FILENAME is a placeholder, not a shell variable.

parallel-cli extract "$ARGUMENTS" --json -o "/tmp/$FILENAME.json"

Concrete example:

parallel-cli extract "https://docs.parallel.ai" --json -o "/tmp/parallel-docs.json"

Note: -o always saves JSON. The extension must be .json.

Options if needed:

  • --objective "focus area" to focus extraction on a specific goal (also silences the "neither objective nor search_queries" warning that V1 emits when neither is set)
  • -q "keyword" (repeatable) to prioritize keywords in excerpts
  • --full-content to include the complete page body (for long articles, PDFs, or when excerpts may not capture what you need)
  • --full-content-max-chars N to cap full-content size per result
  • --no-excerpts to strip excerpts when you only want full content

Handling failed extractions

If the response has an errors field, an empty results array, or a 404/timeout for the URL, do NOT fabricate content. Tell the user the extraction failed, surface the upstream status, and suggest:

  • Verifying the URL (the page may have moved)
  • Retrying with --full-content if excerpts came back empty but the page exists
  • Using parallel-cli search to locate the current URL if the page was renamed

Response format

Return content as:

Page Title

Then the extracted content verbatim, with these rules:

  • Keep content verbatim - do not paraphrase or summarize
  • Parse lists exhaustively - extract EVERY numbered/bulleted item
  • Strip only obvious noise: nav menus, footers, ads
  • Preserve all facts, names, numbers, dates, quotes

After the response, mention the output file path (/tmp/$FILENAME.json) so the user knows it's available for follow-up questions.

If the parallel-cli binary is not installed

If the shell reports command not found: parallel-cli (i.e. the binary itself is missing — distinct from a No such command error from a stale CLI, which the in-body guidance above covers), stop immediately. Do NOT search the web yourself, do NOT use any built-in search tools, and do NOT try to answer the query from your own knowledge. Instead, tell the user:

  1. parallel-cli is not installed
  2. Run /parallel-setup to install it
  3. Then retry their request

Больше skills от parallel-web

parallel-monitor
parallel-web
Непрерывно отслеживайте изменения в интернете с заданной периодичностью. Используйте, когда пользователь просит «отслеживать», «следить за изменениями», «наблюдать» или «уведомить меня, когда» что-то…
migrate-to-parallel
parallel-web
Полностью перенесите интеграции веб-данных Exa, Tavily, Perplexity или Firecrawl на соответствующие продукты Parallel, сохраняя поведение приложения. Используйте…
parallel-data-enrichment
parallel-web
Массовое обогащение данных о компаниях, людях или продуктах веб-полями, такими как имена CEO, финансирование и контактная информация. Принимает встроенные JSON-данные или CSV-файлы; выводит обогащённые результаты в CSV. Работает асинхронно с отслеживанием прогресса через URL мониторинга и команды опроса. Требует инструмент parallel-cli и доступ в интернет; обрабатывает большие наборы данных с настраиваемыми тайм-аутами. Поддерживает гибкие запросы полей через описания на естественном языке (например, «имя CEO и год основания»).
parallel-deep-research
parallel-web
Исчерпывающее исследование с настраиваемыми компромиссами по глубине, задержке и стоимости для сложных тем. Три уровня процессоров (pro-fast, ultra-fast, ultra) от 30 секунд до 25 минут, с масштабированием стоимости от 1x до 3x от базовой. Асинхронное выполнение с опросом: запуск исследования мгновенно, отслеживание прогресса через URL, получение результатов по готовности без блокировки. Вывод отформатированного отчёта в Markdown и метаданных в JSON; исполнительное резюме выводится в stdout для быстрого обзора. Разработано для явного...
parallel-findall
parallel-web
Обнаруживает сущности (компании, людей, продукты и т.д.), соответствующие описанию на естественном языке. Используйте, когда пользователь просит «найти все X» или «перечислить все Y, которые…» —…
parallel-memory
parallel-web
Вспоминать прошлые запуски Parallel Task, Monitor и FindAll, когда они могут помочь; удалять запуски или очищать память по запросу.
parallel-web-extract
parallel-web
Извлекает содержимое из нескольких URL-адресов параллельно, эффективно расходуя токены. Обрабатывает веб-страницы, статьи, PDF-файлы и сайты с интенсивным использованием JavaScript одной командой. Работает в форкнутом контексте, чтобы минимизировать затраты токенов по сравнению со встроенным WebFetch. Поддерживает пакетное извлечение нескольких URL-адресов с опциональными целевыми задачами. Требует установки parallel-cli и аутентификации; выводит извлечённое содержимое в формате markdown в локальный файл для последующих запросов.
parallel-web-search
parallel-web
Быстрый веб-поиск для получения актуальной информации, исследований и проверки фактов в интернете. Выполняет одиночные целевые запросы или множественные параллельные поиски по ключевым словам, возвращая до 10 результатов с выдержками и метаданными. Поддерживает фильтрацию по времени через --after-date и поиск по конкретным доменам с помощью --include-domains. Выводит структурированный JSON с заголовками, URL, датами публикации и выдержками для удобного анализа и последующих запросов. Требует встроенных цитат для каждого утверждения с использованием Markdown...