parallel-web-extract

โดย parallel-web

แยกเนื้อหาจากหลาย URL พร้อมกันอย่างมีประสิทธิภาพด้านโทเค็น รองรับหน้าเว็บ บทความ PDF และเว็บไซต์ที่ใช้ JavaScript หนักด้วยคำสั่งเดียว ทำงานในบริบทที่แยกออกมาเพื่อลดโอเวอร์เฮดของโทเค็นเมื่อเทียบกับ WebFetch ในตัว รองรับการแยกเนื้อหาแบบกลุ่มหลาย URL พร้อมวัตถุประสงค์โฟกัสเสริม ต้องติดตั้ง parallel-cli และยืนยันตัวตน ส่งออกเนื้อหาที่แยกแล้วเป็น markdown ไปยังไฟล์ในเครื่องสำหรับคำถามติดตามผล

npx skills add https://github.com/parallel-web/parallel-agent-skills --skill parallel-web-extract

URL Extraction

Extract content from: $ARGUMENTS

Command

Choose a short, descriptive filename based on the URL or content (e.g., vespa-docs, react-hooks-api). Use lowercase with hyphens, no spaces. Substitute it into the command inline$FILENAME is a placeholder, not a shell variable.

parallel-cli extract "$ARGUMENTS" --json -o "/tmp/$FILENAME.json"

Concrete example:

parallel-cli extract "https://docs.parallel.ai" --json -o "/tmp/parallel-docs.json"

Note: -o always saves JSON. The extension must be .json.

Options if needed:

  • --objective "focus area" to focus extraction on a specific goal (also silences the "neither objective nor search_queries" warning that V1 emits when neither is set)
  • -q "keyword" (repeatable) to prioritize keywords in excerpts
  • --full-content to include the complete page body (for long articles, PDFs, or when excerpts may not capture what you need)
  • --full-content-max-chars N to cap full-content size per result
  • --no-excerpts to strip excerpts when you only want full content

Handling failed extractions

If the response has an errors field, an empty results array, or a 404/timeout for the URL, do NOT fabricate content. Tell the user the extraction failed, surface the upstream status, and suggest:

  • Verifying the URL (the page may have moved)
  • Retrying with --full-content if excerpts came back empty but the page exists
  • Using parallel-cli search to locate the current URL if the page was renamed

Response format

Return content as:

Page Title

Then the extracted content verbatim, with these rules:

  • Keep content verbatim - do not paraphrase or summarize
  • Parse lists exhaustively - extract EVERY numbered/bulleted item
  • Strip only obvious noise: nav menus, footers, ads
  • Preserve all facts, names, numbers, dates, quotes

After the response, mention the output file path (/tmp/$FILENAME.json) so the user knows it's available for follow-up questions.

Setup

If parallel-cli is not found, install and authenticate:

/parallel:parallel-cli-setup

If parallel-cli extract returns 403, tell the user balance is likely required. Offer to run parallel-cli balance get, and if needed ask for explicit confirmation before running parallel-cli balance add <amount_cents>. Then retry the original extract command.

Skills เพิ่มเติมจาก parallel-web

parallel-monitor
parallel-web
ติดตามการเปลี่ยนแปลงบนเว็บอย่างต่อเนื่องตามช่วงเวลาที่กำหนด ใช้เมื่อผู้ใช้ขอให้ 'ตรวจสอบ', 'ติดตามการเปลี่ยนแปลงของ', 'เฝ้าดู', หรือ 'แจ้งเตือนฉันเมื่อ' มีบางอย่าง...
migrate-to-parallel
parallel-web
ย้ายการผสานรวมข้อมูลเว็บของ Exa, Tavily, Perplexity หรือ Firecrawl ไปยังผลิตภัณฑ์ Parallel ที่เหมาะสมอย่างสมบูรณ์พร้อมคงพฤติกรรมของแอปพลิเคชันไว้ ใช้…
parallel-data-enrichment
parallel-web
การเพิ่มข้อมูลบริษัท บุคคล หรือผลิตภัณฑ์จำนวนมากด้วยฟิลด์จากเว็บ เช่น ชื่อซีอีโอ เงินทุน และข้อมูลติดต่อ รองรับข้อมูล JSON แบบอินไลน์หรือไฟล์ CSV ส่งออกผลลัพธ์ที่เพิ่มข้อมูลแล้วเป็น CSV ทำงานแบบอะซิงโครนัสพร้อมติดตามความคืบหน้าผ่าน URL การตรวจสอบและคำสั่ง polling ต้องใช้เครื่องมือ parallel-cli และการเชื่อมต่ออินเทอร์เน็ต จัดการชุดข้อมูลขนาดใหญ่พร้อมการหมดเวลาที่ปรับแต่งได้ รองรับการขอฟิลด์ที่ยืดหยุ่นผ่านคำอธิบายความตั้งใจในภาษาธรรมชาติ (เช่น "ชื่อซีอีโอและปีที่ก่อตั้ง")
parallel-deep-research
parallel-web
การวิจัยอย่างละเอียดพร้อมการปรับสมดุลระหว่างความลึก ความหน่วง และต้นทุนที่กำหนดค่าได้สำหรับหัวข้อที่ซับซ้อน สามระดับโปรเซสเซอร์ (pro-fast, ultra-fast, ultra) ตั้งแต่ 30 วินาทีถึง 25 นาที โดยต้นทุนปรับขนาดจาก 1x ถึง 3x ของพื้นฐาน การทำงานแบบอะซิงโครนัสพร้อมการสอบถามสถานะ: เริ่มการวิจัยทันที ติดตามความคืบหน้าผ่าน URL ดึงผลลัพธ์เมื่อพร้อมโดยไม่ต้องรอ ผลลัพธ์เป็นรายงานรูปแบบ markdown และข้อมูลเมตา JSON สรุปผู้บริหารพิมพ์ไปยัง stdout เพื่อภาพรวมอย่างรวดเร็ว ออกแบบมาสำหรับการดำเนินการที่ชัดเจน...
parallel-findall
parallel-web
ค้นหานิติบุคคล (บริษัท บุคคล ผลิตภัณฑ์ ฯลฯ) ที่ตรงกับคำอธิบายในภาษาธรรมชาติ ใช้เมื่อผู้ใช้ขอให้ 'ค้นหา X ทั้งหมด' หรือ 'แสดงรายการ Y ทุกตัวที่...' —...
parallel-memory
parallel-web
จดจำการรัน Parallel Task, Monitor และ FindAll ในอดีตเมื่ออาจช่วยได้; ไล่การรันออกหรือล้างหน่วยความจำเมื่อถูกขอ
parallel-web-search
parallel-web
การค้นหาเว็บอย่างรวดเร็วสำหรับข้อมูลปัจจุบัน งานวิจัย และการค้นหาข้อเท็จจริงทั่วอินเทอร์เน็ต ดำเนินการค้นหาตามวัตถุประสงค์เดียวหรือค้นหาหลายคำหลักแบบขนาน ส่งคืนผลลัพธ์สูงสุด 10 รายการพร้อมข้อความที่ตัดตอนมาและข้อมูลเมตา รองรับการกรองตามเวลาผ่าน --after-date และการค้นหาเฉพาะโดเมนด้วย --include-domains ส่งออก JSON ที่มีโครงสร้างพร้อมชื่อเรื่อง URL วันที่เผยแพร่ และข้อความที่ตัดตอนมาเพื่อการแยกวิเคราะห์และการค้นหาต่อเนื่องที่ง่ายดาย ต้องมีการอ้างอิงในบรรทัดสำหรับทุกข้อความที่อ้างโดยใช้ markdown...
setup
parallel-web
ติดตั้งปลั๊กอิน Parallel (ติดตั้ง CLI)