tavily-extract

โดย tavily-ai

แยกข้อมูลเป็น markdown หรือข้อความที่สะอาดจาก URL สูงสุด 20 รายการ พร้อมรองรับการเรนเดอร์ JavaScript และการแบ่งส่วนตามคำค้นหา จัดการหน้าเว็บที่เรนเดอร์ด้วย JavaScript ได้ โดยปรับระดับการแยกข้อมูลได้ (พื้นฐานสำหรับหน้าเว็บธรรมดา ขั้นสูงสำหรับ SPA และตารางแบบไดนามิก) รองรับการแยกข้อมูลตามคำค้นหาเพื่อส่งคืนเฉพาะเนื้อหาที่เกี่ยวข้อง แทนที่จะส่งคืนทั้งหน้า ส่งคืน markdown ที่ปรับให้เหมาะสมกับ LLM โดยค่าเริ่มต้น พร้อมตัวเลือกรูปแบบข้อความธรรมดาและเอาต์พุต JSON แบบมีโครงสร้าง ประมวลผล URL สูงสุด 20 รายการในการเรียกครั้งเดียว...

npx skills add https://github.com/tavily-ai/skills --skill tavily-extract

tavily extract

Extract clean markdown or text content from one or more URLs.

Before running

Run extract directly when tvly is available. Extract supports capped keyless access, so do not look for an API key or authenticate before the first request.

If tvly is missing, follow the tavily-cli setup before retrying. If the keyless cap is reached in an interactive session, run tvly login to open browser OAuth, then retry the original extraction once. In an unattended environment, report the cap and authentication options instead of starting an interactive flow. Do not start a second login immediately after guided setup has completed.

When to use

  • You have a specific URL and want its content
  • You need text from JavaScript-rendered pages
  • Step 2 in the workflow: search → extract → map → crawl → research

Quick start

# Single URL
tvly extract "https://example.com/article" --json

# Multiple URLs
tvly extract "https://example.com/page1" "https://example.com/page2" --json

# Query-focused extraction (returns relevant chunks only)
tvly extract "https://example.com/docs" --query "authentication API" --chunks-per-source 3 --json

# JS-heavy pages
tvly extract "https://app.example.com" --extract-depth advanced --json

# Save to file
tvly extract "https://example.com/article" -o article.json

Options

OptionDescription
--queryRerank chunks by relevance to this query
--chunks-per-sourceChunks per URL (1-5, requires --query)
--extract-depthbasic (default) or advanced (for JS pages)
--formatmarkdown (default) or text
--include-imagesInclude image URLs
--timeoutMax wait time (1-60 seconds)
-o, --outputSave the JSON response to a file
--jsonStructured JSON output

Extract depth

DepthWhen to use
basicSimple pages, fast — try this first
advancedJS-rendered SPAs, dynamic content, tables

Tips

  • Max 20 URLs per request — batch larger lists into multiple calls.
  • Use --query + --chunks-per-source to get only relevant content instead of full pages.
  • Try basic first, fall back to advanced if content is missing.
  • Set --timeout for slow pages (up to 60s).
  • Inspect failed_results even after exit code 0. A successful request can still return no extracted pages. Retry the affected URL with advanced when appropriate, otherwise report the per-URL failure instead of treating the request as complete.
  • If search results already contain the content you need (via --include-raw-content), skip the extract step.

See also

Skills เพิ่มเติมจาก tavily-ai

research
tavily-ai
การวิจัยเชิงลึกในทุกหัวข้อ พร้อมการรวบรวมแหล่งข้อมูล วิเคราะห์ และอ้างอิงโดยอัตโนมัติ ดำเนินการวิจัยทางเว็บจากหลายแหล่งพร้อมการอ้างอิงที่ชัดเจน เหมาะสำหรับการเปรียบเทียบ เหตุการณ์ปัจจุบัน การวิเคราะห์ตลาด และรายงานโดยละเอียด มีสามตัวเลือกโมเดล: mini สำหรับการวิจัยหัวข้อเดียวแบบเจาะจง (~30 วินาที), pro สำหรับการวิเคราะห์หลายมุมแบบครอบคลุม (~60-120 วินาที) และ auto สำหรับการตรวจจับความซับซ้อนผ่าน API ยืนยันตัวตนผ่าน OAuth ผ่านเซิร์ฟเวอร์ Tavily MCP พร้อมการเข้าสู่ระบบผ่านเบราว์เซอร์อัตโนมัติบน...
search
tavily-ai
ค้นหาเว็บด้วยผลลัพธ์ที่ปรับให้เหมาะสมกับ LLM การให้คะแนนความเกี่ยวข้อง และการกรองที่ยืดหยุ่น รองรับโหมดความลึกในการค้นหาสี่โหมด (เร็วพิเศษ เร็ว พื้นฐาน ขั้นสูง) พร้อมการปรับแต่งความหน่วงและความเกี่ยวข้องที่กำหนดค่าได้ รวมถึงการกรองโดเมน ข้อจำกัดช่วงเวลา ช่วงวันที่ การเพิ่มน้ำหนักประเทศ และการดึงเนื้อหาดิบ ส่งคืนผลลัพธ์พร้อมชื่อเรื่อง URL ตัวอย่างเนื้อหา และคะแนนความเกี่ยวข้อง ผลลัพธ์รูปภาพและ favicon แบบเลือกได้ การรับรองความถูกต้อง OAuth อัตโนมัติผ่านเซิร์ฟเวอร์ Tavily MCP หรือการกำหนดค่าคีย์ API...
tavily-best-practices
tavily-ai
Web search API สำหรับ LLMs ที่เข้าถึงข้อมูลแบบเรียลไทม์ ดึงเนื้อหา ค้นหาเว็บไซต์ และวิจัยด้วย AI มีห้าวิธีหลัก: search() สำหรับผลลัพธ์เว็บ, extract() สำหรับเนื้อหา URL, crawl() สำหรับดึงข้อมูลทั้งเว็บไซต์, map() สำหรับค้นหา URL, และ research() สำหรับสังเคราะห์ AI แบบครบวงจร รองรับ Python และ JavaScript SDK พร้อม async clients สำหรับการค้นหาแบบขนานและปรับความลึกการค้นหาได้ (ultra-fast/fast/basic/advanced) วิธี crawl รองรับคำสั่งเชิงความหมายเพื่อโฟกัสการดึงข้อมูลที่...
tavily-cli
tavily-ai
การค้นหาเว็บ การดึงเนื้อหา การรวบรวมข้อมูลเว็บไซต์ และการวิจัยเชิงลึกผ่าน Tavily CLI มีโหมดคำสั่งห้าโหมดครอบคลุมการค้นหา การดึงข้อมูล การค้นพบ URL การรวบรวมข้อมูลจำนวนมาก และการวิจัยหลายแหล่งพร้อมการอ้างอิง คำสั่งทั้งหมดรองรับเอาต์พุต JSON และการบันทึกไฟล์สำหรับเวิร์กโฟลว์แบบมีโครงสร้างและแบบเอเจนต์ รูปแบบการเพิ่มระดับจะแนะนำคุณจากการค้นหาอย่างง่ายผ่านการดึงข้อมูล การทำแผนที่ การรวบรวมข้อมูล ไปจนถึงการวิจัยที่ครอบคลุมตามความต้องการของคุณ ต้องติดตั้ง tavily-cli และการตรวจสอบสิทธิ์คีย์ API ผ่าน tvly login
tavily-crawl
tavily-ai
โปรแกรมรวบรวมข้อมูลเว็บไซต์หลายหน้าที่มีการกรองเชิงความหมายและส่งออกเป็นมาร์กดาวน์ เรียกดูส่วนต่างๆ ของไซต์ทั้งหมดพร้อมควบคุมความลึกและความกว้าง กรองตาม regex ของเส้นทาง โดเมน หรือคำสั่งภาษาธรรมชาติเพื่อเน้นผลลัพธ์ บันทึกแต่ละหน้าเป็นไฟล์มาร์กดาวน์ในเครื่องผ่าน --output-dir หรือส่งคืน JSON ที่มีโครงสร้างสำหรับการประมวลผลแบบเอเจนต์ ใช้คำสั่งเชิงความหมายพร้อมการแยกส่วนเพื่อป้องกันการขยายบริบทเมื่อป้อนผลลัพธ์ให้กับ LLM ใช้การแยกทั้งหน้าสำหรับการดาวน์โหลดเอกสารออฟไลน์ รองรับ...
tavily-dynamic-search
tavily-ai
ค้นหาเว็บ กรองผลลัพธ์ และดึงเนื้อหา เพื่อให้ข้อมูลการค้นหาดิบไม่เข้าสู่หน้าต่างบริบทของคุณ มีเพียงผลลัพธ์ print() ที่คุณจัดเตรียมไว้เท่านั้นที่จะถูกส่งกลับมา
tavily-research
tavily-ai
การวิจัยที่ขับเคลื่อนด้วย AI อย่างครอบคลุม พร้อมการสังเคราะห์จากหลายแหล่งและการอ้างอิง สร้างรายงานที่มีโครงสร้างซึ่งอ้างอิงจากแหล่งข้อมูลบนเว็บ ใช้เวลา 30-120 วินาที ขึ้นอยู่กับการเลือกโมเดล (mini สำหรับคำค้นหาเฉพาะเจาะจง pro สำหรับการเปรียบเทียบที่ซับซ้อน) รองรับรูปแบบผลลัพธ์หลายแบบ: รายงาน markdown, JSON พร้อม schema ที่กำหนดเอง และรูปแบบการอ้างอิงที่ปรับแต่งได้ (หมายเลข, MLA, APA, Chicago) รวมถึงเวิร์กโฟลว์แบบอะซิงโครนัสสำหรับการวิจัยที่ใช้เวลานานผ่านคำสั่ง --no-wait, status และ poll พร้อมการทำงานแบบเรียลไทม์...
tavily-search
tavily-ai
ค้นหาเว็บด้วยผลลัพธ์ที่ปรับให้เหมาะสมกับ LLM ตัวอย่างเนื้อหา และคะแนนความเกี่ยวข้อง รองรับความลึกในการค้นหาสี่ระดับ (เร็วพิเศษ เร็ว พื้นฐาน ขั้นสูง) พร้อมกำหนดจำนวนผลลัพธ์ได้สูงสุดถึง 20 รายการ รวมถึงการกรองโดเมนและข้อจำกัดช่วงเวลา ส่งคืนผลลัพธ์ในรูปแบบ JSON ที่มีโครงสร้างพร้อมตัวอย่างเนื้อหา คะแนนความเกี่ยวข้อง และข้อมูลเมตาที่ปรับให้เหมาะสมสำหรับการใช้งาน LLM รวมถึงโหมดการค้นหาเฉพาะสำหรับหัวข้อข่าวและการเงิน พร้อมคำตอบที่สร้างโดย AI แบบไม่บังคับ และการดึงเนื้อหาหน้าเต็ม รวมเข้ากับ...