tavily-extract

Extrahiere sauberes Markdown oder Text aus bis zu 20 URLs, mit Unterstützung für JavaScript-Rendering und abfragefokussierte Chunking. Verarbeitet JavaScript-gerenderte Seiten mit konfigurierbarer Extraktionstiefe (einfach für einfache Seiten, erweitert für dynamische SPAs und Tabellen). Unterstützt abfragefokussierte Extraktion, um nur relevante Inhaltsabschnitte statt ganzer Seiten zurückzugeben. Gibt standardmäßig LLM-optimiertes Markdown zurück, mit Optionen für Klartextformat und strukturierte JSON-Ausgabe. Verarbeitet bis zu 20 URLs in einem einzigen Aufruf;...

npx skills add https://github.com/tavily-ai/skills --skill tavily-extract

tavily extract

Extract clean markdown or text content from one or more URLs.

Before running

Run extract directly when tvly is available. Extract supports capped keyless access, so do not look for an API key or authenticate before the first request.

If tvly is missing, follow the tavily-cli setup before retrying. If the keyless cap is reached in an interactive session, run tvly login to open browser OAuth, then retry the original extraction once. In an unattended environment, report the cap and authentication options instead of starting an interactive flow. Do not start a second login immediately after guided setup has completed.

When to use

  • You have a specific URL and want its content
  • You need text from JavaScript-rendered pages
  • Step 2 in the workflow: search → extract → map → crawl → research

Quick start

# Single URL
tvly extract "https://example.com/article" --json

# Multiple URLs
tvly extract "https://example.com/page1" "https://example.com/page2" --json

# Query-focused extraction (returns relevant chunks only)
tvly extract "https://example.com/docs" --query "authentication API" --chunks-per-source 3 --json

# JS-heavy pages
tvly extract "https://app.example.com" --extract-depth advanced --json

# Save to file
tvly extract "https://example.com/article" -o article.json

Options

OptionDescription
--queryRerank chunks by relevance to this query
--chunks-per-sourceChunks per URL (1-5, requires --query)
--extract-depthbasic (default) or advanced (for JS pages)
--formatmarkdown (default) or text
--include-imagesInclude image URLs
--timeoutMax wait time (1-60 seconds)
-o, --outputSave the JSON response to a file
--jsonStructured JSON output

Extract depth

DepthWhen to use
basicSimple pages, fast — try this first
advancedJS-rendered SPAs, dynamic content, tables

Tips

  • Max 20 URLs per request — batch larger lists into multiple calls.
  • Use --query + --chunks-per-source to get only relevant content instead of full pages.
  • Try basic first, fall back to advanced if content is missing.
  • Set --timeout for slow pages (up to 60s).
  • Inspect failed_results even after exit code 0. A successful request can still return no extracted pages. Retry the affected URL with advanced when appropriate, otherwise report the per-URL failure instead of treating the request as complete.
  • If search results already contain the content you need (via --include-raw-content), skip the extract step.

See also

Mehr Skills von tavily-ai

research
tavily-ai
Umfassende Recherche zu jedem Thema mit automatischer Quellensammlung, Analyse und Zitaten. Führt mehrquellige Web-Recherche mit expliziten Zitaten durch, ideal für Vergleiche, aktuelle Ereignisse, Marktanalysen und detaillierte Berichte. Bietet drei Modelloptionen: Mini für gezielte Ein-Themen-Recherche (~30s), Pro für umfassende Multi-Perspektiven-Analyse (~60-120s) und Auto für API-gesteuerte Komplexitätserkennung. Authentifiziert sich über OAuth durch den Tavily MCP-Server mit automatischem browserbasiertem Login auf...
search
tavily-ai
Web-Suche mit LLM-optimierten Ergebnissen, Relevanzbewertung und flexiblen Filtern. Unterstützt vier Suchtiefenmodi (ultraschnell, schnell, einfach, erweitert) mit konfigurierbaren Latenz- und Relevanzabwägungen. Enthält Domain-Filterung, Zeitbereichseinschränkungen, Datumsbereiche, Länder-Boosting und Rohinhalts-Extraktion. Gibt Ergebnisse mit Titel, URL, Inhaltsausschnitt und Relevanzbewertung zurück; optionale Bild-Ergebnisse und Favicons. Automatische OAuth-Authentifizierung über Tavily MCP-Server oder API-Key-Konfiguration;...
tavily-best-practices
tavily-ai
Websuch-API für LLMs mit Echtzeit-Datenzugriff, Inhalts-Extraktion, Site-Crawling und KI-gestützter Recherche. Fünf Kernmethoden: search() für Webergebnisse, extract() für URL-Inhalte, crawl() für siteweite Extraktion, map() für URL-Erkennung und research() für durchgängige KI-Synthese. Unterstützt Python- und JavaScript-SDKs mit asynchronen Clients für parallele Abfragen und konfigurierbare Suchtiefe (ultra-fast/fast/basic/advanced). Die Crawl-Methode akzeptiert semantische Anweisungen, um die Extraktion auf... zu fokussieren.
tavily-cli
tavily-ai
Websuche, Inhalts-Extraktion, Site-Crawling und tiefgehende Recherche über Tavily CLI. Fünf Befehlsmodi für Suche, Extraktion, URL-Erkennung, Bulk-Crawling und Multi-Quellen-Recherche mit Zitaten. Alle Befehle unterstützen JSON-Ausgabe und Dateispeicherung für strukturierte, agentische Workflows. Ein Eskalationsmuster führt Sie von der einfachen Suche über Extraktion, Mapping, Crawling bis hin zur umfassenden Recherche, je nach Bedarf. Erfordert die Installation von tavily-cli und API-Key-Authentifizierung über tvly login.
tavily-crawl
tavily-ai
Mehrseitiger Website-Crawler mit semantischer Filterung und Markdown-Export. Durchsuchen Sie gesamte Site-Abschnitte mit Tiefen- und Breitensteuerung; filtern Sie nach Pfad-Regex, Domain oder natürlichen Sprachinstruktionen, um Ergebnisse zu fokussieren. Speichern Sie jede Seite als lokale Markdown-Dateien über --output-dir oder geben Sie strukturiertes JSON für agentische Verarbeitung zurück. Verwenden Sie semantische Instruktionen mit Chunk-Extraktion, um Kontextaufblähung bei der Übergabe von Ergebnissen an LLMs zu vermeiden; verwenden Sie Ganzseiten-Extraktion für Offline-Dokumentationsdownloads. Unterstützt...
tavily-dynamic-search
tavily-ai
Das Web durchsuchen, Ergebnisse filtern und Inhalte extrahieren, sodass rohe Suchdaten niemals in Ihren Kontextbereich gelangen. Nur Ihre kuratierte print()-Ausgabe wird zurückgegeben.
tavily-research
tavily-ai
Umfassende KI-gestützte Recherche mit Multi-Quellen-Synthese und Zitaten. Erstellt strukturierte Berichte auf Basis von Webquellen, Dauer 30-120 Sekunden je nach Modellauswahl (mini für gezielte Abfragen, pro für komplexe Vergleiche). Unterstützt mehrere Ausgabeformate: Markdown-Berichte, JSON mit benutzerdefinierten Schemas und konfigurierbare Zitierstile (nummeriert, MLA, APA, Chicago). Beinhaltet asynchronen Workflow für länger laufende Recherchen über --no-wait, Status- und Poll-Befehle, plus Echtzeit...
tavily-search
tavily-ai
Websuche mit LLM-optimierten Ergebnissen, Inhaltsausschnitten und Relevanzbewertungen. Unterstützt vier Suchtiefen (ultraschnell, schnell, basisch, erweitert) mit konfigurierbaren Ergebnisanzahlen bis zu 20, plus Domain-Filterung und Zeitbereichseinschränkungen. Gibt strukturierte JSON-Ausgabe mit Inhaltsausschnitten, Relevanzbewertungen und Metadaten zurück, optimiert für LLM-Nutzung. Enthält spezialisierte Suchmodi für Nachrichten- und Finanzthemen, mit optionalen KI-generierten Antworten und vollständiger Seitenextraktion. Integriert sich in...