Firecrawl MCP
официальныйДобавляет мощные возможности веб-скрапинга и поиска для LLM-клиентов, таких как Cursor и Claude.
Что можно делать с Firecrawl MCP?
- Scrape any URL — Ask your assistant to extract clean, structured data from a single page using
firecrawl_scrape, with JSON schema support for targeted extraction. - Search the web — Use
firecrawl_searchto find information across the web and optionally pull full page content from results. - Map a website — Discover all indexed URLs on a site with
firecrawl_mapto find specific sections before scraping. - Crawl multiple pages — Launch
firecrawl_crawlto extract content from an entire site or section, with configurable depth and page limits. - Run autonomous research — Delegate complex multi-source research to
firecrawl_agentand pollfirecrawl_agent_statusfor structured results. - Interact with pages — Use
firecrawl_interactto click, type, and navigate dynamic pages, then stop sessions withfirecrawl_interact_stop.
Документация
Firecrawl MCP Server
Сервер Model Context Protocol (MCP), который подключает Firecrawl к MCP-совместимым ИИ-агентам — поиск, скрапинг и взаимодействие с живым вебом для получения чистого, готового к использованию агентом контекста.
Огромное спасибо @vrknetha и @knacklabs за первоначальную реализацию!
Возможности
- Поиск в вебе и получение полного содержимого страниц
- Поиск по индексу, созданному для агентов-программистов: issues на GitHub, объединённые pull request, README и документация
- Скрапинг любого URL в чистые структурированные данные
- Взаимодействие со страницами — клики, навигация, операции
- Глубокое исследование с автономным агентом
- Автоматические повторы и ограничение частоты запросов
- Поддержка облака и self-hosted развёртывания
- Поддержка SSE
Поэкспериментируйте с нашим MCP-сервером на площадке MCP.so или на Klavis AI.
Установка
Хостируемый MCP (бесплатный тариф без ключа)
Подключитесь к удалённому хостируемому серверу без настройки:
https://mcp.firecrawl.dev/v2/mcp
На бесплатном тарифе без ключа scrape, search и parse работают без API-ключа (с ограничением частоты запросов). Другие инструменты, такие как crawl, map и agent, по-прежнему требуют ключ.
Предпочитайте OAuth или API-ключ, когда пользователь может зарегистрироваться. Это открывает полный набор инструментов и более высокие лимиты.
Для интерактивного подключения учётной записи настройте ваш MCP-клиент на использование этого URL сервера. Это MCP-эндпоинт, не браузерная страница; используйте поток подключения учётной записи клиента и не добавляйте вторую запись Firecrawl-сервера при повторном подключении:
https://mcp.firecrawl.dev/v2/mcp-oauth
Для подключения по API-ключу (например, для автоматизированной интеграции) оставьте URL сервера как:
https://mcp.firecrawl.dev/v2/mcp
Затем настройте защищённый заголовок или секретный параметр клиента:
Authorization: Bearer <FIRECRAWL_API_KEY>
Никогда не помещайте API-ключ в URL сервера. Никогда не помещайте API-ключ в чат с агентом. Настраивайте его непосредственно в клиенте или в менеджере секретов. См. руководство по настройке хостируемого MCP и руководство по онбордингу агентов для инструкций по конкретным клиентам.
Эндпоинт только для поиска
Доступна также поверхность только для чтения и только для поиска:
https://mcp.firecrawl.dev/v2/mcp-search
Она предоставляет фиксированный набор из шести инструментов только для чтения: firecrawl_search и пять инструментов firecrawl_research_*. Она не выполняет получение содержимого страниц и имеет собственную OAuth-идентичность; полный эндпоинт выше не изменён. См. docs/search-profile.md для полного описания контракта.
Запуск с помощью npx
env FIRECRAWL_API_KEY=fc-YOUR_API_KEY npx -y firecrawl-mcp
Ручная установка
npm install -g firecrawl-mcp
Запуск в Cursor
Настройка Cursor 🖥️ Примечание: требуется версия Cursor 0.45.6+ Для самых актуальных инструкций по настройке обратитесь к официальной документации Cursor по настройке MCP-серверов: Руководство по настройке MCP-серверов в Cursor
Для настройки Firecrawl MCP в Cursor v0.48.6
- Откройте настройки Cursor
- Перейдите в Features > MCP Servers
- Нажмите "+ Add new global MCP server"
- Введите следующий код:
{ "mcpServers": { "firecrawl-mcp": { "command": "npx", "args": ["-y", "firecrawl-mcp"], "env": { "FIRECRAWL_API_KEY": "YOUR-API-KEY" } } } }
Для настройки Firecrawl MCP в Cursor v0.45.6
- Откройте настройки Cursor
- Перейдите в Features > MCP Servers
- Нажмите "+ Add New MCP Server"
- Введите следующее:
- Name: "firecrawl-mcp" (или предпочитаемое вами имя)
- Type: "command"
- Command:
env FIRECRAWL_API_KEY=your-api-key npx -y firecrawl-mcp
Если вы используете Windows и сталкиваетесь с проблемами, попробуйте
cmd /c "set FIRECRAWL_API_KEY=your-api-key && npx -y firecrawl-mcp"
Замените your-api-key на ваш API-ключ Firecrawl. Если у вас его ещё нет, вы можете создать учётную запись и получить его на https://www.firecrawl.dev/app/api-keys
После добавления обновите список MCP-серверов, чтобы увидеть новые инструменты. Composer Agent будет автоматически использовать Firecrawl MCP, когда это уместно, но вы можете явно запросить его, описав свои потребности в веб-скрапинге. Откройте Composer с помощью Command+L (Mac), выберите "Agent" рядом с кнопкой отправки и введите ваш запрос.
Запуск в Windsurf
Добавьте это в ваш ./codeium/windsurf/model_config.json:
{
"mcpServers": {
"mcp-server-firecrawl": {
"command": "npx",
"args": ["-y", "firecrawl-mcp"],
"env": {
"FIRECRAWL_API_KEY": "YOUR_API_KEY"
}
}
}
}
Запуск с Streamable HTTP в локальном режиме
Чтобы запустить сервер с использованием Streamable HTTP локально вместо стандартного stdio-транспорта:
env HTTP_STREAMABLE_SERVER=true FIRECRAWL_API_KEY=fc-YOUR_API_KEY npx -y firecrawl-mcp
Используйте URL: http://localhost:3000/mcp
Установка через Smithery (устаревший способ)
Чтобы автоматически установить Firecrawl для Claude Desktop через Smithery:
npx -y @smithery/cli install @mendableai/mcp-server-firecrawl --client claude
Запуск в VS Code
Для установки в один клик нажмите одну из кнопок установки ниже...
Для ручной установки добавьте следующий JSON-блок в файл User Settings (JSON) в VS Code. Вы можете сделать это, нажав Ctrl + Shift + P и введя Preferences: Open User Settings (JSON).
{
"mcp": {
"inputs": [
{
"type": "promptString",
"id": "apiKey",
"description": "Firecrawl API Key",
"password": true
}
],
"servers": {
"firecrawl": {
"command": "npx",
"args": ["-y", "firecrawl-mcp"],
"env": {
"FIRECRAWL_API_KEY": "${input:apiKey}"
}
}
}
}
}
При желании вы можете добавить его в файл с именем .vscode/mcp.json в вашем рабочем пространстве. Это позволит вам делиться конфигурацией с другими:
{
"inputs": [
{
"type": "promptString",
"id": "apiKey",
"description": "Firecrawl API Key",
"password": true
}
],
"servers": {
"firecrawl": {
"command": "npx",
"args": ["-y", "firecrawl-mcp"],
"env": {
"FIRECRAWL_API_KEY": "${input:apiKey}"
}
}
}
}
Конфигурация
Переменные окружения
Требуются для облачного API
FIRECRAWL_API_KEY: Ваш API-ключ Firecrawl- Требуется при использовании облачного API (по умолчанию)
- Необязателен при использовании self-hosted экземпляра с
FIRECRAWL_API_URL
FIRECRAWL_API_URL(необязательно): Пользовательский API-эндпоинт для self-hosted экземпляров- Пример:
https://firecrawl.your-domain.com - Если не указан, будет использоваться облачный API (требуется API-ключ)
- Пример:
MCP OAuth (bearer-токены доступа)
Хостируемый Firecrawl может выдавать OAuth токены доступа (fco_…) через сервер авторизации на firecrawl.dev. Этот MCP-сервер передаёт те учётные данные, которые он разрешает, в Firecrawl API как Authorization: Bearer ….
- HTTP stream-транспорты (
CLOUD_SERVICE=true,HTTP_STREAMABLE_SERVER=trueилиSSE_LOCAL=true): Клиенты должны отправлятьAuthorization: Bearer <fco_access_token>в MCP-запросах. OAuth bearer-токен имеет приоритет надx-firecrawl-api-key/x-api-key, когда присутствуют оба. - stdio: Используйте
FIRECRAWL_OAUTH_TOKENдля статического токена доступа или продолжайте использоватьFIRECRAWL_API_KEYдля API-ключа.
Используйте только токены доступа (fco_…). Токены обновления (fcr_…) должны обмениваться на токен-эндпоинте, а не передаваться в scrape/search API.
Поверхность только для поиска (хостируемая)
В хостируемом режиме (CLOUD_SERVICE=true) второй внутрипроцессный экземпляр обслуживает эндпоинт только для поиска. Встроенный сервис имеет фиксированный контракт развёртывания: nginx маршрутизирует /v2/mcp-search на экземпляр на локальном порту 3001, а идентификатор защищённого ресурса OAuth — https://mcp.firecrawl.dev/v2/mcp-search.
FIRECRAWL_MCP_SEARCH_ENABLED (по умолчанию true) — поддерживаемый операционный переключатель; установите его в false, чтобы предотвратить запуск поискового экземпляра. Процесс Node также принимает FIRECRAWL_MCP_SEARCH_PORT, FIRECRAWL_MCP_SEARCH_ENDPOINT и FIRECRAWL_MCP_SEARCH_RESOURCE_URL для изолированных тестов. Эти переопределения не перенастраивают встроенные маршруты nginx или список разрешений сервера авторизации и не должны использоваться независимо в хостируемом развёртывании.
Поисковый экземпляр требует аутентификацию для каждого запроса (включая tools/list) и отклоняет OAuth-токены, чья аудитория не соответствует его собственному ресурсу.
Примеры конфигурации
Для использования облачного API:
export FIRECRAWL_API_KEY=your-api-key
Для self-hosted экземпляра:
# Required for self-hosted
export FIRECRAWL_API_URL=https://firecrawl.your-domain.com
# Optional authentication for self-hosted
export FIRECRAWL_API_KEY=your-api-key # If your instance requires auth
Использование с Claude Desktop
Добавьте это в ваш claude_desktop_config.json:
{
"mcpServers": {
"mcp-server-firecrawl": {
"command": "npx",
"args": ["-y", "firecrawl-mcp"],
"env": {
"FIRECRAWL_API_KEY": "YOUR_API_KEY_HERE"
}
}
}
}
Как выбрать инструмент
Используйте это руководство, чтобы выбрать подходящий инструмент для вашей задачи:
- Если вы знаете точный URL, который вам нужен: используйте scrape (с JSON-форматом для структурированных данных)
- Если у вас несколько известных URL: вызовите scrape для каждого URL. Если вам конкретно нужна одна массовая операция API, используйте batch-эндпоинт Firecrawl API вне MCP.
- Если вам нужно обнаружить URL на сайте: используйте map
- Если вы хотите искать информацию в вебе: используйте search
- Если у вас вопрос по программированию (библиотека, контракт API, сообщение об ошибке, известный баг): используйте developer search
- Если вам нужно сложное исследование по множеству неизвестных источников: используйте agent
- Если вы хотите проанализировать весь сайт или раздел: используйте crawl (с лимитами!)
- Если вам нужна интерактивная автоматизация браузера (клики, ввод текста, навигация): используйте interact с URL для новой страницы или scrape + interact, когда вы уже скрапили страницу или вам нужен более точный контроль скрапинга
Справочная таблица
| Инструмент | Лучше всего подходит для | Возвращает |
|---|---|---|
| scrape | Содержимое одной страницы | JSON (предпочтительно) или markdown |
| interact | Взаимодействие с URL или скрапленной страницей | Результат выполнения + scrapeId для режима URL |
| map | Обнаружение URL на сайте | URL[] |
| crawl | Многостраничное извлечение (с лимитами) | финальный статус/данные crawl после внутреннего опроса |
| parse | Файлы и хостируемые ссылки на загрузки | markdown, JSON или документный вывод |
| search | Веб-поиск информации | results[] |
| developer | Вопросы по программированию по источникам для разработчиков | results[] с отрывками |
| agent | Сложное исследование по множеству источников | JSON (структурированные данные) |
| monitor | Периодические проверки страниц | метаданные и различия monitor/check |
| research | Исследование статей и репозиториев GitHub | результаты исследования и совпадения репозиториев |
Руководство по выбору формата
При использовании scrape выбирайте правильный формат:
- Формат JSON (рекомендуется в большинстве случаев): Используйте, когда вам нужны конкретные данные со страницы. Определите схему на основе того, что нужно извлечь. Это сохраняет ответы компактными и предотвращает переполнение контекстного окна.
- Формат Markdown (используйте экономно): Только когда вам действительно нужно полное содержимое страницы, например, для чтения целой статьи с целью суммаризации или анализа структуры страницы.
Доступные инструменты
1. Инструмент Scrape (firecrawl_scrape)
Извлекает содержимое с одного URL с расширенными опциями.
Лучше всего подходит для:
- Извлечения содержимого одной страницы, когда вы точно знаете, какая страница содержит нужную информацию.
Не рекомендуется для:
- Извлечения содержимого с нескольких страниц (используйте повторные вызовы scrape для известных URL, или map + scrape для предварительного обнаружения URL, или crawl для полного содержимого страниц)
- Когда вы не уверены, какая страница содержит информацию (используйте search)
Частые ошибки:
- Передача списка URL в один вызов scrape. Вызывайте scrape по одному разу на каждый URL в MCP. Если вам конкретно нужна одна массовая операция API, используйте batch-эндпоинт Firecrawl API вне MCP.
- Использование markdown-формата по умолчанию (используйте JSON-формат, чтобы извлекать только то, что нужно).
Выбор правильного формата:
- Формат JSON (предпочтительно): Для большинства случаев используйте JSON-формат со схемой, чтобы извлекать только конкретные нужные данные. Это сохраняет ответы сфокусированными и предотвращает переполнение контекстного окна.
- Формат Markdown: Только когда задача действительно требует полного содержимого страницы (например, суммаризация целой статьи, анализ структуры страницы).
Пример промпта:
"Получите информацию о продукте с https://example.com/product."
Пример использования (формат JSON — предпочтительно):
{
"name": "firecrawl_scrape",
"arguments": {
"url": "https://example.com/product",
"formats": [
{
"type": "json",
"prompt": "Extract the product information",
"schema": {
"type": "object",
"properties": {
"name": { "type": "string" },
"price": { "type": "number" },
"description": { "type": "string" }
},
"required": ["name", "price"]
}
}
]
}
}
Пример использования (формат markdown — когда нужно полное содержимое):
{
"name": "firecrawl_scrape",
"arguments": {
"url": "https://example.com/article",
"formats": ["markdown"],
"onlyMainContent": true
}
}
Пример использования (формат брендинга — извлечение идентичности бренда):
{
"name": "firecrawl_scrape",
"arguments": {
"url": "https://example.com",
"formats": ["branding"]
}
}
Формат брендинга: Извлекает комплексную идентичность бренда (цвета, шрифты, типографику, интервалы, логотип, UI-компоненты) для дизайн-анализа или воспроизведения стиля.
Конфиденциальность: Установите redactPII: true, чтобы возвращать содержимое с удалённой личной информацией (PII).
Возвращает:
- Структурированные данные JSON, markdown, профиль бренда или другие форматы по запросу.
2. Инструмент Map (firecrawl_map)
Составляет карту веб-сайта для обнаружения всех индексированных URL на сайте.
Лучше всего подходит для:
- Обнаружения URL на веб-сайте перед решением, что скрапить
- Поиска конкретных разделов веб-сайта
Не рекомендуется для:
- Когда вы уже знаете, какой конкретный URL вам нужен (используйте scrape)
- Когда вам нужно содержимое страниц (используйте scrape после составления карты)
Частые ошибки:
- Использование crawl для обнаружения URL вместо map
Пример запроса:
«Список всех URL на example.com.»
Пример использования:
{
"name": "firecrawl_map",
"arguments": {
"url": "https://example.com"
}
}
Возвращает:
- Массив URL, найденных на сайте
3. Инструмент поиска (firecrawl_search)
Выполняет поиск в интернете и при необходимости извлекает содержимое из результатов поиска.
Лучше всего подходит для:
- Поиска конкретной информации на нескольких сайтах, когда вы не знаете, на каком сайте она находится.
- Когда вам нужно наиболее релевантное содержимое по запросу
Не рекомендуется для:
- Когда вы уже знаете, какой сайт нужно спарсить (используйте scrape)
- Когда вам нужен полный охват одного сайта (используйте map или crawl)
Частые ошибки:
- Использование crawl или map для открытых вопросов (вместо этого используйте search)
Пример использования:
{
"name": "firecrawl_search",
"arguments": {
"query": "latest AI research papers 2023",
"highlights": true,
"limit": 5,
"lang": "en",
"country": "us",
"scrapeOptions": {
"formats": ["markdown"],
"onlyMainContent": true,
"redactPII": true
}
}
}
Установите highlights в true, чтобы запросить релевантные запросу фрагменты, или false, чтобы сохранить исходные сниппеты поиска. Опустите его, чтобы использовать поведение API по умолчанию.
Возвращает:
- Массив результатов поиска (с необязательным извлечённым содержимым), а также поле
id. Передайте этотidвfirecrawl_search_feedbackпосле использования результатов, чтобы вернуть 1 кредит (поиск стоит 2) и улучшить качество поиска.
Пример запроса:
«Найдите последние исследовательские работы по ИИ, опубликованные в 2023 году.»
3b. Инструмент обратной связи по поиску (firecrawl_search_feedback)
Отправляет структурированную обратную связь по результату предыдущего firecrawl_search. Первая обратная связь для каждого идентификатора поиска возвращает 1 кредит и улучшает качество поиска Firecrawl. Идемпотентна для каждого идентификатора поиска.
Вызывайте этот инструмент после каждого фактически использованного поиска (или того, который не помог). Плохая/частичная обратная связь с missingContent так же ценна, как и хорошая.
Отказ: установите FIRECRAWL_NO_SEARCH_FEEDBACK=1 (или FIRECRAWL_DISABLE_SEARCH_FEEDBACK=1) в переменных окружения при запуске MCP-сервера. Инструмент firecrawl_search_feedback не будет зарегистрирован, поэтому агенты не смогут его вызывать. Администраторы команды также могут отключить обратную связь на стороне сервера; в этом случае инструмент регистрируется, но всегда возвращает feedbackErrorCode: "TEAM_OPTED_OUT".
Самое важное поле: missingContent. Это массив конкретных фрагментов содержимого, которые агент ожидал найти, но не нашёл. По одной записи на отсутствующую тему — они агрегируются по командам и сообщают нам, что индексировать дальше.
Ежедневный лимит возврата (на команду, за UTC-сутки, по умолчанию 100 кредитов). Когда creditsRefundedToday команды достигает dailyRefundCap, последующие отправки всё ещё записывают обратную связь, но больше не возвращают кредиты. В ответе устанавливается dailyCapReached: true. Агенты должны прекратить вызов этого инструмента до конца UTC-суток, когда они видят этот флаг.
Пример использования:
{
"name": "firecrawl_search_feedback",
"arguments": {
"searchId": "0193f6c5-1234-7890-abcd-1234567890ab",
"rating": "good",
"valuableSources": [
{
"url": "https://docs.firecrawl.dev/features/search",
"reason": "Most up-to-date description of /search."
}
],
"missingContent": [
{
"topic": "Pricing for the search endpoint",
"description": "No pricing tier table for /search specifically."
},
{ "topic": "Per-team rate limits" }
],
"querySuggestions": "Boost docs.firecrawl.dev for queries that mention 'firecrawl'"
}
}
Возвращает:
- JSON
{ success, feedbackId, creditsRefunded, alreadySubmitted? }.
3c. Инструмент общей обратной связи (firecrawl_feedback)
Отправляет структурированную обратную связь для завершённого задания конечной точки v2 через /v2/feedback.
Используйте это для обратной связи на уровне конечной точки для заданий scrape, parse, map или search.
Для качества результатов поиска конкретно предпочитайте firecrawl_search_feedback, потому что он включает рекомендации, специфичные для поиска.
Держите обратную связь краткой: используйте коды проблем, теги, короткие заметки, URL, номера страниц и небольшие объекты метаданных. Не включайте сырые выходные данные scrape/parse.
Отказ: установите FIRECRAWL_NO_ENDPOINT_FEEDBACK=1 (или FIRECRAWL_DISABLE_ENDPOINT_FEEDBACK=1) в переменных окружения при запуске MCP-сервера. Инструмент firecrawl_feedback не будет зарегистрирован, поэтому агенты не смогут его вызывать.
Пример использования:
{
"name": "firecrawl_feedback",
"arguments": {
"endpoint": "scrape",
"jobId": "0193f6c5-1234-7890-abcd-1234567890ab",
"rating": "partial",
"issues": ["missing_markdown"],
"tags": ["docs"],
"note": "The pricing table was missing from the markdown output.",
"url": "https://example.com/pricing",
"pageNumbers": [1],
"metadata": {
"format": "markdown"
}
}
}
Возвращает:
- JSON
{ success, feedbackId, creditsRefunded, creditsRefundedToday?, dailyRefundCap?, dailyCapReached?, alreadySubmitted?, warning? }.
4. Инструмент Crawl (firecrawl_crawl)
Запускает задание crawl, опрашивает до достижения конечного состояния и возвращает итоговый статус/данные crawl.
Лучше всего подходит для:
- Извлечения содержимого с нескольких связанных страниц, когда нужен полный охват.
Не рекомендуется для:
- Извлечения содержимого с одной страницы (используйте scrape)
- Когда важны лимиты токенов (используйте map + scrape для более точного контроля)
- Когда нужны быстрые результаты (crawl может быть медленным)
Предупреждение: Ответы crawl могут быть очень большими и превышать лимиты токенов. Ограничьте глубину crawl и количество страниц или используйте map + scrape для более точного контроля.
Частые ошибки:
- Установка слишком высоких limit или maxDiscoveryDepth (вызывает переполнение токенов)
- Использование crawl для одной страницы (вместо этого используйте scrape)
Пример запроса:
«Получите все записи блога с первых двух уровней example.com/blog.»
Пример использования:
{
"name": "firecrawl_crawl",
"arguments": {
"url": "https://example.com/blog/*",
"maxDiscoveryDepth": 2,
"limit": 100,
"allowExternalLinks": false,
"deduplicateSimilarURLs": true
}
}
Возвращает:
- Итоговый статус и данные crawl после внутреннего опроса, включая
id,status,completed,total,creditsUsed,expiresAt,nextиdata. Используйте возвращённыйidсfirecrawl_check_crawl_status, если нужно позже повторно проверить задание.
5. Проверка статуса crawl (firecrawl_check_crawl_status)
Проверяет статус и результаты существующего задания crawl по ID.
{
"name": "firecrawl_check_crawl_status",
"arguments": {
"id": "550e8400-e29b-41d4-a716-446655440000"
}
}
Возвращает:
- Ответ включает статус задания crawl:
6. Инструмент Parse (firecrawl_parse)
Разбирает локальные файлы или ссылки на размещённые загрузки с помощью конечной точки /v2/parse Firecrawl.
Лучше всего подходит для: PDF, документов Word, электронных таблиц, HTML-файлов и других документов, которым нужен вывод в Markdown или структурированном JSON. Размещённый MCP поддерживает двухэтапный процесс загрузки и ссылки; локальное прямое чтение файлов требует самостоятельного размещения FIRECRAWL_API_URL.
Не рекомендуется для: Удалённых URL (используйте scrape), нескольких файлов в одном вызове (вызывайте parse по одному разу на файл) или действий, доступных только в браузере, таких как скриншоты и клики.
Процесс размещённого MCP: Размещённый MCP не может напрямую читать файловую систему вызывающей стороны. Вызовите firecrawl_parse с filePath, чтобы получить кратковременную команду загрузки и nextToolCall, загрузите файл локально, затем снова вызовите firecrawl_parse с возвращённым uploadRef. Выпуск размещённого URL загрузки требует аутентификации Firecrawl или права на работу без ключа. В локальном режиме npx firecrawl-mcp прямое разбор файлов в настоящее время требует FIRECRAWL_API_URL, указывающий на самостоятельно размещённый API Firecrawl; обычный локальный сервер только с облачным API-ключом не может читать и загружать файлы через этот инструмент.
Пример использования:
{
"name": "firecrawl_parse",
"arguments": {
"filePath": "/absolute/path/to/document.pdf",
"formats": ["markdown"],
"parsers": ["pdf"],
"zeroDataRetention": true
}
}
Возвращает: Содержимое разобранного документа или инструкции по размещённой загрузке с nextToolCall.
7. Структурированные данные с Scrape JSON
Для структурированных данных с известной страницы вызовите firecrawl_scrape один раз на каждый URL с formats: ["json"]. Поместите запрос на извлечение и JSON-схему в jsonOptions.
{
"name": "firecrawl_scrape",
"arguments": {
"url": "https://example.com/product",
"formats": ["json"],
"jsonOptions": {
"prompt": "Extract the product name, price, and description.",
"schema": {
"type": "object",
"properties": {
"name": { "type": "string" },
"price": { "type": "number" },
"description": { "type": "string" }
},
"required": ["name", "price"]
}
}
}
}
Для неизвестных URL или многоисточникового исследования используйте firecrawl_search или firecrawl_agent перед Scrape.
8. Инструмент Agent (firecrawl_agent)
Автономный веб-исследовательский агент. Это отдельный слой ИИ-агента, который самостоятельно просматривает интернет, ищет информацию, перемещается по страницам и извлекает структурированные данные на основе вашего запроса.
Как это работает:
Агент выполняет веб-поиски, переходит по ссылкам, читает страницы и собирает данные автономно. Это работает асинхронно — он сразу возвращает ID задания, а вы опрашиваете firecrawl_agent_status, чтобы проверить завершение и получить результаты.
Асинхронный рабочий процесс:
- Вызовите
firecrawl_agentс вашим запросом/схемой → возвращает ID задания - Займитесь другой работой, пока агент исследует (для сложных запросов может потребоваться несколько минут)
- Опрашивайте
firecrawl_agent_statusс ID задания, чтобы проверить прогресс - Когда статус «completed», ответ включает извлечённые данные
Лучше всего подходит для:
- Сложных исследовательских задач, когда вы не знаете точных URL
- Сбора данных из нескольких источников
- Поиска информации, разбросанной по интернету
- Задач, где вы можете заниматься другой работой, ожидая результатов
Не рекомендуется для:
- Простого одностраничного скрейпинга, когда вы знаете URL (используйте scrape с форматом JSON — быстрее и дешевле)
Аргументы:
prompt: Естественно-языковое описание данных, которые вы хотите (обязательно, максимум 10 000 символов)urls: Необязательный массив URL для фокусировки агента на конкретных страницахschema: Необязательная JSON-схема для структурированного вывода
Пример запроса:
«Найдите основателей Firecrawl и их биографии»
Пример использования (запустите агента, затем опрашивайте результаты):
{
"name": "firecrawl_agent",
"arguments": {
"prompt": "Find the top 5 AI startups founded in 2024 and their funding amounts",
"schema": {
"type": "object",
"properties": {
"startups": {
"type": "array",
"items": {
"type": "object",
"properties": {
"name": { "type": "string" },
"funding": { "type": "string" },
"founded": { "type": "string" }
}
}
}
}
}
}
}
Затем опрашивайте с помощью firecrawl_agent_status, используя возвращённый ID задания.
Пример использования (с URL — агент фокусируется на конкретных страницах):
{
"name": "firecrawl_agent",
"arguments": {
"urls": ["https://docs.firecrawl.dev", "https://firecrawl.dev/pricing"],
"prompt": "Compare the features and pricing information from these pages"
}
}
Возвращает:
- ID задания для проверки статуса. Используйте
firecrawl_agent_statusдля опроса результатов.
9. Проверка статуса агента (firecrawl_agent_status)
Проверяет статус задания агента и получает результаты по завершении. Используйте это для опроса результатов после запуска агента.
Паттерн опроса: Исследование агента может занять несколько минут для сложных запросов. Опрашивайте эту конечную точку периодически (например, каждые 10–30 секунд), пока статус не станет «completed» или «failed».
{
"name": "firecrawl_agent_status",
"arguments": {
"id": "550e8400-e29b-41d4-a716-446655440000"
}
}
Возможные статусы:
processing: Агент всё ещё исследует — проверьте позжеcompleted: Исследование завершено — ответ включает извлечённые данныеfailed: Произошла ошибка
10. Инструмент Interact (firecrawl_interact)
Взаимодействуйте с новым URL или со страницей, которая уже была открыта с помощью firecrawl_scrape.
Лучше всего подходит для: Кликов, ввода текста, навигации и извлечения состояния с динамических страниц без восстановления устаревших браузерных инструментов.
Варианты использования:
- Передайте
url, чтобы спарсить и открыть страницу для взаимодействия за один вызов MCP. - Передайте
scrapeId, чтобы продолжить взаимодействие с уже спарсенной страницей. - Передайте ровно один из
urlилиscrapeId, а также либоprompt, либоcode.
Пример использования:
{
"name": "firecrawl_interact",
"arguments": {
"url": "https://example.com",
"prompt": "Click the pricing link and summarize the visible plans"
}
}
Возвращает: Результат взаимодействия и, для режима URL, производный scrapeId для последующих действий или очистки.
11. Инструмент остановки взаимодействия (firecrawl_interact_stop)
Остановите сеанс взаимодействия для спарсенной страницы, когда закончите взаимодействие.
{
"name": "firecrawl_interact_stop",
"arguments": {
"scrapeId": "scrape-id-here"
}
}
12. Инструменты исследования (firecrawl_research_*)
Ищите и просматривайте статьи и репозитории GitHub через исследовательские MCP-инструменты.
Доступные исследовательские инструменты:
firecrawl_research_search_papers: поиск исследовательских статей.firecrawl_research_inspect_paper: просмотр одной статьи.firecrawl_research_related_papers: поиск связанных статей.firecrawl_research_read_paper: чтение содержимого статьи.firecrawl_research_search_github: поиск репозиториев GitHub.
Лучше всего подходит для: Обзоров литературы, поиска статей и рабочих процессов обнаружения репозиториев, где агенту нужна сфокусированная исследовательская поверхность вместо общего веб-скрейпинга.
13. Инструменты мониторинга (firecrawl_monitor_*)
Создавайте и управляйте повторяющимися мониторами страниц. Мониторы выполняют запланированные scrape или crawl, сравнивают каждый результат с последним сохранённым снимком и могут уведомлять через вебхук или электронную почту.
Лучше всего подходит для:
- Наблюдения за одной или несколькими страницами в течение времени
- Оповещения о значимых изменениях с использованием цели на простом английском
- Отслеживания истории проверок и различий на уровне страниц
Рекомендуемый шаблон создания:
Используйте page или pages плюс goal. MCP-сервер формирует запрос монитора с 30-минутным расписанием, а API автоматически включает оценку значимых изменений.
Оценка значимых изменений выполняется автоматически, когда установлено goal. Вебхуки страниц предоставляют isMeaningful и judgment для событий monitor.page.
Формулируйте цели как краткие инструкции для монитора из 2–3 предложений. Укажите, что должно вызывать оповещение, сохраняйте любую область, заданную пользователем, и включайте исключения, связанные с намерением, только если они очевидны из запроса. Общий шум, такой как пробелы, изменения только форматирования, ID запросов, параметры отслеживания, общие метаданные и неродственные элементы страницы, уже обрабатывается оценщиком, поэтому не повторяйте это в каждой цели. Если пользователь даёт расплывчатое указание, сохраняйте цель широкой; если он просит широкий мониторинг или «любое изменение», сохраняйте это. Если пользователь говорит, что ему что-то не важно, укажите это явно.
{
"name": "firecrawl_monitor_create",
"arguments": {
"page": "https://example.com/pricing",
"goal": "Alert when pricing, packaging, or launch messaging changes."
}
}
Несколько страниц с вебхуками:
{
"name": "firecrawl_monitor_create",
"arguments": {
"pages": ["https://example.com/pricing", "https://example.com/changelog"],
"goal": "Alert when pricing, packaging, or launch messaging changes.",
"webhookUrl": "https://example.com/webhooks/firecrawl"
}
}
Расширенные запросы на создание:
Передайте body, когда вам нужны цели crawl, отслеживание изменений в JSON, настраиваемое хранение или явный контроль judgeEnabled.
{
"name": "firecrawl_monitor_create",
"arguments": {
"body": {
"name": "Docs monitor",
"schedule": { "text": "hourly", "timezone": "UTC" },
"goal": "Alert when docs pages add, remove, or materially change API behavior.",
"targets": [{ "type": "crawl", "url": "https://example.com/docs" }]
}
}
}
Другие инструменты мониторинга:
firecrawl_monitor_list: список мониторов.firecrawl_monitor_get: получить один монитор.firecrawl_monitor_update: обновить поля, включаяgoal,judgeEnabled,webhookиnotification.firecrawl_monitor_run: запустить проверку сейчас.firecrawl_monitor_delete: удалить монитор (деструктивно; вызывать только когда пользователь намерен его удалить).firecrawl_monitor_checks: список проверок, опционально отфильтрованных по статусу.firecrawl_monitor_check: получить результаты на уровне страницы, включаяdiff,snapshot,judgment.meaningfulиjudgment.meaningfulChanges.
14. Инструмент поиска для разработчиков (firecrawl_developer_search)
Поиск по индексу, созданному для агентов кодирования. Индекс охватывает проблемы GitHub, объединённые pull request'ы, README репозиториев и курируемые сайты документации.
Лучше всего подходит для: вопроса по программированию — поведение кода, библиотека или фреймворк, контракт API, сообщение об ошибке или известная ошибка.
Аргументы:
{
"name": "firecrawl_developer_search",
"arguments": {
"query": "how do I configure retries",
"k": 10,
"skills": "only"
}
}
query(обязательный): вопрос разработчика или поисковая фраза.k: количество ранжированных результатов. По умолчанию 10, максимум 100.skills: установите в"only", чтобы искать только файлы навыков агента.
Возвращает: Ранжированные результаты. Каждый результат содержит ID, тип источника (issue, pull_request, readme или doc), URL, заголовок и совпадающие фрагменты в markdown.
firecrawl_search с categories: ["developer"] ищет в том же индексе рядом с веб-результатами. Используйте этот инструмент вместо этого, когда вам нужны фрагменты и не нужны веб-результаты. Конечная точка только для поиска не предоставляет этот инструмент; она сохраняет свой фиксированный набор из шести инструментов, и firecrawl_search обращается к индексу разработчика там.
Система логирования
Сервер включает комплексное логирование:
- Статус и прогресс операций
- Метрики производительности
- Отслеживание лимитов скорости
- Условия ошибок
Пример сообщений журнала:
[INFO] Firecrawl MCP Server initialized successfully
[INFO] Starting scrape for URL: https://example.com
[ERROR] Rate limit exceeded
Обработка ошибок
Сервер обеспечивает надёжную обработку ошибок:
- Ошибки ограничения скорости API, передаваемые MCP-клиенту
- Подробные сообщения об ошибках
- Устойчивость сети
Пример ответа об ошибке:
{
"content": [
{
"type": "text",
"text": "Error: Rate limit exceeded"
}
],
"isError": true
}
Разработка
# Install dependencies
npm install
# Build
npm run build
# Run tests
npm test
Внесение вклада
- Сделайте форк репозитория
- Создайте ветку для вашей функции
- Запустите тесты:
npm test - Отправьте pull request
Благодарности участникам
Спасибо @vrknetha, @cawstudios за первоначальную реализацию!
Спасибо MCP.so и Klavis AI за хостинг и @gstarwd, @xiangkaiz и @zihaolin96 за интеграцию нашего сервера.
Лицензия
MIT License — подробности см. в файле LICENSE