Agenty

официальный

Веб-скрапинг, краулинг и обнаружение изменений с помощью ИИ

Что можно делать с Agenty MCP?

  • Преобразование страниц в Markdown — Попросите преобразовать URL или сырой HTML в чистый, читаемый Markdown с помощью инструмента markdown для контента, удобного для LLM.
  • Создание скриншотов — Используйте screenshot для создания полноразмерных или обрезанных PNG/JPEG-изображений с настраиваемыми окнами просмотра и эмуляцией устройств.
  • Извлечение отрендеренного HTML — Используйте scrape для получения полного отрендеренного HTML страниц с интенсивным использованием JavaScript после загрузки динамического контента.
  • Извлечение структурированных данных — Используйте extract для получения конкретных полей, таких как цены, заголовки или отзывы, с помощью CSS-селекторов или XPath.
  • Генерация PDF — Используйте pdf для экспорта страницы в PDF с параметрами формата, полей, альбомной ориентации, а также верхних и нижних колонтитулов.
  • Обнаружение структуры сайта — Используйте sitemap для чтения файла sitemap.xml сайта и возврата всех обнаруженных URL-адресов с шаблонами исключений.

Документация

Agenty AI предоставляет сервер Model Context Protocol (MCP), который дает AI-ассистентам, таким как Claude, Cursor и любому MCP-совместимому клиенту, прямой доступ к инструментам автоматизации браузера. Вы можете делать скриншоты, создавать PDF-файлы, извлекать данные с веб-страниц, парсить структурированные данные, конвертировать страницы в Markdown и многое другое с помощью LLM-моделей.

В этой статье я расскажу, как подключиться к MCP-серверу Agenty и как использовать каждый доступный инструмент.

Предварительные требования

Перед подключением вам понадобятся:

  • Учетная запись Agenty AI и API-ключ
  • MCP-совместимый клиент, такой как Claude Desktop, Cursor, Windsurf или любой инструмент, поддерживающий Model Context Protocol
  • Node.js 18 или новее, если вы используете CLI или локальный файл конфигурации

Как подключиться

Добавьте следующую конфигурацию в ваш MCP-клиент. Для Claude Desktop это делается в claude_desktop_config.json. Для Cursor — в вашем файле .cursor/mcp.json.

{
  "mcpServers": {
    "agenty": {
      "url": "https://api.agenty.ai/mcp",
      "headers": {
        "Authorization": "Bearer YOUR_API_KEY"
      }
    }
  }
}

Замените YOUR_API_KEY на ключ из вашего Agenty AI > Settings > API Key. После добавления перезапустите клиент, и инструменты Agenty появятся в списке инструментов. Для клиентов, поддерживающих OAuth или вход на основе токенов, вы можете аутентифицироваться напрямую через процесс входа в Agenty AI, не вставляя ключ вручную.

Доступные инструменты

MCP-сервер Agenty предоставляет одиннадцать инструментов, покрывающих наиболее распространенные потребности автоматизации браузера. Каждый инструмент принимает URL или необработанный HTML в качестве входных данных, а также дополнительные параметры для управления поведением браузера.

Available Tools in Agenty MCP

Markdown MCP

Инструмент markdown загружает страницу, удаляет навигацию, нижние колонтитулы, скрипты, рекламу и другие служебные элементы, а затем преобразует оставшийся читаемый контент в чистый Markdown. Он может преобразовывать относительные ссылки в абсолютные URL и удалять изображения данных.

Это особенно полезно для передачи веб-контента в LLM, создания RAG-конвейеров или сохранения читаемых версий статей.

Пример запроса:

«Преобразуй Web scraping - Wikipedia в Markdown»

«Получи Markdown-содержимое этого поста в блоге: https://example.com/article »

Website scraping preview using Claude desktop

Screenshot MCP

Инструмент screenshot запускает реальный браузер, загружает страницу и захватывает ее как изображение PNG или JPEG. Он поддерживает полноэкранные скриншоты, обрезку областей, настраиваемые области просмотра, эмуляцию устройств и манипуляции с изображениями, такие как изменение размера и поворот.

Это полезно, когда вам нужен визуальный снимок страницы, необходимо задокументировать интерфейс или проверить, как сайт выглядит при определенном размере экрана.

Пример запроса:

«Сделай полноэкранный скриншот https://example.com и верни его как PNG»

«Сделай мобильный скриншот https://agenty.ai с областью просмотра iPhone 14»

Web Scraping MCP

Инструмент web scrape загружает URL в реальном браузере с полным выполнением JavaScript и возвращает отрендеренный HTML. В отличие от простых HTTP-запросов, он ожидает загрузки динамического контента, что делает его надежным для одностраничных приложений и сайтов с большим количеством JavaScript.

Используйте это, когда вам нужен необработанный HTML страницы точно так, как его видит пользователь после выполнения всех скриптов.

Пример запроса:

«Извлеки HTML с https://news.ycombinator.com и верни полный отрендеренный контент»

«Извлеки эту страницу и подожди 3 секунды для загрузки динамического контента: https://example.com/dashboard »

Web Crawling MCP

Инструмент links crawling отображает страницу и извлекает каждую гиперссылку, найденную в DOM. Он возвращает плоский список всех href-атрибутов якорей, который можно использовать для создания очереди обхода, аудита внутренних ссылок или обнаружения контента.

Пример запроса:

«Найди все ссылки на https://agenty.ai »

«Извлеки каждую ссылку с https://example.com/blog и дай мне список URL статей»

PDF MCP

Инструмент PDF отображает страницу в реальном браузере и экспортирует ее в PDF. Вы можете установить формат страницы (A4, Letter и т. д.), включить альбомный режим, установить поля, показать или скрыть фон и предоставить пользовательские верхние и нижние колонтитулы.

Пример запроса:

«Создай PDF из https://agenty.ai в формате A4 с включенным фоном для печати»

«Создай альбомный PDF из https://example.com/report »

Data Extraction MCP

Инструмент extract отображает страницу и извлекает структурированные данные с помощью CSS-селекторов или XPath. Он подходит для извлечения конкретных полей, таких как цены на товары, количество отзывов, названия должностей или любых повторяющихся элементов с отрендеренной страницы.

Пример запроса:

«Извлеки названия товаров и цены с https://example.com/products »

«Получи все заголовки с https://news.ycombinator.com »

Sitemap MCP

Инструмент sitemap crawler читает sitemap.xml сайта, следует за файлами индекса карты сайта и возвращает полный список всех обнаруженных URL. Он поддерживает шаблоны исключений для фильтрации определенных путей.

Используйте это, чтобы быстро понять полную структуру сайта или создать список для обхода большого сайта.

Пример запроса:

«Найди все URL в карте сайта для https://agenty.ai »

«Получи карту сайта для https://example.com и исключи все URL, содержащие /blog/»

Redirect Tracing MCP

Инструмент redirects capture отслеживает все HTTP-редиректы для заданного URL и возвращает полную цепочку, включая каждый промежуточный URL, код состояния и конечный пункт назначения.

Это полезно для отладки битых ссылок, проверки канонических URL и аудита партнерских или сокращенных ссылок.

Пример запроса:

«Отследи все редиректы для https://bit.ly/some-link »

«Покажи мне цепочку редиректов для https://example.com/old-page »

Email Scraper MCP

Инструмент emails scraper загружает один или несколько URL (до десяти за раз) и извлекает все адреса электронной почты, найденные на отрендеренной странице. Он обрабатывает обфусцированные адреса и динамически загружаемые контактные разделы.

Пример запроса:

«Найди все адреса электронной почты на https://example.com/contact »

«Извлеки электронные письма с этих трех страниц: https://site1.com, https://site2.com, https://site3.com »

Content MCP

Инструмент content возвращает полный отрендеренный HTML страницы после выполнения JavaScript. Он похож на scrape, но оптимизирован для случаев, когда вам нужно конечное состояние DOM, а не конвейер извлечения.

Пример запроса:

«Получи отрендеренный HTML-контент https://example.com/app »

Snapshot MCP

Инструмент snapshot захватывает дерево доступности страницы — структурированный список всех интерактивных и читаемых элементов, включая кнопки, ссылки, поля ввода и заголовки. Он предназначен для AI-агентов, которым необходимо перемещаться по странице или анализировать ее без обработки необработанного HTML.

Пример запроса:

«Сделай снимок доступности https://example.com, чтобы я мог понять структуру страницы»

Примеры запросов

Вот несколько многошаговых примеров, которые комбинируют инструменты:

Аудит контента сайта:
«Получи карту сайта для https://example.com, затем преобразуй топ-5 страниц в Markdown и сделай краткое изложение каждой»

Создание визуального отчета:
«Сделай скриншот https://agenty.ai на мобильной и десктопной области просмотра и покажи мне оба»

Создание списка контактов:
«Найди все ссылки на https://example.com/team, затем извлеки адреса электронной почты со страницы каждого члена команды»

Проверка работоспособности ссылок:
«Извлеки все ссылки с https://example.com/blog и отследи цепочку редиректов для тех, которые не возвращают 200»

Архивирование страницы:
«Преобразуй https://example.com/article в Markdown и создай PDF-версию, обе с абсолютными ссылками»

Поддерживаемые параметры

Все инструменты на основе навигации (screenshot, pdf, scrape, content, markdown, links, extract, redirects) используют общий набор параметров конфигурации браузера:

ПараметрТипОписание
urlstringURL страницы для загрузки. Обязателен, если не указан html.
htmlstringНеобработанная HTML-строка для отображения вместо загрузки URL.
waitForstring или numberОжидание CSS-селектора, количества миллисекунд или сетевого события перед захватом.
viewportobjectУстановите width, height, deviceScaleFactor, isMobile, hasTouch и isLandscape.
devicestringЭмуляция именованного устройства, такого как iPhone 14 или iPad Pro.
userAgentstringПереопределение строки user agent браузера.
cookiesarrayВнедрение cookie перед загрузкой страницы.
blockAdsbooleanБлокировка запросов рекламных сетей. Включено по умолчанию для инструментов извлечения.
blockTrackersbooleanБлокировка скриптов отслеживания и аналитики.
goToOptionsobjectУправление навигацией timeout (мс) и стратегией waitUntil (load, domcontentloaded, networkidle0, networkidle2).
setExtraHTTPHeadersobjectДобавление пользовательских заголовков запроса в виде пар ключ-значение.
rejectRequestPatternarrayБлокировка запросов, соответствующих этим шаблонам URL.
requestInterceptorsarrayПерехват запросов, соответствующих шаблону, и возврат пользовательского ответа.
authenticateobjectУстановка HTTP username и password для страниц за базовой аутентификацией.
anonymousobjectМаршрутизация через прокси и пропуск типов ресурсов для анонимного просмотра.

Параметры, специфичные для скриншотов:

ПараметрТипОписание
options.fullPagebooleanЗахват всей прокручиваемой страницы. По умолчанию true.
options.typestringФормат изображения: png или jpeg. По умолчанию png.
options.qualitynumberКачество JPEG от 0 до 100.
options.clipobjectЗахват определенной области с помощью x, y, width и height.
options.omitBackgroundbooleanСделать фон прозрачным (только PNG).
manipulateobjectПостобработка изображения с помощью resize, rotate, flip и flop.
responseTypestringВозврат изображения как buffer (по умолчанию) или размещенного url.

При использовании инструмента screenshot через MCP результат по умолчанию возвращается как размещенный URL. При прямом вызове API responseType по умолчанию равен buffer. Установите responseType: 'url', чтобы получить размещенную ссылку.

Параметры, специфичные для PDF:

ПараметрТипОписание
options.formatstringРазмер страницы: A4, Letter, Legal, Tabloid, Ledger, A0A6.
options.landscapebooleanОтображение в альбомной ориентации.
options.marginobjectУстановка полей top, bottom, left и right.
options.printBackgroundbooleanВключение CSS-фонов в вывод.
options.displayHeaderFooterbooleanПоказ верхнего и нижнего колонтитулов на каждой странице.
options.headerTemplatestringHTML-шаблон для верхнего колонтитула страницы.
options.footerTemplatestringHTML-шаблон для нижнего колонтитула страницы.
options.pageRangesstringПечать определенных страниц, например 1-5.
options.scalenumberМасштабирование содержимого страницы.
emulateMediastringОтображение как тип медиа screen или print.
responseTypestringВозврат PDF как buffer (по умолчанию) или размещенного url.

При использовании инструмента PDF через MCP результат по умолчанию возвращается как размещенный URL. При прямом вызове API responseType по умолчанию равен buffer. Установите responseType: 'url', чтобы получить размещенную ссылку.

Лимиты и добросовестное использование

Каждый API-ключ имеет месячный лимит запросов в зависимости от вашего тарифного плана. Долго выполняющиеся страницы с тяжёлым JavaScript или большими PDF-файлами потребляют больше ресурсов. Используйте blockAds и blockTrackers, чтобы ускорить запросы и снизить расход трафика при задачах скрейпинга.

Схема запросов и ответов Agenty AI намеренно сохраняет совместимость с наиболее широко используемыми API для автоматизации браузеров, включая Browserless, Firecrawl, Cloudflare Browser Rendering и аналогичные сервисы. Если вы уже используете одного из этих провайдеров, вы можете перейти на Agenty AI, обновив базовый URL и API-ключ, без переписывания существующих запросов.

ПровайдерМиграция
BrowserlessИзмените базовый URL и API-ключ. Все параметры совместимы.
FirecrawlИзмените базовый URL и API-ключ. Конечные точки scrape, markdown и crawl сопоставляются напрямую.
Cloudflare Browser RenderingИзмените базовый URL и заголовок аутентификации. Параметры скриншотов и контента совместимы.
Puppeteer HTTP APIsБольшинство goToOptions и параметров страницы сопоставляются 1:1.