Agenty
chính thứcWeb scraping, thu thập dữ liệu và phát hiện thay đổi với AI
Bạn có thể làm gì với Agenty MCP?
- Chuyển đổi trang thành Markdown — Yêu cầu chuyển đổi URL hoặc HTML thô thành Markdown sạch, dễ đọc bằng công cụ
markdownđể có nội dung thân thiện với LLM. - Chụp ảnh màn hình — Sử dụng
screenshotđể chụp ảnh toàn trang hoặc cắt ảnh PNG/JPEG với khung nhìn tùy chỉnh và mô phỏng thiết bị. - Thu thập HTML đã render — Sử dụng
scrapeđể lấy toàn bộ HTML đã render của các trang nặng JavaScript sau khi nội dung động tải xong. - Trích xuất dữ liệu có cấu trúc — Sử dụng
extractđể lấy các trường cụ thể như giá, tiêu đề hoặc đánh giá qua bộ chọn CSS hoặc XPath. - Tạo PDF — Sử dụng
pdfđể xuất trang dưới dạng PDF với các tùy chọn định dạng, lề, ngang dọc, và đầu trang/chân trang. - Khám phá cấu trúc trang web — Sử dụng
sitemapđể đọc sitemap.xml của trang và trả về tất cả URL tìm thấy, kèm mẫu loại trừ.
Tài liệu
Agenty AI cung cấp máy chủ Model Context Protocol (MCP) cho phép các trợ lý AI như Claude, Cursor và mọi ứng dụng khách tương thích MCP truy cập trực tiếp vào các công cụ tự động hóa trình duyệt. Bạn có thể chụp ảnh màn hình, tạo PDF, thu thập dữ liệu trang web, trích xuất dữ liệu có cấu trúc, chuyển đổi trang sang Markdown và hơn thế nữa bằng các mô hình LLM
Trong bài viết này, tôi sẽ hướng dẫn cách kết nối với máy chủ MCP của Agenty và cách sử dụng từng công cụ có sẵn.
Điều kiện tiên quyết
Trước khi kết nối, bạn cần có:
- Tài khoản Agenty AI và khóa API
- Một ứng dụng khách tương thích MCP như Claude Desktop, Cursor, Windsurf hoặc bất kỳ công cụ nào hỗ trợ Model Context Protocol
- Node.js 18 trở lên nếu bạn sử dụng CLI hoặc tệp cấu hình cục bộ
Cách kết nối
Thêm cấu hình sau vào ứng dụng khách MCP của bạn. Đối với Claude Desktop, cấu hình này nằm trong claude_desktop_config.json. Đối với Cursor, nó nằm trong tệp .cursor/mcp.json của bạn.
{
"mcpServers": {
"agenty": {
"url": "https://api.agenty.ai/mcp",
"headers": {
"Authorization": "Bearer YOUR_API_KEY"
}
}
}
}
Thay YOUR_API_KEY bằng khóa từ Agenty AI > Settings > API Key của bạn. Sau khi thêm, hãy khởi động lại ứng dụng khách và các công cụ Agenty sẽ xuất hiện trong danh sách công cụ. Đối với các ứng dụng khách hỗ trợ đăng nhập OAuth hoặc dựa trên token, bạn có thể xác thực trực tiếp qua quy trình đăng nhập Agenty AI mà không cần dán khóa thủ công.
Các công cụ có sẵn
Máy chủ MCP của Agenty cung cấp mười một công cụ đáp ứng các nhu cầu tự động hóa trình duyệt phổ biến nhất. Mỗi công cụ chấp nhận URL hoặc HTML thô làm đầu vào cùng với các tham số tùy chọn để kiểm soát hành vi của trình duyệt.
Markdown MCP
Công cụ markdown tải một trang, loại bỏ điều hướng, chân trang, tập lệnh, quảng cáo và các nội dung khuôn mẫu khác, rồi chuyển đổi nội dung có thể đọc còn lại thành Markdown sạch. Nó có thể phân giải các liên kết tương đối thành URL tuyệt đối và loại bỏ hình ảnh dữ liệu.
Điều này đặc biệt hữu ích để đưa nội dung web vào LLM, xây dựng quy trình RAG hoặc lưu các phiên bản bài viết có thể đọc được.
Ví dụ về lời nhắc:
"Chuyển đổi Web scraping - Wikipedia sang Markdown"
"Lấy nội dung Markdown của bài đăng blog này: https://example.com/article "
Screenshot MCP
Công cụ screenshot khởi chạy trình duyệt thực, tải trang và chụp lại dưới dạng hình ảnh PNG hoặc JPEG. Nó hỗ trợ chụp toàn trang, vùng cắt, khung nhìn tùy chỉnh, mô phỏng thiết bị và thao tác hình ảnh như thay đổi kích thước và xoay.
Điều này hữu ích khi bạn muốn có ảnh chụp trực quan của một trang, cần ghi lại giao diện người dùng hoặc muốn xác minh giao diện của trang web ở một kích thước màn hình cụ thể.
Ví dụ về lời nhắc:
"Chụp ảnh màn hình toàn trang của https://example.com và trả về dưới dạng PNG"
"Chụp ảnh màn hình di động của https://agenty.ai bằng khung nhìn iPhone 14"
Web Scraping MCP
Công cụ web scrape tải URL trong trình duyệt thực với thực thi JavaScript đầy đủ và trả về HTML đã kết xuất. Không giống như các yêu cầu HTTP đơn giản, nó chờ nội dung động tải xong, giúp đáng tin cậy cho các ứng dụng một trang và các trang nặng JavaScript.
Sử dụng công cụ này khi bạn cần HTML thô của một trang chính xác như người dùng sẽ thấy sau khi tất cả tập lệnh đã chạy.
Ví dụ về lời nhắc:
"Thu thập HTML của https://news.ycombinator.com và trả về toàn bộ nội dung đã kết xuất"
"Thu thập trang này và chờ 3 giây để nội dung động tải: https://example.com/dashboard "
Web Crawling MCP
Công cụ links crawling kết xuất một trang và trích xuất mọi siêu liên kết tìm thấy trong DOM. Nó trả về danh sách phẳng tất cả các href của thẻ neo, bạn có thể dùng để xây dựng hàng đợi thu thập, kiểm tra liên kết nội bộ hoặc khám phá nội dung.
Ví dụ về lời nhắc:
"Tìm tất cả liên kết trên https://agenty.ai "
"Trích xuất mọi liên kết từ https://example.com/blog và đưa tôi danh sách URL bài viết"
PDF MCP
Công cụ PDF kết xuất một trang trong trình duyệt thực và xuất ra dưới dạng PDF. Bạn có thể đặt định dạng trang (A4, Letter, v.v.), bật chế độ ngang, đặt lề, hiện hoặc ẩn nền và cung cấp đầu trang và chân trang tùy chỉnh.
Ví dụ về lời nhắc:
"Tạo PDF của https://agenty.ai ở định dạng A4 với nền in được bật"
"Tạo PDF ngang của https://example.com/report "
Data Extraction MCP
Công cụ extract kết xuất một trang và trích xuất dữ liệu có cấu trúc bằng CSS selectors hoặc XPath. Nó phù hợp để lấy các trường cụ thể như giá sản phẩm, số lượng đánh giá, chức danh công việc hoặc bất kỳ phần tử lặp lại nào từ một trang đã kết xuất.
Ví dụ về lời nhắc:
"Trích xuất tên và giá sản phẩm từ https://example.com/products "
"Lấy tất cả tiêu đề từ https://news.ycombinator.com "
Sitemap MCP
Công cụ sitemap crawler đọc sitemap.xml của trang web, theo dõi các tệp chỉ mục sitemap và trả về danh sách đầy đủ tất cả URL được phát hiện. Nó hỗ trợ các mẫu loại trừ để lọc ra các đường dẫn nhất định.
Sử dụng công cụ này để nhanh chóng hiểu cấu trúc đầy đủ của một trang web hoặc xây dựng danh sách thu thập cho một trang lớn.
Ví dụ về lời nhắc:
"Tìm tất cả URL trong sitemap của https://agenty.ai "
"Lấy sitemap cho https://example.com và loại trừ mọi URL chứa /blog/"
Redirect Tracing MCP
Công cụ redirects capture theo dõi tất cả chuyển hướng HTTP cho một URL nhất định và trả về toàn bộ chuỗi bao gồm từng URL trung gian, mã trạng thái và đích cuối cùng.
Điều này hữu ích để gỡ lỗi các liên kết hỏng, xác minh URL chuẩn và kiểm tra các liên kết tiếp thị liên kết hoặc liên kết rút gọn.
Ví dụ về lời nhắc:
"Theo dõi tất cả chuyển hướng cho https://bit.ly/some-link "
"Hiển thị chuỗi chuyển hướng cho https://example.com/old-page "
Email Scraper MCP
Công cụ emails scraper tải một hoặc nhiều URL (tối đa mười URL cùng lúc) và trích xuất tất cả địa chỉ email tìm thấy trên trang đã kết xuất. Nó xử lý các địa chỉ bị che giấu và các phần liên hệ được tải động.
Ví dụ về lời nhắc:
"Tìm tất cả địa chỉ email trên https://example.com/contact "
"Thu thập email từ ba trang này: https://site1.com, https://site2.com, https://site3.com "
Content MCP
Công cụ content trả về HTML đã kết xuất hoàn chỉnh của một trang sau khi thực thi JavaScript. Nó tương tự như scrape nhưng được tối ưu hóa cho các trường hợp bạn cần trạng thái DOM cuối cùng thay vì một quy trình thu thập.
Ví dụ về lời nhắc:
"Lấy nội dung HTML đã kết xuất của https://example.com/app "
Snapshot MCP
Công cụ snapshot chụp cây khả năng truy cập của một trang — danh sách có cấu trúc của tất cả các phần tử tương tác và có thể đọc được bao gồm nút, liên kết, trường nhập và tiêu đề. Công cụ này được thiết kế cho các tác nhân AI cần điều hướng hoặc suy luận về một trang mà không cần xử lý HTML thô.
Ví dụ về lời nhắc:
"Chụp ảnh nhanh khả năng truy cập của https://example.com để tôi có thể hiểu cấu trúc trang"
Ví dụ về lời nhắc
Dưới đây là một vài ví dụ nhiều bước kết hợp các công cụ:
Kiểm tra nội dung của một trang web:
"Lấy sitemap cho https://example.com, sau đó chuyển đổi 5 trang hàng đầu sang Markdown và tóm tắt từng trang"
Tạo báo cáo trực quan:
"Chụp ảnh màn hình của https://agenty.ai trên khung nhìn di động và máy tính để bàn rồi hiển thị cả hai"
Xây dựng danh sách liên hệ:
"Tìm tất cả liên kết trên https://example.com/team, sau đó thu thập địa chỉ email từ từng trang thành viên nhóm"
Xác minh tình trạng liên kết:
"Trích xuất tất cả liên kết từ https://example.com/blog và theo dõi chuỗi chuyển hướng cho bất kỳ liên kết nào không trả về 200"
Lưu trữ một trang:
"Chuyển đổi https://example.com/article sang Markdown và tạo phiên bản PDF, cả hai đều có liên kết tuyệt đối"
Các tham số được hỗ trợ
Tất cả các công cụ dựa trên điều hướng (screenshot, pdf, scrape, content, markdown, links, extract, redirects) dùng chung một bộ tùy chọn cấu hình trình duyệt:
| Tham số | Loại | Mô tả |
|---|---|---|
url | string | URL trang cần tải. Bắt buộc nếu không cung cấp html. |
html | string | Chuỗi HTML thô để kết xuất thay vì tải URL. |
waitFor | string or number | Chờ một CSS selector, một số mili giây hoặc một sự kiện mạng trước khi chụp. |
viewport | object | Đặt width, height, deviceScaleFactor, isMobile, hasTouch và isLandscape. |
device | string | Mô phỏng một thiết bị có tên như iPhone 14 hoặc iPad Pro. |
userAgent | string | Ghi đè chuỗi user agent của trình duyệt. |
cookies | array | Chèn cookie trước khi trang tải. |
blockAds | boolean | Chặn các yêu cầu mạng quảng cáo. Được bật theo mặc định cho các công cụ thu thập. |
blockTrackers | boolean | Chặn các tập lệnh theo dõi và phân tích. |
goToOptions | object | Kiểm soát timeout điều hướng (ms) và chiến lược waitUntil (load, domcontentloaded, networkidle0, networkidle2). |
setExtraHTTPHeaders | object | Thêm tiêu đề yêu cầu tùy chỉnh dưới dạng cặp khóa-giá trị. |
rejectRequestPattern | array | Chặn các yêu cầu khớp với các mẫu URL này. |
requestInterceptors | array | Chặn các yêu cầu khớp với một mẫu và trả về phản hồi tùy chỉnh. |
authenticate | object | Đặt username và password HTTP cho các trang sau xác thực cơ bản. |
anonymous | object | Định tuyến qua proxy và bỏ qua các loại tài nguyên để duyệt web ẩn danh. |
Các tham số riêng cho screenshot:
| Tham số | Loại | Mô tả |
|---|---|---|
options.fullPage | boolean | Chụp toàn bộ trang có thể cuộn. Mặc định là true. |
options.type | string | Định dạng hình ảnh: png hoặc jpeg. Mặc định là png. |
options.quality | number | Chất lượng JPEG từ 0 đến 100. |
options.clip | object | Chụp một vùng cụ thể với x, y, width và height. |
options.omitBackground | boolean | Làm cho nền trong suốt (chỉ PNG). |
manipulate | object | Xử lý hậu kỳ hình ảnh với resize, rotate, flip và flop. |
responseType | string | Trả về hình ảnh dưới dạng buffer (mặc định) hoặc url được lưu trữ. |
Khi sử dụng công cụ screenshot qua MCP, kết quả được trả về dưới dạng URL được lưu trữ theo mặc định. Khi gọi API trực tiếp, responseType mặc định là buffer. Đặt responseType: 'url' để nhận liên kết được lưu trữ thay thế.
Các tham số riêng cho PDF:
| Tham số | Loại | Mô tả |
|---|---|---|
options.format | string | Kích thước trang: A4, Letter, Legal, Tabloid, Ledger, A0 – A6. |
options.landscape | boolean | Kết xuất theo hướng ngang. |
options.margin | object | Đặt lề top, bottom, left và right. |
options.printBackground | boolean | Bao gồm nền CSS trong đầu ra. |
options.displayHeaderFooter | boolean | Hiển thị đầu trang và chân trang trên mỗi trang. |
options.headerTemplate | string | Mẫu HTML cho đầu trang. |
options.footerTemplate | string | Mẫu HTML cho chân trang. |
options.pageRanges | string | In các trang cụ thể, ví dụ: 1-5. |
options.scale | number | Tỷ lệ nội dung trang. |
emulateMedia | string | Kết xuất dưới dạng loại phương tiện screen hoặc print. |
responseType | string | Trả về PDF dưới dạng buffer (mặc định) hoặc url được lưu trữ. |
Khi sử dụng công cụ PDF qua MCP, kết quả được trả về dưới dạng URL được lưu trữ theo mặc định. Khi gọi API trực tiếp, responseType mặc định là buffer. Đặt responseType: 'url' để nhận liên kết được lưu trữ thay thế.
Giới hạn tốc độ và sử dụng hợp lý
Mỗi khóa API có giới hạn yêu cầu hàng tháng dựa trên gói của bạn. Các trang chạy lâu với JavaScript nặng hoặc PDF lớn sẽ tiêu tốn nhiều tài nguyên hơn. Sử dụng blockAds và blockTrackers để tăng tốc yêu cầu và giảm băng thông sử dụng cho các tác vụ thu thập dữ liệu.
Lược đồ yêu cầu và phản hồi của Agenty AI được cố ý giữ tương thích với các API tự động hóa trình duyệt được sử dụng rộng rãi nhất bao gồm Browserless, Firecrawl, Cloudflare Browser Rendering và các dịch vụ tương tự. Nếu bạn đã sử dụng một trong các nhà cung cấp này, bạn có thể chuyển sang Agenty AI bằng cách cập nhật URL cơ sở và khóa API mà không cần viết lại các yêu cầu hiện có.
| Nhà cung cấp | Di chuyển |
|---|---|
| Browserless | Thay đổi URL cơ sở và khóa API. Tất cả các tham số đều tương thích. |
| Firecrawl | Thay đổi URL cơ sở và khóa API. Các điểm cuối scrape, markdown và crawl ánh xạ trực tiếp. |
| Cloudflare Browser Rendering | Thay đổi URL cơ sở và tiêu đề xác thực. Các tham số ảnh chụp màn hình và nội dung đều tương thích. |
| Puppeteer HTTP APIs | Hầu hết các goToOptions và tùy chọn trang ánh xạ 1:1. |

