Scrapeless

官方

将实时Scrapeless Google SERP(Google搜索、Google航班、Google地图、Google职位等)结果集成到您的LLM应用中。该服务器可为AI工作流、聊天机器人和研究工具提供动态上下文检索。

你可以用 Scrapeless MCP 做什么?

  • Google 搜索与趋势 — 通过 google_search 和 google_trends 获取实时搜索结果或趋势数据。
  • 浏览器自动化 — 使用 browser_goto 和 browser_click 等工具,指挥云端浏览器进行导航、点击、输入、滚动及截图操作。
  • 抓取任意 URL — 使用 scrape_html、scrape_markdown 或 scrape_screenshot 获取页面的 HTML、Markdown 或截图。
  • 爬取整个网站 — 使用 crawl_start 启动异步爬取任务,然后通过 crawl_result 轮询获取结果。
  • AI 驱动的提取 — 使用 ai_scraper 为 ChatGPT、Gemini 或 Perplexity 等引擎创建结构化抓取任务。

文档

preview

Scrapeless MCP 服务器

欢迎使用官方 Scrapeless 模型上下文协议(MCP)服务器 —— 这是一个强大的集成层,使 LLM、AI 代理和 AI 应用能够实时与网络交互。

基于开放的 MCP 标准构建,Scrapeless MCP 服务器无缝连接 ChatGPT、Claude 等模型,以及 Cursor 和 Windsurf 等工具,提供广泛的外部能力,包括:

  • Google 服务集成(搜索、趋势)
  • 浏览器自动化,用于页面级导航和交互
  • 抓取动态、JS 密集型网站——导出为 HTML、Markdown 或截图
  • 爬取整个网站,通过跟踪链接并以多种格式捕获每个页面
  • AI 抓取器 为 ChatGPT、Gemini、Perplexity、Copilot、Google AI Mode、Google AI Overview、Grok 或 Alexa 创建 AI 抓取任务

无论您是在构建 AI 研究助手、编码副驾还是自主网络代理,该服务器都能提供您工作流所需的动态上下文和真实世界数据——且不会被拦截。

使用示例

  1. 使用 Claude 进行自动化网络交互和数据提取

使用 Scrapeless MCP 浏览器,Claude 可以通过对话命令执行复杂的任务,如网页导航、点击、滚动和抓取,并通过 live sessions 实时预览网络交互结果。

preview

  1. 绕过 Cloudflare 获取目标页面内容

使用 Scrapeless MCP 浏览器服务,自动访问 Cloudflare 页面,流程完成后,提取页面内容并以 Markdown 格式返回。

preview

  1. 提取动态渲染的页面内容并写入文件

使用 Scrapeless MCP 通用 API,抓取上述目标页面的 JavaScript 渲染内容,导出为 Markdown 格式,最后写入名为 text.md 的本地文件。

preview

  1. 自动化 SERP 抓取

使用 Scrapeless MCP 服务器,在 Google 搜索中查询关键词“web scraping”,获取前 10 条搜索结果(包括标题、链接和摘要),并将内容写入名为 serp.text 的文件。

preview

以下是一些使用这些服务器的额外示例:

示例
通过 Google 搜索搜索 scrapeless。
查找过去一年“AI”的搜索兴趣。
使用浏览器访问 chatgpt.com,搜索“今天天气怎么样?”,并总结结果。
抓取 scrapeless.com 页面的 HTML 内容。
抓取 scrapeless.com 页面的 Markdown 内容。
获取 scrapeless.com 的截图。

设置指南

  1. 获取 Scrapeless 密钥
  • 登录 Scrapeless 控制台(可免费试用)
  • 然后点击左侧的“设置” -> 选择“API 密钥管理” -> 点击“创建 API 密钥”。最后,点击您创建的 API 密钥以复制它。

preview

  1. 配置您的 MCP 客户端

Scrapeless MCP 服务器支持 Stdio 和 Streamable HTTP 两种传输模式。

🖥️ Stdio(本地执行)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "command": "npx",
      "args": ["-y", "scrapeless-mcp-server"],
      "env": {
        "SCRAPELESS_API_KEY": "YOUR_SCRAPELESS_KEY"
      }
    }
  }
}

🌐 Streamable HTTP(托管 API 模式)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "type": "streamable-http",
      "url": "https://api.scrapeless.com/mcp",
      "headers": {
        "x-api-token": "YOUR_SCRAPELESS_KEY"
      },
      "disabled": false,
      "alwaysAllow": []
    }
  }
}

高级选项

使用可选参数自定义浏览器会话行为。这些可以通过环境变量(用于 Stdio)或 HTTP 头(用于 Streamable HTTP)设置:

Stdio(环境变量)Streamable HTTP(HTTP 头)描述
BROWSER_PROFILE_IDx-browser-profile-id指定可复用的浏览器配置文件 ID,用于会话连续性。
BROWSER_PROFILE_PERSISTx-browser-profile-persist启用 cookie、本地存储等的持久化存储。
BROWSER_SESSION_TTLx-browser-session-ttl定义最大会话超时时间(秒)。会话将在该不活动时长后自动过期。

与 Claude Desktop 集成

  1. 打开 Claude Desktop
  2. 导航到:Settings → Tools → MCP Servers
  3. 点击 “添加 MCP 服务器”
  4. 粘贴上述 Stdio 或 Streamable HTTP 配置
  5. 保存并启用服务器
  6. Claude 现在可以使用 Scrapeless 发出网络查询、提取内容并与页面交互

与 Cursor IDE 集成

  1. 打开 Cursor
  2. 按 Cmd + Shift + P 并搜索:Configure MCP Servers
  3. 使用上述格式添加 Scrapeless MCP 配置
  4. 保存文件并重启 Cursor(如有需要)
  5. 现在您可以向 Cursor 提问,例如:
    1. "Search StackOverflow for a solution to this error"
    2. "Scrape the HTML from this page"
  6. 它将在后台使用 Scrapeless。

支持的 MCP 工具

名称描述
google_search通用信息搜索引擎。
google_trends从 Google Trends 获取趋势搜索数据。
browser_create使用 Scrapeless 创建或复用云浏览器会话。
browser_close通过断开云浏览器连接来关闭当前会话。
browser_goto将浏览器导航到指定 URL。
browser_go_back在浏览器历史记录中后退一步。
browser_go_forward在浏览器历史记录中前进一步。
browser_click点击页面上的特定元素。
browser_type在指定的输入字段中输入文本。
browser_press_key模拟按键。
browser_wait_for等待特定页面元素出现。
browser_wait暂停执行固定时长。
browser_screenshot捕获当前页面的截图。
browser_get_html获取当前页面的完整 HTML。
browser_get_text获取当前页面的所有可见文本。
browser_scroll滚动到页面底部。
browser_scroll_to将特定元素滚动到视图中。
scrape_html抓取 URL 并返回其完整 HTML 内容。
scrape_markdown抓取 URL 并将其内容返回为 Markdown。
scrape_screenshot捕获任何网页的高质量截图。
crawl_start从基础 URL 启动异步爬取任务并返回其任务 ID。
crawl_cancel按 ID 取消进行中的爬取任务。
crawl_result按 ID 轮询爬取任务直至完成并返回爬取的数据。
ai_scraper为 ChatGPT、Gemini、Perplexity、Copilot、Google AI Mode、Google AI Overview、Grok 或 Alexa 创建 AI 抓取任务。

安全最佳实践

在使用 Scrapeless MCP 服务器与 LLM(如 ChatGPT、Claude 或 Cursor)时,务必谨慎处理所有抓取或提取的网络内容。网络数据默认不可信,处理不当可能会使您的应用面临提示注入或其他安全漏洞。

✅ 推荐做法

  • 切勿将原始抓取内容直接传入 LLM 提示。 原始 HTML、JavaScript 或用户生成的文本可能包含隐藏的注入载荷。
  • 对所有提取的内容进行清理和验证。 在下游逻辑或 AI 模型中使用内容之前,剥离或转义潜在有害的标签和脚本。
  • 优先使用结构化提取而非自由格式文本。 使用 scrape_html、scrape_markdown 或带有已知安全选择器的定向 browser_get_text 仅提取您信任的内容。
  • 在抓取动态生成的页面时应用域名或选择器白名单,以限制数据流向已知且可信的来源。
  • 记录并监控所有通过浏览器或抓取工具发出的出站请求,尤其是在处理敏感数据、令牌或内部网络访问时。

🚫 避免

  • 将抓取的 HTML 直接注入提示
  • 允许用户指定任意 URL 或 CSS 选择器而不进行验证
  • 存储未过滤的抓取内容以供将来提示使用

社区

联系我们

如有问题、建议或合作咨询,欢迎通过以下方式联系我们: