Scrapeless

ทางการ

ผสานรวมผลลัพธ์ Scrapeless Google SERP แบบเรียลไทม์ (Google Search, Google Flight, Google Map, Google Jobs....) เข้ากับแอปพลิเคชัน LLM ของคุณ เซิร์ฟเวอร์นี้ช่วยให้สามารถดึงข้อมูลบริบทแบบไดนามิกสำหรับเวิร์กโฟลว์ AI แชทบอท และเครื่องมือวิจัย

คุณทำอะไรได้บ้างด้วย Scrapeless MCP?

  • ค้นหา Google และรับผลลัพธ์ — ให้ผู้ช่วยของคุณทำการค้นหาเว็บผ่าน google_search และส่งคืนชื่อเรื่อง ลิงก์ และข้อความตัวอย่าง
  • ดึงข้อมูล Google Trends — ขอข้อมูลแนวโน้มความสนใจในการค้นหาตามช่วงเวลาสำหรับคำสำคัญโดยใช้ google_trends
  • ดึงข้อมูลหน้าเว็บเป็น HTML, Markdown หรือภาพหน้าจอ — แยกเนื้อหาจาก URL ใดๆ ด้วย scrape_html, scrape_markdown หรือ scrape_screenshot
  • ควบคุมเซสชันเบราว์เซอร์บนคลาวด์ — นำทาง คลิก พิมพ์ เลื่อน และรอในหน้าเว็บโดยใช้ browser_goto, browser_click, browser_type และเครื่องมือที่เกี่ยวข้อง
  • บันทึกสถานะเบราว์เซอร์ — รับ HTML ข้อความที่มองเห็นได้ หรือภาพหน้าจอของหน้าปัจจุบันผ่าน browser_get_html, browser_get_text หรือ browser_screenshot

เอกสาร

preview

Scrapeless MCP Server

ยินดีต้อนรับสู่ Scrapeless Model Context Protocol (MCP) Server อย่างเป็นทางการ — เลเยอร์การผสานรวมอันทรงพลังที่ช่วยให้ LLM, AI Agent และแอปพลิเคชัน AI สามารถโต้ตอบกับเว็บได้แบบเรียลไทม์

Scrapeless MCP Server สร้างขึ้นบนมาตรฐาน MCP แบบเปิด เชื่อมต่อโมเดลต่างๆ เช่น ChatGPT, Claude และเครื่องมืออย่าง Cursor และ Windsurf เข้ากับความสามารถภายนอกที่หลากหลายได้อย่างราบรื่น ซึ่งรวมถึง:

  • การผสานรวมบริการของ Google (Search, Trends)
  • ระบบอัตโนมัติของเบราว์เซอร์ สำหรับการนำทางและโต้ตอบในระดับหน้าเว็บ
  • Scrape เว็บไซต์ไดนามิกที่ใช้ JS หนักๆ — ส่งออกเป็น HTML, Markdown หรือภาพหน้าจอ

ไม่ว่าคุณกำลังสร้างผู้ช่วยวิจัย AI, โค้ดผู้ช่วย หรือเอเจนต์เว็บอัตโนมัติ เซิร์ฟเวอร์นี้จะมอบบริบทแบบไดนามิกและข้อมูลโลกแห่งความเป็นจริงที่เวิร์กโฟลว์ของคุณต้องการ — โดยไม่ถูกบล็อก

ตัวอย่างการใช้งาน

  1. การโต้ตอบกับเว็บอัตโนมัติและการดึงข้อมูลด้วย Claude

ด้วย Scrapeless MCP Browser ทำให้ Claude สามารถทำงานที่ซับซ้อน เช่น การนำทางเว็บ การคลิก การเลื่อน และการ scrape ผ่านคำสั่งสนทนา พร้อมการแสดงตัวอย่างผลลัพธ์การโต้ตอบกับเว็บแบบเรียลไทม์ผ่าน live sessions

preview

  1. การบายพาส Cloudflare เพื่อดึงเนื้อหาหน้าเป้าหมาย

ด้วยบริการ Scrapeless MCP Browser หน้า Cloudflare จะถูกเข้าถึงโดยอัตโนมัติ และหลังจากกระบวนการเสร็จสิ้น เนื้อหาของหน้าจะถูกดึงและส่งคืนในรูปแบบ Markdown

preview

  1. การดึงเนื้อหาหน้าที่เรนเดอร์แบบไดนามิกและเขียนลงไฟล์

ด้วย Scrapeless MCP Universal API เนื้อหาที่เรนเดอร์ด้วย JavaScript ของหน้าเป้าหมายด้านบนจะถูก scrape ส่งออกในรูปแบบ Markdown และสุดท้ายเขียนลงไฟล์ในเครื่องชื่อ text.md

preview

  1. การ scrape SERP อัตโนมัติ

ด้วย Scrapeless MCP Server ค้นหาคีย์เวิร์ด “web scraping” บน Google Search ดึงผลการค้นหา 10 รายการแรก (รวมชื่อเรื่อง ลิงก์ และสรุป) และเขียนเนื้อหาลงไฟล์ชื่อ serp.text

preview

นี่คือตัวอย่างเพิ่มเติมเกี่ยวกับวิธีใช้เซิร์ฟเวอร์เหล่านี้:

ตัวอย่าง
ค้นหา scrapeless ด้วย Google search
ค้นหาความสนใจในการค้นหาสำหรับ "AI" ในปีที่ผ่านมา
ใช้เบราว์เซอร์ไปที่ chatgpt.com ค้นหา "What's the weather like today?" และสรุปผลลัพธ์
Scrape เนื้อหา HTML ของหน้า scrapeless.com
Scrape เนื้อหา Markdown ของหน้า scrapeless.com
รับภาพหน้าจอของ scrapeless.com

คู่มือการตั้งค่า

  1. รับ Scrapeless Key
  • เข้าสู่ระบบ Scrapeless Dashboard (มีรุ่นทดลองใช้ฟรี)
  • จากนั้นคลิก "Setting" ทางซ้าย -> เลือก "API Key Management" -> คลิก "Create API Key" สุดท้ายคลิก API Key ที่คุณสร้างเพื่อ คัดลอก

preview

  1. กำหนดค่า MCP Client ของคุณ

Scrapeless MCP Server รองรับโหมดการขนส่งทั้ง Stdio และ Streamable HTTP

🖥️ Stdio (การดำเนินการภายในเครื่อง)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "command": "npx",
      "args": ["-y", "scrapeless-mcp-server"],
      "env": {
        "SCRAPELESS_KEY": "YOUR_SCRAPELESS_KEY"
      }
    }
  }
}

🌐 Streamable HTTP (โหมด API แบบโฮสต์)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "type": "streamable-http",
      "url": "https://api.scrapeless.com/mcp",
      "headers": {
        "x-api-token": "YOUR_SCRAPELESS_KEY"
      },
      "disabled": false,
      "alwaysAllow": []
    }
  }
}

ตัวเลือกขั้นสูง

ปรับแต่งพฤติกรรมเซสชันเบราว์เซอร์ด้วยพารามิเตอร์เสริม สามารถตั้งค่าได้ผ่านตัวแปรสภาพแวดล้อม (สำหรับ Stdio) หรือ HTTP headers (สำหรับ Streamable HTTP):

Stdio (Env Var)Streamable HTTP (HTTP Header)คำอธิบาย
BROWSER_PROFILE_IDx-browser-profile-idระบุ ID โปรไฟล์เบราว์เซอร์ที่ใช้ซ้ำได้เพื่อความต่อเนื่องของเซสชัน
BROWSER_PROFILE_PERSISTx-browser-profile-persistเปิดใช้งานการจัดเก็บข้อมูลถาวรสำหรับคุกกี้, local storage ฯลฯ
BROWSER_SESSION_TTLx-browser-session-ttlกำหนด ระยะหมดเวลาเซสชันสูงสุด เป็นวินาที เซสชันจะหมดอายุโดยอัตโนมัติหลังจากไม่มีการใช้งานเป็นระยะเวลานี้

การผสานรวมกับ Claude Desktop

  1. เปิด Claude Desktop
  2. ไปที่: SettingsToolsMCP Servers
  3. คลิก "Add MCP Server"
  4. วางการกำหนดค่า Stdio หรือ Streamable HTTP ด้านบน
  5. บันทึกและเปิดใช้งานเซิร์ฟเวอร์
  6. Claude จะสามารถออกคำสั่งเว็บ ดึงเนื้อหา และโต้ตอบกับหน้าเว็บโดยใช้ Scrapeless ได้แล้ว

การผสานรวมกับ Cursor IDE

  1. เปิด Cursor
  2. กด Cmd + Shift + P และค้นหา: Configure MCP Servers
  3. เพิ่มการกำหนดค่า Scrapeless MCP โดยใช้รูปแบบด้านบน
  4. บันทึกไฟล์และรีสตาร์ท Cursor (หากจำเป็น)
  5. ตอนนี้คุณสามารถถาม Cursor ได้ เช่น:
    1. "Search StackOverflow for a solution to this error"
    2. "Scrape the HTML from this page"
  6. และมันจะใช้ Scrapeless ในเบื้องหลัง

เครื่องมือ MCP ที่รองรับ

ชื่อคำอธิบาย
google_searchเครื่องมือค้นหาข้อมูลสากล
google_trendsรับข้อมูลการค้นหายอดนิยมจาก Google Trends
browser_createสร้างหรือใช้เซสชันเบราว์เซอร์คลาวด์ซ้ำโดยใช้ Scrapeless
browser_closeปิดเซสชันปัจจุบันโดยตัดการเชื่อมต่อเบราว์เซอร์คลาวด์
browser_gotoนำทางเบราว์เซอร์ไปยัง URL ที่ระบุ
browser_go_backย้อนกลับหนึ่งขั้นในประวัติเบราว์เซอร์
browser_go_forwardเดินหน้าหนึ่งขั้นในประวัติเบราว์เซอร์
browser_clickคลิกองค์ประกอบเฉพาะบนหน้า
browser_typeพิมพ์ข้อความลงในช่องป้อนข้อมูลที่ระบุ
browser_press_keyจำลองการกดปุ่ม
browser_wait_forรอให้องค์ประกอบหน้าเฉพาะปรากฏ
browser_waitหยุดการดำเนินการชั่วคราวตามระยะเวลาที่กำหนด
browser_screenshotจับภาพหน้าจอของหน้าปัจจุบัน
browser_get_htmlรับ HTML ทั้งหมดของหน้าปัจจุบัน
browser_get_textรับข้อความที่มองเห็นได้ทั้งหมดจากหน้าปัจจุบัน
browser_scrollเลื่อนไปที่ด้านล่างของหน้า
browser_scroll_toเลื่อนองค์ประกอบเฉพาะให้เข้ามาในมุมมอง
scrape_htmlScrape URL และส่งคืนเนื้อหา HTML ทั้งหมด
scrape_markdownScrape URL และส่งคืนเนื้อหาเป็น Markdown
scrape_screenshotจับภาพหน้าจอคุณภาพสูงของหน้าเว็บใดๆ

แนวทางปฏิบัติที่ดีที่สุดด้านความปลอดภัย

เมื่อใช้ Scrapeless MCP Server กับ LLM (เช่น ChatGPT, Claude หรือ Cursor) สิ่งสำคัญคือต้องจัดการเนื้อหาเว็บที่ scrape หรือดึงมาทั้งหมดด้วยความระมัดระวัง ข้อมูลเว็บไม่น่าเชื่อถือโดยค่าเริ่มต้น และการจัดการที่ไม่เหมาะสมอาจทำให้แอปพลิเคชันของคุณเสี่ยงต่อการถูกโจมตีด้วย prompt injection หรือช่องโหว่ด้านความปลอดภัยอื่นๆ

✅ แนวทางปฏิบัติที่แนะนำ

  • อย่าส่งเนื้อหาที่ scrape แบบดิบไปยัง LLM prompts โดยตรง HTML, JavaScript หรือข้อความที่ผู้ใช้สร้างขึ้นอาจมี payload สำหรับการโจมตีซ่อนอยู่
  • ทำความสะอาดและตรวจสอบเนื้อหาที่ดึงมาทั้งหมด ลบหรือ escape แท็กและสคริปต์ที่อาจเป็นอันตรายก่อนใช้เนื้อหาในตรรกะขั้นต่อไปหรือโมเดล AI
  • เลือกใช้การดึงข้อมูลแบบมีโครงสร้างมากกว่าข้อความอิสระ ใช้เครื่องมือเช่น scrape_html, scrape_markdown หรือ browser_get_text แบบเจาะจงด้วยตัวเลือกที่รู้ว่าปลอดภัยเพื่อดึงเฉพาะเนื้อหาที่คุณเชื่อถือ
  • ใช้การอนุญาตพิเศษโดเมนหรือตัวเลือก เมื่อ scrape หน้าเว็บที่สร้างแบบไดนามิก เพื่อจำกัดการไหลของข้อมูลไปยังแหล่งที่รู้จักและเชื่อถือได้
  • บันทึกและตรวจสอบคำขอขาออกทั้งหมด ที่ทำผ่านเบราว์เซอร์หรือเครื่องมือ scrape โดยเฉพาะอย่างยิ่งหากคุณกำลังจัดการข้อมูลที่ละเอียดอ่อน โทเค็น หรือการเข้าถึงเครือข่ายภายใน

🚫 หลีกเลี่ยง

  • การแทรก HTML ที่ scrape โดยตรงลงใน prompts
  • การให้ผู้ใช้ระบุ URL หรือ CSS selectors ตามอำเภอใจโดยไม่มีการตรวจสอบ
  • การจัดเก็บเนื้อหาที่ scrape โดยไม่กรองเพื่อใช้ใน prompt ในอนาคต

ชุมชน

ติดต่อเรา

สำหรับคำถาม ข้อเสนอแนะ หรือข้อสงสัยเกี่ยวกับความร่วมมือ โปรดติดต่อเราผ่าน: