Crew Risk

Un sistema de evaluación de riesgos de cumplimiento para rastreadores a través de una API simple.

Documentación

mcp-crew-risk

Un evaluador de riesgos para rastreadores basado en el Protocolo de Contexto del Modelo (MCP).
Este servidor proporciona una interfaz API simple que permite a los usuarios realizar una evaluación integral de riesgos de cumplimiento para rastreadores en una página web específica.

Descripción del Marco de Evaluación de Riesgos de Cumplimiento para Rastreadores

Este marco tiene como objetivo proporcionar a los desarrolladores y operadores de rastreadores un conjunto de herramientas automatizadas de detección de cumplimiento para evaluar la amabilidad hacia los rastreadores y los riesgos potenciales de los sitios web objetivo. Cubre tres dimensiones principales: legal, ética social y técnica. A través de advertencias de riesgo de múltiples niveles y recomendaciones específicas, ayuda a planificar estrategias de rastreo de manera razonable para evitar disputas legales e impactos sociales negativos, al tiempo que mejora la estabilidad técnica y la eficiencia.


Estructura del Marco

1. Riesgo Legal

Contenido de Detección

  • Si existen Términos de Servicio explícitos que restrinjan las actividades de rastreo
  • Si el sitio web declara información de derechos de autor y si el contenido está protegido por derechos de autor
  • Si las páginas contienen datos personales sensibles (por ejemplo, correos electrónicos, números de teléfono, números de identificación)

Importancia del Riesgo

Violar los términos puede llevar a incumplimiento de contrato, infracción o responsabilidad penal; extraer datos sensibles puede violar regulaciones de privacidad como GDPR, CCPA, etc.

Ejemplos de Detección

  • Detectar etiquetas <meta> y palabras clave clave en el contenido de la página
  • Coincidencia de expresiones regulares para correos electrónicos y números de teléfono

2. Riesgo Social/Ético

Contenido de Detección

  • Si robots.txt desautoriza el acceso del rastreador a rutas específicas
  • Tecnologías anti-rastreo implementadas por el sitio (por ejemplo, Cloudflare JS Challenge)
  • Riesgos de recopilar información privada o sensible de usuarios

Importancia del Riesgo

El rastreo excesivo puede dañar la experiencia del usuario y la confianza; recopilar datos privados conlleva riesgos éticos y responsabilidades sociales.

Ejemplos de Detección

  • Acceder y analizar robots.txt
  • Detectar mecanismos anti-rastreo y desafíos JS
  • Advertencias de extracción de información sensible

3. Riesgo Técnico

Contenido de Detección

  • Si se encuentran redirecciones, CAPTCHAs u obstáculos de renderizado JS durante el acceso
  • Si robots.txt se puede acceder con éxito para obtener reglas de rastreo
  • Exposición de rutas API objetivo, posibles restricciones de permisos o límites de velocidad

Importancia del Riesgo

Los riesgos técnicos pueden causar fallos del rastreador, bloqueos de IP o datos incompletos, afectando la estabilidad del negocio.

Ejemplos de Detección

  • Análisis de códigos de estado HTTP y encabezados de respuesta
  • Detección de tecnologías anti-rastreo
  • Escaneo de rutas API

Sistema de Clasificación

  • allowed: Sin restricciones o riesgos obvios, generalmente seguro para rastrear
  • partial: Algunas restricciones (por ejemplo, robots.txt desautoriza algunas rutas, medidas anti-rastreo), requiere operación cautelosa
  • blocked: Restricciones severas o alto riesgo (por ejemplo, desafíos anti-rastreo JS intensos, protección de datos sensibles), no se recomienda el rastreo

Recomendaciones

Dimensión de RiesgoRecomendaciones Resumidas
Riesgo LegalLea y cumpla cuidadosamente los Términos de Servicio del sitio objetivo; evite extraer datos sensibles o personales; consulte asesoría legal si es necesario.
Riesgo Social/ÉticoControle la frecuencia de rastreo; evite afectar el rendimiento del servidor y la experiencia del usuario; sea transparente sobre las fuentes de datos y su uso.
Riesgo TécnicoUtilice marcos y estrategias de rastreo apropiados; soporte renderizado dinámico y evasión anti-rastreo; maneje excepciones y monitoree la salud del acceso en tiempo real.

Proceso de Implementación

  1. Evaluación Previa al Rastreo
    Ejecute la evaluación de cumplimiento en el sitio objetivo para confirmar los niveles de riesgo y las restricciones.

  2. Formulación de Estrategia de Cumplimiento
    Ajuste la frecuencia de acceso del rastreador y el alcance del contenido según los resultados de la evaluación para evitar infracciones o violaciones.

  3. Ejecución y Monitoreo del Rastreador
    Monitoree continuamente las excepciones técnicas y los cambios de riesgo durante el rastreo; reevalúe periódicamente.

  4. Procesamiento y Protección de Datos
    Asegúrese de que los datos extraídos cumplan con los requisitos de protección de privacidad y realice la anonimización necesaria.


Resumen de Implementación Técnica

  • Use Axios + node-fetch para solicitudes HTTP, con soporte de tiempo de espera y control de redirecciones.
  • Analice etiquetas robots.txt y meta de la página para identificar automáticamente reglas de rastreo.
  • Use expresiones regulares para detectar información sensible de privacidad (correos electrónicos, teléfonos, números de identificación, etc.).
  • Detecte tecnologías anti-rastreo (por ejemplo, Cloudflare JS Challenge) y endpoints API expuestos.
  • Proporcione advertencias de riesgo legal, social y técnico y sugerencias integrales mediante funciones de evaluación de riesgos.

Extensiones Futuras

  • Integre Puppeteer/Playwright para la detección de páginas renderizadas con JavaScript.
  • Analice y notifique automáticamente las actualizaciones de texto de los Términos de Servicio.
  • Agregue módulos de detección dedicados para GDPR, CCPA y otras leyes regionales.
  • Combine modelos de aprendizaje automático para mejorar la precisión del reconocimiento de datos sensibles de privacidad.
  • Proporcione una interfaz web para mostrar informes de cumplimiento y sugerencias de riesgo.

Resumen

Este marco de evaluación de riesgos de cumplimiento proporciona una evaluación de riesgos fundamental e integral para el desarrollo y operación de rastreadores. Ayuda a los equipos a cumplir con leyes, regulaciones y principios éticos, al tiempo que mejora la eficiencia técnica y la calidad de los datos y reduce los riesgos legales y sociales potenciales.

✅ 1. Verificaciones Técnicas

Elemento de VerificaciónDescripciónRecomendación
Existencia de robots.txtAcceder a https://example.com/robots.txtSi existe, analizar y seguir estrictamente las reglas
Rutas de rastreo permitidas en robots.txtVerificar reglas para el User-Agent especificado (por ejemplo, Disallow, Allow)Configurar un User-Agent adecuado para la coincidencia
Etiqueta Meta robotsSi <meta name="robots" content="noindex, nofollow"> existe en la páginaSi está presente, evitar rastrear/indexar el contenido de la página
Encabezado de respuesta X-Robots-TagSi los encabezados de respuesta HTTP contienen X-Robots-Tag (por ejemplo, noindex)Seguir las directivas respectivas
Contenido renderizado dinámicamenteSi la página depende de la carga JS (React/Vue, etc.)Puede requerir un navegador sin interfaz (por ejemplo, Puppeteer)
Límite de velocidad de IP / WAFSi existen límites de frecuencia de acceso, bloqueos de IP, CAPTCHAsImplementar límite de velocidad, reintentos, grupos de proxies
Detección de mecanismos anti-rastreoVerificar validación de tokens, verificaciones de Referer, ofuscación JSUsar herramientas de análisis de red para investigar
Soporte de APISi los datos de la página también se proporcionan a través de una API públicaPreferir API para mayor eficiencia si está disponible

2. Verificaciones Legales y Éticas

Elemento de VerificaciónDescripciónRecomendación
Existencia de Términos de ServicioVerificar si los ToS prohíben el rastreo automatizadoSi está explícitamente prohibido, no rastrear
Declaración de derechos de autor del sitioSi el contenido tiene derechos de autor declarados en el pie de páginaEvitar extraer datos con derechos de autor para uso comercial
Política de datos públicos/datos abiertosAlgunos sitios ofrecen datos abiertos o licenciasCumplir con licencias o acuerdos de código abierto
Litigios previos debido al rastreoAlgunos sitios (por ejemplo, LinkedIn, Facebook) tienen posturas estrictas contra el rastreoSi existen casos previos, mayor riesgo — evitar el rastreo

3. Protección de Datos y Privacidad

Elemento de VerificaciónDescripciónRecomendación
Presencia de contenido generado por el usuarioComentarios, avatares, teléfono, correo electrónico, ubicación, etc.Extraer estos datos puede violar leyes de privacidad
Existencia de Política de PrivacidadVerificar los límites y restricciones de uso de datosSeguir los términos de procesamiento de datos establecidos en la política
Participación de usuarios de la UE o CASujeto a regulaciones GDPR o CCPANo almacenar ni analizar datos personales sin consentimiento
Información de identificación personal extraídaNúmeros de teléfono, IDs, correos electrónicos, direcciones IPFiltrar o anonimizar a menos que sea necesario
Datos de dominios sensiblesMédicos, financieros, menores, etc.Requiere cumplimiento estricto, se recomienda evitar o anonimizar

4. Sugerencias Operativas Prácticas (Estrategias Amigables con el Cumplimiento)

Elemento de VerificaciónDescripciónRecomendación
Configurar un User-Agent razonableIndicar claramente el origen de la herramienta, por ejemplo, MyCrawlerBot/1.0 (+email@example.com)Aumentar credibilidad y facilitar la identificación del sitio
Configurar límites de frecuencia de accesoEvitar solicitudes demasiado frecuentes (por ejemplo, 1-2 solicitudes/segundo)Reducir la carga del servidor, evitar ser bloqueado
Agregar encabezados Referer y AcceptSimular el comportamiento normal del navegadorPrevenir el bloqueo anti-rastreo
Soporte de mecanismo de reintento ante fallosManejar errores 503, 429, caídas de conexiónMejorar la robustez
Registro y control del horario de rastreoGuardar registros de rastreo y programar el rastreo durante horas de baja actividadCoordinar con las ventanas de mantenimiento del sitio
Indicar la fuente de datos en las salidasCuando se use para visualización o investigación, citar la fuente de datosEvitar disputas de derechos de autor
Anonimización del almacenamiento de datosEspecialmente para datos personalesEvitar violaciones de leyes de privacidad

🧠 Resumen en una frase:

No robots.txt ≠ permiso para rastrear libremente; la rastreabilidad técnica ≠ permiso legal; respete los datos, los sitios web y los usuarios — esa es la base del rastreo conforme.

🚩Características

Evaluación de Riesgos de Cumplimiento para Rastreadores de Sitios Web Basada en MCP – Características Principales:


1. Acceso al Sitio Web Objetivo y Verificación de Estado Básico ✅ Completado

  • Acceder a la página de inicio del sitio web objetivo con tiempo de espera y soporte de hasta 5 redirecciones
  • Devolver el código de estado HTTP para determinar la accesibilidad del sitio
  • Detectar redirecciones y advertir sobre riesgos potenciales

2. Detección de Mecanismos Anti-Rastreo ✅ Completado

  • Detectar si el servidor usa Cloudflare o protección anti-rastreo similar
  • Detectar la presencia de desafíos de verificación JavaScript (por ejemplo, Cloudflare JS Challenge)
  • Analizar etiquetas <meta name="robots"> de la página y el encabezado de respuesta HTTP X-Robots-Tag
  • Solicitar y analizar automáticamente robots.txt, extrayendo rutas permitidas y desautorizadas

3. Detección de Contenido Sensible y Advertencia de Riesgo Legal ✅ Completado

  • Detectar avisos de derechos de autor e información relacionada con los Términos de Servicio en las páginas
  • Coincidencia de expresiones regulares para identificar posible información privada personal (correo electrónico, teléfono, ID)
  • Proporcionar advertencias de cumplimiento legal para prevenir infracciones y fugas de privacidad

4. Detección de Endpoints de API Pública ✅ Completado

  • Acceder a rutas API comunes (por ejemplo, /api/, /v1/, /rest/)
  • Determinar si las API están abiertas y si se requiere autenticación; advertir sobre riesgos potenciales de permisos y límites de velocidad

5. Evaluación Integral de Riesgos y Clasificación ✅ Completado

- Proporcionar una calificación de permisibilidad de rastreo de tres niveles basada en todos los resultados de detección:

  • allowed: sin restricciones ni riesgos evidentes
  • partial: algunas restricciones técnicas o de cumplimiento
  • blocked: anti-rastreo evidente o alto riesgo

6. Funciones Planificadas 🚧 Pendientes

⚙️Instalación

git clone https://github.com/Joooook/mcp-crew-risk.git
npm i

▶️Inicio Rápido

CLI

npx -y mcp-crew-risk

Configuración del Servidor MCP

{
    "mcpServers": {
        "mcp-crew-risk": {
            "command": "npx",
            "args": [
                "-y",
                "mcp-crew-risk"
            ]
        }
    }
}

💭Murmullos

Este proyecto es solo con fines educativos. Las contribuciones y solicitudes de funciones son bienvenidas.

Contacto

mcp-crew-risk MCP server

Correo de Colaboración Empresarial: deeppathai@outlook.com

🧠 Enlaces de Acceso MCP