Crew Risk
Un sistema de evaluación de riesgos de cumplimiento para rastreadores a través de una API simple.
Documentación
mcp-crew-risk
Un evaluador de riesgos para rastreadores basado en el Protocolo de Contexto del Modelo (MCP).
Este servidor proporciona una interfaz API simple que permite a los usuarios realizar una evaluación integral de riesgos de cumplimiento para rastreadores en una página web específica.
Descripción del Marco de Evaluación de Riesgos de Cumplimiento para Rastreadores
Este marco tiene como objetivo proporcionar a los desarrolladores y operadores de rastreadores un conjunto de herramientas automatizadas de detección de cumplimiento para evaluar la amabilidad hacia los rastreadores y los riesgos potenciales de los sitios web objetivo. Cubre tres dimensiones principales: legal, ética social y técnica. A través de advertencias de riesgo de múltiples niveles y recomendaciones específicas, ayuda a planificar estrategias de rastreo de manera razonable para evitar disputas legales e impactos sociales negativos, al tiempo que mejora la estabilidad técnica y la eficiencia.
Estructura del Marco
1. Riesgo Legal
Contenido de Detección
- Si existen Términos de Servicio explícitos que restrinjan las actividades de rastreo
- Si el sitio web declara información de derechos de autor y si el contenido está protegido por derechos de autor
- Si las páginas contienen datos personales sensibles (por ejemplo, correos electrónicos, números de teléfono, números de identificación)
Importancia del Riesgo
Violar los términos puede llevar a incumplimiento de contrato, infracción o responsabilidad penal; extraer datos sensibles puede violar regulaciones de privacidad como GDPR, CCPA, etc.
Ejemplos de Detección
- Detectar etiquetas
<meta>y palabras clave clave en el contenido de la página - Coincidencia de expresiones regulares para correos electrónicos y números de teléfono
2. Riesgo Social/Ético
Contenido de Detección
- Si robots.txt desautoriza el acceso del rastreador a rutas específicas
- Tecnologías anti-rastreo implementadas por el sitio (por ejemplo, Cloudflare JS Challenge)
- Riesgos de recopilar información privada o sensible de usuarios
Importancia del Riesgo
El rastreo excesivo puede dañar la experiencia del usuario y la confianza; recopilar datos privados conlleva riesgos éticos y responsabilidades sociales.
Ejemplos de Detección
- Acceder y analizar robots.txt
- Detectar mecanismos anti-rastreo y desafíos JS
- Advertencias de extracción de información sensible
3. Riesgo Técnico
Contenido de Detección
- Si se encuentran redirecciones, CAPTCHAs u obstáculos de renderizado JS durante el acceso
- Si robots.txt se puede acceder con éxito para obtener reglas de rastreo
- Exposición de rutas API objetivo, posibles restricciones de permisos o límites de velocidad
Importancia del Riesgo
Los riesgos técnicos pueden causar fallos del rastreador, bloqueos de IP o datos incompletos, afectando la estabilidad del negocio.
Ejemplos de Detección
- Análisis de códigos de estado HTTP y encabezados de respuesta
- Detección de tecnologías anti-rastreo
- Escaneo de rutas API
Sistema de Clasificación
- allowed: Sin restricciones o riesgos obvios, generalmente seguro para rastrear
- partial: Algunas restricciones (por ejemplo, robots.txt desautoriza algunas rutas, medidas anti-rastreo), requiere operación cautelosa
- blocked: Restricciones severas o alto riesgo (por ejemplo, desafíos anti-rastreo JS intensos, protección de datos sensibles), no se recomienda el rastreo
Recomendaciones
| Dimensión de Riesgo | Recomendaciones Resumidas |
|---|---|
| Riesgo Legal | Lea y cumpla cuidadosamente los Términos de Servicio del sitio objetivo; evite extraer datos sensibles o personales; consulte asesoría legal si es necesario. |
| Riesgo Social/Ético | Controle la frecuencia de rastreo; evite afectar el rendimiento del servidor y la experiencia del usuario; sea transparente sobre las fuentes de datos y su uso. |
| Riesgo Técnico | Utilice marcos y estrategias de rastreo apropiados; soporte renderizado dinámico y evasión anti-rastreo; maneje excepciones y monitoree la salud del acceso en tiempo real. |
Proceso de Implementación
-
Evaluación Previa al Rastreo
Ejecute la evaluación de cumplimiento en el sitio objetivo para confirmar los niveles de riesgo y las restricciones. -
Formulación de Estrategia de Cumplimiento
Ajuste la frecuencia de acceso del rastreador y el alcance del contenido según los resultados de la evaluación para evitar infracciones o violaciones. -
Ejecución y Monitoreo del Rastreador
Monitoree continuamente las excepciones técnicas y los cambios de riesgo durante el rastreo; reevalúe periódicamente. -
Procesamiento y Protección de Datos
Asegúrese de que los datos extraídos cumplan con los requisitos de protección de privacidad y realice la anonimización necesaria.
Resumen de Implementación Técnica
- Use Axios + node-fetch para solicitudes HTTP, con soporte de tiempo de espera y control de redirecciones.
- Analice etiquetas
robots.txtymetade la página para identificar automáticamente reglas de rastreo. - Use expresiones regulares para detectar información sensible de privacidad (correos electrónicos, teléfonos, números de identificación, etc.).
- Detecte tecnologías anti-rastreo (por ejemplo, Cloudflare JS Challenge) y endpoints API expuestos.
- Proporcione advertencias de riesgo legal, social y técnico y sugerencias integrales mediante funciones de evaluación de riesgos.
Extensiones Futuras
- Integre Puppeteer/Playwright para la detección de páginas renderizadas con JavaScript.
- Analice y notifique automáticamente las actualizaciones de texto de los Términos de Servicio.
- Agregue módulos de detección dedicados para GDPR, CCPA y otras leyes regionales.
- Combine modelos de aprendizaje automático para mejorar la precisión del reconocimiento de datos sensibles de privacidad.
- Proporcione una interfaz web para mostrar informes de cumplimiento y sugerencias de riesgo.
Resumen
Este marco de evaluación de riesgos de cumplimiento proporciona una evaluación de riesgos fundamental e integral para el desarrollo y operación de rastreadores. Ayuda a los equipos a cumplir con leyes, regulaciones y principios éticos, al tiempo que mejora la eficiencia técnica y la calidad de los datos y reduce los riesgos legales y sociales potenciales.
✅ 1. Verificaciones Técnicas
| Elemento de Verificación | Descripción | Recomendación |
|---|---|---|
Existencia de robots.txt | Acceder a https://example.com/robots.txt | Si existe, analizar y seguir estrictamente las reglas |
| Rutas de rastreo permitidas en robots.txt | Verificar reglas para el User-Agent especificado (por ejemplo, Disallow, Allow) | Configurar un User-Agent adecuado para la coincidencia |
| Etiqueta Meta robots | Si <meta name="robots" content="noindex, nofollow"> existe en la página | Si está presente, evitar rastrear/indexar el contenido de la página |
| Encabezado de respuesta X-Robots-Tag | Si los encabezados de respuesta HTTP contienen X-Robots-Tag (por ejemplo, noindex) | Seguir las directivas respectivas |
| Contenido renderizado dinámicamente | Si la página depende de la carga JS (React/Vue, etc.) | Puede requerir un navegador sin interfaz (por ejemplo, Puppeteer) |
| Límite de velocidad de IP / WAF | Si existen límites de frecuencia de acceso, bloqueos de IP, CAPTCHAs | Implementar límite de velocidad, reintentos, grupos de proxies |
| Detección de mecanismos anti-rastreo | Verificar validación de tokens, verificaciones de Referer, ofuscación JS | Usar herramientas de análisis de red para investigar |
| Soporte de API | Si los datos de la página también se proporcionan a través de una API pública | Preferir API para mayor eficiencia si está disponible |
2. Verificaciones Legales y Éticas
| Elemento de Verificación | Descripción | Recomendación |
|---|---|---|
| Existencia de Términos de Servicio | Verificar si los ToS prohíben el rastreo automatizado | Si está explícitamente prohibido, no rastrear |
| Declaración de derechos de autor del sitio | Si el contenido tiene derechos de autor declarados en el pie de página | Evitar extraer datos con derechos de autor para uso comercial |
| Política de datos públicos/datos abiertos | Algunos sitios ofrecen datos abiertos o licencias | Cumplir con licencias o acuerdos de código abierto |
| Litigios previos debido al rastreo | Algunos sitios (por ejemplo, LinkedIn, Facebook) tienen posturas estrictas contra el rastreo | Si existen casos previos, mayor riesgo — evitar el rastreo |
3. Protección de Datos y Privacidad
| Elemento de Verificación | Descripción | Recomendación |
|---|---|---|
| Presencia de contenido generado por el usuario | Comentarios, avatares, teléfono, correo electrónico, ubicación, etc. | Extraer estos datos puede violar leyes de privacidad |
| Existencia de Política de Privacidad | Verificar los límites y restricciones de uso de datos | Seguir los términos de procesamiento de datos establecidos en la política |
| Participación de usuarios de la UE o CA | Sujeto a regulaciones GDPR o CCPA | No almacenar ni analizar datos personales sin consentimiento |
| Información de identificación personal extraída | Números de teléfono, IDs, correos electrónicos, direcciones IP | Filtrar o anonimizar a menos que sea necesario |
| Datos de dominios sensibles | Médicos, financieros, menores, etc. | Requiere cumplimiento estricto, se recomienda evitar o anonimizar |
4. Sugerencias Operativas Prácticas (Estrategias Amigables con el Cumplimiento)
| Elemento de Verificación | Descripción | Recomendación |
|---|---|---|
Configurar un User-Agent razonable | Indicar claramente el origen de la herramienta, por ejemplo, MyCrawlerBot/1.0 (+email@example.com) | Aumentar credibilidad y facilitar la identificación del sitio |
| Configurar límites de frecuencia de acceso | Evitar solicitudes demasiado frecuentes (por ejemplo, 1-2 solicitudes/segundo) | Reducir la carga del servidor, evitar ser bloqueado |
Agregar encabezados Referer y Accept | Simular el comportamiento normal del navegador | Prevenir el bloqueo anti-rastreo |
| Soporte de mecanismo de reintento ante fallos | Manejar errores 503, 429, caídas de conexión | Mejorar la robustez |
| Registro y control del horario de rastreo | Guardar registros de rastreo y programar el rastreo durante horas de baja actividad | Coordinar con las ventanas de mantenimiento del sitio |
| Indicar la fuente de datos en las salidas | Cuando se use para visualización o investigación, citar la fuente de datos | Evitar disputas de derechos de autor |
| Anonimización del almacenamiento de datos | Especialmente para datos personales | Evitar violaciones de leyes de privacidad |
🧠 Resumen en una frase:
No robots.txt ≠ permiso para rastrear libremente; la rastreabilidad técnica ≠ permiso legal; respete los datos, los sitios web y los usuarios — esa es la base del rastreo conforme.
🚩Características
Evaluación de Riesgos de Cumplimiento para Rastreadores de Sitios Web Basada en MCP – Características Principales:
1. Acceso al Sitio Web Objetivo y Verificación de Estado Básico ✅ Completado
- Acceder a la página de inicio del sitio web objetivo con tiempo de espera y soporte de hasta 5 redirecciones
- Devolver el código de estado HTTP para determinar la accesibilidad del sitio
- Detectar redirecciones y advertir sobre riesgos potenciales
2. Detección de Mecanismos Anti-Rastreo ✅ Completado
- Detectar si el servidor usa Cloudflare o protección anti-rastreo similar
- Detectar la presencia de desafíos de verificación JavaScript (por ejemplo, Cloudflare JS Challenge)
- Analizar etiquetas
<meta name="robots">de la página y el encabezado de respuesta HTTPX-Robots-Tag - Solicitar y analizar automáticamente
robots.txt, extrayendo rutas permitidas y desautorizadas
3. Detección de Contenido Sensible y Advertencia de Riesgo Legal ✅ Completado
- Detectar avisos de derechos de autor e información relacionada con los Términos de Servicio en las páginas
- Coincidencia de expresiones regulares para identificar posible información privada personal (correo electrónico, teléfono, ID)
- Proporcionar advertencias de cumplimiento legal para prevenir infracciones y fugas de privacidad
4. Detección de Endpoints de API Pública ✅ Completado
- Acceder a rutas API comunes (por ejemplo,
/api/,/v1/,/rest/) - Determinar si las API están abiertas y si se requiere autenticación; advertir sobre riesgos potenciales de permisos y límites de velocidad
5. Evaluación Integral de Riesgos y Clasificación ✅ Completado
- Proporcionar una calificación de permisibilidad de rastreo de tres niveles basada en todos los resultados de detección:
allowed: sin restricciones ni riesgos evidentespartial: algunas restricciones técnicas o de cumplimientoblocked: anti-rastreo evidente o alto riesgo
6. Funciones Planificadas 🚧 Pendientes
⚙️Instalación
git clone https://github.com/Joooook/mcp-crew-risk.git
npm i
▶️Inicio Rápido
CLI
npx -y mcp-crew-risk
Configuración del Servidor MCP
{
"mcpServers": {
"mcp-crew-risk": {
"command": "npx",
"args": [
"-y",
"mcp-crew-risk"
]
}
}
}
💭Murmullos
Este proyecto es solo con fines educativos. Las contribuciones y solicitudes de funciones son bienvenidas.
Contacto
Correo de Colaboración Empresarial: deeppathai@outlook.com
🧠 Enlaces de Acceso MCP
-
🌐 Dirección MCP de ModelScope
Para probar e integrar el serviciomcp-crew-risken la plataforma ModelScope. -
🛠️ Dirección MCP de Smithery.ai
Para configurar e invocar visualmente el serviciomcp-crew-riska través de la plataforma Smithery.