PDF Agent MCP

Un servidor para que agentes de IA procesen y extraigan contenido de documentos PDF de forma selectiva.

Documentación

PDF Agent MCP

🌐 Visita la página de inicio para una descripción general y una descarga fácil

⚠️ Instrucciones de configuración importantes

Antes de usar esta extensión, DEBES configurar Claude Desktop correctamente:

Configuración requerida

  1. Instala Node.js LTS: Visita nodejs.org y descarga la versión LTS
  2. Configura Claude Desktop:
    • Ve a Claude > Configuración > Extensiones > Configuración avanzada
    • Desactiva "Usar Node.js integrado para MCP"
    • Reinicia Claude Desktop

Esta extensión NO funcionará con el Node.js integrado de Claude. Debes usar la instalación de Node.js de tu sistema.

Solución de problemas

Si tienes problemas para cargar la extensión:

  1. Verifica que Node.js esté instalado: Ejecuta node --version en tu terminal
  2. Asegúrate de que "Usar Node.js integrado para MCP" esté desactivado en la configuración de Claude Desktop
  3. Reinicia Claude Desktop por completo
  4. Revisa los registros en ~/Library/Logs/Claude/mcp-server-PDF Agent MCP.log (macOS) o %LOCALAPPDATA%\Claude\Logs\mcp-server-PDF Agent MCP.log (Windows)

Un servidor de Model Context Protocol diseñado para la lectura agéntica y el procesamiento selectivo de PDFs. Permite que los sistemas de IA naveguen y extraigan contenido de PDFs de manera eficiente sin saturar las ventanas de contexto.

Características

  • Extracción de metadatos: Obtén las propiedades del PDF, el número de páginas e información del archivo
  • Extracción de texto: Extracción de texto nativa con procesamiento híbrido para mejores resultados
  • Conversión de imágenes: Convierte páginas de PDF en imágenes optimizadas para análisis visual
  • Búsqueda de contenido: Búsqueda de patrones/regex con fragmentos de contexto
  • Tabla de contenido: Extrae marcadores y el esquema del documento
  • Soporte de rutas flexible: Usa rutas absolutas o relativas desde ~/pdf-agent/

Guía de uso

PDF Agent MCP resuelve el problema común del desbordamiento de la ventana de contexto al trabajar con PDFs en herramientas de IA.

Importante: No arrastres PDFs al chat — esto cargará todo el contenido del PDF de forma tradicional y omitirá el procesamiento inteligente. En su lugar, proporciona rutas de archivo o URLs para activar las herramientas de PDF Agent para un procesamiento selectivo.

Cómo usar

Para PDFs locales:

  • Proporciona la ruta absoluta del archivo a tu PDF
  • Consejo rápido: haz clic derecho en tu PDF → "Abrir con Chrome" → copia la URL de la barra de direcciones para obtener la ruta absoluta

Para PDFs en línea:

  • Simplemente proporciona la URL del PDF — el agente lo descargará y lo procesará localmente

Beneficios clave

  • Lectura selectiva: La IA examina primero los metadatos y el esquema, luego abre solo las páginas relevantes
  • Eficiencia de tokens: Evita imágenes cuando es posible, y las usa solo cuando es necesario para el análisis visual
  • Escalable: Funciona con documentos grandes (libros de texto de más de 1000 páginas) y múltiples PDFs simultáneamente
  • Capacidad de búsqueda: Búsqueda integrada de patrones/regex en el contenido del PDF

Enfoque

Este MCP usa búsqueda agéntica con herramientas simples en lugar de alternativas complejas:

  • No requiere creación de embeddings, fragmentación ni almacenamiento vectorial
  • Sin complejidad de coordinación multiagente ni transferencias
  • Solo herramientas limpias y efectivas que los sistemas de IA modernos pueden usar de manera inteligente

Perfecto para investigadores, estudiantes y profesionales que trabajan con extensas bibliotecas de PDFs.

Prompt del asistente de IA para un uso óptimo

Copia este prompt en las instrucciones personalizadas o en el contexto de tu asistente de IA para obtener los mejores resultados:

When working with PDFs using the PDF Agent MCP tools, follow this strategic approach:

### 1. Query Analysis & PDF Identification
- **Think carefully** about the user's search query and information needs
- **Identify which PDF(s)** are most likely to contain the answer
- Consider the document type, domain, and likely structure based on the query

### 2. Exploratory Phase (Always Start Here)
- **Get metadata** first using `get_pdf_metadata` to understand document size, creation date, and properties
- **Extract table of contents** with `get_pdf_outline` to understand document structure and navigation
- **Analyze the outline** to identify which sections are most relevant to the query

### 3. Strategic Content Extraction
Based on the outline and metadata:
- **Use page ranges** (`"5:10"`, `"20:"`) to focus on specific sections rather than entire documents
- **Extract images** with `get_pdf_images` when visual content is critical (charts, diagrams, tables, equations)
- **Choose text extraction strategy**: `hybrid` (default) for most cases, `native` for clean PDFs, `ocr` for scanned documents

### 4. Advanced Search Strategies
- **Use multiple search queries** with different keywords and synonyms
- **Apply regex patterns** for flexible matching: `/budget|cost|expense/gi` instead of single terms
- **Combine searches**: Start broad, then narrow down with specific terms
- **Use context characters** (150+ chars) to understand search result context
- **Implement early stopping** with `max_results` for large documents

### 5. Iterative Refinement
- **Start with targeted searches** based on outline analysis
- **Follow up with broader searches** if initial queries don't yield results
- **Extract specific page ranges** identified through search results
- **Use visual analysis** (images) when text extraction seems incomplete or when layout matters

### 6. Performance Optimization
- **Avoid processing entire large PDFs** - always use page ranges when possible
- **Use search with early stopping** before extracting large sections
- **Prefer search over full text extraction** for finding specific information
- **Extract images selectively** only when visual analysis is needed

### 7. Multi-Document Workflows
- **Process documents in parallel** when comparing multiple PDFs
- **Use consistent search terms** across documents for comparison
- **Combine results strategically** rather than processing everything at once

### Key Principles:
- **Strategic before comprehensive**: Understand document structure before diving deep
- **Search before extract**: Use pattern matching to locate relevant content first  
- **Visual when necessary**: Extract images only when text extraction is insufficient
- **Iterative refinement**: Start targeted, expand scope as needed
- **Context preservation**: Always maintain enough context around search results

This approach maximizes efficiency, minimizes token usage, and provides more accurate, focused results than traditional "dump entire PDF" methods.

Instalación

Opción 1: Paquete DXT (Recomendado)

  1. Primero, asegúrate de haber completado la Configuración requerida anterior
  2. Descarga el archivo pdf-agent-mcp.dxt más reciente desde los lanzamientos
  3. Haz doble clic en el archivo .dxt para instalarlo en Claude Desktop

Opción 2: Instalación manual

  1. Primero, asegúrate de haber completado la Configuración requerida anterior
  2. Clona este repositorio
  3. Compila el proyecto: npm install && npm run build
  4. Encuentra tu archivo de configuración de Claude Desktop:
  • macOS: ~/Library/Application Support/Claude/claude_desktop_config.json
  • Windows: %APPDATA%\Claude\claude_desktop_config.json

Agrega lo siguiente:

{
  "mcpServers": {
    "pdf-agent": {
      "command": "node",
      "args": [
        "PATH_TO_REPO/server/index.js"
      ]
    }
  }
}

Reemplaza PATH_TO_REPO con la ruta real de tu repositorio clonado.

Desarrollo

# Install dependencies
npm install

# Build the project
npm run build

# Create DXT package
npm run build:dxt

# Pack the final .dxt file for distribution
dxt pack

Ver registros

Para depurar problemas, puedes ver los registros del servidor MCP:

# View logs (macOS)
open "$HOME/Library/Logs/Claude/mcp-server-PDF Agent MCP.log"

# Stream logs in real-time (macOS)
tail -f "$HOME/Library/Logs/Claude/mcp-server-PDF Agent MCP.log"

# Clear/delete logs (macOS)
rm "$HOME/Library/Logs/Claude/mcp-server-PDF Agent MCP.log"

# View logs (Windows)
notepad "%LOCALAPPDATA%\Claude\Logs\mcp-server-PDF Agent MCP.log"

# Clear/delete logs (Windows)
del "%LOCALAPPDATA%\Claude\Logs\mcp-server-PDF Agent MCP.log"

Licencia

MIT