consult7

Analiza grandes bases de código y colecciones de documentos utilizando modelos de alto contexto a través de OpenRouter, OpenAI o Google AI — muy útil, por ejemplo, con Claude Code

Documentación

Servidor MCP Consult7

Consult7 es un servidor de Protocolo de Contexto de Modelo (MCP) que permite a los agentes de IA consultar modelos de ventana de contexto amplia a través de OpenRouter para analizar colecciones extensas de archivos: bases de código completas, repositorios de documentos o contenido mixto que exceda los límites de contexto del agente actual.

¿Por qué Consult7?

Consult7 permite que cualquier agente compatible con MCP descargue el análisis de archivos a modelos de contexto amplio (hasta 2M de tokens). Útil cuando:

  • El contexto actual del agente está lleno
  • La tarea requiere capacidades especializadas del modelo
  • Se necesita analizar bases de código grandes en una sola consulta
  • Se quieren comparar resultados de diferentes modelos

"Para los usuarios de Claude Code, Consult7 es un cambio radical."

Cómo funciona

Consult7 recopila archivos de las rutas específicas que proporciones (con comodines opcionales en los nombres de archivo), los ensambla en un único contexto y los envía a un modelo de ventana de contexto amplia junto con tu consulta. El resultado se devuelve directamente al agente con el que estás trabajando.

Ejemplos de casos de uso

Resumen rápido de una base de código

  • Archivos: ["/Users/john/project/src/*.py", "/Users/john/project/lib/*.py"]
  • Consulta: "Resume la arquitectura y los componentes principales de este proyecto Python"
  • Modelo: "google/gemini-3-flash-preview"
  • Modo: "fast"

Análisis profundo con razonamiento

  • Archivos: ["/Users/john/webapp/src/*.py", "/Users/john/webapp/auth/*.py", "/Users/john/webapp/api/*.js"]
  • Consulta: "Analiza el flujo de autenticación en esta base de código. Piensa paso a paso sobre las vulnerabilidades de seguridad y sugiere mejoras"
  • Modelo: "anthropic/claude-opus-4.8"
  • Modo: "think"

Generar un informe guardado en un archivo

  • Archivos: ["/Users/john/project/src/*.py", "/Users/john/project/tests/*.py"]
  • Consulta: "Genera un informe exhaustivo de revisión de código con análisis de arquitectura, evaluación de calidad del código y recomendaciones de mejora"
  • Modelo: "google/gemini-2.5-pro"
  • Modo: "think"
  • Archivo de salida: "/Users/john/reports/code_review.md"
  • Resultado: Devuelve "Result has been saved to /Users/john/reports/code_review.md" en lugar de saturar el contexto del agente

Destacado: Modelos Gemini 3.1

Consult7 es compatible con la familia Google Gemini 3.1:

  • Gemini 3.1 Pro (google/gemini-3.1-pro-preview) - Modelo de razonamiento insignia, contexto de 1M
  • Gemini 3 Flash (google/gemini-3-flash-preview) - Modelo ultrarrápido, contexto de 1M
  • Gemini 3.1 Flash Lite (google/gemini-3.1-flash-lite-preview) - Modelo ligero ultrarrápido, contexto de 1M

Nemotecnias rápidas para usuarios avanzados:

  • gemt = Gemini 3.1 Pro + think (razonamiento insignia)
  • gemf = Gemini 3 Flash + fast (ultrarrápido)
  • gptt = GPT-5.6 Sol + think (último GPT)
  • grot = Grok 4.20 + think (razonamiento automático)
  • oput = Claude Opus 4.8 + think (pensamiento adaptativo)
  • fabt = Claude Fable 5 + think (razonamiento más profundo; premium — reservado para problemas difíciles)
  • ULTRA = Ejecuta GEMT, GPTT, GROT y OPUT en paralelo (4 modelos de frontera)
  • FUSE = Fusión: un panel de frontera delibera y un juez sintetiza, en una sola llamada

Estas nemotecnias facilitan la referencia a combinaciones de modelo+modo en tus consultas.

Nota sobre Fable 5. anthropic/claude-fable-5 es el modelo más capaz de Anthropic pero tiene un precio premium (~2× Opus 4.8). No reemplaza a Opus 4.8 como el modelo Claude predeterminado y no forma parte del panel ULTRA — úsalo deliberadamente, solo en problemas específicamente difíciles donde la profundidad adicional justifique el costo. A diferencia de Opus 4.8 (solo pensamiento adaptativo), OpenRouter respeta la escala de esfuerzo de Fable, por lo que mid/think se asignan a effort=high/effort=xhigh.

Destacado: Fusion (análisis multimodelo)

Consult7 es compatible con Fusion de OpenRouter (openrouter/fusion) — una sola llamada donde un panel de modelos de frontera (Opus, GPT, Gemini Pro) responde tu consulta en paralelo y un modelo juez sintetiza sus respuestas en una sola. Úsalo en preguntas difíciles donde múltiples perspectivas ayuden y el costo de equivocarse supere unas pocas completaciones adicionales.

  • Contexto: 128K — más pequeño que los modelos individuales de 1M–2M, por lo que es mejor para preguntas difíciles con entrada moderada, no para paquetes de archivos gigantes.
  • Modo → profundidad de investigación: fast / mid / think asignan el presupuesto de búsqueda web/obtención del panel a max_tool_calls de 2 / 8 / 16.
  • Nemotecnia: FUSE = openrouter/fusion.

Las indicaciones triviales se responden directamente (sin panel); el panel se activa solo cuando la pregunta amerita deliberación. Fusion se factura por ejecución de panel, por lo que cuesta más que una llamada de modelo único.

Instalación

Claude Code

Simplemente ejecuta:

claude mcp add -s user consult7 uvx -- consult7 your-openrouter-api-key

Claude Desktop

Añade a tu archivo de configuración de Claude Desktop:

{
  "mcpServers": {
    "consult7": {
      "type": "stdio",
      "command": "uvx",
      "args": ["consult7", "your-openrouter-api-key"]
    }
  }
}

Reemplaza your-openrouter-api-key con tu clave de API real de OpenRouter.

No se requiere instalación: uvx descarga y ejecuta automáticamente consult7 en un entorno aislado.

Opciones de línea de comandos

uvx consult7 <api-key> [--test]
  • <api-key>: Obligatorio. Tu clave de API de OpenRouter
  • --test: Opcional. Prueba la conexión con la API

El modelo y el modo se especifican al llamar a la herramienta, no al iniciar.

Modelos compatibles

Consult7 es compatible con los más de 500 modelos disponibles en OpenRouter. A continuación se muestran los modelos insignia con límites de tamaño de archivo dinámicos optimizados:

ModeloContextoCaso de uso
openai/gpt-5.6-sol1MÚltimo GPT de primer nivel, razonamiento basado en esfuerzo
google/gemini-3.1-pro-preview1MModelo de razonamiento insignia
google/gemini-3-flash-preview1MGemini 3 Flash, ultrarrápido
google/gemini-3.1-flash-lite-preview1MModelo ligero ultrarrápido
anthropic/claude-fable-51MEl más capaz; precio premium — reservado para problemas difíciles
anthropic/claude-opus-4.81MMejor calidad, pensamiento adaptativo
anthropic/claude-sonnet-4.61MExcelente razonamiento, rápido
anthropic/claude-haiku-4.5200kEconómico, muy rápido
x-ai/grok-4.202MRazonamiento automático, contexto enorme
x-ai/grok-4.1-fast2MVentana de contexto más grande
openrouter/fusion128kPanel multimodelo + juez (ver Destacado: Fusion)

Nemotecnias rápidas:

  • gptt = openai/gpt-5.6-sol + think (último GPT, razonamiento profundo)
  • gemt = google/gemini-3.1-pro-preview + think (Gemini 3.1 Pro, razonamiento insignia)
  • grot = x-ai/grok-4.20 + think (Grok 4.20, razonamiento automático)
  • oput = anthropic/claude-opus-4.8 + think (Claude Opus, pensamiento adaptativo)
  • opuf = anthropic/claude-opus-4.8 + fast (Claude Opus, sin razonamiento)
  • fabt = anthropic/claude-fable-5 + think (Claude Fable, razonamiento más profundo [esfuerzo xhigh]; premium, solo problemas difíciles)
  • fabm = anthropic/claude-fable-5 + mid (Claude Fable, razonamiento de alto esfuerzo; premium)
  • gemf = google/gemini-3-flash-preview + fast (Gemini 3 Flash, ultrarrápido)
  • ULTRA = llama a GEMT, GPTT, GROT y OPUT EN PARALELO (4 modelos de frontera para máxima información; Fable está deliberadamente fuera del panel)
  • FUSE = openrouter/fusion (una llamada: un panel de frontera delibera, un juez sintetiza; el modo establece la profundidad de investigación web)

Puedes usar cualquier ID de modelo de OpenRouter (p. ej., deepseek/deepseek-r1-0528). Consulta la lista completa de modelos. Los límites de tamaño de archivo se calculan automáticamente según la ventana de contexto de cada modelo.

Modos de rendimiento

  • fast: Sin razonamiento: respuestas rápidas, tareas simples
  • mid: Razonamiento moderado: revisiones de código, análisis de errores
  • think: Razonamiento máximo: auditorías de seguridad, refactorización compleja

Reglas de especificación de archivos

  • Solo rutas absolutas: /Users/john/project/src/*.py
  • Comodines solo en nombres de archivo: /Users/john/project/*.py (no en rutas de directorio)
  • Extensión obligatoria con comodines: *.py no *
  • Mezcla archivos y patrones: ["/path/src/*.py", "/path/README.md", "/path/tests/*_test.py"]

Patrones comunes:

  • Todos los archivos Python: /path/to/dir/*.py
  • Archivos de prueba: /path/to/tests/*_test.py o /path/to/tests/test_*.py
  • Múltiples extensiones: ["/path/*.js", "/path/*.ts"]

Ignorados automáticamente: __pycache__, .env, secrets.py, .DS_Store, .git, node_modules

Límites de tamaño: Dinámicos según la ventana de contexto del modelo (p. ej., Grok 4.20: ~8MB, GPT-5.6 Sol: ~4MB)

Parámetros de la herramienta

La herramienta de consulta acepta los siguientes parámetros:

  • files (obligatorio): Lista de rutas de archivo absolutas o patrones con comodines solo en nombres de archivo
  • query (obligatorio): Tu pregunta o instrucción para que el LLM procese los archivos
  • model (obligatorio): El modelo LLM a usar (ver Modelos compatibles arriba)
  • mode (obligatorio): Modo de rendimiento: fast, mid o think
  • output_file (opcional): Ruta absoluta para guardar la respuesta en un archivo en lugar de devolverla
    • Si el archivo existe, se guardará con el sufijo _updated (p. ej., report.mdreport_updated.md)
    • Cuando se especifica, devuelve solo: "Result has been saved to /path/to/file"
    • Útil para generar informes, documentación o análisis sin saturar el contexto del agente
  • zdr (opcional): Habilita el enrutamiento de Retención Cero de Datos (predeterminado: false)
    • Cuando es true, enruta solo a endpoints con política ZDR (el proveedor no retiene las indicaciones)
    • ZDR disponible: Gemini 3.1 Pro/Flash, Claude Opus 4.8, GPT-5, GPT-5.5
    • No disponible: GPT-5.6 Sol, Grok 4.20, Claude Fable 5 (devuelve error)

Ejemplos de uso

Mediante MCP en Claude Code

Claude Code usará automáticamente la herramienta con los parámetros adecuados:

{
  "files": ["/Users/john/project/src/*.py"],
  "query": "Explain the main architecture",
  "model": "google/gemini-3-flash-preview",
  "mode": "fast"
}

Mediante la API de Python

from consult7.consultation import consultation_impl

result = await consultation_impl(
    files=["/path/to/file.py"],
    query="Explain this code",
    model="google/gemini-3-flash-preview",
    mode="fast",  # fast, mid, or think
    provider="openrouter",
    api_key="sk-or-v1-..."
)

Pruebas

# Test OpenRouter connection
uvx consult7 sk-or-v1-your-api-key --test

Desinstalación

Para eliminar consult7 de Claude Code:

claude mcp remove consult7 -s user

Historial de versiones

v3.9.0

  • Nuevo GPT predeterminado: GPT-5.6 Sol (openai/gpt-5.6-sol) — el último GPT de primer nivel, ~1M de contexto / 128K de salida, razonamiento basado en esfuerzo (mideffort=medium, thinkeffort=high). Reemplaza a GPT-5.5 como predeterminado de gptt; GPT-5.5 sigue disponible como modelo heredado. ZDR no es compatible con GPT-5.6 Sol (GPT-5.5 sí lo es).
  • Grok 4.5 no añadido: x-ai/grok-4.5 está restringido por región en OpenRouter (devuelve un 403 "no disponible en tu región") y no pudo verificarse contra la API real, por lo que no se integró. Grok 4.20 sigue siendo el predeterminado de grot.

v3.8.0

  • Añadido Claude Fable 5 (anthropic/claude-fable-5) — el modelo más capaz de Anthropic, contexto de 1M. Precio premium (~2× Opus 4.8), por lo que está reservado para problemas específicamente difíciles y no forma parte del panel ULTRA; no reemplaza a Opus 4.8 como modelo Claude predeterminado. Nuevas nemotecnias fabt (think) / fabm (mid). A diferencia de Opus 4.8 (solo pensamiento adaptativo), OpenRouter respeta la escala de esfuerzo de Fable, por lo que mid/think se asignan a effort=high/effort=xhigh (max deliberadamente no expuesto — tiende a pensar de más a ~2× el costo de tokens). ZDR no compatible (Fable requiere retención de 30 días).
  • Indicación de longitud de respuesta ajustada: la indicación del sistema ahora pide al modelo que ajuste la longitud de la respuesta a la tarea (exhaustiva cuando la pregunta requiere profundidad, concisa en caso contrario) en lugar de un "sé conciso" contundente.

v3.7.1

  • Se muestran los errores de API a mitad de transmisión: cuando OpenRouter envía un error como fragmento de datos de streaming (después del 200 inicial), la llamada ahora devuelve ese mensaje de error en lugar de un engañoso "No se recibió contenido".

v3.7.0

  • Añadido Fusion (openrouter/fusion) — un panel multimodelo más un juez en una sola llamada; mode se asigna a la profundidad de investigación web (fast/mid/thinkmax_tool_calls 2/8/16). Nueva nemotecnia FUSE.
  • Actualizado Claude Opus 4.7 → 4.8 (contexto de 1M, pensamiento adaptativo); oput/opuf ahora apuntan a 4.8, y 4.7 se mantiene como ID heredado.
  • El pie de página de respuesta ahora informa el costo de la llamada en USD (según la contabilidad de uso de OpenRouter), p. ej., cost: $0.0923.

v3.6.1

  • El pie de página de alternancia de razonamiento ahora distingue mid frente a think para modelos adaptativos (Opus, Grok)
  • Mensaje de error más amigable cuando un modelo no tiene endpoint de Retención Cero de Datos
  • La devolución de output_file ahora incluye el pie de página de metadatos para que los llamadores puedan verificar qué se ejecutó

v3.6.0

  • Modelos actualizados: GPT-5.5, Claude Opus 4.7, Grok 4.20
  • Claude Opus 4.7 (contexto de 1M) usa pensamiento adaptativo — reasoning.enabled=true
  • Grok 4.20 (contexto de 2M) usa razonamiento automático — reasoning.enabled=true
  • Mnemónicos actualizados: gptt → GPT-5.5, oput/opuf → Claude Opus 4.7, grot → Grok 4.20
  • Los IDs de modelos heredados siguen siendo compatibles

v3.5.0

  • GPT-5.2 actualizado → GPT-5.4 (~contexto de 1M)

v3.4.0

  • Modelos actualizados: Gemini 3.1 Pro, Claude Opus 4.6, Claude Sonnet 4.6, Grok 4.1 Fast
  • Nuevos modelos añadidos: Claude Haiku 4.5, Gemini 3.1 Flash Lite
  • Mnemónicos actualizados: gemt → Gemini 3.1 Pro, oput/opuf → Claude Opus 4.6
  • Los IDs de modelos heredados siguen siendo compatibles

v3.3.0

  • Corregido el problema de truncamiento del modo de pensamiento de GPT-5.2 (cambiado a streaming)
  • Añadido google/gemini-3-flash-preview (Gemini 3 Flash, ultra rápido)
  • Actualizado el mnemónico gemf para usar Gemini 3 Flash
  • Añadido el parámetro zdr para el enrutamiento de retención de datos cero

v3.2.0

  • Actualizado a GPT-5.2 con razonamiento basado en esfuerzo

v3.1.0

  • Añadido google/gemini-3-pro-preview (contexto de 1M, modelo de razonamiento insignia)
  • Nuevos mnemónicos: gemt (Gemini 3 Pro), grot (Grok 4), ULTRA (ejecución paralela)

v3.0.0

  • Eliminados los proveedores directos de Google y OpenAI - ahora solo OpenRouter
  • Eliminado el sufijo |thinking - usa el parámetro mode en su lugar (ahora obligatorio)
  • API de parámetro mode limpia: fast, mid, think
  • CLI simplificada de consult7 <provider> <key> a consult7 <key>
  • Mejor integración con MCP mediante validación de enumeraciones para modos
  • Límites dinámicos de tamaño de archivo basados en la ventana de contexto del modelo

v2.1.0

  • Añadido el parámetro output_file para guardar respuestas en archivos

v2.0.0

  • Nueva interfaz de lista de archivos con validación simplificada
  • Límites de tamaño de archivo reducidos a valores realistas

Licencia

MIT