consult7
Analiza grandes bases de código y colecciones de documentos utilizando modelos de alto contexto a través de OpenRouter, OpenAI o Google AI — muy útil, por ejemplo, con Claude Code
Documentación
Servidor MCP Consult7
Consult7 es un servidor de Protocolo de Contexto de Modelo (MCP) que permite a los agentes de IA consultar modelos de ventana de contexto amplia a través de OpenRouter para analizar colecciones extensas de archivos: bases de código completas, repositorios de documentos o contenido mixto que excede los límites de contexto del agente actual.
¿Por qué Consult7?
Consult7 permite que cualquier agente compatible con MCP delegue el análisis de archivos a modelos de contexto amplio (hasta 2M de tokens). Útil cuando:
- El contexto actual del agente está lleno
- La tarea requiere capacidades especializadas del modelo
- Se necesita analizar bases de código grandes en una sola consulta
- Se desea comparar resultados de diferentes modelos
"Para los usuarios de Claude Code, Consult7 es un cambio de juego."
Cómo funciona
Consult7 recopila archivos de las rutas específicas que proporciones (con comodines opcionales en los nombres de archivo), los ensambla en un solo contexto y los envía a un modelo de ventana de contexto amplia junto con tu consulta. El resultado se devuelve directamente al agente con el que estás trabajando.
Ejemplos de casos de uso
Resumen rápido de base de código
- Archivos:
["/Users/john/project/src/*.py", "/Users/john/project/lib/*.py"] - Consulta: "Resume la arquitectura y los componentes principales de este proyecto Python"
- Modelo:
"google/gemini-3-flash-preview" - Modo:
"fast"
Análisis profundo con razonamiento
- Archivos:
["/Users/john/webapp/src/*.py", "/Users/john/webapp/auth/*.py", "/Users/john/webapp/api/*.js"] - Consulta: "Analiza el flujo de autenticación en esta base de código. Piensa paso a paso sobre las vulnerabilidades de seguridad y sugiere mejoras"
- Modelo:
"anthropic/claude-opus-4.8" - Modo:
"think"
Generar un informe guardado en archivo
- Archivos:
["/Users/john/project/src/*.py", "/Users/john/project/tests/*.py"] - Consulta: "Genera un informe completo de revisión de código con análisis de arquitectura, evaluación de calidad del código y recomendaciones de mejora"
- Modelo:
"google/gemini-3.1-pro-preview" - Modo:
"think" - Archivo de salida:
"/Users/john/reports/code_review.md" - Resultado: Devuelve
"Result has been saved to /Users/john/reports/code_review.md"más una línea de metadatos al pie, en lugar de inundar el contexto del agente
Destacado: Modelos Gemini 3.1
Consult7 soporta la familia Gemini 3.1 de Google:
- Gemini 3.1 Pro (
google/gemini-3.1-pro-preview) - Modelo de razonamiento insignia, contexto de 1M - Gemini 3 Flash (
google/gemini-3-flash-preview) - Modelo ultrarápido, contexto de 1M - Gemini 3.1 Flash Lite (
google/gemini-3.1-flash-lite-preview) - Modelo ligero ultrarápido, contexto de 1M
Nemotecnias rápidas para usuarios avanzados:
gemt= Gemini 3.1 Pro + think (razonamiento insignia)gemf= Gemini 3 Flash + fast (ultrarrápido)gptt= GPT-6 Astra + think (último GPT, esfuerzo xhigh)grot= Grok 4.7 + think (esfuerzo xhigh)oput= Claude Opus 4.8 + think (pensamiento adaptativo)fabt= Claude Fable 5.1 + think (razonamiento más profundo, esfuerzo xhigh; premium)ULTRA= Ejecutar GPTT, GROT y FABT en paralelo (3 modelos frontera)FUSE= Fusión: un panel frontera delibera y un juez sintetiza, en una sola llamada
Estas nemotecnias facilitan la referencia a combinaciones de modelo+modo en tus consultas.
Nota sobre Fable 5.1.
anthropic/claude-fable-5.1es el modelo más capaz de Anthropic pero tiene un precio premium (~2× Opus 4.8). No reemplaza a Opus 4.8 como la opción diaria de Claude para llamadas individuales. Desde v3.11.0 ocupa el asiento de Anthropic en el panelULTRA(que de todos modos está pensado para preguntas difíciles). A diferencia de Opus 4.8 (solo pensamiento adaptativo), OpenRouter respeta la escala de esfuerzo de Fable, por lo quemid/thinkse asignan aeffort=high/effort=xhigh.
Destacado: Fusión (análisis multimodelo)
Consult7 soporta Fusión de OpenRouter (openrouter/fusion) — una sola llamada donde un panel de modelos frontera (Opus, GPT, Gemini Pro) responde tu consulta en paralelo y un modelo juez sintetiza sus respuestas en una sola. Úsalo para preguntas difíciles donde múltiples perspectivas ayudan y el costo de equivocarse supera unas cuantas completaciones adicionales.
- Contexto: 128K — más pequeño que los modelos individuales de 1M–2M, por lo que es mejor para preguntas difíciles con entrada moderada, no para paquetes de archivos gigantes.
- Modo → profundidad de investigación:
fast/mid/thinkasignan el presupuesto de búsqueda web/obtención del panel amax_tool_callsde 2 / 8 / 16. - Nemotecnia:
FUSE=openrouter/fusion.
Las indicaciones triviales se responden directamente (sin panel); el panel se activa solo cuando la pregunta merece deliberación. La Fusión se factura por ejecución del panel, por lo que cuesta más que una llamada de modelo único.
Instalación
Claude Code
Simplemente ejecuta:
claude mcp add -s user consult7 uvx -- consult7 your-openrouter-api-key
Claude Desktop
Agrega a tu archivo de configuración de Claude Desktop:
{
"mcpServers": {
"consult7": {
"type": "stdio",
"command": "uvx",
"args": ["consult7", "your-openrouter-api-key"]
}
}
}
Reemplaza your-openrouter-api-key con tu clave real de API de OpenRouter.
No se requiere instalación: uvx descarga y ejecuta automáticamente consult7 en un entorno aislado.
Opciones de línea de comandos
uvx consult7 <api-key> [--test]
<api-key>: Obligatorio. Tu clave de API de OpenRouter--test: Opcional. Prueba la conexión de la API
El modelo y el modo se especifican al llamar a la herramienta, no al inicio.
Modelos soportados
Consult7 soporta los más de 500 modelos disponibles en OpenRouter. A continuación se muestran los modelos insignia con límites de tamaño de archivo dinámicos optimizados:
| Modelo | Contexto | Caso de uso |
|---|---|---|
openai/gpt-6-astra | 1M | Último GPT de primer nivel, razonamiento basado en esfuerzo; precio premium |
google/gemini-3.1-pro-preview | 1M | Modelo de razonamiento insignia |
google/gemini-3-flash-preview | 1M | Gemini 3 Flash, ultrarrápido |
google/gemini-3.1-flash-lite-preview | 1M | Modelo ligero ultrarrápido |
anthropic/claude-fable-5.1 | 1M | El más capaz; precio premium — reservado para problemas difíciles |
anthropic/claude-opus-4.8 | 1M | Mejor calidad, pensamiento adaptativo |
anthropic/claude-sonnet-4.6 | 1M | Excelente razonamiento, rápido |
anthropic/claude-haiku-4.5 | 200k | Económico, muy rápido |
x-ai/grok-4.7 | 500k | Grok frontera, razonamiento basado en esfuerzo |
x-ai/grok-4.20 | 2M | Razonamiento automático, contexto enorme |
x-ai/grok-4.1-fast | 2M | Ventana de contexto más grande |
openrouter/fusion | 128k | Panel multimodelo + juez (ver Destacado: Fusión) |
Los IDs superados aún funcionan con sus configuraciones ajustadas: openai/gpt-5.6-sol, x-ai/grok-4.6, anthropic/claude-fable-5.
Nemotecnias rápidas:
gptt=openai/gpt-6-astra+think(último GPT, razonamiento profundo [esfuerzo xhigh]; premium)gemt=google/gemini-3.1-pro-preview+think(Gemini 3.1 Pro, razonamiento insignia)grot=x-ai/grok-4.7+think(Grok 4.7, razonamiento profundo [esfuerzo xhigh]; contexto de 500K — usax-ai/grok-4.20para paquetes más grandes)oput=anthropic/claude-opus-4.8+think(Claude Opus, pensamiento adaptativo)opuf=anthropic/claude-opus-4.8+fast(Claude Opus, sin razonamiento)fabt=anthropic/claude-fable-5.1+think(Claude Fable, razonamiento más profundo [esfuerzo xhigh]; premium, solo problemas difíciles)fabm=anthropic/claude-fable-5.1+mid(Claude Fable, razonamiento de alto esfuerzo; premium)gemf=google/gemini-3-flash-preview+fast(Gemini 3 Flash, ultrarrápido)ULTRA= llamar a GPTT, GROT y FABT EN PARALELO (3 modelos frontera para máxima información)FUSE=openrouter/fusion(una llamada: un panel frontera delibera, un juez sintetiza; el modo establece la profundidad de investigación web)
Puedes usar cualquier ID de modelo de OpenRouter (por ejemplo, deepseek/deepseek-r1-0528). Consulta la lista completa de modelos. Los límites de tamaño de archivo se calculan automáticamente según la ventana de contexto de cada modelo.
Modos de rendimiento
fast: Sin razonamiento solicitado: respuestas rápidas, tareas simples. GPT-6 Astra, Grok 4.7 y Fable razonan por diseño, por lo que en ellosfastsignifica su nivel predeterminado (facturado), mostrado en el pie comoreasoning: model defaultmid: Razonamiento moderado: revisiones de código, análisis de erroresthink: Razonamiento máximo: auditorías de seguridad, refactorización compleja
Reglas de especificación de archivos
- Solo rutas absolutas:
/Users/john/project/src/*.py - Comodines solo en nombres de archivo:
/Users/john/project/*.py(no en rutas de directorio) - Extensión requerida con comodines:
*.pyno* - Mezclar archivos y patrones:
["/path/src/*.py", "/path/README.md", "/path/tests/*_test.py"]
Patrones comunes:
- Todos los archivos Python:
/path/to/dir/*.py - Archivos de prueba:
/path/to/tests/*_test.pyo/path/to/tests/test_*.py - Múltiples extensiones:
["/path/*.js", "/path/*.ts"]
Ignorados automáticamente: __pycache__, .env, secrets.py, .DS_Store, .git, node_modules. Los comodines los omiten; nombrar uno explícitamente es un error.
Fallo rápido: una ruta relativa o inexistente, un directorio, un comodín que no coincide con nada, un archivo ignorado nombrado explícitamente, un archivo binario (bytes NUL en los primeros 8 KB) o archivos que superan el presupuesto de tamaño del modelo hacen fallar toda la llamada antes de enviar cualquier cosa al modelo (sin costo). El error enumera cada problema.
Presupuesto de tamaño: un total para todos los archivos juntos, sin límite por archivo: (contexto del modelo − reserva de salida − reserva de razonamiento) × ~4 bytes por token, por ejemplo, ~4 MB para modelos de contexto 1M, ~2 MB para Grok 4.7 (500K), ~8 MB para Grok 4.20 (2M). Una segunda verificación del recuento estimado de tokens mantiene un margen de seguridad del 10%. Un error de tamaño indica el presupuesto y el total solicitado.
Parámetros de la herramienta
La herramienta de consulta acepta los siguientes parámetros:
- files (obligatorio): Lista de rutas de archivo absolutas o patrones con comodines solo en nombres de archivo
- query (obligatorio): Tu pregunta o instrucción para que el LLM procese los archivos
- model (obligatorio): El modelo LLM a usar (ver Modelos soportados arriba)
- mode (obligatorio): Modo de rendimiento:
fast,midothink - output_file (opcional): Ruta absoluta para guardar la respuesta en un archivo en lugar de devolverla
- La ruta se verifica antes de llamar al modelo, por lo que una ruta incorrecta no cuesta nada
- Si el archivo existe, se guardará con el sufijo
_updated(por ejemplo,report.md→report_updated.md, luegoreport_updated_1.md, ...) - Cuando se especifica, devuelve
"Result has been saved to /path/to/file"más el pie de metadatos - Útil para generar informes, documentación o análisis sin inundar el contexto del agente
- zdr (opcional): Habilita el enrutamiento de Retención de Datos Cero (predeterminado:
false)- Cuando es
true, enruta solo a endpoints con política ZDR (el proveedor no retiene las indicaciones) - ZDR disponible: GPT-6 Astra, Grok 4.7, Gemini 3.1 Pro/Flash, Claude Opus 4.8, GPT-5, GPT-5.5, Grok 4.6
- No disponible: Claude Fable 5.1 y 5, GPT-5.6 Sol, Grok 4.20 (devuelve error)
- Cuando es
Ejemplos de uso
Vía MCP en Claude Code
Claude Code usará automáticamente la herramienta con los parámetros adecuados:
{
"files": ["/Users/john/project/src/*.py"],
"query": "Explain the main architecture",
"model": "google/gemini-3-flash-preview",
"mode": "fast"
}
Vía API de Python
from consult7.consultation import consultation_impl
result = await consultation_impl(
files=["/path/to/file.py"],
query="Explain this code",
model="google/gemini-3-flash-preview",
mode="fast", # fast, mid, or think
provider="openrouter",
api_key="sk-or-v1-..."
)
Pruebas
# Test OpenRouter connection
uvx consult7 sk-or-v1-your-api-key --test
Desinstalación
Para eliminar consult7 de Claude Code:
claude mcp remove consult7 -s user
Historial de versiones
v3.11.2
- Sin límite de tamaño por archivo. Los archivos comparten un presupuesto total único, por lo que un solo archivo grande puede usar todo el presupuesto (antes, un archivo estaba limitado a la mitad del presupuesto). Los errores de tamaño informan el total solicitado y el presupuesto, y los errores de tokens mencionan el margen de seguridad del 10%.
- Los archivos binarios fallan rápidamente (bytes NUL en los primeros 8 KB) en lugar de enviarse como tokens basura.
- IDs de modelo desconocidos: cuando un modelo no está en la lista de modelos de OpenRouter, los errores lo indican, nombran el contexto asumido de 128K y sugieren los IDs listados más cercanos. Los IDs de variantes como
model:nitrousan el tamaño de contexto del modelo base. - Pie: tiempo de reloj
time, el modo siempre se muestra ([fast]también),zdrse muestra cuando está activado. Ambas estimaciones de tokens ahora usan el mismo texto de indicación, y una llamada rechazada defastya no afirmareasoning disabled.
v3.11.1
- Fallo rápido antes de cualquier llamada de pago. Un archivo faltante en una lista, un comodín que no coincide con nada, un archivo ignorado explícitamente nombrado (
.env,secrets.py, ...), o archivos que superan el límite de tamaño por archivo o total del modelo ahora fallan la llamada con un error claro antes de que se envíe algo. Antes, estos solo se informaban dentro del prompt (o se descartaban), y la llamada de pago se realizaba con entrada parcial. output_filese verifica antes de la llamada. Una ruta relativa o no escribible falla sin costo. Si guardar aún falla después de la llamada, la respuesta se devuelve en lugar de perderse.- Los errores establecen
isError=trueen el resultado de MCP, para que los clientes y envoltorios puedan detectar fallos sin analizar texto. - Los mensajes de error ascendentes ya no incluyen la cuenta de OpenRouter
user_id. - Pie de página:
1 file(no1 files). Enfast, los modelos que siempre razonan (GPT-6 Astra, Grok 4.7, Fable) muestranreasoning: model default. - Descripción de herramienta más corta (menos de 2,000 caracteres, reglas de archivo primero). Claude Code truncaba la anterior antes de las reglas de archivo.
v3.11.0
- Nuevo panel ULTRA: GPTT + GROT + FABT (3 modelos en paralelo). Gemini 3.1 Pro sale del panel (
gemty todos los modelos Gemini siguen disponibles); Opus 4.8 (oput/opuf) sigue disponible pero su asiento ULTRA pasa a Fable. gptt→ GPT-6 Astra (openai/gpt-6-astra, contexto de 1M, $10/$50 por M) — también el modelo utilizado porconsult7 <key> --test. El razonamiento es obligatorio en Astra, por lo quemid/thinkahora se asignan aeffort=high/effort=xhigh(GPT-5.6 Sol usabamedium/high). ZDR compatible.grot→ Grok 4.7 (x-ai/grok-4.7, contexto de 500K; grok 4.6 había sido el predeterminado desde v3.10.0). Mismo mapeo de esfuerzo (high/xhigh). ZDR compatible.fabt/fabm→ Claude Fable 5.1 (anthropic/claude-fable-5.1, contexto de 1M). Mismo mapeo de esfuerzo. ZDR no compatible.- Los IDs reemplazados (
openai/gpt-5.6-sol,x-ai/grok-4.6,anthropic/claude-fable-5) siguen funcionando con sus configuraciones anteriores.
v3.9.0
- Nuevo GPT predeterminado: GPT-5.6 Sol (
openai/gpt-5.6-sol) — el último GPT de primer nivel, ~1M de contexto / 128K de salida, razonamiento basado en esfuerzo (mid→effort=medium,think→effort=high). Reemplaza a GPT-5.5 como predeterminado degptt; GPT-5.5 sigue disponible como modelo heredado. ZDR no es compatible en GPT-5.6 Sol (GPT-5.5 sí lo es). - Grok 4.5 no agregado:
x-ai/grok-4.5está restringido por región en OpenRouter (devuelve un 403 "no disponible en tu región") y no pudo verificarse contra la API real, por lo que no se integró. Grok 4.20 sigue siendo el predeterminado degrot.
v3.8.0
- Agregado Claude Fable 5 (
anthropic/claude-fable-5) — el modelo más capaz de Anthropic, contexto de 1M. Precio premium (~2× Opus 4.8), por lo que está reservado para problemas específicamente difíciles y no forma parte del panelULTRA; no reemplaza a Opus 4.8 como modelo Claude predeterminado. Nuevas mnemotecniasfabt(pensar) /fabm(medio). A diferencia de Opus 4.8 (solo pensamiento adaptativo), OpenRouter respeta la escala de esfuerzo de Fable, por lo quemid/thinkse asignan aeffort=high/effort=xhigh(maxintencionalmente no expuesto — tiende a pensar de más a ~2× costo de tokens). ZDR no compatible (Fable requiere retención de 30 días). - Prompt de longitud de respuesta ajustado: el prompt del sistema ahora pide al modelo que ajuste la longitud de la respuesta a la tarea (exhaustivo cuando la pregunta requiere profundidad, conciso en caso contrario) en lugar de un "sé conciso" contundente.
v3.7.1
- Superficie de errores de API a mitad de transmisión: cuando OpenRouter envía un error como un fragmento de datos de transmisión (después del 200 inicial), la llamada ahora devuelve ese mensaje de error en lugar de un engañoso "No se recibió contenido".
v3.7.0
- Agregado Fusion (
openrouter/fusion) — un panel de múltiples modelos más un juez en una sola llamada;modese asigna a la profundidad de investigación web (fast/mid/think→max_tool_calls2/8/16). Nueva mnemotecniaFUSE. - Actualizado Claude Opus 4.7 → 4.8 (contexto de 1M, pensamiento adaptativo);
oput/opufahora apuntan a 4.8, y 4.7 se mantiene como ID heredado. - El pie de página de respuesta ahora informa el costo de la llamada en USD (de la contabilidad de uso de OpenRouter), por ejemplo,
cost: $0.0923.
v3.6.1
- El pie de página de alternancia de razonamiento ahora distingue
midvsthinkpara modelos adaptativos (Opus, Grok) - Mensaje de error más amigable cuando un modelo no tiene endpoint de Retención de Datos Cero
- El retorno de
output_fileahora incluye el pie de página de metadatos para que los llamadores puedan verificar qué se ejecutó
v3.6.0
- Modelos actualizados: GPT-5.5, Claude Opus 4.7, Grok 4.20
- Claude Opus 4.7 (contexto de 1M) usa pensamiento adaptativo —
reasoning.enabled=true - Grok 4.20 (contexto de 2M) usa razonamiento automático —
reasoning.enabled=true - Mnemotecnias actualizadas:
gptt→ GPT-5.5,oput/opuf→ Claude Opus 4.7,grot→ Grok 4.20 - Los IDs de modelos heredados siguen siendo compatibles
v3.5.0
- Actualizado GPT-5.2 → GPT-5.4 (~1M de contexto)
v3.4.0
- Modelos actualizados: Gemini 3.1 Pro, Claude Opus 4.6, Claude Sonnet 4.6, Grok 4.1 Fast
- Nuevos modelos agregados: Claude Haiku 4.5, Gemini 3.1 Flash Lite
- Mnemotecnias actualizadas:
gemt→ Gemini 3.1 Pro,oput/opuf→ Claude Opus 4.6 - Los IDs de modelos heredados siguen siendo compatibles
v3.3.0
- Corregido el problema de truncamiento del modo de pensamiento de GPT-5.2 (cambiado a transmisión)
- Agregado
google/gemini-3-flash-preview(Gemini 3 Flash, ultra rápido) - Mnemotecnia
gemfactualizada para usar Gemini 3 Flash - Agregado el parámetro
zdrpara el enrutamiento de Retención de Datos Cero
v3.2.0
- Actualizado a GPT-5.2 con razonamiento basado en esfuerzo
v3.1.0
- Agregado
google/gemini-3-pro-preview(contexto de 1M, modelo de razonamiento insignia) - Nuevas mnemotecnias:
gemt(Gemini 3 Pro),grot(Grok 4),ULTRA(ejecución en paralelo)
v3.0.0
- Eliminados los proveedores directos de Google y OpenAI — ahora solo OpenRouter
- Eliminado el sufijo
|thinking— use el parámetromodeen su lugar (ahora requerido) - API de parámetro
modelimpia:fast,mid,think - CLI simplificada de
consult7 <provider> <key>aconsult7 <key> - Mejor integración con MCP con validación de enumeración para modos
- Límites de tamaño de archivo dinámicos basados en la ventana de contexto del modelo
v2.1.0
- Agregado el parámetro
output_filepara guardar respuestas en archivos
v2.0.0
- Nueva interfaz de lista de archivos con validación simplificada
- Límites de tamaño de archivo reducidos a valores realistas
Licencia
MIT