tachibot-mcp

Pare as alucinações de IA antes que elas comecem. Execute modelos da OpenAI, Google, Anthropic, xAI, Perplexity e OpenRouter em paralelo. Eles verificam o trabalho uns dos outros, debatem soluções e detectam erros antes que você os veja.

Documentação

TachiBot MCP

Plataforma de Orquestração de IA Multi-Modelo

Version Tools License Node MCP

65 ferramentas de IA. 12 provedores. Um protocolo.

Orquestre Perplexity, Grok 4.5, GPT-5.6, Gemini, Qwen, Kimi K3 e MiniMax M3 a partir do Claude Code, Claude Desktop, Cursor ou de qualquer cliente MCP.

Começar · Ver Ferramentas · Documentação


Se o TachiBot ajuda no seu fluxo de trabalho, uma estrela faz toda a diferença.

GitHub stars npm downloads


Novidades

v2.28.0

  • Qwen3.8 Max (3 de agosto, qwen/qwen3.8-max) — o novo carro-chefe da Alibaba, GA no mesmo dia, agora alimenta qwen_algo, qwen_reason e o jurado qwen_reason. Contexto de 1M (antes 262K), multimodal (entrada de texto+imagem+vídeo), e o primeiro Qwen com esforço de raciocínio configurável. $2/$6 por M.
  • Medido em um problema de algoritmo de consulta por intervalo, o 3.8 Max foi o único entre cinco candidatos Qwen a apresentar tanto o tradeoff offline-vs-online quanto o caso de borda de desigualdade estrita com duplicatas. O qwen3-235b-a22b-thinking-2507 anterior estava correto, mas superficial; qwen3.7-max custou 1,6x pelo dobro do tempo de execução; qwen3-max-thinking foi rejeitado diretamente — ele retorna zero tokens de raciocínio.
  • O esforço está fixado em medium, deliberadamente. O esforço padrão deste modelo se comporta como high: 302s e $0,09 em uma única chamada qwen_algo. No nível medium, a mesma chamada responde com profundidade igual em 18–48s por $0,006–0,018 — mais barato e 3,5x mais rápido que o modelo que ele substitui, que levava 169s e $0,036 para uma resposta mais curta. low começa a descartar alternativas e não é utilizado.
  • Passagem reasoning_effort para OpenRoutercallOpenRouter agora repassa o parâmetro; o OpenRouter o descarta para modelos que não o listam, então a cadeia de fallback por cota (3.8 Max → 3.7 Max → 235B Thinking) permanece segura. Qwen3.8/3.7-Max também entram no grupo de timeout estendido de 600s.
  • qwen_coder, qwen_competitive, testgen permanecem no Qwen3-Coder-Next — ele é especializado em código e ~16x mais barato ($0,12/$0,80); 3.8 Max é o nível de raciocínio, não o nível de geração de código.

v2.27.1

  • Kimi K3 (16 de julho, moonshotai/kimi-k3) agora alimenta todas as ferramentas Kimi, o jurado kimi e o assento Kimi no diff_review. MoE de peso aberto de 2.8T — o maior modelo aberto já lançado — com contexto de 1M (antes 262K), entrada multimodal nativa e codificação agêntica de longo horizonte que supera Opus 4.8 e GPT-5.5 nos benchmarks de codificação/agentes. Atenção ao preço: $3/$15 por M, 4x o K2.7-Code — o K2.7-Code permanece como fallback automático (K3 → K2.7-Code → K2.6).
  • Gemini 3.6 Flash (21 de julho, gemini-3.6-flash) é o novo nível de busca/carga de trabalho por trás do gemini_search — contexto de 1M a $1,50/$7,50, abaixo dos $9 de saída, e ~17% menos tokens de saída que o 3.5 Flash. O Flash-Lite passa para gemini-3.5-flash-lite ($0,30/$2,50).
  • Todo o resto reverificado, inalterado — uma auditoria completa dos provedores (26 de julho) confirma que GPT-5.6, Grok 4.5, DeepSeek V4 Pro, GLM-5.2, MiniMax M3, StepFun 3.7, ERNIE 4.5 VL, Qwen Coder-Next e Perplexity Sonar continuam sendo os mais novos disponíveis. O Gemini 3.1 Pro permanece como padrão de raciocínio/juiz: o Google lançou três modelos em 21 de julho e pulou o 3.5 Pro. O rollout em etapas da xAI terminou (acesso na UE em 17 de julho), então o fallback grok-4.3 agora é um seguro de cota/região, não uma solução para o rollout.

v2.27.0

  • Grok 4.5 (carro-chefe de 8 de julho, "classe Opus") agora alimenta todas as ferramentas Grok, com fallback automático para grok-4.3 enquanto o rollout em etapas por região da xAI é concluído (UE em meados de julho) — as ferramentas continuam funcionando em qualquer lugar, e o 4.5 se ativa sozinho.
  • grok_search_lite (nova ferramenta, 65 no total) — a mesma busca ao vivo do Grok no grok-4-1-fast ($0,20/$0,50, 2M de contexto), ~10x mais barato que o grok_search. Use para consultas de alto volume e fan-outs de júri/conselho.
  • Níveis do GPT-5.6 — as ferramentas openai_* passam para gpt-5.6-sol (carro-chefe, mesmos $5/$30 do 5.5, porém mais forte), terra para código (nível 5.5 pela metade do preço), luna para explicações ($1/$6). O nível gpt-5.5-pro de $30/$180 é substituído por sol + esforço de raciocínio; um fallback de permissão (sol → terra → 5.5) cobre contas restritas pela organização.

v2.26.1

  • Skills /test e /audit (19 skills no total) — /test gera testes executáveis via testgen; /audit executa uma revisão de segurança OWASP/CWE via security_review.
  • Instalação de skills no wizardtachibot init agora oferece instalar as skills do Claude Code com opção de pular por skill ([Enter]=todas · [s]=escolher quais pular · [n]=nenhuma). As skills são opt-in — postinstall não escreve mais em ~/.claude silenciosamente (npm run install-skills ainda instala todas de forma não interativa).
  • Correções — a extensão .mcpb de um clique agora aponta para um entry point válido (estava quebrada) e rastreia a versão do pacote; tachibot init encerra corretamente em stdin não interativo/CI em vez de travar.

v2.26.0

Pilha de prompts, modernizada

  • refine_prompt (nova ferramenta) — melhorador de prompt opt-in em um modelo barato/rápido: consulta bruta → brief orientado a objetivos + o que mudou + perguntas em aberto. Nunca dispara automaticamente, nunca executa nada — você revisa e depois usa o brief. No Claude Code, /prompt refine apresenta as perguntas em aberto como opções clicáveis e mescla suas respostas em um brief final.
  • Lista de técnicas curadalist_prompt_techniques agora usa por padrão as ~9 técnicas principais que ainda ajudam os modelos de raciocínio de 2026 (contratos de saída como scot, pre_mortem, bdd_spec); all=true para as 31 completas.
  • technique="auto"preview_prompt_technique recomenda a técnica certa para sua tarefa, com justificativas. Pergunte ao tachi "melhore meu prompt" para o menu baseado em sintomas.

Setup, desmistificado

  • tachibot init (novo wizard de CLI) — detecta suas chaves de API e clientes, imprime a configuração exata para Claude Code e Claude Desktop. Nunca escreve nem ecoa chaves.
  • Instalação com um clique no Claude Desktop — baixe o .mcpb da versão mais recente e dê dois cliques. Sem edição de JSON.
  • doctor — mostra quais chaves estão definidas, quais ferramentas estão visíveis vs ocultas e por quê, e o que tentar primeiro.

Novas ferramentas e skills (65 ferramentas · 19 skills)

  • debug_triage — hipóteses de causa raiz ranqueadas com o teste discriminante mais barato para cada uma (Grok 4.3)
  • spec_writer — solicitação vaga → spec revisável: user stories, Dado/Quando/Então, fora de escopo, perguntas em aberto (GPT-5.5)
  • diff_review / plan_critique / testgen / security_review — revisão de diff multi-modelo, red-team adversarial de planos, geração de testes, auditoria OWASP/CWE
  • Skills: /review, /redteam, /spec, /triage, /setup

Correções

  • Tela de orquestração do focus: 37 linhas de scaffolding repetido → 10 linhas focadas
  • npm test sai com 0 novamente (timers de corrida não cancelados vazavam após o teardown do Jest)
  • Raciocínio de alto esforço do GPT-5.5 não é mais cortado aos 3 minutos (timeout de 180s → 600s)

Skills (Claude Code)

O TachiBot acompanha 19 comandos de barra para o Claude Code. Eles orquestram as ferramentas em fluxos de trabalho poderosos:

SkillO que fazExemplo
/setupConfiguração guiada — executa o doctor, percorre chaves/perfis/setup
/specSolicitação → spec revisável antes do planejamento/spec add OAuth somehow
/blueprintPlanejamento multi-modelo → etapas TDD em pequenas porções/blueprint add OAuth with refresh tokens
/judgeConselho multi-modelo - análise paralela com síntese/judge how to implement rate limiting
/thinkCadeia de raciocínio sequencial com qualquer modelo/think grok,gemini design a cache layer
/focusRaciocínio baseado em modos (debate, pesquisa, análise)/focus architecture-debate Redis vs Pg
/breakdownDecomposição estratégica com pre-mortem/breakdown refactor payment module
/decomposeDivide em subproblemas, aprofunda cada um/decompose implement collaborative editor
/promptRecomenda a técnica de pensamento certa (31 disponíveis)/prompt why do users churn
/algoAnálise de algoritmos com 4 modelos especializados (DeepSeek líder)/algo optimize LRU cache O(1)
/lensAnálise de contexto longo na janela de 1M do Kimi/lens find inconsistencies in this spec
/reflectLoop de reflexão fundamentado — crítica vs evidência externa/reflect harden this auth middleware
/totÁrvore de Pensamento: ramificar → poda por júri → sintetizar/tot design a rate limiter
/reviewRevisão de diff multi-modelo — painel + veredito do juiz Gemini/review (ou cole um diff)
/redteamRed-team adversarial de planos — pre-mortem, riscos, edições no plano/redteam <paste plan>
/triageTriage de bugs por causa raiz ranqueada/triage <paste stack trace>
/testGera testes executáveis (casos de borda primeiro)/test src/auth.ts
/auditRevisão de segurança — achados OWASP/CWE + correções/audit the login handler
/tachiAjuda — veja skills disponíveis, ferramentas, status das chaves/tachi

As skills se adaptam automaticamente às suas chaves de API configuradas. Mesmo com apenas 1-2 provedores, todas as skills funcionam.

Começando agora? Digite /tachi para ver o que está disponível.


Recursos Principais

Inteligência Multi-Modelo

  • 65 Ferramentas de IA em 12 provedores — Perplexity, Grok, GPT-5, Gemini, Qwen, Kimi, MiniMax, DeepSeek, GLM (Zhipu), StepFun, ERNIE (Baidu), além de modelos locais gratuitos (Ollama / LM Studio / llama.cpp / vLLM)
  • Gemini 3.6 Flash (gemini-3.6-flash, GA em 21 de jul de 2026) — nível Flash/busca; o padrão de raciocínio permanece gemini-3.1-pro-preview (o Google ainda não lançou um 3.5 Pro)
  • Conselho Multi-Modelo — planner_maker sintetiza planos de 5+ modelos em etapas TDD em pequenas porções
  • Roteamento Inteligente — Seleção automática de modelos para resultados ideais
  • Gateway OpenRouter — Uma única chave de API opcional para todos os provedores

Fluxos de Trabalho Avançados

  • Fluxos de Trabalho Baseados em YAML — Processos de IA em múltiplas etapas com grafos de dependência
  • Engenharia de Prompts — 31 técnicas baseadas em pesquisa (incluindo SCoT, ReAct, Reflexion)
  • Pontos de Verificação — 50% / 80% / 100% com pontuação de qualidade automatizada
  • Execução Paralela — Execute vários modelos simultaneamente

Perfis de Ferramentas

PerfilFerramentasMelhor Para
Mínimo13Tarefas rápidas, orçamento de tokens baixo
Poder de Pesquisa36Investigação profunda, múltiplas fontes
Foco em Código42Desenvolvimento de software, tarefas SWE
Equilibrado54Uso geral, fluxos de trabalho mistos
Codificação Pesada58Máximo de ferramentas de código + fluxos agênticos
Completo (padrão)65Tudo habilitado

Experiência do Desenvolvedor

  • Claude Code — Suporte de primeira classe
  • Claude Desktop — Integração completa
  • Cursor — Funciona perfeitamente
  • TypeScript — Totalmente tipado e extensível

Início Rápido

Instalação

npm install -g tachibot-mcp

Wizard de setup

npx -y -p tachibot-mcp tachibot init

Detecta suas chaves e clientes e imprime a configuração exata para Claude Code e Claude Desktop.

Claude Code (linha única)

claude mcp add tachibot -- npx -y -p tachibot-mcp tachibot

Depois verifique com /mcp. Adicione chaves de API com --env, por exemplo, --env OPENROUTER_API_KEY=sk-or-xxx --env PERPLEXITY_API_KEY=pplx-xxx.

Setup (Claude Desktop)

Um clique (mais fácil): baixe o tachibot-mcp.mcpb da versão mais recente e dê dois cliques — o Claude Desktop instala a extensão sem edição de JSON. Adicione suas chaves de API quando solicitado (ou depois, pelas configurações da extensão).

Modo Gateway (Recomendado) — 2 chaves, todos os provedores:

{
  "mcpServers": {
    "tachibot": {
      "command": "tachibot",
      "env": {
        "OPENROUTER_API_KEY": "sk-or-xxx",
        "PERPLEXITY_API_KEY": "pplx-xxx",
        "USE_OPENROUTER_GATEWAY": "true"
      }
    }
  }
}

Modo Direto — Uma chave por provedor:

{
  "mcpServers": {
    "tachibot": {
      "command": "tachibot",
      "env": {
        "PERPLEXITY_API_KEY": "your-key",
        "GROK_API_KEY": "your-key",
        "OPENAI_API_KEY": "your-key",
        "GOOGLE_API_KEY": "your-key",
        "OPENROUTER_API_KEY": "your-key"
      }
    }
  }
}

Obtenha chaves: OpenRouter | Perplexity

Consulte o Guia de Instalação para instruções detalhadas.


Ecossistema de Ferramentas (65 Ferramentas)

Pesquisa e Busca (6)

perplexity_ask · perplexity_reason · grok_search · grok_search_lite · openai_search · gemini_search

Raciocínio e Planejamento (14)

grok_reason · openai_reason · qwen_reason · qwq_reason · kimi_thinking · kimi_decompose · deepseek_reason · glm_reason · stepfun_reason · ernie_reason · planner_maker · planner_runner · list_plans · spec_writer

Inteligência de Código (11)

kimi_code · grok_code · grok_debug · qwen_coder · qwen_algo · qwen_competitive · deepseek_algo · minimax_code · minimax_agent · testgen · debug_triage

Análise e Julgamento (14)

gemini_analyze_text · gemini_analyze_code · gemini_judge · jury · diff_review · plan_critique · gemini_brainstorm · openai_brainstorm · openai_code_review · openai_explain · grok_brainstorm · grok_architect · security_review · kimi_long_context

Meta e Orquestração (6)

think · nextThought · focus · tachi · doctor · usage_stats

Fluxos de Trabalho (9)

workflow · workflow_start · continue_workflow · list_workflows · create_workflow · visualize_workflow · workflow_status · validate_workflow · validate_workflow_file

Engenharia de Prompts (4)

list_prompt_techniques · preview_prompt_technique · execute_prompt_technique · refine_prompt

Modelos Locais (1)

local_query — qualquer servidor local compatível com OpenAI (Ollama / LM Studio / llama.cpp / vLLM). Custo zero, offline, privado; também disponível como jurado do júri local (hermes é aceito como alias legado). Executa o que LOCAL_LLM_MODEL apontar — por exemplo, uma build Nous Hermes (ollama pull hermes3). Observe que o agente Hermes em si é agnóstico de modelo — ele roda em mais de 300 backends (GPT, Claude, Gemini, DeepSeek, ou Ollama/vLLM auto-hospedados) — então "Hermes" nunca foi uma garantia de pesos distintos.

Modos Avançados (bônus)

  • Challenger — Análise crítica com verificação de fatos multi-modelo
  • Verifier — Verificação de consenso multi-modelo
  • Scout — Coleta de inteligência híbrida

Exemplo de Uso

Planejamento Multi-Modelo

// Create a plan with multi-model council
planner_maker({ task: "Build a REST API with auth and tests", mode: "start" })
// → Grok searches → Qwen analyzes → Kimi decomposes → GPT critiques → Gemini synthesizes

// Execute with checkpoints
planner_runner({ plan: planContent, mode: "step", stepNum: 1 })
// → Automatic verification at 50%, 80% (kimi_decompose), and 100%

Decomposição de Tarefas

kimi_decompose({
  task: "Migrate monolith to microservices",
  depth: 3,
  outputFormat: "dependencies"
})
// → Structured subtasks with IDs, parallel flags, acceptance criteria

Revisão de Código

kimi_code({
  task: "review",
  code: "function processPayment(amount, card) { ... }",
  language: "typescript"
})
// → SWE-Bench 76.8% quality analysis

Raciocínio Profundo

focus({
  query: "Design a scalable event-driven architecture",
  mode: "deep-reasoning",
  models: ["grok", "gemini", "kimi"],
  rounds: 5
})

Documentação

Guias de Configuração


Contribuindo

Contribuições são bem-vindas! Consulte CONTRIBUTING.md para diretrizes.


Gostou do que viu?

Dê uma estrela no GitHub — ajuda mais do que você imagina.

GitHub stars

Site · Docs · npm · Problemas

AGPL-3.0 — consulte LICENSE para detalhes.

Feito com carinho por @byPawel

Orquestração de IA multi-modelo, unificada.