tachibot-mcp

Pare as alucinações de IA antes que elas comecem. Execute modelos da OpenAI, Google, Anthropic, xAI, Perplexity e OpenRouter em paralelo. Eles verificam o trabalho uns dos outros, debatem soluções e detectam erros antes que você os veja.

Documentação

TachiBot MCP

Plataforma de Orquestração de IA Multi-Modelo

Version Tools License Node MCP

67 ferramentas de IA. 12 provedores. Um protocolo.

Orquestre Perplexity, Grok 4.6, GPT-6 Astra, Gemini, Qwen, Kimi K3 e MiniMax M3 a partir do Claude Code, Claude Desktop, Cursor ou qualquer cliente MCP.

Começar · Ver Ferramentas · Documentação


Se o TachiBot ajuda no seu fluxo de trabalho, um star ajuda muito.

GitHub stars npm downloads


Novidades

v2.34.0

  • GPT-6 Astra é o padrão da OpenAI. gpt-6-astra (3 de set de 2026; US$ 10/US$ 50, contexto de 1,05M) agora sustenta openai_reason, openai_brainstorm, openai_code_review, spec_writer, tachi e os revisores GPT em diff_review / plan_critique. A Astra foi lançada primeiro para um conjunto limitado de organizações, então as chamadas recaem para gpt-5.6-sol e depois gpt-5.6-terra quando uma organização não tem acesso. openai_explain permanece em sol — explicações de baixo esforço não precisam do modelo principal.
  • Os modelos GPT-6 não podiam ser chamados de forma alguma. callOpenAI usava apenas a API de Respostas para nomes que começam com gpt-5., então a Astra caía para Chat Completions com temperature: 0.7 e recebia um erro 400. gpt-6-* agora vai para a API de Respostas sem temperatura, e os esforços de raciocínio none/minimal que a Astra rejeita são enviados como low.
  • qwq_reason voltou a funcionar. qwen/qwq-32b foi aposentado do OpenRouter (todas as chamadas retornavam 404), então a ferramenta agora executa qwen/qwen3.8-27b em reasoning_effort: medium com o modelo de pensamento de 235B como fallback — correto em um problema de teste em 2,0s por US$ 0,0007. Nome da ferramenta e parâmetros inalterados.
  • Contagem de ferramentas inalterada em 67.

v2.33.0

  • A família de escrita (storm, re3, de_generic). A biblioteca tinha pensamento criativo (what_if, innovate, alt_view, creative_use) e zero escrita criativa: contra um pipeline de 7 estágios, o estágio 4 (estrutura) e o estágio 5 (rascunho) estavam vazios, e o estágio 6 (revisão) caía para reflexion — que otimiza para correto, enquanto a revisão de prosa é corte, ritmo e especificidade. 85 → 88 técnicas.
  • blog_writer — pesquisa de formato longo em uma única chamada, compondo storm e re3 em vez de carregar uma cópia privada do texto deles. Uma cópia divergiria no momento em que qualquer um dos modelos fosse editado, e divergiria silenciosamente, porque ambos os caminhos ainda emitem prosa bem formada. research: true executa a entrevista de persona primeiro e alimenta suas 3 respostas surpreendentes na escrita de quatro passagens. 66 → 67 ferramentas; habilitado em full, balanced e research_power.
  • preview_prompt_technique(technique="auto") não tinha rota para intenção de escrita. RECOMMEND_RULES não carregava correspondência, então "escreva um post de blog" caía para CORE_TECHNIQUES.slice(0, 3) — chain_of_note / astute_rag / spotlighting — enquanto list_prompt_techniques anunciava auto como o caminho de entrada. Verbos de escrita agora roteiam para storm, re3, de_generic.
  • blog_writer truncava silenciosamente em maxTokens: 8000. Sua saída são várias renderizações completas da mesma peça (rascunho, reestruturação e edição de linha de re3, além das 16 respostas marcadas de storm), diferente das ferramentas irmãs que emitem um artefato. 8000 já estava no teto na contagem de palavras que a documentação usa como exemplo próprio, e nada errava na truncagem. Elevado para 16000.
  • Testes anti-divergência não conseguiam detectar divergência. Os testes "usa o modelo em vez de uma cópia privada" afirmavam frases características que uma cópia também satisfaria; agora afirmam a saída viva exata do mecanismo.

v2.32.0

  • Família tabular (7 novas técnicas) — trabalho em formato de dados não tinha cobertura alguma, então "filtre estas linhas" caía para os contratos genéricos principais. data_assert declara o propósito downstream primeiro, depois verifica os dados com asserções executáveis carregando contagens, porque um filtro que silenciosamente correspondeu a zero linhas é indistinguível de um que funcionou. Mais chain_of_table, sub_table_first, sql_stages, xlsx_map, table_format, self_debug.
  • Família de recuperação completada (3 novas) — astute_rag responde da memória primeiro, depois marca cada fonte como concorda/preenche/conflita e resolve cada conflito em voz alta; crag classifica fontes como corretas/ambíguas/erradas e age com base na classificação, já que a busca sempre retorna seus vizinhos mais próximos e não tem como retornar nada; hyde rascunha a resposta que você gostaria que existisse, busca com o vocabulário dela, depois a descarta.
  • Cercas de destaque carregavam 24 bits de entropia, não 32. untrustedFence() chamava randomBytes(3) enquanto seu próprio bloco de comentário tinha raciocinado até 4. Toda a propriedade de segurança do destaque é que um atacante não pode adivinhar o delimitador necessário para fechar seu bloco, então a deficiência era estrutural. Agora são 8 caracteres hexadecimais, como documentado.
  • O literal 37 sobreviveu a três expansões do catálogo (37 → 74 → 85) dentro da descrição de list_prompt_techniques — o texto que um modelo lê para decidir se chama a ferramenta. Agora é derivado de FLAT_TECHNIQUES.length.
  • 74 → 85 técnicas. Contagem de ferramentas inalterada em 66.

v2.31.0

  • Biblioteca de técnicas de prompt vai de 37 → 74, fechando três famílias que estavam com zero cobertura. Recuperação (4): o TachiBot oferece cinco ferramentas de busca e não tinha disciplina para o que fazer com o que elas retornam — texto recuperado ia direto para o raciocínio sem filtro, que é de onde vêm fontes citadas com confiança incorreta. Defesa contra injeção de prompt (1): essas mesmas ferramentas ingerem texto web não confiável sem contrato de isolamento, então uma página dizendo "ignore instruções anteriores" era lida exatamente como nosso próprio prompt; spotlighting a isola e declara a regra. Few-shot (5): nada tocava na seleção ou ordenação de exemplos, apesar de isso mover a precisão mais do que a maioria dos truques de raciocínio.
  • Oito técnicas de gerenciamento de rastreamento da pesquisa de junho–agosto de 2026, incluindo hourglass (comprimir para uma regra, descartar a exploração, regenerar a partir da regra em vez de anexar erros) e backtrack (rebobinar para o último checkpoint validado em vez de reiniciar ou corrigir).
  • Doze prompts originais reescritos para lerem como instruções. O conjunto inicial usava abreviação telegráfica que lê como um rótulo em vez de um pedido, deixando o modelo inferir a tarefa.
  • Regras de recomendação para tudo isso — 74 técnicas é além do ponto em que alguém lembra nomes, então RECOMMEND_RULES ganhou oito grupos correspondentes a como as pessoas realmente formulam a situação. Sem isso, as novas técnicas eram alcançáveis apenas sabendo o nome delas antecipadamente.

v2.30.1

  • Descrições de ferramentas não mencionam mais versões de modelo. 19 descrições foram reescritas para nomear o provedor e a tarefa em vez de strings fixas como "GPT-5.2", "Kimi K3" ou "424B MoE" — elas apodrecem silenciosamente a cada atualização de modelo e depois enganam ativamente o modelo de roteamento. Duas estavam totalmente erradas: openai_reason e openai_search anunciavam "GPT-5.2" enquanto o código chama o nível principal atual da OpenAI.
  • grok_search finalmente diz por que escolhê-lo. A descrição inteira era "Busca na web" — sem como escolhê-lo entre as outras quatro ferramentas de busca. Agora declara sua vantagem de fundamentação ao vivo em X/notícias e faz referência cruzada a grok_search_lite como o caminho mais barato. Os cinco raciocinadores OpenRouter (deepseek_reason, glm_reason, stepfun_reason, ernie_reason, qwen_reason) também diferiam apenas por detalhes de fornecedor; cada um agora carrega uma regra de roteamento real para quando escolhê-lo.
  • Manifesto do Claude Desktop corrigido — anunciava 65 ferramentas (real: 66), omitia o perfil heavy_coding da ajuda de TACHIBOT_PROFILE, e sua dica de OPENAI_API_KEY afirmava que essa chave alimenta as ferramentas Qwen e QwQ (essas roteiam via OpenRouter).
  • Empacotamento não quebra mais a árvore de trabalho. scripts/package-extension.sh executava npm install --production, podando devDependencies e deixando tsc incapaz de compilar depois. Agora restaura a árvore de dependências completa ao terminar.
  • O servidor se apresentava como v2.0.0. serverInfo.version estava codificado de uma era de 12 ferramentas ~28 versões menores atrás, então o painel de conexão do Claude Desktop identificava incorretamente toda instalação. Agora lê a versão real de package.json. Os tamanhos de perfil do assistente /setup estavam desatualizados da mesma forma e agora correspondem aos seis perfis reais.
  • Correção à v2.30.0: grok_search_lite não está quebrado e está permanecendo. Aquela versão afirmava que grok-4.3 "também não invoca busca na web" — o que tornaria o nível de busca barato inútil. Re-testado em 15 de agosto perguntando a data de hoje: grok-4.3 executou 2 buscas na web e retornou uma citação em 10,4s; grok-4.6 fez o mesmo em 36,4s. Lite é fundamentado, mais barato e 3–4x mais rápido — prefira-o para consultas de alto volume. grok-4.5 ainda é o que não fundamenta. O nível barato agora tem seu próprio teste de fundamentação, já que nada cobria isso antes.
  • Nenhuma ferramenta adicionada ou removida — a contagem permanece 66.

v2.30.0

  • grok_search não estava buscando. Executava em grok-4.5, que nunca invoca a ferramenta web_search na API de Ferramentas de Agentes da xAI — então respondia a partir de dados de treinamento enquanto ainda renderizava um rodapé de fontes e uma linha de custo "Busca usou até N fontes" calculada localmente a partir de max_search_results, não do uso real. Testado em 14 de agosto: perguntando a data de hoje, grok-4.5 respondeu "10 de outubro de 2025" com zero entradas de web_search_call; grok-4.6 respondeu corretamente com duas chamadas de busca e uma citação. grok_search agora executa grok-4.6 (mesmos US$ 2/US$ 6 e contexto de 500K que o 4.5). O teste de regressão afirma fundamentação — um web_search_call e ≥1 anotação — nunca o texto da resposta, porque uma resposta plausível sem fundamentação é exatamente o que escondeu isso.
  • Correção à nota v2.27.0 abaixo: grok_search_lite nunca executou em grok-4-1-fast a US$ 0,20/US$ 0,50. A xAI aposentou esse id e silenciosamente serviu grok-4.3 — HTTP 200, a troca divulgada apenas no campo model do corpo da resposta, então nada lançou erro e nenhum fallback disparou. O anunciado "~10x mais barato" era realmente ~1,6x.
  • 13 chamadas de console.log estavam corrompendo o fluxo do protocolo MCP. stdout é o canal JSON-RPC em um servidor stdio; diagnósticos agora vão para stderr, protegidos por um teste que também rejeita console.info, console.debug e process.stdout.write.
  • create_workflow destruía silenciosamente arquivos de fluxo de trabalho existentes — a verificação de existência protegia o diretório, não o arquivo. Agora recusa sobrescrever a menos que overwrite: true, e reporta o caminho real de .tachibot/workflows/ em vez de .tachi/workflows/.
  • Oito mapas de prompt injetavam a string literal "undefined" em prompts de sistema para qualquer approach/task não reconhecido, porque o fallback de || ficava dentro do índice. Corrigido em grok_reason, grok_code, kimi_thinking, qwen_reason, deepseek_reason, glm_reason, stepfun_reason, ernie_reason.
  • Etapas de fluxo de trabalho executavam o modelo errado — a etapa qwen_algo chamava QwQ-32B com um prompt genérico em vez de Qwen3.8-Max, e qwq_reason perdeu sua deliberação de 4 personas inteiramente. Ambos agora delegam para as ferramentas reais. Separadamente, a etapa qwen_coder de planner_maker enviava um parâmetro que o esquema rejeita, então toda execução falhava na validação.
  • Suíte de testes 130 → 158. A sonda de busca ao vivo agora é opcional atrás de RUN_LIVE_TESTS=1, então um npm test comum não faz mais uma chamada de API cobrada.

v2.28.0

  • Qwen3.8 Max (3 de agosto, qwen/qwen3.8-max) — novo carro-chefe da Alibaba, GA no mesmo dia, agora alimenta qwen_algo, qwen_reason e o jurado qwen_reason. Contexto de 1M (antes 262K), multimodal (entrada de texto+imagem+vetor) e o primeiro Qwen expondo esforço de raciocínio configurável. US$ 2/US$ 6 por M.
  • Medido em um problema de algoritmo de consulta por intervalo, o 3.8 Max foi o único entre cinco candidatos Qwen a trazer tanto o trade-off offline-vs-online quanto o caso de borda de desigualdade estrita com duplicatas. O qwen3-235b-a22b-thinking-2507 anterior estava correto, mas superficial; qwen3.7-max custou 1,6x para o dobro do tempo de execução; qwen3-max-thinking foi rejeitado de imediato — ele retorna zero tokens de raciocínio.
  • O esforço está fixado em medium, deliberadamente. O esforço padrão deste modelo se comporta como high: 302s e US$ 0,09 em uma única chamada qwen_algo. Em medium, a mesma chamada responde com profundidade igual em 18–48s por US$ 0,006–0,018 — mais barato e 3,5x mais rápido que o modelo que substitui, que levava 169s e US$ 0,036 para uma resposta mais curta. low começa a descartar alternativas e não é usado.
  • Passagem reasoning_effort para OpenRouter — callOpenRouter agora encaminha o parâmetro; o OpenRouter o descarta para modelos que não o listam, então a cadeia de fallback por cota (3.8 Max → 3.7 Max → 235B Thinking) permanece segura. Qwen3.8/3.7-Max também entram no bucket de timeout estendido de 600s.
  • qwen_coder, qwen_competitive, testgen permanecem no Qwen3-Coder-Next — ele é especializado em código e ~16x mais barato (US$ 0,12/US$ 0,80); o 3.8 Max é a camada de raciocínio, não a de geração de código.

v2.27.1

  • Kimi K3 (16 de julho, moonshotai/kimi-k3) agora alimenta todas as ferramentas Kimi, o jurado kimi e o assento Kimi em diff_review. MoE aberto de 2,8T — o maior modelo aberto já lançado — com contexto de 1M (antes 262K), entrada multimodal nativa e codificação agêntica de horizonte longo que supera Opus 4.8 e GPT-5.5 em benchmarks de código/agente. Observe o preço: US$ 3/US$ 15 por M, 4x o K2.7-Code — o K2.7-Code permanece como fallback automático (K3 → K2.7-Code → K2.6).
  • Gemini 3.7 Flash (GA em 13 de agosto, gemini-3.7-flash) é a nova camada de busca/trabalho pesado por trás de gemini_search — contexto de 1M a preço introdutório de US$ 0,75/US$ 3,75 até 31 de dezembro de 2026 (depois US$ 1,50/US$ 7,50); gemini-3.6-flash permanece como fallback. Flash-Lite continua sendo gemini-3.5-flash-lite (US$ 0,30/US$ 2,50).
  • Todo o resto re-verificado, inalterado — uma auditoria completa de provedores (26 de julho) confirma que GPT-5.6, Grok 4.5, DeepSeek V4 Pro, GLM-5.2, MiniMax M3, StepFun 3.7, ERNIE 4.5 VL, Qwen Coder-Next e Perplexity Sonar ainda são os mais recentes disponíveis. Gemini 3.1 Pro permanece como padrão de raciocínio/julgamento: o Google lançou três modelos em 21 de julho e pulou o 3.5 Pro. O rollout escalonado da xAI terminou (acesso na UE em 17 de julho), então o fallback grok-4.3 agora é seguro de cota/região, em vez de uma solução para rollout.

v2.27.0

  • Grok 4.5 (carro-chefe de 8 de julho, "classe Opus") agora alimenta todas as ferramentas Grok, com fallback automático para grok-4.3 enquanto o rollout escalonado por região da xAI é concluído (UE em meados de julho) — as ferramentas continuam funcionando em qualquer lugar, e o 4.5 ativa sozinho.
  • grok_search_lite (nova ferramenta, 65 no total) — a mesma busca ao vivo do Grok em grok-4-1-fast (US$ 0,20/US$ 0,50, 2M de contexto), ~10x mais barato que grok_search. Use para consultas de alto volume e fan-outs de júri/conselho.
  • Camadas GPT-5.6 — ferramentas openai_* mudam para gpt-5.6-sol (carro-chefe, mesmos US$ 5/US$ 30 do 5.5, porém mais forte), terra para código (nível 5.5 pela metade do preço), luna para explicações (US$ 1/US$ 6). A camada gpt-5.5-pro de US$ 30/US$ 180 é substituída por sol + esforço de raciocínio; um fallback de permissão (sol → terra → 5.5) cobre contas com restrição organizacional.

v2.26.1

  • Habilidades /test e /audit (19 habilidades no total) — /test gera testes executáveis via testgen; /audit executa uma revisão de segurança OWASP/CWE via security_review.
  • Instalação de habilidades no assistente — tachibot init agora oferece instalar habilidades do Claude Code com uma opção de pular por habilidade ([Enter]=todas · [s]=escolher quais pular · [n]=nenhuma). As habilidades são opcionais — postinstall não escreve mais em ~/.claude silenciosamente (npm run install-skills ainda instala todas de forma não interativa).
  • Correções — a extensão .mcpb de um clique agora aponta para um ponto de entrada válido (estava quebrada) e rastreia a versão do pacote; tachibot init sai limpo em stdin não interativo/CI em vez de travar.

v2.26.0

Pilha de prompts, modernizada

  • refine_prompt (nova ferramenta) — melhorador de prompt opcional em um modelo barato/rápido: consulta bruta → briefing orientado a objetivos + o que mudou + perguntas em aberto. Nunca dispara sozinho, nunca executa nada — você revisa e então usa o briefing. No Claude Code, /prompt refine apresenta as perguntas em aberto como escolhas clicáveis e mescla suas respostas em um briefing final.
  • Lista de técnicas curada — list_prompt_techniques agora usa como padrão as ~9 técnicas principais que ainda ajudam modelos de raciocínio de 2026 (contratos de saída como scot, pre_mortem, bdd_spec); all=true para as 31 completas.
  • technique="auto" — preview_prompt_technique recomenda a técnica certa para sua tarefa, com motivos. Pergunte a tachi "melhore meu prompt" para o menu baseado em sintomas.

Configuração, desmistificada

  • tachibot init (novo assistente CLI) — detecta suas chaves de API e clientes, imprime a configuração exata para Claude Code e Claude Desktop. Nunca escreve ou ecoa chaves.
  • Instalação de um clique no Claude Desktop — baixe o .mcpb do release mais recente e clique duas vezes. Sem edição de JSON.
  • doctor — mostra quais chaves estão definidas, quais ferramentas estão visíveis vs ocultas e por quê, e o que tentar primeiro.

Novas ferramentas e habilidades (66 ferramentas · 19 habilidades)

  • debug_triage — hipóteses de causa raiz ranqueadas com a verificação discriminatória mais barata para cada uma (Grok 4.3)
  • spec_writer — solicitação vaga → especificação revisável: histórias de usuário, Dado/Quando/Então, fora de escopo, perguntas em aberto (GPT-5.5)
  • diff_review / plan_critique / testgen / security_review — revisão de diff multi-modelo, red-team adversarial de planos, geração de testes, auditoria OWASP/CWE
  • Habilidades: /review, /redteam, /spec, /triage, /setup

Correções

  • Tela de orquestração focus: 37 linhas de scaffolding repetido → 10 linhas focadas
  • npm test sai com código 0 novamente (timers de corrida não cancelados vazavam após o teardown do Jest)
  • Raciocínio de alto esforço do GPT-5.5 não é mais cortado aos 3 minutos (timeout de 180s → 600s)

Habilidades (Claude Code)

O TachiBot vem com 19 comandos de barra para o Claude Code. Eles orquestram as ferramentas em fluxos de trabalho poderosos:

HabilidadeO que fazExemplo
/setupConfiguração guiada — executa o doctor, percorre chaves/perfis/setup
/specSolicitação → especificação revisável antes do planejamento/spec add OAuth somehow
/blueprintPlanejamento multi-modelo → etapas TDD em pequenas porções/blueprint add OAuth with refresh tokens
/judgeConselho multi-modelo — análise paralela com síntese/judge how to implement rate limiting
/thinkCadeia de raciocínio sequencial com qualquer modelo/think grok,gemini design a cache layer
/focusRaciocínio baseado em modos (debate, pesquisa, análise)/focus architecture-debate Redis vs Pg
/breakdownDecomposição estratégica com pré-mortem/breakdown refactor payment module
/decomposeDividir em subproblemas, aprofundar em cada um/decompose implement collaborative editor
/promptRecomendar a técnica de pensamento certa (37 disponíveis)/prompt why do users churn
/algoAnálise de algoritmos com 4 modelos especializados (DeepSeek líder)/algo optimize LRU cache O(1)
/lensAnálise de contexto longo na janela de 1M do Kimi/lens find inconsistencies in this spec
/reflectLoop de reflexão fundamentado — crítica vs evidência externa/reflect harden this auth middleware
/totÁrvore de Pensamento: ramificar → podar com júri → sintetizar/tot design a rate limiter
/reviewRevisão de diff multi-modelo — painel + veredito do juiz Gemini/review (ou cole um diff)
/redteamRed-team adversarial de planos — pré-mortem, riscos, edições de plano/redteam <paste plan>
/triageTriagem de bugs ranqueada por causa raiz/triage <paste stack trace>
/testGerar testes executáveis (casos de borda primeiro)/test src/auth.ts
/auditRevisão de segurança — descobertas OWASP/CWE + correções/audit the login handler
/tachiAjuda — ver habilidades disponíveis, ferramentas, status de chaves/tachi

As habilidades se adaptam automaticamente às suas chaves de API configuradas. Mesmo com apenas 1-2 provedores, todas as habilidades funcionam.

Começando? Digite /tachi para ver o que está disponível.


Principais Recursos

Inteligência Multi-Modelo

  • 65 Ferramentas de IA em 12 provedores — Perplexity, Grok, GPT-5, Gemini, Qwen, Kimi, MiniMax, DeepSeek, GLM (Zhipu), StepFun, ERNIE (Baidu), além de modelos locais gratuitos (Ollama / LM Studio / llama.cpp / vLLM)
  • Gemini 3.7 Flash (gemini-3.7-flash, GA em 13 de agosto de 2026) — camada Flash/busca; o padrão de raciocínio permanece gemini-3.1-pro-preview (o Google ainda não lançou um 3.5 Pro)
  • Conselho Multi-Modelo — planner_maker sintetiza planos de 5+ modelos em etapas TDD em pequenas porções
  • Roteamento Inteligente — Seleção automática de modelos para resultados ideais
  • Gateway OpenRouter — Chave de API única opcional para todos os provedores

Fluxos de Trabalho Avançados

  • Fluxos de Trabalho Baseados em YAML — Processos de IA em várias etapas com grafos de dependência
  • Engenharia de Prompts — 85 técnicas baseadas em pesquisa (incluindo SCoT, ReAct, Reflexion, Chain-of-Note, Spotlighting)
  • Pontos de Verificação de Validação — 50% / 80% / 100% com pontuação de qualidade automatizada
  • Execução Paralela — Execute vários modelos simultaneamente

Perfis de Ferramentas

PerfilFerramentasMelhor Para
Mínimo14Tarefas rápidas, orçamento de tokens baixo
Poder de Pesquisa38Investigação profunda, múltiplas fontes
Foco em Código43Desenvolvimento de software, tarefas SWE
Equilibrado56Uso geral, fluxos de trabalho mistos
Codificação Pesada59Máximo de ferramentas de código + fluxos agênticos
Completo (padrão)67Tudo habilitado

Experiência do Desenvolvedor

  • Claude Code — Suporte de primeira classe
  • Claude Desktop — Integração completa
  • Cursor — Funciona perfeitamente
  • TypeScript — Totalmente tipado, extensível

Início Rápido

Instalação

npm install -g tachibot-mcp

Assistente de configuração

npx -y -p tachibot-mcp tachibot init

Detecta suas chaves e clientes e imprime a configuração exata para Claude Code e Claude Desktop.

Claude Code (uma linha)

claude mcp add tachibot -- npx -y -p tachibot-mcp tachibot

Depois verifique com /mcp. Adicione chaves de API com --env, por exemplo, --env OPENROUTER_API_KEY=sk-or-xxx --env PERPLEXITY_API_KEY=pplx-xxx.

Configuração (Claude Desktop)

Um clique (mais fácil): baixe tachibot-mcp.mcpb do release mais recente e clique duas vezes — o Claude Desktop instala a extensão sem edição de JSON. Adicione suas chaves de API quando solicitado (ou depois pelas configurações da extensão).

Modo Gateway (Recomendado) — 2 chaves, todos os provedores:

{
  "mcpServers": {
    "tachibot": {
      "command": "tachibot",
      "env": {
        "OPENROUTER_API_KEY": "sk-or-xxx",
        "PERPLEXITY_API_KEY": "pplx-xxx",
        "USE_OPENROUTER_GATEWAY": "true"
      }
    }
  }
}

Modo Direto — Uma chave por provedor:

{
  "mcpServers": {
    "tachibot": {
      "command": "tachibot",
      "env": {
        "PERPLEXITY_API_KEY": "your-key",
        "GROK_API_KEY": "your-key",
        "OPENAI_API_KEY": "your-key",
        "GOOGLE_API_KEY": "your-key",
        "OPENROUTER_API_KEY": "your-key"
      }
    }
  }
}

Obtenha chaves: OpenRouter | Perplexity

Veja o Guia de Instalação para instruções detalhadas.


Ecossistema de Ferramentas (67 Ferramentas)

Pesquisa e Busca (6)

perplexity_ask · perplexity_reason · grok_search · grok_search_lite · openai_search · gemini_search

Raciocínio e Planejamento (15)

grok_reason · openai_reason · qwen_reason · qwq_reason · kimi_thinking · kimi_decompose · deepseek_reason · glm_reason · stepfun_reason · ernie_reason · planner_maker · planner_runner · list_plans · spec_writer · blog_writer

Inteligência de Código (11)

kimi_code · grok_code · grok_debug · qwen_coder · qwen_algo · qwen_competitive · deepseek_algo · minimax_code · minimax_agent · testgen · debug_triage

Análise e Julgamento (14)

gemini_analyze_text · gemini_analyze_code · gemini_judge · jury · diff_review · plan_critique · gemini_brainstorm · openai_brainstorm · openai_code_review · openai_explain · grok_brainstorm · grok_architect · security_review · kimi_long_context

Meta e Orquestração (6)

think · nextThought · focus · tachi · doctor · usage_stats

Fluxos de Trabalho (9)

workflow · workflow_start · continue_workflow · list_workflows · create_workflow · visualize_workflow · workflow_status · validate_workflow · validate_workflow_file

Engenharia de Prompts (4)

list_prompt_techniques · preview_prompt_technique · execute_prompt_technique · refine_prompt

Modelos Locais (1)

local_query — qualquer servidor local compatível com OpenAI (Ollama / LM Studio / llama.cpp / vLLM). Custo zero, offline, privado; também disponível como jurado do júri local (hermes é aceito como alias legado). Executa o que LOCAL_LLM_MODEL apontar — por exemplo, uma build Nous Hermes (ollama pull hermes3). Observe que o agente Hermes em si é agnóstico de modelo — ele roda em mais de 300 backends (GPT, Claude, Gemini, DeepSeek, ou Ollama/vLLM auto-hospedados) — então "Hermes" nunca foi uma garantia de pesos distintos.

Modos Avançados (bônus)

  • Challenger — Análise crítica com verificação de fatos multi-modelo
  • Verifier — Verificação de consenso multi-modelo
  • Scout — Coleta de inteligência híbrida

Exemplo de Uso

Planejamento Multi-Modelo

// Create a plan with multi-model council
planner_maker({ task: "Build a REST API with auth and tests", mode: "start" })
// → Grok searches → Qwen analyzes → Kimi decomposes → GPT critiques → Gemini synthesizes

// Execute with checkpoints
planner_runner({ plan: planContent, mode: "step", stepNum: 1 })
// → Automatic verification at 50%, 80% (kimi_decompose), and 100%

Decomposição de Tarefas

kimi_decompose({
  task: "Migrate monolith to microservices",
  depth: 3,
  outputFormat: "dependencies"
})
// → Structured subtasks with IDs, parallel flags, acceptance criteria

Revisão de Código

kimi_code({
  task: "review",
  code: "function processPayment(amount, card) { ... }",
  language: "typescript"
})
// → SWE-Bench 76.8% quality analysis

Raciocínio Profundo

focus({
  query: "Design a scalable event-driven architecture",
  mode: "deep-reasoning",
  models: ["grok", "gemini", "kimi"],
  rounds: 5
})

Documentação

Guias de Configuração


Contribuindo

Contribuições são bem-vindas! Veja CONTRIBUTING.md para diretrizes.


Gostou do que viu?

Dê uma estrela no GitHub — ajuda mais do que você imagina.

GitHub stars

Website · Docs · npm · Issues

AGPL-3.0 — veja LICENSE para detalhes.

Feito com carinho por @byPawel

Orquestração de IA multi-modelo, unificada.