caveman-manage

Inspecione o ciclo de vida de experimentos com gate de avaliação do Caveman Cloud e bloqueie execuções inseguras. Use quando o usuário pedir para iniciar, aprovar, cancelar, promover ou reverter um experimento Caveman, ou perguntar qual ação as evidências de um experimento suportam. Leia as evidências primeiro; não execute mutações no ciclo de vida até que a transição autoritativa do servidor e os gates de evidência sejam implantados.

npx skills add https://github.com/juliusbrussee/caveman --skill caveman-manage

Manage eval-gated experiments

Treat every lifecycle change as a production control action. Read current state and results, then report one supported recommendation or block. Current agent MCP is intentionally read-only: control-api does not yet enforce a complete lifecycle transition table and evidence gate atomically.

Non-negotiable gates

  1. A request to review, inspect, explain, or recommend authorizes reads only.
  2. Never approve an experiment whose results are pending, whose required guardrails are absent, or whose evidence reports a breach.
  3. Never convert experiment lift into verified_savings. Only active real traffic plus provider-causal, provider-complete ledger evidence can do that.
  4. Never supply an organization id. Project and tenant scope come from the logged-in Caveman identity and server RBAC.
  5. Never execute a lifecycle mutation, even after user approval. Exact <action>:<experiment_id> strings are agent-generatable and are not proof of human intent.
  6. Unknown states and server errors fail closed. Report exact cave_snake_code.

Step 1 — Load project and experiment

Prefer MCP:

caveman_context {}
caveman_experiment_get {"action":"get","experiment_id":"<id>"}
caveman_experiment_get {"action":"results","experiment_id":"<id>"}

Use {"action":"list"} when the user has not named an id.

CLI fallback:

caveman cloud experiments list
caveman cloud experiments show <id>
caveman cloud experiments results <id>

Stop if login, project, experiment, or results are unavailable.

Step 2 — Evaluate evidence

Report:

  • current lifecycle state and safety class;
  • control and candidate sample sizes;
  • quality or eval result;
  • latency, error, cost, retry, drop, and escalation guardrails when present;
  • evidence cost;
  • rollback or hold reason;
  • whether result is pending, failed, promotable, or active.

Absence is not a pass. If a required field is absent, state evidence incomplete and do not propose approval.

Step 3 — Propose one action

Allowed actions:

  • start — only from a startable draft or queued state with configured graders;
  • approve — only with complete passing evidence and a safety class the current role may approve;
  • cancel — stop a non-active experiment the user no longer wants;
  • rollback — revert an active or harmful change through the server's linked policy path. Current deployments may reject this honestly with cave_not_implemented; never describe that response as a rollback.

Show recommendation and id:

Proposed action: approve experiment 7f...
Reason: candidate passed quality and every configured guardrail.
Execution: blocked until server-authoritative lifecycle and evidence gates ship.

Do not treat earlier generic statements such as "manage it" or "do what is best" as mutation approval.

Step 4 — Block unsafe execution

Do not emit or run an executable lifecycle command. Explain that current server does not yet enforce every evidence/state transition atomically. CLI and MCP agent surfaces therefore expose experiment reads only.

Step 5 — Re-read after external operator action

If operator says they executed command, read detail and results again. Report server-observed post-state, audit or result response, and any policy-delivery status returned. Never infer success from operator intent alone.

Use this close:

Action: <action> <experiment-id>
Before: <state>
Server response: <status and cave_snake_code if any>
After: <re-read state>
Basis: experiment evidence only. Verified savings unchanged unless the signed
ledger independently records active, provider-causal real-traffic savings.

Mais skills de juliusbrussee

caveman
juliusbrussee
Modo de comunicação ultracomprimido. Reduz uso de tokens em ~75% falando como um homem das cavernas, mantendo precisão técnica total. Suporta níveis de intensidade: lite, full (padrão), ultra, wenyan-lite, wenyan-full, wenyan-ultra. Use quando o usuário disser "modo homem das cavernas", "fale como homem das cavernas", "use homem das cavernas", "menos tokens", "seja breve" ou invocar /caveman. Também ativa automaticamente quando eficiência de tokens for solicitada.
communicationproductivity
caveman-commit
juliusbrussee
Gerador de mensagens de commit ultracompactas. Reduz ruído nas mensagens de commit mantendo intenção e raciocínio. Formato Conventional Commits. Assunto ≤50 caracteres, corpo apenas quando o "porquê" não for óbvio. Use quando o usuário disser "escreva um commit", "mensagem de commit", "gerar commit", "/commit" ou invocar /caveman-commit. Aciona automaticamente ao preparar alterações.
developmentcode-review
caveman-compress
juliusbrussee
Comprime arquivos de memória em linguagem natural (CLAUDE.md, todos, preferências) no formato caveman para economizar tokens de entrada. Preserva todo o conteúdo técnico, código, URLs e estrutura. A versão comprimida sobrescreve o arquivo original. Backup legível salvo como FILE.original.md. Gatilho: /caveman-compress FILEPATH ou "compress memory file
developmentdocument
caveman-help
juliusbrussee
Cartão de referência rápida para todos os modos, habilidades e comandos do caveman. Exibição única, não um modo persistente. Gatilho: /caveman-help, "caveman help", "what caveman commands", "how do I use caveman".
developmentdocumentproductivity
caveman-review
juliusbrussee
Comentários de revisão de código ultracompactos. Reduz o ruído do feedback de PR enquanto preserva o sinal acionável. Cada comentário é uma linha: localização, problema, correção. Use quando o usuário disser "revise este PR", "revisão de código", "revise o diff", "/review", ou invocar /caveman-review. Aciona automaticamente ao revisar pull requests.
developmentcode-review
caveman-stats
juliusbrussee
Exibe o uso real de tokens e a economia estimada para a sessão atual. Lê diretamente do log da sessão do Claude Code — sem estimativa de IA. Aciona com /caveman-stats. A saída é injetada pelo hook mode-tracker; o modelo em si não calcula os números.
developmentdata-analysis
cavecrew
juliusbrussee
Decision guide for delegating to caveman-style subagents. Tells the main thread WHEN to spawn `cavecrew-investigator` (locate code), `cavecrew-builder` (1-2 file edit), or `cavecrew-reviewer` (diff review) instead of doing the work inline or using vanilla `Explore`. Subagent output is caveman-compressed so the tool-result injected back into main context is ~60% smaller — main context lasts longer across long sessions. Trigger: "delegate to subagent", "use cavecrew", "spawn...
developmentcode-reviewapi
caveman-explore
juliusbrussee
Explorador de repositório somente leitura. Use PROATIVAMENTE para exploração de início frio, localização ampla entre arquivos, ou quando uma busca direta falhou e você precisa descobrir onde algo está localizado. Evite quando o problema já nomeia o arquivo ou símbolo exato, ou quando um turno anterior já retornou evidência utilizável de arquivo:linha. Retorna apenas citações compactas de caminho:linha; suas leituras e greps nunca entram na conversa principal.