caveman-manage

Inspecciona el ciclo de vida de experimentos con control de evaluación de Caveman Cloud y bloquea la ejecución no segura. Úsalo cuando el usuario pida iniciar, aprobar, cancelar, promover o revertir un experimento de Caveman, o pregunte qué acción respalda la evidencia de un experimento. Lee la evidencia primero; no ejecutes modificaciones del ciclo de vida hasta que se implementen las transiciones autoritativas del servidor y las puertas de evidencia.

npx skills add https://github.com/juliusbrussee/caveman --skill caveman-manage

Manage eval-gated experiments

Treat every lifecycle change as a production control action. Read current state and results, then report one supported recommendation or block. Current agent MCP is intentionally read-only: control-api does not yet enforce a complete lifecycle transition table and evidence gate atomically.

Non-negotiable gates

  1. A request to review, inspect, explain, or recommend authorizes reads only.
  2. Never approve an experiment whose results are pending, whose required guardrails are absent, or whose evidence reports a breach.
  3. Never convert experiment lift into verified_savings. Only active real traffic plus provider-causal, provider-complete ledger evidence can do that.
  4. Never supply an organization id. Project and tenant scope come from the logged-in Caveman identity and server RBAC.
  5. Never execute a lifecycle mutation, even after user approval. Exact <action>:<experiment_id> strings are agent-generatable and are not proof of human intent.
  6. Unknown states and server errors fail closed. Report exact cave_snake_code.

Step 1 — Load project and experiment

Prefer MCP:

caveman_context {}
caveman_experiment_get {"action":"get","experiment_id":"<id>"}
caveman_experiment_get {"action":"results","experiment_id":"<id>"}

Use {"action":"list"} when the user has not named an id.

CLI fallback:

caveman cloud experiments list
caveman cloud experiments show <id>
caveman cloud experiments results <id>

Stop if login, project, experiment, or results are unavailable.

Step 2 — Evaluate evidence

Report:

  • current lifecycle state and safety class;
  • control and candidate sample sizes;
  • quality or eval result;
  • latency, error, cost, retry, drop, and escalation guardrails when present;
  • evidence cost;
  • rollback or hold reason;
  • whether result is pending, failed, promotable, or active.

Absence is not a pass. If a required field is absent, state evidence incomplete and do not propose approval.

Step 3 — Propose one action

Allowed actions:

  • start — only from a startable draft or queued state with configured graders;
  • approve — only with complete passing evidence and a safety class the current role may approve;
  • cancel — stop a non-active experiment the user no longer wants;
  • rollback — revert an active or harmful change through the server's linked policy path. Current deployments may reject this honestly with cave_not_implemented; never describe that response as a rollback.

Show recommendation and id:

Proposed action: approve experiment 7f...
Reason: candidate passed quality and every configured guardrail.
Execution: blocked until server-authoritative lifecycle and evidence gates ship.

Do not treat earlier generic statements such as "manage it" or "do what is best" as mutation approval.

Step 4 — Block unsafe execution

Do not emit or run an executable lifecycle command. Explain that current server does not yet enforce every evidence/state transition atomically. CLI and MCP agent surfaces therefore expose experiment reads only.

Step 5 — Re-read after external operator action

If operator says they executed command, read detail and results again. Report server-observed post-state, audit or result response, and any policy-delivery status returned. Never infer success from operator intent alone.

Use this close:

Action: <action> <experiment-id>
Before: <state>
Server response: <status and cave_snake_code if any>
After: <re-read state>
Basis: experiment evidence only. Verified savings unchanged unless the signed
ledger independently records active, provider-causal real-traffic savings.

Más skills de juliusbrussee

caveman
juliusbrussee
Modo de comunicación ultracomprimido. Reduce el uso de tokens ~75% al hablar como cavernícola manteniendo precisión técnica total. Soporta niveles de intensidad: ligero, completo (predeterminado), ultra, wenyan-ligero, wenyan-completo, wenyan-ultra. Usar cuando el usuario diga "modo cavernícola", "habla como cavernícola", "usa cavernícola", "menos tokens", "sé breve", o invoque /caveman. También se activa automáticamente cuando se solicita eficiencia de tokens.
communicationproductivity
caveman-commit
juliusbrussee
Generador de mensajes de commit ultracomprimidos. Reduce el ruido en los mensajes de commit preservando la intención y el razonamiento. Formato Conventional Commits. Asunto ≤50 caracteres, cuerpo solo cuando el "por qué" no sea obvio. Se usa cuando el usuario dice "escribe un commit", "mensaje de commit", "genera un commit", "/commit", o invoca /caveman-commit. Se activa automáticamente al preparar cambios.
developmentcode-review
caveman-compress
juliusbrussee
Comprime archivos de memoria en lenguaje natural (CLAUDE.md, todos, preferencias) al formato caveman para ahorrar tokens de entrada. Preserva toda la sustancia técnica, código, URL y estructura. La versión comprimida sobrescribe el archivo original. Se guarda una copia de seguridad legible por humanos como FILE.original.md. Activación: /caveman-compress FILEPATH o "compress memory file
developmentdocument
caveman-help
juliusbrussee
Tarjeta de referencia rápida para todos los modos, habilidades y comandos de caveman. Visualización única, no un modo persistente. Activación: /caveman-help, "caveman help", "what caveman commands", "how do I use caveman".
developmentdocumentproductivity
caveman-review
juliusbrussee
Comentarios de revisión de código ultracomprimidos. Reduce el ruido de los comentarios en PR mientras conserva la señal procesable. Cada comentario es una línea: ubicación, problema, solución. Se usa cuando el usuario dice "revisa este PR", "revisión de código", "revisa el diff", "/review", o invoca /caveman-review. Se activa automáticamente al revisar pull requests.
developmentcode-review
caveman-stats
juliusbrussee
Muestra el uso real de tokens y el ahorro estimado para la sesión actual. Lee directamente del registro de sesión de Claude Code, sin estimaciones de IA. Se activa con /caveman-stats. La salida es inyectada por el hook mode-tracker; el modelo no calcula los números por sí mismo.
developmentdata-analysis
cavecrew
juliusbrussee
Decision guide for delegating to caveman-style subagents. Tells the main thread WHEN to spawn `cavecrew-investigator` (locate code), `cavecrew-builder` (1-2 file edit), or `cavecrew-reviewer` (diff review) instead of doing the work inline or using vanilla `Explore`. Subagent output is caveman-compressed so the tool-result injected back into main context is ~60% smaller — main context lasts longer across long sessions. Trigger: "delegate to subagent", "use cavecrew", "spawn...
developmentcode-reviewapi
caveman-explore
juliusbrussee
Explorador de repositorio de solo lectura. Úsalo PROACTIVAMENTE para exploración inicial, localización amplia entre archivos, o cuando una búsqueda directa ha fallado y necesitas encontrar dónde vive algo. Omítelo cuando el problema ya nombra el archivo o símbolo exacto, o cuando un turno anterior ya devolvió evidencia utilizable de file:line. Devuelve solo citas compactas de path:line; sus lecturas y greps nunca entran en la conversación principal.