caveman-manage

Инспектируйте жизненный цикл экспериментов Caveman Cloud с eval-гейтами и блокируйте небезопасное выполнение. Используйте, когда пользователь просит запустить, одобрить, отменить, продвинуть или откатить эксперимент Caveman, или спрашивает, какое действие поддерживают доказательства эксперимента. Сначала читайте доказательства; не выполняйте мутации жизненного цикла, пока не будут выпущены серверные авторитетные переходы и гейты доказательств.

npx skills add https://github.com/juliusbrussee/caveman --skill caveman-manage

Manage eval-gated experiments

Treat every lifecycle change as a production control action. Read current state and results, then report one supported recommendation or block. Current agent MCP is intentionally read-only: control-api does not yet enforce a complete lifecycle transition table and evidence gate atomically.

Non-negotiable gates

  1. A request to review, inspect, explain, or recommend authorizes reads only.
  2. Never approve an experiment whose results are pending, whose required guardrails are absent, or whose evidence reports a breach.
  3. Never convert experiment lift into verified_savings. Only active real traffic plus provider-causal, provider-complete ledger evidence can do that.
  4. Never supply an organization id. Project and tenant scope come from the logged-in Caveman identity and server RBAC.
  5. Never execute a lifecycle mutation, even after user approval. Exact <action>:<experiment_id> strings are agent-generatable and are not proof of human intent.
  6. Unknown states and server errors fail closed. Report exact cave_snake_code.

Step 1 — Load project and experiment

Prefer MCP:

caveman_context {}
caveman_experiment_get {"action":"get","experiment_id":"<id>"}
caveman_experiment_get {"action":"results","experiment_id":"<id>"}

Use {"action":"list"} when the user has not named an id.

CLI fallback:

caveman cloud experiments list
caveman cloud experiments show <id>
caveman cloud experiments results <id>

Stop if login, project, experiment, or results are unavailable.

Step 2 — Evaluate evidence

Report:

  • current lifecycle state and safety class;
  • control and candidate sample sizes;
  • quality or eval result;
  • latency, error, cost, retry, drop, and escalation guardrails when present;
  • evidence cost;
  • rollback or hold reason;
  • whether result is pending, failed, promotable, or active.

Absence is not a pass. If a required field is absent, state evidence incomplete and do not propose approval.

Step 3 — Propose one action

Allowed actions:

  • start — only from a startable draft or queued state with configured graders;
  • approve — only with complete passing evidence and a safety class the current role may approve;
  • cancel — stop a non-active experiment the user no longer wants;
  • rollback — revert an active or harmful change through the server's linked policy path. Current deployments may reject this honestly with cave_not_implemented; never describe that response as a rollback.

Show recommendation and id:

Proposed action: approve experiment 7f...
Reason: candidate passed quality and every configured guardrail.
Execution: blocked until server-authoritative lifecycle and evidence gates ship.

Do not treat earlier generic statements such as "manage it" or "do what is best" as mutation approval.

Step 4 — Block unsafe execution

Do not emit or run an executable lifecycle command. Explain that current server does not yet enforce every evidence/state transition atomically. CLI and MCP agent surfaces therefore expose experiment reads only.

Step 5 — Re-read after external operator action

If operator says they executed command, read detail and results again. Report server-observed post-state, audit or result response, and any policy-delivery status returned. Never infer success from operator intent alone.

Use this close:

Action: <action> <experiment-id>
Before: <state>
Server response: <status and cave_snake_code if any>
After: <re-read state>
Basis: experiment evidence only. Verified savings unchanged unless the signed
ledger independently records active, provider-causal real-traffic savings.

Больше skills от juliusbrussee

caveman
juliusbrussee
Ультра-сжатый режим общения. Сокращает использование токенов примерно на 75% за счёт речи как пещерный человек, сохраняя полную техническую точность. Поддерживает уровни интенсивности: lite, full (по умолчанию), ultra, wenyan-lite, wenyan-full, wenyan-ultra. Используется, когда пользователь говорит «caveman mode», «talk like caveman», «use caveman», «less tokens», «be brief» или вызывает /caveman. Также автоматически срабатывает при запросе эффективности токенов.
communicationproductivity
caveman-commit
juliusbrussee
Ультра-сжатый генератор сообщений коммитов. Убирает шум из сообщений коммитов, сохраняя намерение и обоснование. Формат Conventional Commits. Тема ≤50 символов, тело только когда «почему» не очевидно. Используется, когда пользователь говорит «напиши коммит», «сообщение коммита», «сгенерируй коммит», «/commit» или вызывает /caveman-commit. Автоматически срабатывает при подготовке изменений.
developmentcode-review
caveman-compress
juliusbrussee
Сжимает файлы памяти на естественном языке (CLAUDE.md, todos, preferences) в формат caveman для экономии входных токенов. Сохраняет всё техническое содержание, код, URL и структуру. Сжатая версия перезаписывает исходный файл. Человекочитаемая резервная копия сохраняется как FILE.original.md. Триггер: /caveman-compress FILEPATH или "compress memory file
developmentdocument
caveman-help
juliusbrussee
Краткая справочная карточка по всем режимам, навыкам и командам пещерного человека. Одноразовое отображение, не постоянный режим. Триггер: /caveman-help, "caveman help", "what caveman commands", "how do I use caveman".
developmentdocumentproductivity
caveman-review
juliusbrussee
Ультра-сжатые комментарии к ревью кода. Убирает шум из фидбека по PR, сохраняя полезный сигнал. Каждый комментарий — одна строка: место, проблема, исправление. Используется, когда пользователь говорит «проверь этот PR», «ревью кода», «проверь diff», «/review» или вызывает /caveman-review. Автоматически срабатывает при ревью пул-реквестов.
developmentcode-review
caveman-stats
juliusbrussee
Показывает реальное использование токенов и примерную экономию для текущей сессии. Считывает данные напрямую из лога сессии Claude Code — без ИИ-оценок. Запускается по команде /caveman-stats. Вывод внедряется через хук mode-tracker; сама модель не вычисляет числа.
developmentdata-analysis
cavecrew
juliusbrussee
We need to translate the given text from English to Russian. The text is a description of a decision guide for delegating to subagents. We must preserve product names, protocol names, URLs, numbers, technical terms. The name "cavecrew" appears multiple times, but the instruction says "Do not include the name unless it appears in the source text." Since it appears in the source, we should keep it as is. Also preserve "cavecrew-investigator", "cavecrew-builder", "cavecrew-reviewer", "Explore" (capitalized), "~60%", "main context", "tool-result", "inline", "vanilla". The trigger phrases should be translated but the names inside them preserved? The trigger says "delegate to subagent", "use cavecrew", "spawn..." - we should translate the English words but keep "cavecrew" as is. Also "caveman-style" and "caveman-compressed" - "caveman" is part of the style name, likely should be kept as
developmentcode-reviewapi
caveman-explore
juliusbrussee
Эксплорер репозитория только для чтения. Используйте ПРОАКТИВНО для холодного старта исследования, широкой локализации в пределах нескольких файлов или когда прямой поиск не дал результатов и нужно найти, где находится нужный элемент. Пропустите его, если в задаче уже указан конкретный файл или символ, или если на предыдущем шаге уже были получены полезные ссылки вида файл:строка. Возвращает только компактные цитаты вида путь:строка; его чтения и поиски никогда не попадают в основной разговор.