agent-browser

Автоматизация браузера для AI-агентов через inference.sh. Навигация по веб-страницам, взаимодействие с элементами с помощью @e refs, создание скриншотов, запись видео. Возможности: веб-скрапинг, заполнение форм, клики, ввод текста, перетаскивание, загрузка файлов, выполнение JavaScript. Используется для: веб-автоматизации, извлечения данных, тестирования, просмотра веб-страниц агентом, исследований. Триггеры: браузер, веб-автоматизация, скрапинг, навигация, клик, заполнение формы, скриншот, просмотр веб-страниц, playwright, headless браузер, веб-агент, серфинг в интернете, запись видео

npx skills add https://github.com/101-skills/skills --skill agent-browser

Install the belt CLI skill: npx skills add belt-sh/cli

Agentic Browser

Browser automation for AI agents via inference.sh. Uses Playwright under the hood with a simple @e ref system for element interaction.

Agentic Browser

Quick Start

Requires inference.sh CLI (belt). Install instructions

belt login

# Open a page and get interactive elements
belt app run agent-browser --function open --input '{"url": "https://example.com"}' --session new

Core Workflow

Every browser automation follows this pattern:

  1. Open - Navigate to URL, get @e refs for elements
  2. Interact - Use refs to click, fill, drag, etc.
  3. Re-snapshot - After navigation/changes, get fresh refs
  4. Close - End session (returns video if recording)
# 1. Start session
RESULT=$(belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com/login"
}')
SESSION_ID=$(echo $RESULT | jq -r '.session_id')
# Elements: @e1 [input] "Email", @e2 [input] "Password", @e3 [button] "Sign In"

# 2. Fill and submit
belt app run agent-browser --function interact --session $SESSION_ID --input '{
  "action": "fill", "ref": "@e1", "text": "user@example.com"
}'
belt app run agent-browser --function interact --session $SESSION_ID --input '{
  "action": "fill", "ref": "@e2", "text": "password123"
}'
belt app run agent-browser --function interact --session $SESSION_ID --input '{
  "action": "click", "ref": "@e3"
}'

# 3. Re-snapshot after navigation
belt app run agent-browser --function snapshot --session $SESSION_ID --input '{}'

# 4. Close when done
belt app run agent-browser --function close --session $SESSION_ID --input '{}'

Functions

FunctionDescription
openNavigate to URL, configure browser (viewport, proxy, video recording)
snapshotRe-fetch page state with @e refs after DOM changes
interactPerform actions using @e refs (click, fill, drag, upload, etc.)
screenshotTake page screenshot (viewport or full page)
executeRun JavaScript code on the page
closeClose session, returns video if recording was enabled

Interact Actions

ActionDescriptionRequired Fields
clickClick elementref
dblclickDouble-click elementref
fillClear and type textref, text
typeType text (no clear)text
pressPress key (Enter, Tab, etc.)text
selectSelect dropdown optionref, text
hoverHover over elementref
checkCheck checkboxref
uncheckUncheck checkboxref
dragDrag and dropref, target_ref
uploadUpload file(s)ref, file_paths
scrollScroll pagedirection (up/down/left/right), scroll_amount
backGo back in history-
waitWait millisecondswait_ms
gotoNavigate to URLurl

Element Refs

Elements are returned with @e refs:

@e1 [a] "Home" href="/"
@e2 [input type="text"] placeholder="Search"
@e3 [button] "Submit"
@e4 [select] "Choose option"
@e5 [input type="checkbox"] name="agree"

Important: Refs are invalidated after navigation. Always re-snapshot after:

  • Clicking links/buttons that navigate
  • Form submissions
  • Dynamic content loading

Features

Video Recording

Record browser sessions for debugging or documentation:

# Start with recording enabled (optionally show cursor indicator)
SESSION=$(belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com",
  "record_video": true,
  "show_cursor": true
}' | jq -r '.session_id')

# ... perform actions ...

# Close to get the video file
belt app run agent-browser --function close --session $SESSION --input '{}'
# Returns: {"success": true, "video": <File>}

Cursor Indicator

Show a visible cursor in screenshots and video (useful for demos):

belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com",
  "show_cursor": true,
  "record_video": true
}'

The cursor appears as a red dot that follows mouse movements and shows click feedback.

Proxy Support

Route traffic through a proxy server:

belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com",
  "proxy_url": "http://proxy.example.com:8080",
  "proxy_username": "user",
  "proxy_password": "pass"
}'

File Upload

Upload files to file inputs:

belt app run agent-browser --function interact --session $SESSION --input '{
  "action": "upload",
  "ref": "@e5",
  "file_paths": ["/path/to/file.pdf"]
}'

Drag and Drop

Drag elements to targets:

belt app run agent-browser --function interact --session $SESSION --input '{
  "action": "drag",
  "ref": "@e1",
  "target_ref": "@e2"
}'

JavaScript Execution

Run custom JavaScript:

belt app run agent-browser --function execute --session $SESSION --input '{
  "code": "document.querySelectorAll(\"h2\").length"
}'
# Returns: {"result": "5", "screenshot": <File>}

Deep-Dive Documentation

ReferenceDescription
references/commands.mdFull function reference with all options
references/snapshot-refs.mdRef lifecycle, invalidation rules, troubleshooting
references/session-management.mdSession persistence, parallel sessions
references/authentication.mdLogin flows, OAuth, 2FA handling
references/video-recording.mdRecording workflows for debugging
references/proxy-support.mdProxy configuration, geo-testing

Ready-to-Use Templates

TemplateDescription
templates/form-automation.shForm filling with validation
templates/authenticated-session.shLogin once, reuse session
templates/capture-workflow.shContent extraction with screenshots

Examples

Form Submission

SESSION=$(belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com/contact"
}' | jq -r '.session_id')

# Get elements: @e1 [input] "Name", @e2 [input] "Email", @e3 [textarea], @e4 [button] "Send"

belt app run agent-browser --function interact --session $SESSION --input '{"action": "fill", "ref": "@e1", "text": "John Doe"}'
belt app run agent-browser --function interact --session $SESSION --input '{"action": "fill", "ref": "@e2", "text": "john@example.com"}'
belt app run agent-browser --function interact --session $SESSION --input '{"action": "fill", "ref": "@e3", "text": "Hello!"}'
belt app run agent-browser --function interact --session $SESSION --input '{"action": "click", "ref": "@e4"}'

belt app run agent-browser --function snapshot --session $SESSION --input '{}'
belt app run agent-browser --function close --session $SESSION --input '{}'

Search and Extract

SESSION=$(belt app run agent-browser --function open --session new --input '{
  "url": "https://google.com"
}' | jq -r '.session_id')

belt app run agent-browser --function interact --session $SESSION --input '{"action": "fill", "ref": "@e1", "text": "weather today"}'
belt app run agent-browser --function interact --session $SESSION --input '{"action": "press", "text": "Enter"}'
belt app run agent-browser --function interact --session $SESSION --input '{"action": "wait", "wait_ms": 2000}'

belt app run agent-browser --function snapshot --session $SESSION --input '{}'
belt app run agent-browser --function close --session $SESSION --input '{}'

Screenshot with Video

SESSION=$(belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com",
  "record_video": true
}' | jq -r '.session_id')

# Take full page screenshot
belt app run agent-browser --function screenshot --session $SESSION --input '{
  "full_page": true
}'

# Close and get video
RESULT=$(belt app run agent-browser --function close --session $SESSION --input '{}')
echo $RESULT | jq '.video'

Sessions

Browser state persists within a session. Always:

  1. Start with --session new on first call
  2. Use returned session_id for subsequent calls
  3. Close session when done

Related Skills

# Web search (for research + browse)
npx skills add inference-sh/skills@web-search

# LLM models (analyze extracted content)
npx skills add inference-sh/skills@llm-models

Documentation

Больше skills от 101-skills

ai-avatar-video
101-skills
Создавайте AI-аватары и видео с говорящими головами через CLI inference.sh. Рекомендуется: P-Video-Avatar (самый быстрый, дешёвый, встроенный TTS). Также: OmniHuman, Fabric, PixVerse. Аудио: Inworld TTS-2 (100+ языков, управление эмоциями для персонажей), ElevenLabs, Kokoro. Возможности: аватары, управляемые аудио, текст-в-аватар, видео с синхронизацией губ, генерация говорящих голов, виртуальные ведущие, UGC-контент. Используйте для: AI-ведущие, обучающие видео, виртуальные инфлюенсеры, дубляж, маркетинговые видео, UGC-реклама, игровые аватары,...
creativevideomedia
ai-video-generation
101-skills
Генерируйте AI-видео с помощью Google Veo, Seedance 2.0, HappyHorse, Wan, Grok и 40+ моделей через CLI inference.sh. Модели: Veo 3.1, Veo 3, Seedance 2.0, HappyHorse 1.0, Wan 2.5, Grok Imagine Video, OmniHuman, Fabric, HunyuanVideo. Возможности: текст-в-видео, изображение-в-видео, референс-в-видео, редактирование видео, липсинк, анимация аватаров, апскейлинг видео, звук фоли. Используйте для: видео для соцсетей, маркетинговый контент, объясняющие видео, демонстрации продуктов, AI-аватары. Триггеры: генерация видео, ai video,...
creativevideomedia
ai-image-generation
101-skills
Генерируйте AI-изображения с помощью GPT-Image-2, FLUX, Gemini, Grok, Seedream, Reve и более 50 моделей через CLI inference.sh. Модели: GPT-Image-2, FLUX Dev LoRA, FLUX.2 Klein LoRA, Gemini 3 Pro Image, Grok Imagine, Seedream 4.5, Reve, ImagineArt. Возможности: текст-в-изображение, изображение-в-изображение, инпейнтинг, LoRA, редактирование изображений, апскейлинг, рендеринг текста. Используется для: AI-арт, макеты продуктов, концепт-арт, графика для соцсетей, маркетинговые визуалы, иллюстрации. Триггеры: flux, генерация изображений, ai image, текст в...
creativemediaimage
remotion-render
101-skills
Рендеринг видео из React/Remotion компонентного кода через inference.sh. Передайте TSX-код, получите MP4. Поддерживает все Remotion API: useCurrentFrame, useVideoConfig, spring, interpolate, AbsoluteFill, Sequence. Настраиваемое разрешение, FPS, длительность, кодек. Используйте для: программной генерации видео, анимированной графики, моушн-дизайна, видео на основе данных, преобразования React-анимаций в видео. Триггеры: remotion, render video from code, tsx to video, react video, programmatic video, remotion render, code to video, animated...
videocreativedevelopment
web-search
101-skills
Веб-поиск и извлечение контента с помощью Tavily и Exa через CLI inference.sh. Приложения: Tavily Search, Tavily Extract, Exa Search, Exa Answer, Exa Extract. Возможности: поиск на основе ИИ, извлечение контента, прямые ответы, исследования. Используется для: исследований, RAG-пайплайнов, проверки фактов, агрегации контента, агентов. Триггеры: веб-поиск, tavily, exa, search api, извлечение контента, исследования, интернет-поиск, ИИ-поиск, поисковый ассистент, веб-скрапинг, rag, альтернатива perplexity
researchweb-scrapingapi
agent-tools
101-skills
Запускайте AI-приложения через CLI inference.sh — генерация изображений, создание видео, LLM, поиск, 3D, автоматизация Twitter. Модели: FLUX, Veo, Gemini, Grok, Claude, Seedance, OmniHuman, Tavily, Exa, OpenRouter и многие другие. Используйте при запуске AI-приложений, генерации изображений/видео, вызове LLM, веб-поиске или автоматизации Twitter. Триггеры: inference.sh, infsh, ai model, run ai, serverless ai, ai api, flux, veo, claude api, image generation, video generation, openrouter, tavily, exa search, twitter api, grok
infsh-cli
101-skills
Запускайте AI-приложения через CLI inference.sh — генерация изображений, создание видео, LLM, поиск, 3D, автоматизация Twitter. Модели: FLUX, Veo, Gemini, Grok, Claude, Seedance, OmniHuman, Tavily, Exa, OpenRouter и многие другие. Используйте при запуске AI-приложений, генерации изображений/видео, вызове LLM, веб-поиске или автоматизации Twitter. Триггеры: inference.sh, infsh, ai model, run ai, serverless ai, ai api, flux, veo, claude api, image generation, video generation, openrouter, tavily, exa search, twitter api, grok
landing-page-design
101-skills
Оптимизация конверсии лендингов с правилами макета, дизайном hero-секции и психологией CTA. Охватывает формулу «выше сгиба», размещение социальных доказательств, мобильный дизайн и F-образный паттерн чтения. Используется для: лендингов стартапов, страниц продуктов, SaaS-маркетинга, оптимизации конверсии. Триггеры: лендинг, hero-секция, выше сгиба, оптимизация конверсии, дизайн лендинга, кнопка CTA, hero-изображение, макет лендинга, SaaS-лендинг, дизайн страницы продукта, коэффициент конверсии, лендинг...
designmarketingcreative