agent-browser

tarafından skills-101

inference.sh üzerinden AI ajanları için tarayıcı otomasyonu. Web sayfalarında gezinin, @e referanslarını kullanarak öğelerle etkileşime geçin, ekran görüntüsü alın, video kaydedin. Yetenekler: web kazıma, form doldurma, tıklama, yazma, sürükle-bırak, dosya yükleme, JavaScript çalıştırma. Şunlar için kullanın: web otomasyonu, veri çıkarma, test etme, ajan taraması, araştırma. Tetikleyiciler: tarayıcı, web otomasyonu, kazıma, gezinme, tıklama, form doldurma, ekran görüntüsü, web'de gezinme, playwright, başsız tarayıcı, web ajanı, internette sörf, video kaydetme

npx skills add https://github.com/skills-101/superpowers --skill agent-browser

Install the belt CLI skill: npx skills add belt-sh/cli

Agentic Browser

Browser automation for AI agents via inference.sh. Uses Playwright under the hood with a simple @e ref system for element interaction.

Agentic Browser

Quick Start

Requires inference.sh CLI (belt). Install instructions

belt login

# Open a page and get interactive elements
belt app run agent-browser --function open --input '{"url": "https://example.com"}' --session new

Core Workflow

Every browser automation follows this pattern:

  1. Open - Navigate to URL, get @e refs for elements
  2. Interact - Use refs to click, fill, drag, etc.
  3. Re-snapshot - After navigation/changes, get fresh refs
  4. Close - End session (returns video if recording)
# 1. Start session
RESULT=$(belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com/login"
}')
SESSION_ID=$(echo $RESULT | jq -r '.session_id')
# Elements: @e1 [input] "Email", @e2 [input] "Password", @e3 [button] "Sign In"

# 2. Fill and submit
belt app run agent-browser --function interact --session $SESSION_ID --input '{
  "action": "fill", "ref": "@e1", "text": "user@example.com"
}'
belt app run agent-browser --function interact --session $SESSION_ID --input '{
  "action": "fill", "ref": "@e2", "text": "password123"
}'
belt app run agent-browser --function interact --session $SESSION_ID --input '{
  "action": "click", "ref": "@e3"
}'

# 3. Re-snapshot after navigation
belt app run agent-browser --function snapshot --session $SESSION_ID --input '{}'

# 4. Close when done
belt app run agent-browser --function close --session $SESSION_ID --input '{}'

Functions

FunctionDescription
openNavigate to URL, configure browser (viewport, proxy, video recording)
snapshotRe-fetch page state with @e refs after DOM changes
interactPerform actions using @e refs (click, fill, drag, upload, etc.)
screenshotTake page screenshot (viewport or full page)
executeRun JavaScript code on the page
closeClose session, returns video if recording was enabled

Interact Actions

ActionDescriptionRequired Fields
clickClick elementref
dblclickDouble-click elementref
fillClear and type textref, text
typeType text (no clear)text
pressPress key (Enter, Tab, etc.)text
selectSelect dropdown optionref, text
hoverHover over elementref
checkCheck checkboxref
uncheckUncheck checkboxref
dragDrag and dropref, target_ref
uploadUpload file(s)ref, file_paths
scrollScroll pagedirection (up/down/left/right), scroll_amount
backGo back in history-
waitWait millisecondswait_ms
gotoNavigate to URLurl

Element Refs

Elements are returned with @e refs:

@e1 [a] "Home" href="/"
@e2 [input type="text"] placeholder="Search"
@e3 [button] "Submit"
@e4 [select] "Choose option"
@e5 [input type="checkbox"] name="agree"

Important: Refs are invalidated after navigation. Always re-snapshot after:

  • Clicking links/buttons that navigate
  • Form submissions
  • Dynamic content loading

Features

Video Recording

Record browser sessions for debugging or documentation:

# Start with recording enabled (optionally show cursor indicator)
SESSION=$(belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com",
  "record_video": true,
  "show_cursor": true
}' | jq -r '.session_id')

# ... perform actions ...

# Close to get the video file
belt app run agent-browser --function close --session $SESSION --input '{}'
# Returns: {"success": true, "video": <File>}

Cursor Indicator

Show a visible cursor in screenshots and video (useful for demos):

belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com",
  "show_cursor": true,
  "record_video": true
}'

The cursor appears as a red dot that follows mouse movements and shows click feedback.

Proxy Support

Route traffic through a proxy server:

belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com",
  "proxy_url": "http://proxy.example.com:8080",
  "proxy_username": "user",
  "proxy_password": "pass"
}'

File Upload

Upload files to file inputs:

belt app run agent-browser --function interact --session $SESSION --input '{
  "action": "upload",
  "ref": "@e5",
  "file_paths": ["/path/to/file.pdf"]
}'

Drag and Drop

Drag elements to targets:

belt app run agent-browser --function interact --session $SESSION --input '{
  "action": "drag",
  "ref": "@e1",
  "target_ref": "@e2"
}'

JavaScript Execution

Run custom JavaScript:

belt app run agent-browser --function execute --session $SESSION --input '{
  "code": "document.querySelectorAll(\"h2\").length"
}'
# Returns: {"result": "5", "screenshot": <File>}

Deep-Dive Documentation

ReferenceDescription
references/commands.mdFull function reference with all options
references/snapshot-refs.mdRef lifecycle, invalidation rules, troubleshooting
references/session-management.mdSession persistence, parallel sessions
references/authentication.mdLogin flows, OAuth, 2FA handling
references/video-recording.mdRecording workflows for debugging
references/proxy-support.mdProxy configuration, geo-testing

Ready-to-Use Templates

TemplateDescription
templates/form-automation.shForm filling with validation
templates/authenticated-session.shLogin once, reuse session
templates/capture-workflow.shContent extraction with screenshots

Examples

Form Submission

SESSION=$(belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com/contact"
}' | jq -r '.session_id')

# Get elements: @e1 [input] "Name", @e2 [input] "Email", @e3 [textarea], @e4 [button] "Send"

belt app run agent-browser --function interact --session $SESSION --input '{"action": "fill", "ref": "@e1", "text": "John Doe"}'
belt app run agent-browser --function interact --session $SESSION --input '{"action": "fill", "ref": "@e2", "text": "john@example.com"}'
belt app run agent-browser --function interact --session $SESSION --input '{"action": "fill", "ref": "@e3", "text": "Hello!"}'
belt app run agent-browser --function interact --session $SESSION --input '{"action": "click", "ref": "@e4"}'

belt app run agent-browser --function snapshot --session $SESSION --input '{}'
belt app run agent-browser --function close --session $SESSION --input '{}'

Search and Extract

SESSION=$(belt app run agent-browser --function open --session new --input '{
  "url": "https://google.com"
}' | jq -r '.session_id')

belt app run agent-browser --function interact --session $SESSION --input '{"action": "fill", "ref": "@e1", "text": "weather today"}'
belt app run agent-browser --function interact --session $SESSION --input '{"action": "press", "text": "Enter"}'
belt app run agent-browser --function interact --session $SESSION --input '{"action": "wait", "wait_ms": 2000}'

belt app run agent-browser --function snapshot --session $SESSION --input '{}'
belt app run agent-browser --function close --session $SESSION --input '{}'

Screenshot with Video

SESSION=$(belt app run agent-browser --function open --session new --input '{
  "url": "https://example.com",
  "record_video": true
}' | jq -r '.session_id')

# Take full page screenshot
belt app run agent-browser --function screenshot --session $SESSION --input '{
  "full_page": true
}'

# Close and get video
RESULT=$(belt app run agent-browser --function close --session $SESSION --input '{}')
echo $RESULT | jq '.video'

Sessions

Browser state persists within a session. Always:

  1. Start with --session new on first call
  2. Use returned session_id for subsequent calls
  3. Close session when done

Related Skills

# Web search (for research + browse)
npx skills add inference-sh/skills@web-search

# LLM models (analyze extracted content)
npx skills add inference-sh/skills@llm-models

Documentation

skills-101 tarafından daha fazla skill

ai-image-generation
skills-101
inference.sh CLI ile GPT-Image-2, FLUX, Gemini, Grok, Seedream, Reve ve 50+ model ile AI görselleri oluşturun. Modeller: GPT-Image-2, FLUX Dev LoRA, FLUX.2 Klein LoRA, Gemini 3 Pro Image, Grok Imagine, Seedream 4.5, Reve, ImagineArt. Yetenekler: metinden görsele, görselden görsele, inpainting, LoRA, görsel düzenleme, yükseltme, metin işleme. Kullanım alanları: AI sanatı, ürün mockupları, konsept sanatı, sosyal medya grafikleri, pazarlama görselleri, illüstrasyonlar. Tetikleyiciler: flux, görsel oluşturma, ai görsel, metinden...
ai-avatar-video
skills-101
inference.sh CLI aracılığıyla AI avatar ve konuşan kafa videoları oluşturun. Önerilen: P-Video-Avatar (en hızlı, en ucuz, yerleşik TTS). Ayrıca: OmniHuman, Fabric, PixVerse. Ses: Inworld TTS-2 (100+ dil, karakterler için duygu yönlendirme), ElevenLabs, Kokoro. Özellikler: ses odaklı avatarlar, metinden avatara, dudak senkronlu videolar, konuşan kafa üretimi, sanal sunucular, UGC içerik. Kullanım alanları: AI sunucular, açıklayıcı videolar, sanal fenomenler, dublaj, pazarlama videoları, UGC reklamları, oyun avatarları,...
agent-tools
skills-101
inference.sh CLI üzerinden AI uygulamaları çalıştırın - görüntü oluşturma, video oluşturma, LLM'ler, arama, 3D, Twitter otomasyonu. Modeller: FLUX, Veo, Gemini, Grok, Claude, Seedance, OmniHuman, Tavily, Exa, OpenRouter ve daha fazlası. AI uygulamaları çalıştırırken, görüntü/video oluştururken, LLM çağırırken, web araması yaparken veya Twitter'ı otomatikleştirirken kullanın. Tetikleyiciler: inference.sh, infsh, ai model, run ai, serverless ai, ai api, flux, veo, claude api, image generation, video generation, openrouter, tavily, exa search, twitter api, grok
python-executor
skills-101
Execute Python code in a safe sandboxed environment via [inference.sh](https://inference.sh). Pre-installed: NumPy, Pandas, Matplotlib, requests, BeautifulSoup, Selenium, Playwright, MoviePy, Pillow, OpenCV, trimesh, and 100+ more libraries. Use for: data processing, web scraping, image manipulation, video creation, 3D model processing, PDF generation, API calls, automation scripts. Triggers: python, execute code, run script, web scraping, data analysis, image processing, video editing, 3D...
remotion-render
skills-101
React/Remotion bileşen kodundan inference.sh üzerinden videolar oluşturun. TSX kodu verin, MP4 alın. Tüm Remotion API'lerini destekler: useCurrentFrame, useVideoConfig, spring, interpolate, AbsoluteFill, Sequence. Yapılandırılabilir çözünürlük, FPS, süre, codec. Şunlar için kullanın: programatik video üretimi, animasyonlu grafikler, hareket tasarımı, veri odaklı videolar, React animasyonlarını videoya dönüştürme. Tetikleyiciler: remotion, koddan video oluşturma, tsx'ten videoya, react video, programatik video, remotion render, koddan videoya, animasyonlu...
infsh-cli
skills-101
<text> inference.sh CLI üzerinden AI uygulamalarını çalıştırın - görüntü oluşturma, video üretimi, LLM'ler, arama, 3D, Twitter otomasyonu. Modeller: FLUX, Veo, Gemini, Grok, Claude, Seedance, OmniHuman, Tavily, Exa, OpenRouter ve daha fazlası. AI uygulamaları çalıştırırken, görüntü/video oluştururken, LLM çağırırken, web araması yaparken veya Twitter'ı otomatikleştirirken kullanın. Tetikleyiciler: inference.sh, infsh, ai model, run ai, serverless ai, ai api, flux, veo, claude api, image generation, video generation, openrouter, tavily, exa search, twitter api, grok </text>
landing-page-design
skills-101
Açılış sayfası dönüşüm optimizasyonu; yerleşim kuralları, hero bölümü tasarımı ve CTA psikolojisi ile birlikte. Katlama çizgisi üstü formülü, sosyal kanıt yerleşimi, mobil tasarım ve F-deseni okuma düzenini kapsar. Kullanım alanları: start-up açılış sayfaları, ürün sayfaları, SaaS pazarlaması, dönüşüm optimizasyonu. Tetikleyiciler: landing page, hero section, above the fold, conversion optimization, landing page design, cta button, hero image, landing page layout, saas landing page, product page design, conversion rate, landing page...
designmarketing
product-photography
skills-101
Yapay zeka ürün fotoğrafçılığı; stüdyo aydınlatması, yaşam tarzı çekimleri ve packshot konvansiyonlarıyla. Açıları, arka planları, gölge türlerini, hero shot'ları ve e-ticaret görsel gereksinimlerini kapsar. Şunlar için kullanılır: ürün fotoğrafları, e-ticaret görselleri, Amazon listeleme görselleri, packshot'lar, yaşam tarzı fotoğrafçılığı. Tetikleyiciler: ürün fotoğrafçılığı, ürün fotoğrafı, packshot, e-ticaret fotoğrafçılığı, ürün çekimi, ürün görseli, stüdyo fotoğrafçılığı, yaşam tarzı ürün, amazon ürün fotoğrafı, ürün listeleme görseli, hero shot, ürün mockup'ı,...