blip-2-vision-language
von firecrawl
Bild-Text-Vorabtrainingsframework, das eingefrorene Bildencoder und große Sprachmodelle verbindet. Verwenden Sie dies, wenn Sie Bildunterschriften, visuelle Fragebeantwortung, Bild-Text…
npx skills add https://github.com/firecrawl/ai-research-skills --skill blip-2-vision-language