blip-2-vision-language
par firecrawl
Cadre de pré-entraînement vision-langage reliant des encodeurs d'images figés et des LLM. À utiliser lorsque vous avez besoin de légendes d'images, de réponses à des questions visuelles, de texte-image…
npx skills add https://github.com/firecrawl/ai-research-skills --skill blip-2-vision-language