凍結された画像エンコーダとLLMを橋渡しする視覚言語事前学習フレームワーク。画像キャプション、視覚的質問応答、画像テキスト…が必要な場合に使用します。
npx skills add https://github.com/firecrawl/ai-research-skills --skill blip-2-vision-language