시각-언어 사전 학습 프레임워크로, 고정된 이미지 인코더와 LLM을 연결합니다. 이미지 캡셔닝, 시각 질의 응답, 이미지-텍스트…가 필요할 때 사용하세요.
npx skills add https://github.com/firecrawl/ai-research-skills --skill blip-2-vision-language