optimizing-attention-flash
bởi firecrawl
Tối ưu hóa attention của transformer với Flash Attention giúp tăng tốc 2-4 lần và giảm bộ nhớ 10-20 lần. Sử dụng khi huấn luyện/chạy transformer với các chuỗi dài…
npx skills add https://github.com/firecrawl/ai-research-skills --skill optimizing-attention-flash