B
AI-проект

BLIP-2

BLIP-2 — vision-language research model от Salesforce Research. Архитектура использует Q-Former для связи замороженного vision encoder с большой языковой моделью и решает задачи captioning и visual question answering.

О проекте

BLIP-2 — vision-language research model от Salesforce Research. Архитектура использует Q-Former для связи замороженного vision encoder с большой языковой моделью и решает задачи captioning и visual question answering.

Теги

#vision-language #multimodal #VLM #Q-Former