1 repository
Improving vision-language model accuracy using reinforcement learning and chain-of-thought processing.
Distinct from Reasoning Optimization: Specializes reasoning optimization specifically for multimodal (vision-language) contexts rather than general reasoning models.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multimodal. Refine with filters or upvote what's useful.
VLM-R1 este un model de raționament vizual-lingvistic și un framework de AI întrupat, conceput pentru a mapa intrările vizuale și instrucțiunile lingvistice în puncte de navigație fizice și acțiuni robotice. Acesta funcționează ca un optimizator de politici multimodale și un detector cu vocabular deschis, capabil să localizeze obiecte pe baza unor descrieri arbitrare în limbaj natural. Sistemul se distinge prin utilizarea raționamentului de tip chain-of-thought și a învățării prin consolidare (reinforcement learning) pentru a rezolva sarcini vizuale și spațiale complexe. Utilizează un sistem de memorie semantică video, care folosește un cache vizual pentru a menține un istoric al fluxului video live pentru interacțiune cu latență scăzută și raționament temporal continuu. Framework-ul acoperă o gamă largă de capabilități, inclusiv maparea punctelor de trecere monoculare pentru navigația robotică, localizarea prin token-uri de regiune pentru identificarea obiectelor și fine-tuning supervizat bazat pe politici pentru stabilitatea raționamentului multimodal. De asemenea, suportă detecția cu vocabular deschis, înțelegerea expresiilor de referință și extragerea caracteristicilor fine ale obiectelor prin regăsirea prompt-urilor vizuale. Proiectul este implementat în Python și suportă inferența pe hardware Ascend.
Improves the accuracy of vision language models using reinforcement learning and chain of thought processing.