1 Repo
The design of visual prompts using bounding boxes and region tokens to extract object features.
Distinct from Prompt Engineering: Focuses on the spatial/visual prompt design (tokens/boxes) rather than general text-based prompt engineering.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Visual. Refine with filters or upvote what's useful.
VLM-R1 ist ein Reasoning-Vision-Language-Modell und ein Framework für verkörperte KI (Embodied AI), das darauf ausgelegt ist, visuelle Eingaben und Sprachanweisungen in physische Navigations-Wegpunkte und Roboteraktionen umzusetzen. Es fungiert als multimodaler Policy-Optimierer und Open-Vocabulary-Detektor, der Objekte basierend auf beliebigen natürlichsprachlichen Beschreibungen lokalisieren kann. Das System zeichnet sich durch den Einsatz von Chain-of-Thought-Reasoning und Reinforcement Learning zur Lösung komplexer visueller und räumlicher Aufgaben aus. Es nutzt ein Video-Semantik-Gedächtnissystem, das einen visuellen Cache verwendet, um eine Historie des Live-Videos für latenzarme Interaktion und kontinuierliches zeitliches Schlussfolgern aufrechtzuerhalten. Das Framework deckt ein breites Spektrum an Funktionen ab, darunter monokulare Wegpunkt-Kartierung für die Roboternavigation, Region-Token-Lokalisierung für die Objektidentifikation und Policy-basiertes Supervised Fine-Tuning für die Stabilität multimodaler Schlussfolgerungen. Es unterstützt zudem Open-Vocabulary-Detektion, Referring-Expression-Comprehension und die Extraktion feingranularer Objektmerkmale durch visuelle Prompt-Retrieval. Das Projekt ist in Python implementiert und unterstützt die Inferenz auf Ascend-Hardware.
Uses bounding boxes and region tokens as visual prompts to extract detailed object features and perform spatial localization.