1 مستودع
The design of visual prompts using bounding boxes and region tokens to extract object features.
Distinct from Prompt Engineering: Focuses on the spatial/visual prompt design (tokens/boxes) rather than general text-based prompt engineering.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Visual. Refine with filters or upvote what's useful.
VLM-R1 هو نموذج رؤية ولغوي استنتاجي وإطار عمل للذكاء الاصطناعي المتجسد مصمم لربط المدخلات المرئية والتعليمات اللغوية بنقاط طريق مادية وإجراءات روبوتية. يعمل كمحسن سياسات متعدد الوسائط وكاشف مفتوح المفردات قادر على تحديد موقع الكائنات بناءً على أوصاف لغوية طبيعية اعتباطية. يتميز النظام باستخدام استنتاج سلسلة الأفكار والتعلم التعزيزي لحل المهام المرئية والمكانية المعقدة. ويستخدم نظام ذاكرة دلالية للفيديو، والذي يوظف ذاكرة تخزين مؤقت مرئية للحفاظ على سجل للفيديو المباشر من أجل تفاعل منخفض التأخير واستنتاج زمني مستمر. يغطي إطار العمل مجموعة واسعة من القدرات، بما في ذلك رسم خرائط نقاط الطريق أحادية العين للملاحة الروبوتية، وتحديد موقع رموز المنطقة لتعريف الكائنات، والضبط الدقيق الخاضع للإشراف القائم على السياسات لاستقرار الاستنتاج متعدد الوسائط. كما يدعم الكشف مفتوح المفردات، وفهم تعبيرات الإشارة، واستخراج ميزات الكائنات الدقيقة من خلال استرجاع المطالبات المرئية. تم تنفيذ المشروع بلغة Python ويدعم الاستنتاج على أجهزة Ascend.
Uses bounding boxes and region tokens as visual prompts to extract detailed object features and perform spatial localization.