1 مستودع
Improving vision-language model accuracy using reinforcement learning and chain-of-thought processing.
Distinct from Reasoning Optimization: Specializes reasoning optimization specifically for multimodal (vision-language) contexts rather than general reasoning models.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multimodal. Refine with filters or upvote what's useful.
VLM-R1 هو نموذج رؤية ولغوي استنتاجي وإطار عمل للذكاء الاصطناعي المتجسد مصمم لربط المدخلات المرئية والتعليمات اللغوية بنقاط طريق مادية وإجراءات روبوتية. يعمل كمحسن سياسات متعدد الوسائط وكاشف مفتوح المفردات قادر على تحديد موقع الكائنات بناءً على أوصاف لغوية طبيعية اعتباطية. يتميز النظام باستخدام استنتاج سلسلة الأفكار والتعلم التعزيزي لحل المهام المرئية والمكانية المعقدة. ويستخدم نظام ذاكرة دلالية للفيديو، والذي يوظف ذاكرة تخزين مؤقت مرئية للحفاظ على سجل للفيديو المباشر من أجل تفاعل منخفض التأخير واستنتاج زمني مستمر. يغطي إطار العمل مجموعة واسعة من القدرات، بما في ذلك رسم خرائط نقاط الطريق أحادية العين للملاحة الروبوتية، وتحديد موقع رموز المنطقة لتعريف الكائنات، والضبط الدقيق الخاضع للإشراف القائم على السياسات لاستقرار الاستنتاج متعدد الوسائط. كما يدعم الكشف مفتوح المفردات، وفهم تعبيرات الإشارة، واستخراج ميزات الكائنات الدقيقة من خلال استرجاع المطالبات المرئية. تم تنفيذ المشروع بلغة Python ويدعم الاستنتاج على أجهزة Ascend.
Improves the accuracy of vision language models using reinforcement learning and chain of thought processing.