awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

1 dépôt

Awesome GitHub RepositoriesMultimodal

Improving vision-language model accuracy using reinforcement learning and chain-of-thought processing.

Distinct from Reasoning Optimization: Specializes reasoning optimization specifically for multimodal (vision-language) contexts rather than general reasoning models.

Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multimodal. Refine with filters or upvote what's useful.

Awesome Multimodal GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • om-ai-lab/vlm-r1Avatar de om-ai-lab

    om-ai-lab/VLM-R1

    5,991Voir sur GitHub↗

    VLM-R1 est un modèle de raisonnement vision-langage et un framework d'IA incarnée conçu pour mapper des entrées visuelles et des instructions linguistiques en points de navigation physiques et en actions robotiques. Il fonctionne comme un optimiseur de politique multimodal et un détecteur à vocabulaire ouvert capable de localiser des objets basés sur des descriptions arbitraires en langage naturel. Le système se distingue par l'utilisation du raisonnement par chaîne de pensée (chain-of-thought) et de l'apprentissage par renforcement pour résoudre des tâches visuelles et spatiales complexes. Il utilise un système de mémoire sémantique vidéo, qui emploie un cache visuel pour maintenir un historique de la vidéo en direct pour une interaction à faible latence et un raisonnement temporel continu. Le framework couvre un large éventail de capacités, notamment le mappage de points de navigation monoculaires pour la robotique, la localisation par jetons de région pour l'identification d'objets, et le fine-tuning supervisé basé sur des politiques pour la stabilité du raisonnement multimodal. Il prend également en charge la détection à vocabulaire ouvert, la compréhension d'expressions référentielles et l'extraction de caractéristiques d'objets fines via la récupération par prompt visuel. Le projet est implémenté en Python et prend en charge l'inférence sur le matériel Ascend.

    Improves the accuracy of vision language models using reinforcement learning and chain of thought processing.

    Python
    Voir sur GitHub↗5,991
  1. Home
  2. Artificial Intelligence & ML
  3. Reasoning Models
  4. Reasoning Optimization
  5. Multimodal