awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

1 repositorio

Awesome GitHub RepositoriesMultimodal

Improving vision-language model accuracy using reinforcement learning and chain-of-thought processing.

Distinct from Reasoning Optimization: Specializes reasoning optimization specifically for multimodal (vision-language) contexts rather than general reasoning models.

Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multimodal. Refine with filters or upvote what's useful.

Awesome Multimodal GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • om-ai-lab/vlm-r1Avatar de om-ai-lab

    om-ai-lab/VLM-R1

    5,991Ver en GitHub↗

    VLM-R1 es un modelo de razonamiento visión-lenguaje y framework de IA corpórea (embodied AI) diseñado para mapear entradas visuales e instrucciones de lenguaje en puntos de navegación físicos y acciones robóticas. Funciona como un optimizador de políticas multimodal y un detector de vocabulario abierto capaz de localizar objetos basados en descripciones arbitrarias en lenguaje natural. El sistema se distingue por el uso de razonamiento de cadena de pensamiento (chain-of-thought) y aprendizaje por refuerzo para resolver tareas visuales y espaciales complejas. Utiliza un sistema de memoria semántica de video, que emplea una caché visual para mantener un historial de video en vivo para interacciones de baja latencia y razonamiento temporal continuo. El framework cubre una amplia gama de capacidades, incluyendo el mapeo de puntos de navegación monoculares para robótica, la localización de tokens de región para identificación de objetos y el ajuste fino supervisado basado en políticas para la estabilidad del razonamiento multimodal. También admite detección de vocabulario abierto, comprensión de expresiones de referencia y la extracción de características de objetos detalladas mediante recuperación de prompts visuales. El proyecto está implementado en Python y admite inferencia en hardware Ascend.

    Improves the accuracy of vision language models using reinforcement learning and chain of thought processing.

    Python
    Ver en GitHub↗5,991
  1. Home
  2. Artificial Intelligence & ML
  3. Reasoning Models
  4. Reasoning Optimization
  5. Multimodal