awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

10 repositorios

Awesome GitHub RepositoriesReasoning Optimization

Enhances complex reasoning performance through two-stage reinforcement learning and value estimation.

Distinct from Reasoning Models: Focuses on the optimization methodology for reasoning, distinct from the models themselves.

Explore 10 awesome GitHub repositories matching artificial intelligence & ml · Reasoning Optimization. Refine with filters or upvote what's useful.

Awesome Reasoning Optimization GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • deepseek-ai/deepseek-r1Avatar de deepseek-ai

    deepseek-ai/DeepSeek-R1

    91,996Ver en GitHub↗

    DeepSeek-R1 is an open-weights large language model focused on advanced reasoning. It uses chain-of-thought processing and internal monologues to solve complex mathematical and logical problems by breaking tasks into sequential, verifiable thought processes. The model is developed using reinforcement learning to optimize reasoning patterns and verify logical steps. It employs a distillation process to transfer these high-performance logic capabilities from a large teacher model into smaller, computationally efficient versions. The training framework incorporates group relative policy optimiz

    Optimizes reasoning performance by rewarding correct final answers to generate internal chain-of-thought sequences.

    Ver en GitHub↗91,996
  • huggingface/trlAvatar de huggingface

    huggingface/trl

    18,653Ver en GitHub↗

    This library provides a comprehensive framework for fine-tuning, aligning, and distilling transformer-based language models. It serves as a toolkit for adapting models to specialized domains through supervised learning, while offering advanced methodologies to improve output quality and reasoning capabilities. The project distinguishes itself through specialized alignment and optimization techniques, including direct preference optimization and reinforcement learning, which allow models to be tuned against human preferences without complex reward modeling. It further supports training efficie

    Improves complex reasoning performance through two-stage reinforcement learning and offline value function estimation.

    Python
    Ver en GitHub↗18,653
  • infrasys-ai/aiinfraAvatar de Infrasys-AI

    Infrasys-AI/AIInfra

    7,414Ver en GitHub↗

    Generates multiple reasoning paths and selects the best using reward models and search.

    Jupyter Notebookaiinfraaisystem
    Ver en GitHub↗7,414
  • om-ai-lab/vlm-r1Avatar de om-ai-lab

    om-ai-lab/VLM-R1

    5,991Ver en GitHub↗

    VLM-R1 es un modelo de razonamiento visión-lenguaje y framework de IA corpórea (embodied AI) diseñado para mapear entradas visuales e instrucciones de lenguaje en puntos de navegación físicos y acciones robóticas. Funciona como un optimizador de políticas multimodal y un detector de vocabulario abierto capaz de localizar objetos basados en descripciones arbitrarias en lenguaje natural. El sistema se distingue por el uso de razonamiento de cadena de pensamiento (chain-of-thought) y aprendizaje por refuerzo para resolver tareas visuales y espaciales complejas. Utiliza un sistema de memoria semántica de video, que emplea una caché visual para mantener un historial de video en vivo para interacciones de baja latencia y razonamiento temporal continuo. El framework cubre una amplia gama de capacidades, incluyendo el mapeo de puntos de navegación monoculares para robótica, la localización de tokens de región para identificación de objetos y el ajuste fino supervisado basado en políticas para la estabilidad del razonamiento multimodal. También admite detección de vocabulario abierto, comprensión de expresiones de referencia y la extracción de características de objetos detalladas mediante recuperación de prompts visuales. El proyecto está implementado en Python y admite inferencia en hardware Ascend.

    Improves the accuracy of vision language models using reinforcement learning and chain of thought processing.

    Python
    Ver en GitHub↗5,991
  • kyegomez/tree-of-thoughtsAvatar de kyegomez

    kyegomez/tree-of-thoughts

    4,585Ver en GitHub↗

    Este proyecto es un framework de razonamiento y orquestador de agentes que implementa la metodología Tree of Thoughts para mejorar la salida lógica de los modelos de lenguaje de gran tamaño. Funciona como un solucionador de problemas basado en búsqueda, representando tareas complejas como un modelo de ramificación de espacio de estados donde los pensamientos discretos sirven como nodos y las transiciones lógicas sirven como aristas. El sistema coordina múltiples agentes de modelos para generar, evaluar y podar soluciones candidatas. Emplea heurísticas de búsqueda en profundidad y evaluación recursiva para explorar múltiples rutas de razonamiento, filtrando ramas de baja calidad para iterar hacia una solución óptima. El framework cubre capacidades de alto nivel en optimización del razonamiento y orquestación multi-agente. Se centra en desglosar tareas difíciles en pensamientos candidatos y refinar la salida de los modelos de lenguaje a través de ingeniería de prompts iterativa.

    Optimizes LLM reasoning by exploring multiple potential paths and filtering for the most accurate solutions.

    Pythonartificial-intelligencechatgptdeep-learning
    Ver en GitHub↗4,585
  • changyeyu/llm-rl-visualizedAvatar de changyeyu

    changyeyu/LLM-RL-Visualized

    4,529Ver en GitHub↗

    LLM-RL-Visualized es una biblioteca de referencia visual y colección de mapas de conocimiento diseñados para explicar algoritmos de Modelos de Lenguaje Extensos (LLM) y Aprendizaje por Refuerzo. Proporciona un sistema estructurado de diagramas conceptuales y taxonomías que cubren la intersección de la alineación de modelos de lenguaje y el aprendizaje por refuerzo. El proyecto se distingue por mapeos visuales detallados de flujos de trabajo complejos, como la coordinación de modelos de recompensa y la optimización de políticas en el aprendizaje por refuerzo a partir de retroalimentación humana (RLHF). Contrasta diferentes arquitecturas de optimización de preferencias, como RLHF y Direct Preference Optimization (DPO), y traza el linaje teórico de los algoritmos de aprendizaje por refuerzo desde Procesos de Decisión de Markov hasta frameworks Actor-Critic. La biblioteca cubre una amplia gama de capacidades, incluyendo optimización de inferencia de LLM, técnicas de ajuste fino eficiente en parámetros y las etapas secuenciales del pipeline de desarrollo de modelos. También proporciona diagramas estructurales para configuraciones de modelos, visualizaciones de estrategias de decodificación de tokens y flujos operativos para generación aumentada por recuperación (RAG) e integración de herramientas. El contenido adicional incluye ilustraciones de operaciones fundamentales de redes neuronales y mecanismos de razonamiento lógico como Monte Carlo Tree Search y destilación de conocimiento.

    Visualizes optimization techniques for reasoning paths, such as Chain-of-Thought and Monte Carlo Tree Search.

    Python
    Ver en GitHub↗4,529
  • starsfieldai/r1-vAvatar de StarsfieldAI

    StarsfieldAI/R1-V

    4,060Ver en GitHub↗

    R1-V es un conjunto de herramientas para el desarrollo de modelos multimodales, que proporciona un entorno de entrenamiento de bajo coste diseñado para optimizar los bucles de razonamiento y retroalimentación de modelos grandes de visión-lenguaje. Integra un framework de entrenamiento, pipelines de ajuste fino (fine-tuning) y herramientas de evaluación de rendimiento. El proyecto cuenta con un framework de aprendizaje por refuerzo que mejora el razonamiento visual y la generalización al recompensar las salidas correctas basadas en verificación visual. También incluye un pipeline de ajuste fino supervisado para personalizar modelos de visión-lenguaje en tareas específicas mediante datasets etiquetados y archivos de configuración. La suite abarca herramientas de evaluación de razonamiento visual y datasets específicos para evaluar el rendimiento del modelo en tareas de conteo y geometría.

    Optimizes visual reasoning performance using reinforcement learning based on visual verification feedback.

    Python
    Ver en GitHub↗4,060
  • hkust-nlp/simplerl-reasonAvatar de hkust-nlp

    hkust-nlp/simpleRL-reason

    3,867Ver en GitHub↗

    simpleRL-reason is a training framework designed to improve mathematical and logical deduction in large language models. It utilizes reinforcement learning and policy optimization to enhance the accuracy and transparency of step-by-step deduction chains. The project implements a pipeline that establishes baseline capabilities through supervised fine-tuning before applying reinforcement learning to maximize deductive accuracy. It features a reward modeling toolkit that calculates scalar feedback by comparing generated reasoning steps against verified mathematical ground truths. The framework

    Enhances complex reasoning performance through two-stage reinforcement learning and value estimation.

    Python
    Ver en GitHub↗3,867
  • openmanus/openmanus-rlAvatar de OpenManus

    OpenManus/OpenManus-RL

    3,916Ver en GitHub↗

    OpenManus-RL is a reinforcement learning framework and distributed training pipeline designed to train large language models as agents. It serves as an agentic reasoning optimizer and reward model trainer, providing the infrastructure to improve model decision-making through reward-based policy optimization. The project distinguishes itself through a distributed architecture that supports parameter sharding across multiple compute nodes and a coordinated rollout system for collecting interaction trajectories. It incorporates advanced reasoning strategies, such as Tree-of-Thoughts and Monte Ca

    Implements advanced reasoning optimization using strategies like Tree-of-Thoughts and Monte Carlo Tree Search to improve model decision-making.

    Python
    Ver en GitHub↗3,916
  • rasbt/reasoning-from-scratchAvatar de rasbt

    rasbt/reasoning-from-scratch

    3,060Ver en GitHub↗

    This project is a technical resource and implementation guide for building transformer-based language model architectures and training pipelines from scratch. It focuses on the design of models capable of natural language processing, including the integration of pretrained weights and the creation of foundational model frameworks. The project specifically emphasizes logical reasoning and mathematical problem solving. It provides a framework for optimizing these capabilities through reinforcement learning and the use of automated verifiers to evaluate and reward correct reasoning paths. The r

    Enhances complex reasoning performance through reinforcement learning and verifier-based optimization methodology.

    Jupyter Notebookaiartificial-intelligencedeep-learning
    Ver en GitHub↗3,060
  1. Home
  2. Artificial Intelligence & ML
  3. Reasoning Models
  4. Reasoning Optimization

Explorar subetiquetas

  • MultimodalImproving vision-language model accuracy using reinforcement learning and chain-of-thought processing. **Distinct from Reasoning Optimization:** Specializes reasoning optimization specifically for multimodal (vision-language) contexts rather than general reasoning models.