awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 dépôts

Awesome GitHub RepositoriesProximal Policy Optimization Alignment

Uses a reward model to guide policy updates while clipping large changes to keep training stable.

Distinct from Training and Alignment: Distinct from Training and Alignment: focuses specifically on the PPO algorithm for alignment.

Explore 6 awesome GitHub repositories matching part of an awesome list · Proximal Policy Optimization Alignment. Refine with filters or upvote what's useful.

Awesome Proximal Policy Optimization Alignment GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • morvanzhou/reinforcement-learning-with-tensorflowAvatar de MorvanZhou

    MorvanZhou/Reinforcement-learning-with-tensorflow

    9,464Voir sur GitHub↗

    This project is an educational repository of reinforcement learning agents and tutorials implemented using TensorFlow. It provides a practical codebase for both model-free and model-based learning agents, designed to demonstrate how AI agents learn through trial and error. The collection features detailed implementations of various algorithmic approaches, including Deep Q-Networks and Policy Gradient methods. It specifically covers Actor-Critic architectures for continuous and discrete action spaces, alongside Proximal Policy Optimization and Deep Deterministic Policy Gradients. The framewor

    Implements the PPO algorithm using clipped surrogate objectives to ensure stable policy updates.

    Pythona3cactor-criticasynchronous-advantage-actor-critic
    Voir sur GitHub↗9,464
  • infrasys-ai/aiinfraAvatar de Infrasys-AI

    Infrasys-AI/AIInfra

    7,414Voir sur GitHub↗

    Applies PPO with reward models for stable policy updates during alignment.

    Jupyter Notebookaiinfraaisystem
    Voir sur GitHub↗7,414
  • meta-pytorch/torchtuneAvatar de meta-pytorch

    meta-pytorch/torchtune

    5,774Voir sur GitHub↗

    Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a config-driven system for instantiating components, orchestrating distributed training, and managing parameter-efficient fine-tuning with quantization support, all through YAML-based configurations and command-line overrides. The library distinguishes itself through its comprehensive post-training workflow orchestration, combining supervised fine-tuning, preference optimization (DPO, PPO, GRPO), knowledge distillation, and quantization-aware training in a single configurable pip

    Implements Proximal Policy Optimization for aligning model outputs using a reward model.

    Python
    Voir sur GitHub↗5,774
  • hiyouga/easyr1Avatar de hiyouga

    hiyouga/EasyR1

    5,034Voir sur GitHub↗

    EasyR1 est un système d'entraînement de modèles distribué et un framework d'apprentissage par renforcement pour les grands modèles de langage et les modèles vision-langage. Il fonctionne comme un entraîneur multimodal et une implémentation d'un pipeline Proximal Policy Optimization conçu pour affiner les capacités de raisonnement et de perception des modèles traitant à la fois du texte et des images. Le système se spécialise dans la distribution des charges de travail d'apprentissage par renforcement sur plusieurs nœuds de calcul pour gérer des besoins en mémoire élevés. Il optimise l'utilisation du matériel grâce à un entraînement sans padding et un fine-tuning permettant d'adapter de grands modèles aux unités de traitement graphique disponibles. Le framework couvre l'apprentissage par renforcement et l'orchestration de modèles de récompense, incluant les workflows d'apprentissage par renforcement à partir de feedback humain (RLHF). Sa surface technique inclut le parallélisme de données distribué, l'entraînement en précision hybride et des pipelines d'entrée multimodaux pour des données texte et image entrelacées. Le projet inclut des utilitaires pour la récupération d'état basée sur des checkpoints et s'intègre avec des outils de logging externes pour suivre la progression de l'entraînement et les métriques de performance.

    Provides a concrete implementation of Proximal Policy Optimization for refining generative multimodal models.

    Python
    Voir sur GitHub↗5,034
  • carperai/trlxAvatar de carperai

    carperai/trlx

    4,749Voir sur GitHub↗

    trlx est une bibliothèque d'apprentissage par renforcement et un framework d'entraînement conçu pour aligner les grands modèles de langage en utilisant le feedback humain. Il sert d'entraîneur distribué et d'orchestrateur de calcul pour scaler des modèles à haut nombre de paramètres sur plusieurs GPU et nœuds. Le projet fournit des outils pour l'apprentissage par renforcement à partir de feedback humain et l'alignement de modèles. Il implémente l'optimisation basée sur un modèle de récompense et l'optimisation de politique proximale (PPO) pour affiner le comportement du modèle en fonction de récompenses orientées vers des objectifs ou de jeux de données étiquetés par des humains. Le framework couvre des stratégies d'entraînement distribué, notamment le parallélisme de modèle, le sharding de paramètres et la synchronisation de gradients multi-nœuds. Il intègre également des contraintes comme la divergence KL pour gérer la dérive du modèle pendant le processus d'apprentissage par renforcement.

    Implements Proximal Policy Optimization with a clipped objective function to ensure stable reinforcement learning updates.

    Python
    Voir sur GitHub↗4,749
  • shibing624/medicalgptAvatar de shibing624

    shibing624/MedicalGPT

    4,774Voir sur GitHub↗

    MedicalGPT is an open-source framework for fine-tuning large language models, with a dedicated focus on adapting general models to the medical domain. It provides a complete pipeline that covers continued pretraining on domain-specific corpora, supervised instruction tuning, tokenizer vocabulary extension with medical terminology, and alignment to clinician preferences through direct preference optimization, reinforcement learning, or knowledge distillation. The framework also supports training models to invoke external tools and functions in multi-turn clinical conversations. The platform di

    Refines the language model policy using a learned reward model and the PPO algorithm to align outputs with human preferences within the fine‑tuning framework

    Pythonchatgptdpogpt
    Voir sur GitHub↗4,774
  1. Home
  2. Part of an Awesome List
  3. AI & Machine Learning
  4. Training and Alignment
  5. Proximal Policy Optimization Alignment

Explorer les sous-tags

  • PPO ImplementationsConcrete implementations of the Proximal Policy Optimization algorithm for aligning language model policies using a learned reward model. **Distinct from Proximal Policy Optimization Alignment:** Distinct from Proximal Policy Optimization Alignment: focuses on the specific implementation and integration of PPO within a fine-tuning framework, not the general alignment concept.
  • Proximal Policy Optimization Implementations1 sous-tagConcrete implementations of the PPO algorithm for aligning language model policies using a learned reward model. **Distinct from Proximal Policy Optimization Alignment:** Distinct from the broader Proximal Policy Optimization Alignment category: focuses on the specific implementation and integration of PPO within a fine-tuning framework, not the general alignment concept.