6 dépôts
Uses a reward model to guide policy updates while clipping large changes to keep training stable.
Distinct from Training and Alignment: Distinct from Training and Alignment: focuses specifically on the PPO algorithm for alignment.
Explore 6 awesome GitHub repositories matching part of an awesome list · Proximal Policy Optimization Alignment. Refine with filters or upvote what's useful.
This project is an educational repository of reinforcement learning agents and tutorials implemented using TensorFlow. It provides a practical codebase for both model-free and model-based learning agents, designed to demonstrate how AI agents learn through trial and error. The collection features detailed implementations of various algorithmic approaches, including Deep Q-Networks and Policy Gradient methods. It specifically covers Actor-Critic architectures for continuous and discrete action spaces, alongside Proximal Policy Optimization and Deep Deterministic Policy Gradients. The framewor
Implements the PPO algorithm using clipped surrogate objectives to ensure stable policy updates.
Applies PPO with reward models for stable policy updates during alignment.
Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a config-driven system for instantiating components, orchestrating distributed training, and managing parameter-efficient fine-tuning with quantization support, all through YAML-based configurations and command-line overrides. The library distinguishes itself through its comprehensive post-training workflow orchestration, combining supervised fine-tuning, preference optimization (DPO, PPO, GRPO), knowledge distillation, and quantization-aware training in a single configurable pip
Implements Proximal Policy Optimization for aligning model outputs using a reward model.
EasyR1 est un système d'entraînement de modèles distribué et un framework d'apprentissage par renforcement pour les grands modèles de langage et les modèles vision-langage. Il fonctionne comme un entraîneur multimodal et une implémentation d'un pipeline Proximal Policy Optimization conçu pour affiner les capacités de raisonnement et de perception des modèles traitant à la fois du texte et des images. Le système se spécialise dans la distribution des charges de travail d'apprentissage par renforcement sur plusieurs nœuds de calcul pour gérer des besoins en mémoire élevés. Il optimise l'utilisation du matériel grâce à un entraînement sans padding et un fine-tuning permettant d'adapter de grands modèles aux unités de traitement graphique disponibles. Le framework couvre l'apprentissage par renforcement et l'orchestration de modèles de récompense, incluant les workflows d'apprentissage par renforcement à partir de feedback humain (RLHF). Sa surface technique inclut le parallélisme de données distribué, l'entraînement en précision hybride et des pipelines d'entrée multimodaux pour des données texte et image entrelacées. Le projet inclut des utilitaires pour la récupération d'état basée sur des checkpoints et s'intègre avec des outils de logging externes pour suivre la progression de l'entraînement et les métriques de performance.
Provides a concrete implementation of Proximal Policy Optimization for refining generative multimodal models.
trlx est une bibliothèque d'apprentissage par renforcement et un framework d'entraînement conçu pour aligner les grands modèles de langage en utilisant le feedback humain. Il sert d'entraîneur distribué et d'orchestrateur de calcul pour scaler des modèles à haut nombre de paramètres sur plusieurs GPU et nœuds. Le projet fournit des outils pour l'apprentissage par renforcement à partir de feedback humain et l'alignement de modèles. Il implémente l'optimisation basée sur un modèle de récompense et l'optimisation de politique proximale (PPO) pour affiner le comportement du modèle en fonction de récompenses orientées vers des objectifs ou de jeux de données étiquetés par des humains. Le framework couvre des stratégies d'entraînement distribué, notamment le parallélisme de modèle, le sharding de paramètres et la synchronisation de gradients multi-nœuds. Il intègre également des contraintes comme la divergence KL pour gérer la dérive du modèle pendant le processus d'apprentissage par renforcement.
Implements Proximal Policy Optimization with a clipped objective function to ensure stable reinforcement learning updates.
MedicalGPT is an open-source framework for fine-tuning large language models, with a dedicated focus on adapting general models to the medical domain. It provides a complete pipeline that covers continued pretraining on domain-specific corpora, supervised instruction tuning, tokenizer vocabulary extension with medical terminology, and alignment to clinician preferences through direct preference optimization, reinforcement learning, or knowledge distillation. The framework also supports training models to invoke external tools and functions in multi-turn clinical conversations. The platform di
Refines the language model policy using a learned reward model and the PPO algorithm to align outputs with human preferences within the fine‑tuning framework