1 dépôt
Mathematical objectives used to align language model outputs with human preferences by optimizing the likelihood of preferred responses.
Distinct from Pruning Ratio Optimization: Distinct from Pruning Ratio Optimization: focuses on policy alignment via preference data rather than parameter reduction for resource efficiency.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Preference Alignment Objectives. Refine with filters or upvote what's useful.
Ce projet est un framework destiné à aligner les grands modèles de langage (LLM) sur les préférences humaines. Il fournit une bibliothèque permettant d'optimiser le comportement des modèles en mappant directement les données de préférence sur un objectif de politique, sans avoir recours à un modèle de récompense distinct. Le framework utilise un objectif mathématique en forme fermée pour ajuster les poids du modèle en maximisant la probabilité des réponses préférées par rapport aux autres. Il inclut une boîte à outils pour le fine-tuning supervisé, permettant aux utilisateurs d'établir une base de référence stable sur des données de démonstration avant d'appliquer des techniques d'optimisation basées sur les préférences. La bibliothèque prend en charge l'entraînement distribué, permettant de mettre à l'échelle l'alignement des modèles sur plusieurs accélérateurs matériels grâce au sharding de données et à des stratégies de parallélisation. Elle fournit également des utilitaires pour préparer des jeux de données de préférence personnalisés, en mappant les prompts et les paires de réponses pour structurer le feedback humain destiné au pipeline d'entraînement.
Adjusts model weights by maximizing the likelihood of preferred responses relative to dispreferred ones using a closed-form mathematical objective.