This repo provides the source code & data of our paper: Improving Large Language Models via Fine-grained Reinforcement Learning with Minimum Editing Constraint (arXiv 2024)
Les fonctionnalités principales de rucaibox/rlmec sont : Feedback Alignment, Reinforcement Learning, RLHF Frameworks.
Les alternatives open-source à rucaibox/rlmec incluent : facebookresearch/motif — This repository contains PyTorch code for Motif, training AI agents on NetHack with reward functions derived from an… openai/following-instructions-human-feedback — [Paper link][LINKTOPAPER]. alibabaresearch/damo-convai — DAMO-ConvAI: The official repository which contains the codebase for Alibaba DAMO Conversational AI. anthropics/constitutionalharmlessnesspaper — This repository provides supplementary material for our paper Constitutional AI: Harmlessness from AI Feedback. ganjinzero/rrhf — Arxiv. openrlhf/openrlhf — OpenRLHF is a training framework and alignment library designed for reinforcement learning from human feedback across…
This repository provides supplementary material for our paper Constitutional AI: Harmlessness from AI Feedback.
This repository contains PyTorch code for Motif, training AI agents on NetHack with reward functions derived from an LLM's preferences.
DAMO-ConvAI: The official repository which contains the codebase for Alibaba DAMO Conversational AI.