5 repository-uri
Training workflows for models that map visual and textual data to physical robotic actions.
Distinct from Vision-Language Training: Extends vision-language training to include the output of physical robotic actions
Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Vision-Language-Action Training. Refine with filters or upvote what's useful.
XLeRobot este o platformă de robotică AI întrupată și un ecosistem hardware conceput pentru dezvoltarea și desfășurarea roboților autonomi. Acesta integrează o platformă de robot mobil cu braț dublu cu un controler de robot bazat pe LLM, un mediu de simulare bazat pe fizică și o interfață de teleoperare pentru a traduce instrucțiunile în limbaj natural în acțiuni fizice. Proiectul pune accent pe fabricarea roboților cu cost redus folosind imprimarea 3D și componente accesibile pentru a crea o bază mobilă cu brațe și clești interschimbabili. Dispune de un flux de lucru de teleoperare specializat care permite controlul hardware de la distanță prin interfețe VR și controllere de joc pentru a înregistra date senzoriale sincronizate pentru învățarea prin imitație. Sistemul acoperă o gamă largă de capabilități, inclusiv antrenarea și desfășurarea modelelor vision-language-action, urmărirea vizuală în buclă închisă și simularea bazată pe motor fizic pentru verificarea politicilor AI. Oferă, de asemenea, instrumente pentru înregistrarea seturilor de date de antrenament și gestionarea controlului periferic în timp real pentru manipularea manuală.
Trains vision-language-action models and transformers on recorded datasets to automate complex manipulation tasks.
OpenVLA is a vision-language-action model and framework designed for general-purpose robotic manipulation. It provides a robotic policy training framework and a control inference engine that map visual and textual inputs to robotic control actions, enabling zero-shot instruction following on hardware. The project includes a robotics dataset pipeline for standardizing diverse trajectory data and managing dataset mixtures. It supports large-scale model training through distributed GPU compute and sharded data parallelism, alongside parameter-efficient adaptation for fine-tuning models to new ta
Implements a complete framework for building vision-language-action models from the ground up using distributed GPU workloads.
Align-anything este un framework de aliniere pentru modele de limbaj mari (LLM) multimodale, conceput pentru a ajusta modelele pe text, imagini, video și audio. Funcționează ca un orchestrator de antrenare distribuită și un set de instrumente pentru implementarea învățării bazate pe preferințe, asigurându-se că comportamentul modelului corespunde intențiilor și valorilor umane. Framework-ul oferă pipeline-uri specializate pentru Supervised Fine-Tuning și Direct Preference Optimization. Include un wrapper pentru motorul de inferență de înaltă performanță pentru modelele de tip actor, reducând timpul de generare a secvențelor, și un mediu de antrenare dedicat pentru rafinarea modelelor vision-language-action utilizate în robotică. Sistemul gestionează procesarea datelor multimodale printr-o interfață în linie de comandă (CLI) și suportă implementarea automatizată a sarcinilor de antrenare pe clustere hardware cu resurse gestionate. Capabilitățile sale acoperă implementarea algoritmilor de aliniere, fine-tuning multimodal și optimizarea resurselor hardware.
Provides training workflows for vision-language-action models used in physical robotics to ensure operational reliability.
AgiBot-World is a suite of software pipelines and tools designed for robotic policy training, dataset standardization, embodiment transfer, and performance benchmarking. It provides infrastructure for developing bimanual manipulation policies using foundation models and human-reference trajectory data. The project features a robot embodiment transfer suite that adapts pre-trained models to different robot bodies without requiring new multi-embodiment training data. It also includes a specialized evaluation framework for validating vision-language-action models through open-loop testing and ph
Provides a framework for validating vision-language-action models through open-loop testing and physical hardware replays.
RLinf is a distributed reinforcement learning orchestrator and embodied AI training framework. It provides the infrastructure to train vision-language-action models and robotic policies using a combination of reinforcement learning and supervised fine-tuning. The system is designed for scaling workloads across GPU clusters, managing the placement of actors, rollout workers, and environment components. It features a specialized robotics data collection pipeline for gathering teleoperated demonstrations and simulation trajectories into standardized replay buffers, alongside a hardware interface
Trains modular vision-language-action models to map visual and textual inputs to continuous robotic control commands.