awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 repository-uri

Awesome GitHub RepositoriesVision-Language-Action Training

Training workflows for models that map visual and textual data to physical robotic actions.

Distinct from Vision-Language Training: Extends vision-language training to include the output of physical robotic actions

Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Vision-Language-Action Training. Refine with filters or upvote what's useful.

Awesome Vision-Language-Action Training GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • vector-wangel/xlerobotAvatar Vector-Wangel

    Vector-Wangel/XLeRobot

    5,256Vezi pe GitHub↗

    XLeRobot este o platformă de robotică AI întrupată și un ecosistem hardware conceput pentru dezvoltarea și desfășurarea roboților autonomi. Acesta integrează o platformă de robot mobil cu braț dublu cu un controler de robot bazat pe LLM, un mediu de simulare bazat pe fizică și o interfață de teleoperare pentru a traduce instrucțiunile în limbaj natural în acțiuni fizice. Proiectul pune accent pe fabricarea roboților cu cost redus folosind imprimarea 3D și componente accesibile pentru a crea o bază mobilă cu brațe și clești interschimbabili. Dispune de un flux de lucru de teleoperare specializat care permite controlul hardware de la distanță prin interfețe VR și controllere de joc pentru a înregistra date senzoriale sincronizate pentru învățarea prin imitație. Sistemul acoperă o gamă largă de capabilități, inclusiv antrenarea și desfășurarea modelelor vision-language-action, urmărirea vizuală în buclă închisă și simularea bazată pe motor fizic pentru verificarea politicilor AI. Oferă, de asemenea, instrumente pentru înregistrarea seturilor de date de antrenament și gestionarea controlului periferic în timp real pentru manipularea manuală.

    Trains vision-language-action models and transformers on recorded datasets to automate complex manipulation tasks.

    Python
    Vezi pe GitHub↗5,256
  • openvla/openvlaAvatar openvla

    openvla/openvla

    5,305Vezi pe GitHub↗

    OpenVLA is a vision-language-action model and framework designed for general-purpose robotic manipulation. It provides a robotic policy training framework and a control inference engine that map visual and textual inputs to robotic control actions, enabling zero-shot instruction following on hardware. The project includes a robotics dataset pipeline for standardizing diverse trajectory data and managing dataset mixtures. It supports large-scale model training through distributed GPU compute and sharded data parallelism, alongside parameter-efficient adaptation for fine-tuning models to new ta

    Implements a complete framework for building vision-language-action models from the ground up using distributed GPU workloads.

    Python
    Vezi pe GitHub↗5,305
  • pku-alignment/align-anythingAvatar PKU-Alignment

    PKU-Alignment/align-anything

    4,661Vezi pe GitHub↗

    Align-anything este un framework de aliniere pentru modele de limbaj mari (LLM) multimodale, conceput pentru a ajusta modelele pe text, imagini, video și audio. Funcționează ca un orchestrator de antrenare distribuită și un set de instrumente pentru implementarea învățării bazate pe preferințe, asigurându-se că comportamentul modelului corespunde intențiilor și valorilor umane. Framework-ul oferă pipeline-uri specializate pentru Supervised Fine-Tuning și Direct Preference Optimization. Include un wrapper pentru motorul de inferență de înaltă performanță pentru modelele de tip actor, reducând timpul de generare a secvențelor, și un mediu de antrenare dedicat pentru rafinarea modelelor vision-language-action utilizate în robotică. Sistemul gestionează procesarea datelor multimodale printr-o interfață în linie de comandă (CLI) și suportă implementarea automatizată a sarcinilor de antrenare pe clustere hardware cu resurse gestionate. Capabilitățile sale acoperă implementarea algoritmilor de aliniere, fine-tuning multimodal și optimizarea resurselor hardware.

    Provides training workflows for vision-language-action models used in physical robotics to ensure operational reliability.

    Python
    Vezi pe GitHub↗4,661
  • opendrivelab/agibot-worldAvatar OpenDriveLab

    OpenDriveLab/AgiBot-World

    2,786Vezi pe GitHub↗

    AgiBot-World is a suite of software pipelines and tools designed for robotic policy training, dataset standardization, embodiment transfer, and performance benchmarking. It provides infrastructure for developing bimanual manipulation policies using foundation models and human-reference trajectory data. The project features a robot embodiment transfer suite that adapts pre-trained models to different robot bodies without requiring new multi-embodiment training data. It also includes a specialized evaluation framework for validating vision-language-action models through open-loop testing and ph

    Provides a framework for validating vision-language-action models through open-loop testing and physical hardware replays.

    Pythonpretraining-for-roboticsrobotic-foundation-modelrobotic-manipulation
    Vezi pe GitHub↗2,786
  • rlinf/rlinfAvatar RLinf

    RLinf/RLinf

    2,502Vezi pe GitHub↗

    RLinf is a distributed reinforcement learning orchestrator and embodied AI training framework. It provides the infrastructure to train vision-language-action models and robotic policies using a combination of reinforcement learning and supervised fine-tuning. The system is designed for scaling workloads across GPU clusters, managing the placement of actors, rollout workers, and environment components. It features a specialized robotics data collection pipeline for gathering teleoperated demonstrations and simulation trajectories into standardized replay buffers, alongside a hardware interface

    Trains modular vision-language-action models to map visual and textual inputs to continuous robotic control commands.

    Pythonagentic-aiembodied-aireinforcement-learning
    Vezi pe GitHub↗2,502
  1. Home
  2. Artificial Intelligence & ML
  3. Model Training Frameworks
  4. Vision Model Training
  5. Vision-Language-Action Training

Explorează sub-etichetele

  • VLA Model ValidationSafety and performance testing for vision-language-action models via open-loop and hardware replays. **Distinct from Vision-Language-Action Training:** Focuses on the validation and safety testing phase of VLA models, rather than the training workflow.