34 dépôts
Libraries and tools used to build, optimize, and train neural network architectures.
Distinguishing note: None of the candidates represent a general training framework; most are specific layer types or educational curricula.
Explore 34 awesome GitHub repositories matching artificial intelligence & ml · Neural Network Training Frameworks. Refine with filters or upvote what's useful.
micrograd is a scalar autograd engine and minimal neural network library. It implements a system for reverse-mode automatic differentiation over a dynamic graph of scalar operations to calculate gradients. The project includes a computation graph visualizer that generates representations of data flow and gradient propagation. It provides a set of tools for constructing and training multi-layer perceptrons using an API modeled after PyTorch. The library covers the fundamentals of backpropagation and neural network construction, specifically for binary classification tasks. This includes the i
Provides a minimal library for constructing and training multi-layer perceptrons using a PyTorch-like API.
ConvNetJS is a JavaScript deep learning library and neural network training engine designed for client-side machine learning. It functions as a framework for building, training, and running convolutional neural networks directly within a web browser without the need for a backend server. The library specializes in image recognition and pattern analysis using convolutional and pooling layers. It enables the creation of models for classification and regression tasks, as well as the development of reinforcement learning agents that optimize behavior through trial and error in simulated environme
Functions as a framework for building and optimizing connected layers and non-linear modules for classification and regression tasks.
This project is an educational repository of reinforcement learning agents and tutorials implemented using TensorFlow. It provides a practical codebase for both model-free and model-based learning agents, designed to demonstrate how AI agents learn through trial and error. The collection features detailed implementations of various algorithmic approaches, including Deep Q-Networks and Policy Gradient methods. It specifically covers Actor-Critic architectures for continuous and discrete action spaces, alongside Proximal Policy Optimization and Deep Deterministic Policy Gradients. The framewor
Stores state transitions and updates neural networks to optimize action selection through experience replay.
Torch7 is a scientific computing environment and tensor computation library used for deep learning research and numerical analysis. It functions as a Lua-based framework for training neural networks and learning agents, providing a toolkit for implementing architectures and training through reinforcement learning algorithms. The project is distinguished by its tight integration with C, utilizing a binding layer to map high-level scripting to low-level C structures for direct memory access. It supports hardware-accelerated computation by offloading linear algebra and convolution operations to
Ships a framework for implementing deep learning architectures and training agents via algorithms like DQN.
ANE is an open-source framework for training neural networks directly on Apple's Neural Engine hardware, bypassing Apple's public Core ML toolchain through reverse-engineered private APIs. It provides low-level control over the ANE, enabling developers to compile custom compute graphs into binary kernels, partition transformer model layers into hardware-compatible subgraphs, and share GPU-allocated memory with the Neural Engine via zero-copy IOSurface buffers. The framework distinguishes itself by offering direct access to hardware performance counters and power telemetry for benchmarking thr
An open-source framework for training neural networks directly on Apple's Neural Engine using reverse-engineered APIs.
TinyRecursiveModels is a recursive training framework for small neural networks designed to solve complex logical tasks. It functions as a parameter-efficient model trainer and a reasoning dataset generator, enabling the optimization of models that refine their answers through iterative reasoning steps. The framework differentiates itself by utilizing latent-state recursive refinement, where the model maintains and updates an internal hidden representation to improve prediction accuracy over multiple sequential steps. It also includes tools for generating structured training and evaluation da
Provides a framework for building and optimizing small-scale neural networks on complex logical tasks.
This repository is the official documentation for TensorFlow, a machine learning framework. It provides comprehensive guides, tutorials, and API references for building, training, and deploying machine learning models. The documentation covers the full lifecycle of machine learning projects, from constructing data pipelines and building neural networks with high-level APIs to customizing training loops and deploying trained models in production, on edge devices, or in browsers. The documentation includes step-by-step tutorials for a range of tasks, including reinforcement learning, ranking mo
Ships a complete neural network training framework with sequential and functional APIs.
Tensorpack est un framework de réseau de neurones TensorFlow de haut niveau et une bibliothèque de recherche conçue pour construire et entraîner des modèles de deep learning. Il fournit une collection d'architectures de réseaux de neurones reproductibles pour la vision par ordinateur, les tâches génératives, l'apprentissage par renforcement et le traitement du langage naturel. Le projet se distingue par un pipeline de données de deep learning spécialisé qui utilise du Python pur pour le chargement et le streaming de données en parallèle. Il inclut un orchestrateur d'entraînement multi-GPU pour distribuer les charges de travail via des stratégies de parallélisme de données et un toolkit d'interprétabilité dédié pour visualiser la saillance des modèles et les cartes d'activation. Le framework couvre un large éventail de capacités, incluant des pipelines de vision par ordinateur pour la détection d'objets et la segmentation sémantique, la modélisation de séquences pour la parole et le texte, et le développement d'agents d'apprentissage par renforcement. Il fournit également des outils d'optimisation de modèle pour la quantification des poids et l'entraînement en faible précision, ainsi que des utilitaires pour reproduire des articles de recherche académique et convertir des poids de modèles Caffe legacy.
Provides a high-level framework for building and training diverse deep learning architectures across vision, speech, and NLP.
Tensorpack est un framework d'entraînement TensorFlow haute performance et un toolkit de deep learning distribué. Il fournit une suite d'outils pour construire et entraîner des réseaux de neurones avec un accent sur la vitesse d'exécution et la flexibilité architecturale. Le projet sert de suite d'optimisation de réseaux de neurones, implémentant des modèles d'exécution à haute efficacité pour réduire la surcharge d'entraînement. Il fonctionne comme un pipeline de chargement de données parallèle, utilisant la parallélisation automatisée pour maximiser le débit lors du traitement de grands jeux de données. Le toolkit couvre l'entraînement distribué sur plusieurs GPU et clusters de calcul en utilisant des stratégies de parallélisme de données. Ses capacités incluent le traitement de jeux de données à grande échelle et l'optimisation des performances pour augmenter le débit d'entraînement.
Provides a high-performance framework for building and training flexible neural network architectures.
Skorch est un gestionnaire de workflow de deep learning et une interface de modèle basée sur les tenseurs. Il fournit une API cohérente pour l'entraînement et la prédiction avec des réseaux de neurones au sein de workflows de machine learning standard, agissant comme un optimiseur d'hyperparamètres pour trouver les configurations de réseau optimales. La bibliothèque se spécialise dans l'enveloppement des réseaux de neurones PyTorch dans une interface compatible avec scikit-learn. Cela permet aux modèles basés sur des tenseurs d'être utilisés au sein de pipelines de machine learning traditionnels et d'outils de recherche par grille, incluant le mapping de grilles de paramètres aux configurations de modèle. Le framework couvre la gestion du cycle de vie de l'entraînement via l'arrêt précoce, le checkpointing et les planificateurs de taux d'apprentissage. Il inclut également des capacités pour le contrôle des paramètres du modèle via le gel de couches, la traduction automatique entre tenseurs et tableaux NumPy, et le monitoring de la progression de l'entraînement en temps réel.
Controls the training lifecycle with early stopping, checkpointing, and learning rate schedulers to ensure convergence.
Swift-AI is an on-device library for training and running fully-connected neural networks on Apple platforms. It is designed to enable machine learning workflows directly on mobile hardware without requiring cloud connectivity, supporting both training and inference for tasks such as image classification and handwriting recognition. The library distinguishes itself through deep integration with Apple's ecosystem, leveraging Metal for GPU-accelerated matrix operations and using Swift's compiler infrastructure to parse a domain-specific language for neural network definitions. It implements rev
An on-device library for training and running fully-connected neural networks on Apple platforms.
Chainer is an open-source deep learning framework built around define-by-run automatic differentiation, where computation graphs are constructed dynamically during forward execution. This imperative approach allows networks to be built using standard Python control flow, with gradients computed automatically through reverse-mode differentiation on the dynamically recorded graph. The framework supports GPU acceleration through a NumPy-compatible array backend with CUDA and cuDNN support, and provides a pluggable device abstraction that lets users switch between CPU and GPU computation without c
Provides a framework for building and training neural networks with dynamic computation graphs.
Gorgonia is a Go library that provides an automatic differentiation engine and a computation graph framework for building and training neural networks. It functions as a CUDA-accelerated tensor library and a SIMD-optimized math library, enabling machine learning workflows entirely within the Go ecosystem. The library distinguishes itself through a dual-backend architecture that dispatches neural network operations to either a GPU or CPU depending on CUDA availability at runtime. It constructs differentiable directed acyclic graphs of tensor operations, supports reverse-mode automatic gradient
Builds and trains neural networks using automatic differentiation and graph computation for machine learning tasks.
Ce projet est un cursus éducatif en machine learning et une plateforme d'apprentissage délivrée via des Jupyter Notebooks interactifs. Il sert de guide complet pour maîtriser le toolkit de science des données Python, fournissant des tutoriels structurés pour le calcul numérique, la manipulation de données tabulaires et la visualisation statistique. Le cursus inclut des guides d'implémentation spécifiques pour Scikit-Learn et un cours pratique sur TensorFlow pour construire, entraîner et déployer des réseaux de neurones et des modèles de vision par ordinateur. Il couvre le processus de bout en bout de la construction de modèles prédictifs, de la formulation initiale du problème et de la catégorisation des tâches au déploiement des modèles via des interfaces web interactives. Le projet couvre une large surface de capacités incluant le calcul numérique avec des tableaux multidimensionnels, l'analyse exploratoire des données et les routines de prétraitement des données. Il fournit des flux de travail détaillés pour l'apprentissage supervisé et non supervisé, les pipelines de machine learning automatisés, l'optimisation des hyperparamètres et l'évaluation des modèles utilisant des métriques de classification et la validation croisée. Le contenu éducatif est organisé sous forme d'une série de notebooks qui entremêlent code Python et explications narratives pour documenter les flux de travail en science des données.
Provides instructions for fitting neural networks to datasets by configuring optimizers and loss functions.
Leela Zero est un moteur de Go par apprentissage profond et un système d'apprentissage par renforcement qui implémente l'approche AlphaGo Zero. Il utilise des réseaux convolutifs résiduels profonds et la recherche arborescente de Monte Carlo (MCTS) pour déterminer les coups optimaux et analyser le jeu de Go. Le projet fonctionne comme un outil d'entraînement de réseau neuronal qui génère des données par auto-jeu automatisé. Il utilise un pipeline d'apprentissage supervisé pour affiner les poids du réseau, permettant au système d'améliorer ses capacités de jeu sans dépendre de données fournies par l'homme ou de connaissances d'experts. Le moteur inclut une logique de score de jeu pour déterminer les gagnants en fonction des règles de territoire et de capture. Il fournit également des utilitaires pour le traitement des données de jeu, tels que la conversion de fichiers d'enregistrement de jeu en formats numériques compressés pour les frameworks d'apprentissage profond. Pour interagir avec des interfaces graphiques externes et des outils d'analyse, le moteur implémente le Go Text Protocol pour une communication standardisée.
Trains game-playing models using deep learning frameworks and exports the resulting network weights.
keras-rl est une bibliothèque d'apprentissage par renforcement qui permet l'entraînement d'agents neuronaux en utilisant Keras. Elle sert de framework pour implémenter des agents de deep reinforcement learning qui interagissent avec des environnements simulés pour découvrir des comportements optimaux et maximiser les récompenses cumulées. La bibliothèque fournit un système pour configurer, entraîner et gérer des agents de réseaux de neurones. Elle gère la boucle d'interaction entre les agents et les environnements, permettant aux modèles d'apprendre par expérience directe et optimisation basée sur le gradient. Le framework inclut des capacités de gestion des poids des modèles, permettant aux utilisateurs de sauvegarder et de restaurer les états appris des agents entraînés pour préserver la progression ou les déployer pour évaluation.
Manages the full lifecycle of neural agents, from configuration and training to weight saving.
Srez est un framework de deep learning pour la super-résolution d'images, conçu pour améliorer la résolution d'images basse définition en caractéristiques visuelles nettes et haute résolution. Il fonctionne comme un outil d'entraînement de réseaux de neurones qui utilise des réseaux antagonistes génératifs (GAN) pour synthétiser des détails d'image réalistes. Le projet inclut un visualiseur d'évolution de modèle qui génère des animations et des lots d'images pour suivre les améliorations visuelles pendant le processus d'entraînement. Il utilise une combinaison de fonctions de perte adverses et L1 pour optimiser les poids du modèle et prend en charge la création périodique de points de contrôle (checkpoints) pour la récupération et le déploiement. Le système couvre la construction de réseaux de neurones utilisant des couches feedforward, la normalisation par lots et des fonctions d'activation. Il fournit également des outils d'observabilité pour comparer la qualité de l'upscaling par rapport aux données de vérité terrain et surveiller la progression de l'entraînement via des séquences visuelles itératives.
Provides a system for optimizing model weights using adversarial loss and state checkpointing.
Ce projet est une ressource pédagogique sur le deep learning consistant en des implémentations de modèles PyTorch et des exemples de code. Il fournit des scripts Python fonctionnels et des notebooks pour construire, entraîner et optimiser des réseaux de neurones en utilisant le calcul basé sur les tenseurs. Le dépôt inclut des implémentations pour concevoir des couches de réseau et des fonctions de perte personnalisées, ainsi que des exemples de workflows d'apprentissage par transfert qui chargent des poids de modèles pré-entraînés pour accélérer le développement. La base de code couvre un large éventail de capacités en deep learning, incluant l'entraînement de réseaux de neurones, la conception de composants de modèles personnalisés et l'implémentation d'architectures multicouches pour reconnaître des motifs complexes dans des jeux de données.
Provides a framework for building and training multi-layer neural network architectures.
Caffe est un framework de deep learning haute performance et une bibliothèque de réseaux de neurones convolutifs conçue pour l'entraînement et le déploiement de réseaux de neurones. Il fonctionne comme un moteur de machine learning accéléré par GPU avec un cœur implémenté en C++ pour permettre des opérations sur tenseurs à haut débit. Le projet utilise un système de configuration déclaratif où les architectures de modèles et les hyperparamètres sont définis dans des fichiers texte externes, séparant la conception du réseau du code d'exécution. Il inclut un système de sérialisation de modèles pour exporter les poids entraînés et les topologies dans des fichiers binaires pour un déploiement efficace sur différents environnements matériels. Le framework couvre un large éventail de capacités, y compris la conception d'architectures de réseaux de neurones, l'entraînement de modèles supervisés avec optimisation basée sur le gradient et les flux de travail de classification d'images. Il fournit des outils pour le prétraitement des jeux de données, l'extraction de caractéristiques neuronales et le fine-tuning de modèles pré-entraînés. Le cœur C++ est accessible via une interface multi-langage avec des bindings officiels pour Python et MATLAB.
Provides a complete computational framework to build and train deep learning models on CPU and GPU hardware.
Ce projet est un framework d'apprentissage par renforcement et un moteur d'IA de jeu conçu pour entraîner des agents antagonistes dans des jeux au tour par tour à deux joueurs. Il implémente une boucle d'entraînement qui utilise le self-play et la recherche arborescente de Monte Carlo pour produire des réseaux de neurones capables de prédire la force du plateau et les probabilités de coup. Le système découple le moteur d'apprentissage par renforcement des règles de jeu spécifiques via une interface de logique de jeu abstraite, permettant la définition de règles de jeu personnalisées, de conditions de victoire et de représentations de plateau. Il prend en charge l'intégration avec divers frameworks d'apprentissage profond pour servir de fonctions de politique et de valeur et inclut une architecture de réseau de neurones à double tête pour prédire à la fois les résultats attendus et les distributions de coups légaux. Le framework couvre un large éventail de capacités, notamment l'encodage de l'état du jeu, la gestion des points de contrôle des modèles et le suivi des métriques d'entraînement. Il fournit des outils pour évaluer la performance des agents via des simulations de tournois, des interfaces humain-agent et un protocole textuel pour se connecter à des moteurs de jeu externes. Les modèles entraînés peuvent être exportés vers un format compatible JavaScript pour une utilisation dans des environnements de déploiement basés sur le web.
Implements a complete self-play reinforcement learning loop for training adversarial agents in turn-based games.