34 repositorios
Libraries and tools used to build, optimize, and train neural network architectures.
Distinguishing note: None of the candidates represent a general training framework; most are specific layer types or educational curricula.
Explore 34 awesome GitHub repositories matching artificial intelligence & ml · Neural Network Training Frameworks. Refine with filters or upvote what's useful.
micrograd is a scalar autograd engine and minimal neural network library. It implements a system for reverse-mode automatic differentiation over a dynamic graph of scalar operations to calculate gradients. The project includes a computation graph visualizer that generates representations of data flow and gradient propagation. It provides a set of tools for constructing and training multi-layer perceptrons using an API modeled after PyTorch. The library covers the fundamentals of backpropagation and neural network construction, specifically for binary classification tasks. This includes the i
Provides a minimal library for constructing and training multi-layer perceptrons using a PyTorch-like API.
ConvNetJS is a JavaScript deep learning library and neural network training engine designed for client-side machine learning. It functions as a framework for building, training, and running convolutional neural networks directly within a web browser without the need for a backend server. The library specializes in image recognition and pattern analysis using convolutional and pooling layers. It enables the creation of models for classification and regression tasks, as well as the development of reinforcement learning agents that optimize behavior through trial and error in simulated environme
Functions as a framework for building and optimizing connected layers and non-linear modules for classification and regression tasks.
This project is an educational repository of reinforcement learning agents and tutorials implemented using TensorFlow. It provides a practical codebase for both model-free and model-based learning agents, designed to demonstrate how AI agents learn through trial and error. The collection features detailed implementations of various algorithmic approaches, including Deep Q-Networks and Policy Gradient methods. It specifically covers Actor-Critic architectures for continuous and discrete action spaces, alongside Proximal Policy Optimization and Deep Deterministic Policy Gradients. The framewor
Stores state transitions and updates neural networks to optimize action selection through experience replay.
Torch7 is a scientific computing environment and tensor computation library used for deep learning research and numerical analysis. It functions as a Lua-based framework for training neural networks and learning agents, providing a toolkit for implementing architectures and training through reinforcement learning algorithms. The project is distinguished by its tight integration with C, utilizing a binding layer to map high-level scripting to low-level C structures for direct memory access. It supports hardware-accelerated computation by offloading linear algebra and convolution operations to
Ships a framework for implementing deep learning architectures and training agents via algorithms like DQN.
ANE is an open-source framework for training neural networks directly on Apple's Neural Engine hardware, bypassing Apple's public Core ML toolchain through reverse-engineered private APIs. It provides low-level control over the ANE, enabling developers to compile custom compute graphs into binary kernels, partition transformer model layers into hardware-compatible subgraphs, and share GPU-allocated memory with the Neural Engine via zero-copy IOSurface buffers. The framework distinguishes itself by offering direct access to hardware performance counters and power telemetry for benchmarking thr
An open-source framework for training neural networks directly on Apple's Neural Engine using reverse-engineered APIs.
TinyRecursiveModels is a recursive training framework for small neural networks designed to solve complex logical tasks. It functions as a parameter-efficient model trainer and a reasoning dataset generator, enabling the optimization of models that refine their answers through iterative reasoning steps. The framework differentiates itself by utilizing latent-state recursive refinement, where the model maintains and updates an internal hidden representation to improve prediction accuracy over multiple sequential steps. It also includes tools for generating structured training and evaluation da
Provides a framework for building and optimizing small-scale neural networks on complex logical tasks.
This repository is the official documentation for TensorFlow, a machine learning framework. It provides comprehensive guides, tutorials, and API references for building, training, and deploying machine learning models. The documentation covers the full lifecycle of machine learning projects, from constructing data pipelines and building neural networks with high-level APIs to customizing training loops and deploying trained models in production, on edge devices, or in browsers. The documentation includes step-by-step tutorials for a range of tasks, including reinforcement learning, ranking mo
Ships a complete neural network training framework with sequential and functional APIs.
Tensorpack es un framework de redes neuronales de alto nivel para TensorFlow y una librería de investigación diseñada para construir y entrenar modelos de deep learning. Proporciona una colección de arquitecturas de redes neuronales reproducibles para visión artificial, tareas generativas, aprendizaje por refuerzo y procesamiento de lenguaje natural. El proyecto se distingue por un pipeline de datos de deep learning especializado que utiliza Python puro para la carga y transmisión de datos en paralelo. Incluye un orquestador de entrenamiento multi-GPU para distribuir cargas de trabajo mediante estrategias de paralelismo de datos y un toolkit de interpretabilidad dedicado para visualizar la relevancia del modelo y los mapas de activación. El framework cubre una amplia gama de capacidades, incluyendo pipelines de visión artificial para detección de objetos y segmentación semántica, modelado de secuencias para voz y texto, y desarrollo de agentes de aprendizaje por refuerzo. También proporciona herramientas de optimización de modelos para cuantización de pesos y entrenamiento de baja precisión, junto con utilidades para reproducir artículos de investigación académica y convertir pesos de modelos Caffe heredados.
Provides a high-level framework for building and training diverse deep learning architectures across vision, speech, and NLP.
Tensorpack es un framework de entrenamiento de TensorFlow de alto rendimiento y un toolkit de deep learning distribuido. Proporciona un conjunto de herramientas para construir y entrenar redes neuronales con un enfoque en la velocidad de ejecución y la flexibilidad arquitectónica. El proyecto sirve como una suite de optimización de redes neuronales, implementando patrones de ejecución de alta eficiencia para reducir la sobrecarga de entrenamiento. Funciona como un pipeline de carga de datos en paralelo, utilizando la paralelización automatizada para maximizar el rendimiento al procesar grandes conjuntos de datos. El toolkit cubre el entrenamiento distribuido a través de múltiples GPUs y clusters de cómputo utilizando estrategias de paralelismo de datos. Sus capacidades incluyen el procesamiento de conjuntos de datos a gran escala y la optimización del rendimiento para aumentar el rendimiento del entrenamiento.
Provides a high-performance framework for building and training flexible neural network architectures.
Skorch es un gestor de flujo de trabajo de aprendizaje profundo e interfaz de modelos basada en tensores. Proporciona una API consistente para entrenar y predecir con redes neuronales dentro de flujos de trabajo de machine learning estándar, actuando como un optimizador de hiperparámetros para encontrar configuraciones de red óptimas. La biblioteca se especializa en envolver redes neuronales de PyTorch en una interfaz compatible con scikit-learn. Esto permite que los modelos basados en tensores se utilicen dentro de pipelines de machine learning tradicionales y herramientas de búsqueda de rejilla (grid search), incluyendo el mapeo de rejillas de parámetros a configuraciones de modelos. El framework cubre la gestión del ciclo de vida del entrenamiento mediante parada temprana (early stopping), puntos de control (checkpointing) y programadores de tasa de aprendizaje. También incluye capacidades para el control de parámetros del modelo mediante congelación de capas, traducción automática entre tensores y arrays de NumPy, y monitoreo del progreso del entrenamiento en tiempo real.
Controls the training lifecycle with early stopping, checkpointing, and learning rate schedulers to ensure convergence.
Swift-AI is an on-device library for training and running fully-connected neural networks on Apple platforms. It is designed to enable machine learning workflows directly on mobile hardware without requiring cloud connectivity, supporting both training and inference for tasks such as image classification and handwriting recognition. The library distinguishes itself through deep integration with Apple's ecosystem, leveraging Metal for GPU-accelerated matrix operations and using Swift's compiler infrastructure to parse a domain-specific language for neural network definitions. It implements rev
An on-device library for training and running fully-connected neural networks on Apple platforms.
Chainer is an open-source deep learning framework built around define-by-run automatic differentiation, where computation graphs are constructed dynamically during forward execution. This imperative approach allows networks to be built using standard Python control flow, with gradients computed automatically through reverse-mode differentiation on the dynamically recorded graph. The framework supports GPU acceleration through a NumPy-compatible array backend with CUDA and cuDNN support, and provides a pluggable device abstraction that lets users switch between CPU and GPU computation without c
Provides a framework for building and training neural networks with dynamic computation graphs.
Gorgonia is a Go library that provides an automatic differentiation engine and a computation graph framework for building and training neural networks. It functions as a CUDA-accelerated tensor library and a SIMD-optimized math library, enabling machine learning workflows entirely within the Go ecosystem. The library distinguishes itself through a dual-backend architecture that dispatches neural network operations to either a GPU or CPU depending on CUDA availability at runtime. It constructs differentiable directed acyclic graphs of tensor operations, supports reverse-mode automatic gradient
Builds and trains neural networks using automatic differentiation and graph computation for machine learning tasks.
Este proyecto es un currículo educativo de machine learning y plataforma de aprendizaje entregada a través de Jupyter Notebooks interactivos. Sirve como una guía completa para dominar el toolkit de ciencia de datos de Python, proporcionando tutoriales estructurados para computación numérica, manipulación de datos tabulares y visualización estadística. El currículo incluye guías de implementación específicas para Scikit-Learn y un curso práctico sobre TensorFlow para construir, entrenar y desplegar redes neuronales y modelos de visión artificial. Cubre el proceso de extremo a extremo de construcción de modelos predictivos, desde la formulación inicial del problema y categorización de tareas hasta el despliegue de modelos mediante interfaces web interactivas. El proyecto cubre una amplia superficie de capacidades incluyendo computación numérica con arrays multidimensionales, análisis exploratorio de datos y rutinas de preprocesamiento de datos. Proporciona flujos de trabajo detallados para aprendizaje supervisado y no supervisado, pipelines de machine learning automatizado, optimización de hiperparámetros y evaluación de modelos utilizando métricas de clasificación y validación cruzada. El contenido educativo está organizado como una serie de notebooks que intercalan código Python con explicaciones narrativas para documentar flujos de trabajo de ciencia de datos.
Provides instructions for fitting neural networks to datasets by configuring optimizers and loss functions.
Leela Zero es un motor de Go de aprendizaje profundo y sistema de aprendizaje por refuerzo que implementa el enfoque de AlphaGo Zero. Utiliza redes convolucionales residuales profundas y búsqueda de árbol de Monte Carlo (MCTS) para determinar los movimientos óptimos y analizar el juego de Go. El proyecto funciona como una herramienta de entrenamiento de redes neuronales que genera datos a través de auto-juego automatizado. Utiliza una tubería de aprendizaje supervisado para refinar los pesos de la red, permitiendo que el sistema mejore sus capacidades de juego sin depender de datos proporcionados por humanos o conocimiento experto. El motor incluye lógica de puntuación de juegos para determinar ganadores basados en territorio y reglas de captura. También proporciona utilidades para el procesamiento de datos de juegos, como la conversión de archivos de registro de juegos en formatos numéricos comprimidos para frameworks de aprendizaje profundo. Para interactuar con interfaces gráficas externas y herramientas de análisis, el motor implementa el Protocolo de Texto de Go (GTP) para una comunicación estandarizada.
Trains game-playing models using deep learning frameworks and exports the resulting network weights.
keras-rl is a reinforcement learning library that enables the training of neural agents using Keras. It serves as a framework for implementing deep reinforcement learning agents that interact with simulated environments to discover optimal behaviors and maximize cumulative rewards. The library provides a system for configuring, training, and managing neural network agents. It handles the interaction loop between agents and environments, allowing models to learn through direct experience and gradient-based optimization. The framework includes capabilities for model weight management, allowing
Manages the full lifecycle of neural agents, from configuration and training to weight saving.
Srez es un framework de aprendizaje profundo para superresolución de imágenes diseñado para escalar imágenes de baja resolución a características visuales nítidas de alta resolución. Funciona como una herramienta de entrenamiento de redes neuronales que emplea redes generativas antagónicas (GAN) para sintetizar detalles de imagen realistas. El proyecto incluye un visualizador de evolución de modelos que genera animaciones y lotes de imágenes para rastrear las mejoras visuales durante el proceso de entrenamiento. Utiliza una combinación de funciones de pérdida adversaria y L1 para optimizar los pesos del modelo y soporta puntos de control (checkpoints) de estado periódicos para la recuperación y el despliegue. El sistema cubre la construcción de redes neuronales utilizando capas feedforward, normalización de lotes y funciones de activación. También proporciona herramientas de observabilidad para comparar la calidad del escalado contra datos de referencia (ground truth) y monitorear el progreso del entrenamiento mediante secuencias visuales iterativas.
Provides a system for optimizing model weights using adversarial loss and state checkpointing.
Este proyecto es un recurso educativo de deep learning que consiste en implementaciones de modelos de PyTorch y ejemplos de código. Proporciona scripts funcionales en Python y notebooks para construir, entrenar y optimizar redes neuronales utilizando computación basada en tensores. El repositorio incluye implementaciones para diseñar capas de red y funciones de pérdida personalizadas, así como ejemplos de flujos de trabajo de aprendizaje por transferencia (transfer learning) que cargan pesos de modelos preentrenados para acelerar el desarrollo. El código base cubre una amplia gama de capacidades de deep learning, incluyendo entrenamiento de redes neuronales, diseño de componentes de modelos personalizados y la implementación de arquitecturas multicapa para reconocer patrones complejos en conjuntos de datos.
Provides a framework for building and training multi-layer neural network architectures.
Caffe es un framework de deep learning de alto rendimiento y una librería de redes neuronales convolucionales diseñada para entrenar y desplegar redes neuronales. Funciona como un motor de machine learning acelerado por GPU con un núcleo implementado en C++ para permitir operaciones de tensores de alto rendimiento. El proyecto utiliza un sistema de configuración declarativa donde las arquitecturas de modelos y los hiperparámetros se definen en archivos de texto externos, separando el diseño de la red del código de ejecución. Incluye un sistema de serialización de modelos para exportar pesos y topologías entrenadas a archivos binarios para un despliegue eficiente en diferentes entornos de hardware. El framework cubre una amplia gama de capacidades, incluyendo el diseño de arquitectura de redes neuronales, entrenamiento de modelos supervisados con optimización basada en gradientes y flujos de trabajo de clasificación de imágenes. Proporciona herramientas para el preprocesamiento de datasets, extracción de características neuronales y ajuste fino de modelos preentrenados. El núcleo en C++ es accesible a través de una interfaz multilenguaje con bindings oficiales para Python y MATLAB.
Provides a complete computational framework to build and train deep learning models on CPU and GPU hardware.
Este proyecto es un framework de aprendizaje por refuerzo y un motor de IA para juegos diseñado para entrenar agentes antagónicos en juegos de dos jugadores por turnos. Implementa un bucle de entrenamiento que utiliza auto-juego y búsqueda de árbol de Monte Carlo para producir redes neuronales capaces de predecir la fuerza del tablero y las probabilidades de movimiento. El sistema desacopla el motor de aprendizaje por refuerzo de las reglas específicas del juego a través de una interfaz de lógica de juego abstracta, permitiendo la definición de reglas de juego personalizadas, condiciones de victoria y representaciones del tablero. Admite la integración con varios frameworks de deep learning para servir como funciones de política y valor, e incluye una arquitectura de red neuronal de doble cabezal para predecir tanto los resultados esperados como las distribuciones de movimientos legales. El framework cubre una amplia gama de capacidades, incluyendo codificación del estado del juego, gestión de puntos de control del modelo y seguimiento de métricas de entrenamiento. Proporciona herramientas para evaluar el rendimiento del agente mediante simulaciones de torneos, interfaces humano-agente y un protocolo basado en texto para conectarse a motores de juego externos. Los modelos entrenados pueden exportarse a un formato compatible con JavaScript para su uso en entornos de despliegue basados en web.
Implements a complete self-play reinforcement learning loop for training adversarial agents in turn-based games.