10 dépôts
Techniques for reducing the memory footprint and computational complexity of trained neural networks.
Distinct from Neural Network Optimizers: Shortlist candidates focused on training optimizers (convergence) rather than post-training size reduction.
Explore 10 awesome GitHub repositories matching artificial intelligence & ml · Neural Network Model Compression. Refine with filters or upvote what's useful.
This project is a Python implementation of the Faster R-CNN object detection framework. It serves as a convolutional neural network library and tool for locating and classifying multiple objects within images. The framework provides a pre-trained model implementation that allows for object detection inference without manual training. It supports the full lifecycle of object detection, including training detectors on visual datasets to identify and bound specific object classes. The system covers capabilities for computer vision model evaluation, neural network optimization to reduce model si
Provides methods to reduce model size and complexity to improve processing speed and memory efficiency.
Ce projet est une collection de Jupyter Notebooks éducatifs proposant des tutoriels sur la construction de réseaux de neurones et les opérations sur tenseurs avec le framework TensorFlow. Il sert de dépôt pédagogique pour le machine learning et de guide d'implémentation pour les étudiants en deep learning. La suite se concentre sur des architectures avancées spécifiques, notamment les réseaux convolutifs pour la classification d'images, les réseaux résiduels avec connexions sautées pour la stabilité de l'entraînement, et les auto-encodeurs variationnels pour la modélisation générative et la synthèse de données. Elle inclut également des guides pour construire des auto-encodeurs de débruitage et profonds afin d'effectuer l'extraction de caractéristiques et la réduction de dimensionnalité. Le dépôt couvre un large spectre de modélisation prédictive, avec des implémentations de régression linéaire, polynomiale et logistique pour prédire des valeurs continues et des résultats binaires. Le contenu est organisé en notebooks interactifs permettant aux utilisateurs d'exécuter des opérations mathématiques et de modifier des expériences de machine learning.
Provides implementations of autoencoders to compress input data into lower-dimensional latent representations.
AutoGPTQ est un toolkit de compression de modèles et un framework de quantification post-entraînement conçu pour réduire l'empreinte mémoire des grands modèles de langage. Il utilise l'algorithme GPTQ pour compresser les poids des réseaux de neurones, abaissant les exigences matérielles et réduisant l'utilisation de la VRAM. Le projet sert d'accélérateur d'inférence en fournissant des noyaux optimisés qui augmentent la vitesse de génération de tokens. Il propose une extensibilité de l'architecture des modèles, permettant d'ajouter des capacités de quantification à de nouvelles structures de modèles via des modèles configurables. Le framework couvre un pipeline de quantification complet, incluant la compression de poids couche par couche, l'estimation d'échelle basée sur la calibration et le mappage mémoire spécifique à la précision. Il inclut également des systèmes pour l'évaluation de la performance des modèles afin de mesurer l'impact de la quantification sur la précision à travers des tâches de langage et de résumé.
Reduces the memory footprint and computational complexity of trained neural networks through quantization.
Ce projet est une collection d'exemples d'apprentissage automatique TensorFlow fournissant des implémentations de référence pour divers paradigmes de réseaux de neurones. Il couvre les modèles d'apprentissage supervisé, non supervisé, par renforcement et séquentiel. Le dépôt inclut des implémentations pour les réseaux de neurones convolutifs axés sur la classification et le classement d'images, ainsi que des réseaux de neurones récurrents pour la prévision de séries temporelles et la traduction séquence-à-séquence. Il fournit en outre des exemples d'agents d'apprentissage par renforcement entraînés via l'optimisation des récompenses et des techniques d'apprentissage non supervisé telles que les auto-encodeurs et les cartes auto-organisatrices pour le clustering de données. Les capacités supplémentaires couvrent la régression et la classification supervisées, la génération d'embeddings sémantiques et l'utilisation de modèles de Markov cachés pour la modélisation de données séquentielles. Le projet inclut également des utilitaires pour la gestion des opérations de tenseurs et la visualisation des performances des modèles via des tableaux de bord. Le contenu est livré sous forme d'une série de Jupyter Notebooks.
Uses autoencoder architectures to compress image data into lower-dimensional latent representations for noise removal.
This research framework provides a deep learning driving simulator and a multimodal data pipeline for autonomous vehicle research. It centers on the creation of synchronized autonomous vehicle datasets, which combine high-frequency vehicle telemetry with camera frames to train neural networks. The project implements a convolutional neural network trainer specifically designed to predict steering angles and vehicle transition states from visual data. It features generative capabilities, using autoencoders and transition models to synthesize driving environments and simulate future vehicle move
Uses autoencoders to learn compressed representations of driving data for image synthesis and model checkpoints.
Pretrained-Language-Model is a machine learning library and natural language processing toolkit designed for pretraining, tokenizing, and compressing large language models using transformer architectures and specialized optimization techniques. It supports Chinese and multilingual natural language processing tasks, including text classification and conversational response generation. The framework provides specialized capabilities for training large-scale autoregressive and contextual language models, alongside model compression techniques like knowledge distillation and quantization to reduc
Reduces neural network size and computational overhead using quantization and distillation.
Instructor-embedding est un framework de traitement du langage naturel (NLP) conçu pour transformer du texte non structuré en vecteurs numériques de haute dimension. En utilisant une architecture d'encodeur basée sur des transformers, le système facilite la récupération sémantique, la classification de données et l'analyse de similarité sur de grands ensembles de données. Le framework se distingue par une projection vectorielle conditionnée par des instructions, qui intègre des instructions en langage naturel directement dans le processus d'embedding pour améliorer les performances sur des tâches spécifiques sans nécessiter d'entraînement supplémentaire. Il fonctionne comme une bibliothèque d'apprentissage contrastif, permettant aux utilisateurs d'affiner (fine-tune) des modèles de langage pré-entraînés sur des jeux de données personnalisés pour créer des embeddings spécialisés pour des domaines de niche. Le projet fournit une suite complète d'outils pour gérer les représentations vectorielles, incluant des capacités de benchmarking de la précision des modèles par rapport à des métriques standardisées et l'indexation des embeddings pour une recherche de similarité rapide. Pour prendre en charge le déploiement dans des environnements aux ressources limitées, le framework inclut des fonctionnalités d'optimisation telles que la quantification de modèle en précision mixte pour réduire l'utilisation de la mémoire et accélérer la vitesse d'inférence.
Reduces the memory footprint and increases inference speed by lowering the numerical precision of neural network parameters.
Knowledge-Distillation-Zoo est un framework pour la compression de modèles de réseaux de neurones qui facilite le transfert de modèles appris de grands modèles enseignants vers des architectures étudiantes plus petites. Il fournit un environnement modulaire pour exécuter des pipelines d'entraînement conçus pour réduire les exigences computationnelles des modèles d'apprentissage profond tout en maintenant la précision prédictive. La bibliothèque implémente le transfert de connaissances à travers à la fois le mimétisme basé sur les logits et l'alignement des cartes de caractéristiques (feature-map), permettant aux étudiants de reproduire le comportement de classification et les représentations internes d'un enseignant. Elle prend en charge le découplage enseignant-étudiant, où le modèle enseignant reste gelé pendant le processus d'entraînement, et utilise une composition de perte modulaire pour équilibrer les objectifs spécifiques à la tâche avec des pénalités spécifiques à la distillation. La boîte à outils inclut une interface en ligne de commande pour gérer les flux de travail d'entraînement et prend en charge l'injection de paramètres configurables pour basculer entre différentes stratégies de distillation. Elle est construite en tant que bibliothèque pour PyTorch, fournissant un environnement structuré pour optimiser les réseaux de neurones pour le déploiement sur du matériel aux ressources limitées.
Reduces the size and computational requirements of deep learning models by transferring knowledge from large teacher networks.
This project provides a TensorFlow implementation of the Stable Diffusion model, serving as a generative engine for creating and modifying visual content. It functions as a machine learning architecture that translates natural language descriptions into high-quality images by iteratively refining noise within a compressed latent space. The system enables a variety of generative tasks, including text-to-image synthesis, image inpainting to fill missing or masked regions, and image editing to transform existing visuals based on text prompts. Beyond static imagery, the framework supports the gen
Compresses high-resolution pixel data into compact latent representations to reduce computational overhead.
This project provides a comprehensive educational curriculum and research resource for deep learning, focusing on the theoretical and technical foundations of neural network implementation. It serves as a structured academic guide for building and training complex models from scratch, covering the essential mathematical primitives, computational graph construction, and automatic differentiation mechanisms required for modern machine learning. The repository distinguishes itself through its extensive coverage of generative modeling and specialized neural architectures. It includes practical im
Reduces high-dimensional input data into compact latent representations using autoencoder architectures.