5 dépôts
Techniques that reduce model size and improve execution performance by setting a portion of weights to zero.
Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Model Sparsity. Refine with filters or upvote what's useful.
TensorFlow is a comprehensive machine learning framework designed for the construction, training, and deployment of complex mathematical models. It utilizes a graph-based execution model that represents operations as directed acyclic graphs, enabling automatic differentiation and efficient parallel processing. The system provides high-level interfaces for defining neural network architectures, alongside a robust engine for managing multidimensional array structures and tensor mathematics. The framework distinguishes itself through a scalable distributed runtime that orchestrates workloads acr
Optimizes execution performance by setting specific model weights to zero through target-aware authoring and specialized kernels.
YOLOv5 is a comprehensive computer vision framework designed for end-to-end deep learning, specializing in real-time object detection, image classification, and instance segmentation. It provides a unified toolkit that manages the entire lifecycle of a model, from initial dataset configuration and hyperparameter tuning to high-speed inference and deployment. The framework utilizes a modular neural architecture, allowing users to swap backbone and head components to tailor models for specific visual tasks. What distinguishes this project is its focus on production-ready deployment and model ef
Decreases model size and improves execution speed by setting a specific percentage of weights to zero.
whisper.cpp is a C++ implementation of the Whisper speech-to-text model, serving as a lightweight machine learning inference engine and quantized runtime. It provides high-performance automatic speech recognition and real-time audio transcription without requiring a Python environment. The project utilizes model quantization to reduce memory usage and increase inference speed on local hardware. It incorporates hardware acceleration to optimize processing speed across different processors. The system covers audio processing capabilities including voice activity detection, speaker diarization,
Optimizes the inference path by skipping unnecessary calculations within the transformer architecture.
Il s'agit d'une boîte à outils de traitement du langage naturel chinois fournissant une suite d'outils pour la segmentation des mots, l'étiquetage morphosyntaxique et la reconnaissance d'entités nommées. Elle inclut un analyseur de dépendances neuronal pour analyser les relations syntaxiques et sémantiques entre les mots, ainsi qu'une suite d'entraînement en apprentissage automatique pour créer des modèles linguistiques personnalisés en utilisant des jeux de données annotés. La boîte à outils se distingue par sa flexibilité de déploiement, offrant un serveur dockerisé et une interface de service web qui expose les capacités de traitement via API. Elle prend en charge l'utilisation de modèles pré-entraînés et permet l'intégration de lexiques externes et d'extensions de dictionnaires de mots pour améliorer la précision de l'analyse. Globalement, le projet couvre un pipeline complet de tâches linguistiques, incluant la segmentation des phrases, le mappage des dépendances syntaxiques et l'étiquetage des rôles sémantiques. Ces capacités sont disponibles via une interface en ligne de commande, des modules autonomes ou des pipelines d'analyse intégrés. La logique centrale est implémentée en C++ avec des bindings officiels pour Python et Java.
Implements sparsity-based model compression to reduce memory footprint and improve execution speed.
Engram est un système de récupération de connaissances dynamique et un framework d'augmentation de mémoire pour les grands modèles de langage (LLM). Il fonctionne comme une couche de recherche en mémoire scalable et un composant d'architecture creuse conçu pour fusionner les connaissances statiques du modèle avec des états externes dynamiques afin d'améliorer la véracité et réduire les hallucinations. Le système utilise la récupération conditionnelle en mémoire et l'adressage mémoire différentiable pour mapper les jetons d'entrée vers des indices spécifiques au sein d'un magasin de mémoire associative à grande échelle. Cela permet au modèle d'augmenter ses paramètres totaux disponibles en stockant des poids dans des tables de recherche externes et en n'activant que les segments de connaissances pertinents pour une entrée donnée. Le framework couvre l'optimisation de la sparsité des modèles et l'augmentation scalable, utilisant la récupération clé-valeur et la fusion dynamique de paramètres pour améliorer les performances sur des tâches spécialisées sans nécessiter un réentraînement complet du réseau.
Reduces computational overhead by using conditional memory lookups to increase structural sparsity.