5 repositorios
Techniques that reduce model size and improve execution performance by setting a portion of weights to zero.
Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Model Sparsity. Refine with filters or upvote what's useful.
TensorFlow is a comprehensive machine learning framework designed for the construction, training, and deployment of complex mathematical models. It utilizes a graph-based execution model that represents operations as directed acyclic graphs, enabling automatic differentiation and efficient parallel processing. The system provides high-level interfaces for defining neural network architectures, alongside a robust engine for managing multidimensional array structures and tensor mathematics. The framework distinguishes itself through a scalable distributed runtime that orchestrates workloads acr
Optimizes execution performance by setting specific model weights to zero through target-aware authoring and specialized kernels.
YOLOv5 is a comprehensive computer vision framework designed for end-to-end deep learning, specializing in real-time object detection, image classification, and instance segmentation. It provides a unified toolkit that manages the entire lifecycle of a model, from initial dataset configuration and hyperparameter tuning to high-speed inference and deployment. The framework utilizes a modular neural architecture, allowing users to swap backbone and head components to tailor models for specific visual tasks. What distinguishes this project is its focus on production-ready deployment and model ef
Decreases model size and improves execution speed by setting a specific percentage of weights to zero.
whisper.cpp is a C++ implementation of the Whisper speech-to-text model, serving as a lightweight machine learning inference engine and quantized runtime. It provides high-performance automatic speech recognition and real-time audio transcription without requiring a Python environment. The project utilizes model quantization to reduce memory usage and increase inference speed on local hardware. It incorporates hardware acceleration to optimize processing speed across different processors. The system covers audio processing capabilities including voice activity detection, speaker diarization,
Optimizes the inference path by skipping unnecessary calculations within the transformer architecture.
Este es un toolkit de procesamiento de lenguaje natural para chino que proporciona un conjunto de herramientas para segmentación de palabras, etiquetado gramatical (POS tagging) y reconocimiento de entidades nombradas. Incluye un parser de dependencia neuronal para analizar relaciones sintácticas y semánticas entre palabras y una suite de entrenamiento de machine learning para crear modelos lingüísticos personalizados utilizando datasets anotados. El toolkit se distingue por su flexibilidad de despliegue, ofreciendo un servidor dockerizado y una interfaz de servicio web que expone capacidades de procesamiento vía API. Soporta el uso de modelos preentrenados y permite la integración de léxicos externos y extensiones de diccionarios de palabras para mejorar la precisión del análisis. En términos generales, el proyecto cubre un pipeline completo de tareas lingüísticas, incluyendo segmentación de oraciones, mapeo de dependencia sintáctica y etiquetado de roles semánticos. Estas capacidades están disponibles a través de una interfaz de línea de comandos, módulos independientes o pipelines de análisis integrados. La lógica central está implementada en C++ con bindings oficiales para Python y Java.
Implements sparsity-based model compression to reduce memory footprint and improve execution speed.
Engram es un sistema dinámico de recuperación de conocimiento y framework de aumento de memoria para modelos de lenguaje grandes (LLM). Funciona como una capa de búsqueda de memoria escalable y un componente de arquitectura dispersa diseñado para fusionar el conocimiento estático del modelo con estados externos dinámicos para mejorar la veracidad y reducir las alucinaciones. El sistema utiliza recuperación de memoria condicional y direccionamiento de memoria diferenciable para mapear tokens de entrada a índices específicos dentro de un almacén de memoria asociativa a gran escala. Esto permite al modelo aumentar sus parámetros totales disponibles almacenando pesos en tablas de búsqueda externas y activando solo los segmentos de conocimiento relevantes para una entrada dada. El framework cubre la optimización de dispersión del modelo y el aumento escalable, utilizando recuperación clave-valor y fusión dinámica de parámetros para mejorar el rendimiento en tareas especializadas sin requerir un reentrenamiento completo de la red.
Reduces computational overhead by using conditional memory lookups to increase structural sparsity.