6 dépôts
Retrieving and standardizing internal model weights for structural analysis across different architectures.
Distinct from Model Architecture Analysis: Distinct from model extraction (surrogates) or parameter tuning; focuses on the technical retrieval and formatting of weights.
Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Weight Extraction. Refine with filters or upvote what's useful.
LLaMA-Adapter est un framework de fine-tuning efficace en paramètres conçu pour adapter les grands modèles de langage en utilisant un ensemble minimal de paramètres entraînables. Il fonctionne comme un outil d'instruction tuning et un adaptateur multimodal, permettant aux modèles pré-entraînés de suivre des instructions humaines et de traiter des données non textuelles. Le projet se spécialise dans l'intégration de données d'image, vidéo, audio et capteurs dans les modèles de langage pour une compréhension cross-modale. Il permet la personnalisation des modèles LLaMA via l'utilisation d'adaptateurs légers, ce qui permet l'extraction et le stockage des poids appris indépendamment du checkpoint complet du modèle. Le framework couvre l'intégralité du cycle de vie d'entraînement et d'évaluation, incluant le pré-entraînement et le raffinement des adaptateurs. Il fournit des capacités pour l'intégration de données multimodales et l'évaluation de la performance des modèles par rapport à des jeux de données de référence pour mesurer la précision des réponses.
Isolates trained adapter parameters from full model checkpoints for lightweight storage and portable deployment.
AnimeGANv2 est un framework d'entraînement de réseaux antagonistes génératifs (GAN) et un outil de stylisation d'images conçu pour convertir des photos et vidéos réelles en images de style anime. Il fonctionne comme un générateur de style anime qui transforme des scènes réelles en animation par transfert de style supervisé. Le projet fournit un système pour entraîner des modèles de style et extraire des paramètres de poids spécifiques à partir de checkpoints de deep learning afin de créer des modèles légers pour l'inférence. Il se concentre sur la stylisation de paysages et la capacité à imiter des styles artistiques précis à partir de jeux de données fournis. Le framework supporte la conversion photo-vers-anime et vidéo-vers-anime en appliquant une esthétique cohérente sur chaque image. Ses capacités couvrent la génération d'art par IA et l'entraînement de générateurs pour reproduire des styles cibles.
Isolates generator weight parameters from training checkpoints for use during model inference.
AnimeGAN is a generative adversarial network and image translator developed with TensorFlow. It is designed for photo-to-anime style transfer, utilizing a deep learning system to transform real-world photographs and video frames into anime-style imagery. The system includes a video-to-anime converter that applies consistent visual transformations across sequential frames. It supports both the training of generative networks on artistic datasets to replicate specific styles and the extraction of generator weights from checkpoints for efficient inference. The project provides utilities for ima
Isolates generator weights from trained checkpoints to enable lightweight style transfer inference.
MedSAM est un framework de deep learning conçu pour automatiser la segmentation de structures anatomiques dans l'imagerie médicale 2D et 3D. Il fournit des outils spécialisés pour le fine-tuning de poids de segmentation pré-entraînés sur des datasets médicaux personnalisés et pour évaluer la précision de ces prédictions par rapport aux labels de vérité terrain. Le projet se concentre sur l'adaptation de l'architecture Segment Anything Model pour un usage médical, permettant l'isolation de structures anatomiques spécifiques via des méthodes guidées par des prompts tels que des boîtes englobantes et des points. Le système couvre un workflow complet d'IA médicale, incluant l'ingénierie de données pour la normalisation d'intensité et le rééchantillonnage spatial, ainsi que la gestion de modèles pour la conversion de checkpoints et l'extraction de poids. Il prend en charge l'entraînement via des pipelines GPU simples ou distribués pour traiter des datasets d'imagerie à grande échelle.
Provides tools for extracting and standardizing model weights from checkpoints to ensure correct loading during inference.
Stable-audio-tools is a toolkit for training and deploying latent diffusion models for high-fidelity audio synthesis. It provides a framework for generating audio by iteratively refining noise within a compressed latent space, using specialized encoders to preserve temporal and spectral features of the audio signal. The project features a system for adapting pre-trained audio checkpoints to new datasets through modular initialization and configuration files. It includes utilities for weight extraction and inference model export, which remove training metadata and optimizer states to create li
Extracts core weights from training wrappers to reduce file size for efficient inference and training.
TransformerLens is a library for mechanistic interpretability research designed to reverse engineer the learned algorithms within large language models. It provides a standardized framework for wrapping diverse transformer architectures, allowing researchers to extract, manipulate, and analyze internal activations and weights through a consistent interface. The project distinguishes itself through a comprehensive system of activation hooks that can capture, patch, and ablate internal tensors during the forward pass. It includes specialized utilities for decomposing fused projections, material
Extracts internal model weights and converts them into a standardized format to facilitate analysis across diverse architectures.