6 repositorios
Retrieving and standardizing internal model weights for structural analysis across different architectures.
Distinct from Model Architecture Analysis: Distinct from model extraction (surrogates) or parameter tuning; focuses on the technical retrieval and formatting of weights.
Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Weight Extraction. Refine with filters or upvote what's useful.
LLaMA-Adapter es un framework de ajuste fino (fine-tuning) eficiente en parámetros, diseñado para adaptar modelos de lenguaje grandes utilizando un conjunto mínimo de parámetros entrenables. Funciona como una herramienta de ajuste de instrucciones y un adaptador multimodal, permitiendo que los modelos preentrenados sigan instrucciones humanas y procesen datos no textuales. El proyecto se especializa en la integración de datos de imagen, video, audio y sensores en modelos de lenguaje para la comprensión intermodal. Permite la personalización de modelos LLaMA mediante el uso de adaptadores ligeros, lo que permite la extracción y almacenamiento de pesos aprendidos independientemente del checkpoint completo del modelo. El framework cubre todo el ciclo de vida de entrenamiento y evaluación, incluyendo el preentrenamiento y refinamiento del adaptador. Proporciona capacidades para la integración de datos multimodales y la evaluación del rendimiento del modelo frente a conjuntos de datos de referencia para medir la precisión de las respuestas.
Isolates trained adapter parameters from full model checkpoints for lightweight storage and portable deployment.
AnimeGANv2 es un framework de entrenamiento de redes generativas antagónicas (GAN) y una herramienta de estilización de imágenes diseñada para convertir fotografías y vídeos reales en imágenes con estilo anime. Funciona como un generador de estilo anime que transforma escenas reales en animación mediante transferencia de estilo supervisada. El proyecto proporciona un sistema para entrenar modelos de estilo y extraer parámetros de peso específicos del generador a partir de checkpoints de deep learning para crear modelos ligeros para inferencia. Se centra en la estilización de paisajes y en la capacidad de imitar estilos artísticos específicos a partir de datasets proporcionados. El framework admite tanto la conversión de foto a anime como de vídeo a anime, aplicando una estética consistente en cada fotograma. Sus capacidades cubren la generación de arte mediante IA y el entrenamiento de generadores para replicar estilos objetivo.
Isolates generator weight parameters from training checkpoints for use during model inference.
AnimeGAN es una red generativa antagónica (GAN) y traductor de imágenes desarrollado con TensorFlow. Está diseñado para la transferencia de estilo de foto a anime, utilizando un sistema de aprendizaje profundo para transformar fotografías del mundo real y fotogramas de video en imágenes de estilo anime. El sistema incluye un convertidor de video a anime que aplica transformaciones visuales consistentes a través de fotogramas secuenciales. Admite tanto el entrenamiento de redes generativas en datasets artísticos para replicar estilos específicos como la extracción de pesos del generador a partir de puntos de control (checkpoints) para una inferencia eficiente. El proyecto proporciona utilidades para el refinamiento de imágenes, incluyendo suavizado de bordes y desenfoque para mejorar las transiciones visuales. También gestiona el procesamiento de archivos de video a través de pipelines de fotogramas secuenciales.
Isolates generator weights from trained checkpoints to enable lightweight style transfer inference.
MedSAM es un framework de aprendizaje profundo diseñado para automatizar la segmentación de estructuras anatómicas en imágenes médicas 2D y 3D. Proporciona herramientas especializadas para ajustar pesos de segmentación preentrenados en datasets médicos personalizados y evaluar la precisión de esas predicciones frente a etiquetas de verdad fundamental (ground truth). El proyecto se centra en adaptar la arquitectura del Segment Anything Model para uso médico, permitiendo el aislamiento de estructuras anatómicas específicas a través de métodos guiados por prompts como cuadros delimitadores y puntos de referencia. El sistema cubre un flujo de trabajo completo de IA médica, incluyendo ingeniería de datos para normalización de intensidad y remuestreo espacial, así como gestión de modelos para conversión de checkpoints y extracción de pesos. Admite el entrenamiento a través de pipelines de GPU únicos o distribuidos para procesar datasets de imágenes a gran escala.
Provides tools for extracting and standardizing model weights from checkpoints to ensure correct loading during inference.
Stable-audio-tools is a toolkit for training and deploying latent diffusion models for high-fidelity audio synthesis. It provides a framework for generating audio by iteratively refining noise within a compressed latent space, using specialized encoders to preserve temporal and spectral features of the audio signal. The project features a system for adapting pre-trained audio checkpoints to new datasets through modular initialization and configuration files. It includes utilities for weight extraction and inference model export, which remove training metadata and optimizer states to create li
Extracts core weights from training wrappers to reduce file size for efficient inference and training.
TransformerLens is a library for mechanistic interpretability research designed to reverse engineer the learned algorithms within large language models. It provides a standardized framework for wrapping diverse transformer architectures, allowing researchers to extract, manipulate, and analyze internal activations and weights through a consistent interface. The project distinguishes itself through a comprehensive system of activation hooks that can capture, patch, and ablate internal tensors during the forward pass. It includes specialized utilities for decomposing fused projections, material
Extracts internal model weights and converts them into a standardized format to facilitate analysis across diverse architectures.