3 repositorios
Layers that perform affine transformations via matrix multiplication and bias addition.
Distinct from Linear Mixing Layers: Distinct from Linear Mixing Layers by focusing on general size transformation (input to output) rather than mixing dimensions
Explore 3 awesome GitHub repositories matching artificial intelligence & ml · Linear Transformation Layers. Refine with filters or upvote what's useful.
Flashlight es una biblioteca de aprendizaje automático y de tensores independiente en C++ utilizada para construir y entrenar redes neuronales. Funciona como un framework integral de redes neuronales y motor de diferenciación automática, proporcionando las herramientas para construir grafos de computación y calcular gradientes mediante retropropagación. El proyecto sirve como framework de entrenamiento distribuido, utilizando operaciones all-reduce para sincronizar gradientes y parámetros a través de múltiples nodos de cómputo y dispositivos. Se distingue por una integración profunda de manipulación de tensores de alto rendimiento, interoperabilidad nativa de memoria de dispositivo y un sistema para sincronizar pesos a través de trabajadores distribuidos para acelerar el entrenamiento de modelos a gran escala. El framework cubre una amplia gama de capacidades de aprendizaje profundo, incluyendo composición modular de capas para diseñar arquitecturas complejas como bloques residuales y celdas recurrentes. Proporciona utilidades extensas de gestión de datos para ingesta y prefetching, junto con sistemas de serialización para persistir estados de modelos. Además, incluye una suite de herramientas de monitorización y observabilidad para rastrear métricas de entrenamiento y medir errores de secuencia. La biblioteca está implementada en C++.
Implements linear transformation layers that use matrix multiplication and optional bias to transform input tensor sizes.
PerceptualSimilarity es un framework de aprendizaje profundo diseñado para cuantificar y evaluar la distancia perceptual entre imágenes. Proporciona un sistema para medir qué tan similares parecen dos imágenes o parches de imagen a la visión humana mediante el uso de representaciones de características profundas en lugar de diferencias a nivel de píxel. El proyecto implementa una métrica de distancia diferenciable que funciona como una función de pérdida, permitiendo que los píxeles de la imagen se optimicen mediante retropropagación para alcanzar una apariencia visual objetivo. Incluye una capa lineal entrenable que se puede aplicar a características profundas congeladas para aprender métricas de distancia ponderadas alineadas con la percepción humana. El framework cubre amplias capacidades en evaluación de calidad de imagen, entrenamiento de métricas de similitud y evaluación comparativa de visión artificial. La precisión del modelo se evalúa comparando las puntuaciones de distancia predichas con conjuntos de datos de juicio humano utilizando frameworks como pruebas de elección forzada de dos alternativas.
Uses a trainable linear layer on top of frozen features to learn weighted human-perceptual distances.
DeepSeek-VL es un modelo de lenguaje grande multimodal y motor de razonamiento de imagen a texto. Funciona como un modelo de visión-lenguaje y sistema de respuesta a preguntas visuales que integra la percepción visual con el razonamiento lingüístico para comprender y describir imágenes. El proyecto permite la comprensión multimodal de imágenes y el análisis de imágenes de documentos, procesando específicamente capturas de pantalla de páginas web y diagramas técnicos. Proporciona capacidades para IA conversacional visual, permitiendo a los usuarios interactuar con datos visuales para extraer información y realizar razonamientos complejos a través de diferentes tipos de información visual. El sistema utiliza una arquitectura transformer de visión-lenguaje que combina un Vision Transformer para la codificación visual con un modelo de lenguaje grande. Emplea ajuste de instrucciones multimodal y una capa de proyección para alinear los vectores de características visuales con el espacio de embedding del modelo de lenguaje para la generación de texto autorregresiva.
Employs a learnable projection layer to align visual feature vectors with the language model's embedding space.