3 dépôts
Layers that perform affine transformations via matrix multiplication and bias addition.
Distinct from Linear Mixing Layers: Distinct from Linear Mixing Layers by focusing on general size transformation (input to output) rather than mixing dimensions
Explore 3 awesome GitHub repositories matching artificial intelligence & ml · Linear Transformation Layers. Refine with filters or upvote what's useful.
Flashlight est une bibliothèque de machine learning et de tenseurs autonome en C++ utilisée pour construire et entraîner des réseaux de neurones. Elle fonctionne comme un framework complet de réseaux de neurones et un moteur de différenciation automatique, fournissant les outils pour construire des graphes de calcul et calculer les gradients via la rétropropagation. Le projet sert de framework d'entraînement distribué, utilisant des opérations all-reduce pour synchroniser les gradients et les paramètres sur plusieurs nœuds de calcul et appareils. Il se distingue par une intégration profonde de la manipulation de tenseurs haute performance, l'interopérabilité native de la mémoire des appareils et un système pour synchroniser les poids entre les workers distribués afin d'accélérer l'entraînement de modèles à grande échelle. Le framework couvre un large éventail de capacités de deep learning, incluant la composition modulaire de couches pour concevoir des architectures complexes comme des blocs résiduels et des cellules récurrentes. Il fournit des utilitaires étendus de gestion de données pour l'ingestion et le préchargement, ainsi que des systèmes de sérialisation pour persister les états de modèle. De plus, il inclut une suite d'outils de surveillance et d'observabilité pour suivre les métriques d'entraînement et mesurer les erreurs de séquence. La bibliothèque est implémentée en C++.
Implements linear transformation layers that use matrix multiplication and optional bias to transform input tensor sizes.
PerceptualSimilarity est un framework de deep learning conçu pour quantifier et évaluer la distance perceptuelle entre les images. Il fournit un système pour mesurer à quel point deux images ou patchs d'image semblent similaires à la vision humaine en utilisant des représentations de caractéristiques profondes au lieu de différences au niveau des pixels. Le projet implémente une métrique de distance différentiable qui fonctionne comme une fonction de perte, permettant aux pixels de l'image d'être optimisés via rétropropagation pour atteindre une apparence visuelle cible. Il inclut une couche linéaire entraînable qui peut être appliquée à des caractéristiques profondes gelées pour apprendre des métriques de distance pondérées alignées sur la perception humaine. Le framework couvre de larges capacités en évaluation de la qualité d'image, entraînement de métriques de similarité et benchmarking de vision par ordinateur. La précision du modèle est évaluée en comparant les scores de distance prédits avec des jeux de données de jugement humain utilisant des frameworks tels que les tests de choix forcé à deux alternatives.
Uses a trainable linear layer on top of frozen features to learn weighted human-perceptual distances.
DeepSeek-VL est un grand modèle de langage multimodal et un moteur de raisonnement image-vers-texte. Il fonctionne comme un modèle vision-langage et un système de réponse aux questions visuelles qui intègre la perception visuelle au raisonnement linguistique pour comprendre et décrire des images. Le projet permet la compréhension d'images multimodales et l'analyse d'images de documents, traitant spécifiquement les captures d'écran de pages web et de diagrammes techniques. Il fournit des capacités pour l'IA conversationnelle visuelle, permettant aux utilisateurs d'interagir avec des données visuelles pour extraire des informations et effectuer des raisonnements complexes à travers différents types d'informations visuelles. Le système utilise une architecture transformer vision-langage qui combine un Vision Transformer pour l'encodage visuel avec un grand modèle de langage. Il emploie un réglage d'instruction multimodal et une couche de projection pour aligner les vecteurs de caractéristiques visuelles avec l'espace d'embedding du modèle de langage pour la génération de texte autorégressive.
Employs a learnable projection layer to align visual feature vectors with the language model's embedding space.