1 dépôt
Linear layers specifically designed to map visual feature vectors into the embedding space of a language model.
Distinct from Linear Transformation Layers: Specializes in aligning vision and language modalities, whereas general linear transformation layers are agnostic to the data type.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multimodal Alignment Layers. Refine with filters or upvote what's useful.
DeepSeek-VL est un grand modèle de langage multimodal et un moteur de raisonnement image-vers-texte. Il fonctionne comme un modèle vision-langage et un système de réponse aux questions visuelles qui intègre la perception visuelle au raisonnement linguistique pour comprendre et décrire des images. Le projet permet la compréhension d'images multimodales et l'analyse d'images de documents, traitant spécifiquement les captures d'écran de pages web et de diagrammes techniques. Il fournit des capacités pour l'IA conversationnelle visuelle, permettant aux utilisateurs d'interagir avec des données visuelles pour extraire des informations et effectuer des raisonnements complexes à travers différents types d'informations visuelles. Le système utilise une architecture transformer vision-langage qui combine un Vision Transformer pour l'encodage visuel avec un grand modèle de langage. Il emploie un réglage d'instruction multimodal et une couche de projection pour aligner les vecteurs de caractéristiques visuelles avec l'espace d'embedding du modèle de langage pour la génération de texte autorégressive.
Employs a learnable projection layer to align visual feature vectors with the language model's embedding space.