awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

1 dépôt

Awesome GitHub RepositoriesMultimodal Alignment Layers

Linear layers specifically designed to map visual feature vectors into the embedding space of a language model.

Distinct from Linear Transformation Layers: Specializes in aligning vision and language modalities, whereas general linear transformation layers are agnostic to the data type.

Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multimodal Alignment Layers. Refine with filters or upvote what's useful.

Awesome Multimodal Alignment Layers GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • deepseek-ai/deepseek-vlAvatar de deepseek-ai

    deepseek-ai/DeepSeek-VL

    4,134Voir sur GitHub↗

    DeepSeek-VL est un grand modèle de langage multimodal et un moteur de raisonnement image-vers-texte. Il fonctionne comme un modèle vision-langage et un système de réponse aux questions visuelles qui intègre la perception visuelle au raisonnement linguistique pour comprendre et décrire des images. Le projet permet la compréhension d'images multimodales et l'analyse d'images de documents, traitant spécifiquement les captures d'écran de pages web et de diagrammes techniques. Il fournit des capacités pour l'IA conversationnelle visuelle, permettant aux utilisateurs d'interagir avec des données visuelles pour extraire des informations et effectuer des raisonnements complexes à travers différents types d'informations visuelles. Le système utilise une architecture transformer vision-langage qui combine un Vision Transformer pour l'encodage visuel avec un grand modèle de langage. Il emploie un réglage d'instruction multimodal et une couche de projection pour aligner les vecteurs de caractéristiques visuelles avec l'espace d'embedding du modèle de langage pour la génération de texte autorégressive.

    Employs a learnable projection layer to align visual feature vectors with the language model's embedding space.

    Python
    Voir sur GitHub↗4,134
  1. Home
  2. Artificial Intelligence & ML
  3. Machine Learning
  4. Algorithms
  5. Linear Regression Implementations
  6. Linear Transformation Layers
  7. Multimodal Alignment Layers