awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

1 dépôt

Awesome GitHub RepositoriesMultimodal Encoders

Specialized components that convert raw audio and visual signals into conceptual representations for a central model.

Distinct from Encoder-Decoder Model Integrations: More specific than general encoder-decoder integrations; focuses on multimodal signal conversion.

Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multimodal Encoders. Refine with filters or upvote what's useful.

Awesome Multimodal Encoders GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • qwenlm/qwen2.5-omniAvatar de QwenLM

    QwenLM/Qwen2.5-Omni

    4,026Voir sur GitHub↗

    Qwen2.5-Omni est un modèle de langage multimodal omnicanal conçu pour traiter et générer du contenu textuel, audio, visuel et vidéo. Il fonctionne comme une IA vocale en temps réel, utilisant une architecture de bout en bout pour maintenir des conversations vocales synchrones avec des réponses à faible latence. Le projet met l'accent sur l'efficacité grâce à des modèles de périphérie quantifiés, permettant une inférence locale sur du matériel mobile et des appareils aux ressources limitées. Il emploie une quantification de poids 4 bits, un déchargement des processus sur CPU et un chargement des poids à la demande pour réduire les besoins en mémoire GPU. Le système intègre des encodeurs spécialisés pour analyser les flux de données multimodaux et dispose d'un décodeur en streaming pour la génération vocale en temps réel. Il inclut également des capacités de personnalisation de la voix pour modifier les caractéristiques tonales et le genre de la sortie audio.

    Integrates specialized encoders to convert raw audio and visual streams into high-level conceptual representations.

    Jupyter Notebook
    Voir sur GitHub↗4,026
  1. Home
  2. Artificial Intelligence & ML
  3. Artificial Intelligence Tooling
  4. Encoder-Decoder Model Integrations
  5. Multimodal Encoders