1 dépôt
Specialized components that convert raw audio and visual signals into conceptual representations for a central model.
Distinct from Encoder-Decoder Model Integrations: More specific than general encoder-decoder integrations; focuses on multimodal signal conversion.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multimodal Encoders. Refine with filters or upvote what's useful.
Qwen2.5-Omni est un modèle de langage multimodal omnicanal conçu pour traiter et générer du contenu textuel, audio, visuel et vidéo. Il fonctionne comme une IA vocale en temps réel, utilisant une architecture de bout en bout pour maintenir des conversations vocales synchrones avec des réponses à faible latence. Le projet met l'accent sur l'efficacité grâce à des modèles de périphérie quantifiés, permettant une inférence locale sur du matériel mobile et des appareils aux ressources limitées. Il emploie une quantification de poids 4 bits, un déchargement des processus sur CPU et un chargement des poids à la demande pour réduire les besoins en mémoire GPU. Le système intègre des encodeurs spécialisés pour analyser les flux de données multimodaux et dispose d'un décodeur en streaming pour la génération vocale en temps réel. Il inclut également des capacités de personnalisation de la voix pour modifier les caractéristiques tonales et le genre de la sortie audio.
Integrates specialized encoders to convert raw audio and visual streams into high-level conceptual representations.