1 repository
Specialized components that convert raw audio and visual signals into conceptual representations for a central model.
Distinct from Encoder-Decoder Model Integrations: More specific than general encoder-decoder integrations; focuses on multimodal signal conversion.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multimodal Encoders. Refine with filters or upvote what's useful.
Qwen2.5-Omni este un model de limbaj mare (LLM) multimodal omnicanal, conceput pentru a procesa și genera conținut text, audio, vizual și video. Funcționează ca un AI vocal în timp real, utilizând o arhitectură end-to-end pentru a menține conversații vocale sincrone cu răspunsuri de latență scăzută. Proiectul pune accent pe eficiență prin modele edge cuantizate, permițând inferența locală pe hardware mobil și dispozitive cu resurse limitate. Utilizează cuantizarea ponderilor pe 4 biți, descărcarea proceselor pe CPU și încărcarea ponderilor la cerere pentru a reduce cerințele de memorie GPU. Sistemul integrează encodere specializate pentru a analiza fluxurile de date multimodale și dispune de un decoder de streaming pentru generarea vocală în timp real. Include, de asemenea, capabilități de personalizare a vocii pentru a modifica caracteristicile tonale și de gen ale ieșirii audio.
Integrates specialized encoders to convert raw audio and visual streams into high-level conceptual representations.