1 مستودع
Specialized components that convert raw audio and visual signals into conceptual representations for a central model.
Distinct from Encoder-Decoder Model Integrations: More specific than general encoder-decoder integrations; focuses on multimodal signal conversion.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multimodal Encoders. Refine with filters or upvote what's useful.
Qwen2.5-Omni هو نموذج لغوي ضخم متعدد الوسائط وشامل مصمم لمعالجة وتوليد المحتوى عبر النصوص والصوت والرؤية والفيديو. يعمل كذكاء اصطناعي صوتي في الوقت الفعلي، مستخدماً بنية شاملة (End-to-end) للحفاظ على محادثات صوتية متزامنة مع استجابات ذات زمن انتقال منخفض. يركز المشروع على الكفاءة من خلال نماذج الحافة المكممة (Quantized edge models)، مما يسمح بالاستدلال المحلي على أجهزة الجوال والأجهزة ذات الموارد المحدودة. ويستخدم تكميم الأوزان بـ 4 بت، وتفريغ العمليات على وحدة المعالجة المركزية (CPU)، وتحميل الأوزان عند الطلب لتقليل متطلبات ذاكرة GPU. يدمج النظام مشفرات متخصصة لتحليل تدفقات البيانات متعددة الوسائط ويتميز بفك تشفير متدفق لتوليد الكلام في الوقت الفعلي. كما يتضمن إمكانيات لتخصيص صوت الكلام لتعديل الخصائص النغمية والجنسية للمخرجات الصوتية.
Integrates specialized encoders to convert raw audio and visual streams into high-level conceptual representations.