3 مستودعات
Layers that perform affine transformations via matrix multiplication and bias addition.
Distinct from Linear Mixing Layers: Distinct from Linear Mixing Layers by focusing on general size transformation (input to output) rather than mixing dimensions
Explore 3 awesome GitHub repositories matching artificial intelligence & ml · Linear Transformation Layers. Refine with filters or upvote what's useful.
Flashlight هي مكتبة تعلم آلي مستقلة بلغة C++ ومكتبة موترات تستخدم لبناء وتدريب الشبكات العصبية. تعمل كإطار عمل شامل للشبكات العصبية ومحرك للتمايز التلقائي، مما يوفر الأدوات لبناء رسوم بيانية للحساب وحساب التدرجات عبر الانتشار العكسي. يعمل المشروع كإطار عمل للتدريب الموزع، حيث يستخدم عمليات (All-reduce) لمزامنة التدرجات والمعلمات عبر عقد حساب وأجهزة متعددة. يتميز بالتكامل العميق لمعالجة الموترات عالية الأداء، وقابلية التشغيل البيني لذاكرة الجهاز الأصلية، ونظام لمزامنة الأوزان عبر العمال الموزعين لتسريع تدريب النماذج واسعة النطاق. يغطي إطار العمل مجموعة واسعة من قدرات التعلم العميق، بما في ذلك تكوين الطبقات المعيارية لتصميم بنيات معقدة مثل الكتل المتبقية (Residual blocks) والخلايا المتكررة. يوفر أدوات واسعة النطاق لإدارة البيانات للاستيعاب والجلب المسبق، إلى جانب أنظمة التسلسل لحفظ حالات النموذج. بالإضافة إلى ذلك، يتضمن مجموعة من أدوات المراقبة وقابلية المراقبة لتتبع مقاييس التدريب وقياس أخطاء التسلسل. تم تنفيذ المكتبة بلغة C++.
Implements linear transformation layers that use matrix multiplication and optional bias to transform input tensor sizes.
PerceptualSimilarity هو إطار عمل للتعلم العميق مصمم لقياس وتقييم المسافة الإدراكية بين الصور. يوفر نظاماً لقياس مدى تشابه صورتين أو رقعتين من الصور مع الرؤية البشرية باستخدام تمثيلات الميزات العميقة بدلاً من الاختلافات على مستوى البكسل. ينفذ المشروع مقياس مسافة قابل للتمايز يعمل كدالة خسارة، مما يسمح بتحسين بكسلات الصورة عبر الانتشار العكسي للوصول إلى مظهر بصري مستهدف. يتضمن طبقة خطية قابلة للتدريب يمكن تطبيقها على الميزات العميقة المجمدة لتعلم مقاييس المسافة المرجحة المتوافقة مع الإدراك البشري. يغطي إطار العمل قدرات واسعة في تقييم جودة الصورة، وتدريب مقياس التشابه، وقياس أداء رؤية الكمبيوتر. يتم تقييم دقة النموذج من خلال مقارنة درجات المسافة المتوقعة مقابل مجموعات بيانات الحكم البشري باستخدام أطر عمل مثل اختبارات الاختيار القسري البديلين.
Uses a trainable linear layer on top of frozen features to learn weighted human-perceptual distances.
DeepSeek-VL هو نموذج لغة كبير متعدد الوسائط ومحرك استدلال من الصورة إلى النص. يعمل كنموذج رؤية-لغة ونظام للإجابة على الأسئلة المرئية يدمج الإدراك البصري مع الاستدلال اللغوي لفهم ووصف الصور. يمكن المشروع من فهم الصور متعددة الوسائط وتحليل صور المستندات، وتحديداً معالجة لقطات شاشة صفحات الويب والمخططات التقنية. ويوفر إمكانيات للذكاء الاصطناعي التحادثي المرئي، مما يسمح للمستخدمين بالتفاعل مع البيانات المرئية لاستخراج الرؤى وإجراء استدلال معقد عبر أنواع مختلفة من المعلومات المرئية. يستخدم النظام بنية محول رؤية-لغة تجمع بين محول رؤية (Vision Transformer) للترميز البصري ونموذج لغة كبير. ويستخدم ضبط التعليمات متعدد الوسائط وطبقة إسقاط لمحاذاة متجهات الميزات المرئية مع مساحة تضمين نموذج اللغة لتوليد النص التلقائي.
Employs a learnable projection layer to align visual feature vectors with the language model's embedding space.