6 مستودعات
Training deep-learning models to sort text into predefined categories using convolutional or self-attentive architectures.
Distinct from Text Model Training: Distinct from Text Model Training: specifically targets text classification with convolutional or self-attentive architectures, not general text model training.
Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Text Classifier Training. Refine with filters or upvote what's useful.
fastText is a library and framework for word embedding generation, text vectorization, and supervised text classification. It provides tools to transform raw text into fixed-length vector representations and to train models that assign category labels to sentences or documents. The system utilizes subword-based vectorization and character n-gram embeddings, allowing it to generate meaningful vectors for words that were not present during training. To manage resource usage, it includes a quantized language model implementation that employs product quantization and dimensionality reduction to d
Trains supervised models to categorize text and evaluates them using precision and recall.
PyText is an extensible PyTorch-based framework for building, training, and deploying custom natural language processing models, including text classifiers, sequence taggers, and intent-slot predictors. It provides a modular toolkit that allows developers to assemble these models using pluggable registries for model architectures, data formats, and tensorizers, all configurable through YAML files without requiring code changes. The framework distinguishes itself through its comprehensive support for the full NLP model lifecycle, from training to production inference. It includes pre-built neu
Trains deep-learning models to sort text into predefined categories using configurable architectures.
هذا المشروع عبارة عن تنفيذ TensorFlow لشبكة عصبية تلافيفية مصممة لتصنيف النصوص. يعمل كمصنف نصوص للتعلم العميق يقوم بتعيين تسميات محددة مسبقاً لمستندات النص من خلال تحديد وتحليل الأنماط المتعلمة داخل مجموعات التدريب. يستخدم النموذج تسلسلاً من تحويل النصوص إلى متجهات (vectorization) في طبقة التضمين، وطبقات تلافيفية لاستخراج الميزات، وتقليل أخذ العينات (max-pooling) لمعالجة بيانات النص. يتم تحديد احتمالات الفئة النهائية من خلال نظام تصنيف الطبقة الكثيفة. يغطي سير العمل دورة حياة التعلم الآلي من البداية إلى النهاية، بما في ذلك تعلم النص الخاضع للإشراف، وتدريب النموذج مع أبعاد تضمين وأحجام فلاتر قابلة للتكوين، وتقييم الأداء باستخدام مجموعات بيانات التحقق واستمرارية النموذج القائمة على نقاط التفتيش (checkpoints).
Trains deep-learning models to sort text into categories using a configurable convolutional architecture.
هذا المشروع عبارة عن مدرب نماذج متعدد الوسائط وأداة ضبط دقيق للتعلم الآلي توفر سير عمل حاوية لتكييف النماذج المدربة مسبقاً لمهام محددة. يتميز بواجهة ويب بدون كود ولوحة تحكم لتدريب النماذج اللغوية الكبيرة ومجموعات بيانات التعلم الآلي الأخرى دون كتابة كود. يتميز النظام بدمج واجهة بدون كود مع تنسيق GPU عن بعد، مما يسمح للمستخدمين بنشر بيئات تدريب حاوية على البنية التحتية السحابية أو الأجهزة المحلية. يتضمن مدمجاً مخصصاً لتحميل أوزان وتكوينات النموذج المدرب مباشرة إلى Hugging Face Hub. تغطي القدرات مجموعة واسعة من الوسائط، بما في ذلك الرؤية الحاسوبية لتصنيف الصور واكتشاف الكائنات، ومعالجة اللغات الطبيعية لتصنيف النصوص ومهام التسلسل إلى التسلسل، والتعلم الخاضع للإشراف للبيانات الجدولية. تدعم مجموعة الأدوات أيضاً تحسين النموذج اللغوي المتخصص من خلال الضبط الدقيق الفعال للمعلمات والكمية. تتم إدارة سير عمل التدريب عبر ملفات التكوين أو واجهة قائمة على المتصفح، مع دعم مدمج لتعيين أعمدة مجموعة البيانات ومراقبة تقدم التدريب.
Develops models that assign predefined categories or labels to blocks of text.
Spark NLP هي مجموعة أدوات لتحليل النصوص القابل للتوسع والتعلم الآلي مبنية على إطار عمل الحوسبة الموزعة Apache Spark. توفر إطار عمل للتعلم الآلي متعدد الوسائط ونظام خط أنابيب موزع لتسلسل أدوات التعليق لمعالجة البيانات اللغوية على نطاق واسع. تتضمن المكتبة معالج نصوص محولاً (transformer) لتوليد تضمينات متجهات سياقية ومحرك استدلال مخصص لإدارة نماذج اللغة الكبيرة. يتميز المشروع بقدرته على معالجة أنواع البيانات غير المتجانسة، بما في ذلك النصوص والصوت والصور، ضمن بنية رؤية-لغة موحدة. ويدعم إمكانيات الذكاء الاصطناعي التوليدي المتقدمة مثل هندسة الأوامر (prompt engineering)، واستخراج الكيانات المهيكلة مع مخرجات JSON مقيدة، والاستدلال المحلي للقضاء على زمن انتقال الشبكة. بالإضافة إلى ذلك، يوفر أدوات للترجمة عبر اللغات والتصنيف بدون تدريب عبر كل من وسائط النص والصورة. يغطي إطار العمل مجموعة واسعة من الإمكانيات، بما في ذلك تدريب النماذج الخاضعة للإشراف للتعرف على الكيانات وتحليل المشاعر، بالإضافة إلى الإجابة على الأسئلة الاستخراجية وتلخيص المستندات. ويدمج دعم قاعدة بيانات المتجهات للبحث عن التشابه ويوفر بنية تحتية لتسريع GPU وإدارة دورة حياة النموذج عبر سجل مركزي. تسمح مجموعة الأدوات بتوزيع النماذج وخطوط الأنابيب المخصصة عبر مستودع عام وتدعم نشر النماذج عبر واجهات برمجة تطبيقات REST.
Implements deep learning training for single-label multi-class and multi-label text categorization.
هذا المشروع هو تنفيذ لمعمارية النموذج اللغوي ALBERT، ويوفر إطار عمل لتدريب وتقييم مصنفات النصوص ونماذج التشابه القائمة على المحولات (Transformers). يتضمن بشكل خاص أصولاً مدربة مسبقاً وأدوات محسنة لتوليد تضمينات دلالية وتمثيلات للنص الصيني. يتميز إطار العمل بأدوات لتحويل نقاط فحص النماذج اللغوية الثقيلة إلى تنسيقات خفيفة الوزن لتمكين الاستنتاج منخفض التأخير على الأجهزة المحمولة. ويستخدم تقنيات محددة لتقليل الأوزان، بما في ذلك مشاركة المعلمات المتقاطعة ومعلمات التضمين الموحدة، للحفاظ على الأداء مع بصمة ذاكرة أصغر. يغطي النظام خط إنتاج كاملاً للمعالجة اللغوية الطبيعية، من تطبيع النص الخام وترميز الكلمات الفرعية إلى التدريب المسبق ذاتي الإشراف باستخدام نمذجة اللغة المقنعة. ويوفر إمكانيات لتكييف المهام اللاحقة، مما يسمح بضبط النماذج المدربة مسبقاً لتحليل تشابه النصوص والتصنيف الخاضع للإشراف. يتضمن المشروع أدوات لتحويل بيانات السجلات الثنائية وتحويل تنسيق النموذج لضمان التوافق عبر منصات التعلم الآلي المختلفة.
Provides a supervised pipeline to train and evaluate text classifiers on specific language datasets.