6 repository-uri
Training deep-learning models to sort text into predefined categories using convolutional or self-attentive architectures.
Distinct from Text Model Training: Distinct from Text Model Training: specifically targets text classification with convolutional or self-attentive architectures, not general text model training.
Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Text Classifier Training. Refine with filters or upvote what's useful.
fastText is a library and framework for word embedding generation, text vectorization, and supervised text classification. It provides tools to transform raw text into fixed-length vector representations and to train models that assign category labels to sentences or documents. The system utilizes subword-based vectorization and character n-gram embeddings, allowing it to generate meaningful vectors for words that were not present during training. To manage resource usage, it includes a quantized language model implementation that employs product quantization and dimensionality reduction to d
Trains supervised models to categorize text and evaluates them using precision and recall.
PyText is an extensible PyTorch-based framework for building, training, and deploying custom natural language processing models, including text classifiers, sequence taggers, and intent-slot predictors. It provides a modular toolkit that allows developers to assemble these models using pluggable registries for model architectures, data formats, and tensorizers, all configurable through YAML files without requiring code changes. The framework distinguishes itself through its comprehensive support for the full NLP model lifecycle, from training to production inference. It includes pre-built neu
Trains deep-learning models to sort text into predefined categories using configurable architectures.
This project is a TensorFlow implementation of a convolutional neural network designed for text classification. It functions as a deep learning text categorizer that assigns predefined labels to text documents by identifying and analyzing learned patterns within training sets. The model utilizes a sequence of embedding-layer vectorization, convolutional layers for feature extraction, and max-pooling downsampling to process text data. Final category probabilities are determined through a dense-layer classification system. The workflow covers the end-to-end machine learning lifecycle, includin
Trains deep-learning models to sort text into categories using a configurable convolutional architecture.
Acest proiect este un trainer de modele multimodale și un instrument de fine-tuning pentru machine learning care oferă un flux de lucru containerizat pentru adaptarea modelelor pre-antrenate la sarcini specifice. Dispune de o interfață web no-code și un dashboard pentru antrenarea modelelor de limbaj mari și a altor seturi de date de machine learning fără a scrie cod. Sistemul se distinge prin integrarea unei interfețe no-code cu orchestrarea GPU remote, permițând utilizatorilor să implementeze medii de antrenare containerizate pe infrastructură cloud sau hardware local. Include un integrator dedicat pentru încărcarea ponderilor modelelor antrenate și a configurațiilor direct în Hugging Face Hub. Capabilitățile acoperă o gamă largă de modalități, inclusiv computer vision pentru clasificarea imaginilor și detectarea obiectelor, procesarea limbajului natural pentru clasificarea textului și sarcini sequence-to-sequence, și învățarea supervizată pentru date tabelare. Toolkit-ul suportă, de asemenea, optimizarea specializată a modelelor de limbaj prin fine-tuning eficient din punct de vedere al parametrilor și cuantizare. Fluxurile de lucru de antrenare sunt gestionate prin fișiere de configurare sau o interfață bazată pe browser, cu suport încorporat pentru maparea coloanelor setului de date și monitorizarea progresului antrenării.
Develops models that assign predefined categories or labels to blocks of text.
Spark NLP este un toolkit pentru analiza scalabilă a textului și machine learning, construit pe framework-ul de calcul distribuit Apache Spark. Oferă un framework de machine learning multimodal și un sistem de pipeline distribuit pentru secvențierea adnotatoarelor în vederea procesării datelor lingvistice la scară largă. Biblioteca include un procesor de text de tip transformer pentru generarea de embedding-uri vectoriale contextuale și un motor de inferență dedicat pentru gestionarea modelelor de limbaj mari (LLM). Proiectul se distinge prin capacitatea sa de a procesa tipuri de date eterogene, inclusiv text, audio și imagini, într-o arhitectură unificată vision-language. Suportă capabilități avansate de AI generativ, cum ar fi prompt engineering, extracția structurată a entităților cu output JSON constrâns și inferența locală pentru a elimina latența rețelei. În plus, oferă instrumente pentru traducerea între limbi și clasificare zero-shot pe modalități de text și imagine. Framework-ul acoperă o gamă largă de capabilități, inclusiv antrenarea modelelor supervizate pentru recunoașterea entităților și analiza sentimentelor, precum și răspunsul extractiv la întrebări și sumarizarea documentelor. Integrează suport pentru baze de date vectoriale pentru căutarea de similaritate și oferă infrastructură pentru accelerare GPU și gestionarea ciclului de viață al modelelor printr-un registru centralizat. Toolkit-ul permite distribuirea modelelor și pipeline-urilor personalizate printr-un repository public și suportă implementarea modelelor prin API-uri REST.
Implements deep learning training for single-label multi-class and multi-label text categorization.
Acest proiect este o implementare a arhitecturii modelului lingvistic ALBERT, oferind un framework pentru antrenarea și evaluarea clasificatorilor de text și a modelelor de similaritate bazate pe transformer. Acesta include în mod specific active pre-antrenate și instrumente optimizate pentru generarea de embedding-uri semantice și reprezentări ale textului chinezesc. Framework-ul se distinge prin instrumente pentru conversia checkpoint-urilor modelelor lingvistice grele în formate ușoare pentru a permite inferența cu latență scăzută pe dispozitive mobile. Utilizează tehnici specifice de reducere a ponderilor, inclusiv partajarea cross-parameter și parametrizarea embedding-urilor factorizate, pentru a menține performanța cu o amprentă de memorie mai mică. Sistemul acoperă un pipeline complet pentru procesarea limbajului natural, de la normalizarea textului brut și tokenizarea subword până la pre-antrenarea auto-supervizată folosind masked language modeling. Oferă capacități pentru adaptarea sarcinilor ulterioare, permițând modelelor pre-antrenate să fie reglate fin pentru analiza similarității textului și clasificare supervizată. Proiectul include utilitare pentru conversia datelor de înregistrare binară și transformarea formatului modelului pentru a asigura compatibilitatea între diferite platforme de machine learning.
Provides a supervised pipeline to train and evaluate text classifiers on specific language datasets.