23 repository-uri
End-to-end training of machine learning models specifically for text data, including multilingual support.
Distinct from Model Training Pipelines: The candidates are too narrow (translation) or too general (generic model training pipelines).
Explore 23 awesome GitHub repositories matching artificial intelligence & ml · Text Model Training. Refine with filters or upvote what's useful.
fastText is a library and framework for word embedding generation, text vectorization, and supervised text classification. It provides tools to transform raw text into fixed-length vector representations and to train models that assign category labels to sentences or documents. The system utilizes subword-based vectorization and character n-gram embeddings, allowing it to generate meaningful vectors for words that were not present during training. To manage resource usage, it includes a quantized language model implementation that employs product quantization and dimensionality reduction to d
Trains supervised models to categorize text and evaluates them using precision and recall.
AutoGluon is an automated machine learning framework and multimodal library designed to automate the end-to-end pipeline from data preprocessing to high-accuracy model training and validation. It functions as an automated model trainer for tabular, image, text, and time series data, as well as a tool for time series forecasting and foundation model finetuning. The project is distinguished by its ability to jointly process and fuse different data types, allowing for the construction of multimodal neural networks that integrate images, text, and structured tables. It supports zero-shot inferenc
Trains high-quality models for text data using various backbones and supports cross-lingual transfer.
This project is a Transformer machine translation model and attention-based neural network implemented using the PyTorch deep learning framework. It functions as a text-to-text translation tool designed to convert source sequences into target language text. The implementation focuses on neural machine translation, covering the development of sequence-to-sequence architectures. It includes the full pipeline for translation, from text sequence preprocessing and vocabulary creation to model training and text generation inference. The system incorporates standard transformer components such as a
Provides the machinery for end-to-end training of text-based sequence-to-sequence models.
This project is a toolkit for fine-tuning and managing text-to-image diffusion models. It focuses on low-rank adaptation to create small, portable weight files that customize model styles and behaviors without modifying the entire base model. The project provides specialized utilities for model distillation using singular value decomposition to extract adapters from fully trained models, as well as tools for blending and merging multiple adapters through weight interpolation. It includes capabilities for subject inversion and pivotal tuning to increase the visual fidelity of specific identiti
Implements training capabilities that link images with text descriptions to improve generation accuracy.
nlp.js is a JavaScript natural language processing library and development framework used to build natural language understanding engines. It provides a toolkit for creating local machine learning models for intent classification and acts as a multilingual text processor that detects languages and normalizes text across various dialects. The framework distinguishes itself by supporting local execution on both servers and mobile devices, enabling chatbot functionality without an internet connection. It features a specialized system for conversational slot filling to collect mandatory informati
Enables the initialization of model knowledge bases by fetching JSON corpora from remote URLs.
Acesta este un framework de machine learning pentru tratarea diverselor sarcini de procesare a limbajului natural ca o problemă unificată de tip text-to-text. Oferă un toolkit pentru pre-antrenarea și ajustarea fină a modelelor transformer la scară largă, utilizând un sistem în care atât input-urile, cât și output-urile sunt formatate ca secvențe de text brut. Framework-ul se distinge prin sistemul său de antrenare distribuită, care utilizează strategii bazate pe mesh pentru a scala ponderile modelelor și batch-urile de antrenament pe mai multe nuclee TPU. Susține învățarea multi-task prin combinarea diverselor seturi de date într-un singur flux de antrenament folosind rate de amestec configurabile, permițând unui singur model să gestioneze diverse sarcini lingvistice. Sistemul acoperă o gamă largă de capabilități, inclusiv arhitecturi encoder-decoder, decodare beam-search pentru generarea de text și fluxuri de lucru de transfer learning. Include utilitare pentru pregătirea seturilor de date NLP, evaluarea performanței modelului și exportul checkpoint-urilor antrenate pentru servire în producție. Biblioteca susține încărcarea checkpoint-urilor de modele pre-antrenate de diverse dimensiuni pentru a accelera dezvoltarea.
Provides a unified framework for training transformer models to handle diverse text-to-text natural language processing tasks.
pycorrector is an open-source toolkit for detecting and correcting spelling and grammar errors in Chinese text. It combines multiple correction approaches, including rule-based methods using Kenlm n-gram language models and confusion sets, as well as deep learning correctors built on BERT, GPT, and T5 models. The toolkit also provides a command-line interface for batch processing Chinese text files with configurable detection and output options. The project distinguishes itself by offering a range of correction strategies that can be mixed and matched. Rule-based correction uses character-lev
Provides training scripts for BERT models on paired error-correction data to learn character-level corrections.
This project is a neural machine translation system used to build models that automatically translate text from one language to another. It utilizes sequence-to-sequence modeling to transform variable-length input sequences into corresponding output sequences. The system implements bidirectional recurrent neural network encoding and attention mechanisms to capture contextual information and focus on specific parts of the source text during translation. To manage training and inference, it employs separate computational graphs and supports distributing model layers across multiple GPU devices.
Processes raw text into batched and padded tensors using vocabulary lookups for model input.
This project is a collection of educational resources and technical guides focused on the development and implementation of large language models. It provides a comprehensive curriculum covering transformer architectures, training methods, and deployment strategies. The materials provide detailed instructions for building autonomous agents using reasoning loops and tool integration, as well as guides for fine-tuning models through supervised learning and preference optimization. It also includes tutorials for constructing retrieval augmented generation pipelines and implementing transformer m
Trains transformer-based models on sentiment datasets for text classification tasks.
PyText is an extensible PyTorch-based framework for building, training, and deploying custom natural language processing models, including text classifiers, sequence taggers, and intent-slot predictors. It provides a modular toolkit that allows developers to assemble these models using pluggable registries for model architectures, data formats, and tensorizers, all configurable through YAML files without requiring code changes. The framework distinguishes itself through its comprehensive support for the full NLP model lifecycle, from training to production inference. It includes pre-built neu
Trains deep-learning models to sort text into predefined categories using configurable architectures.
Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a config-driven system for instantiating components, orchestrating distributed training, and managing parameter-efficient fine-tuning with quantization support, all through YAML-based configurations and command-line overrides. The library distinguishes itself through its comprehensive post-training workflow orchestration, combining supervised fine-tuning, preference optimization (DPO, PPO, GRPO), knowledge distillation, and quantization-aware training in a single configurable pip
Reads conversational data from local files or remote HTTPS URLs using the Hugging Face datasets loader.
This project is a TensorFlow implementation of a convolutional neural network designed for text classification. It functions as a deep learning text categorizer that assigns predefined labels to text documents by identifying and analyzing learned patterns within training sets. The model utilizes a sequence of embedding-layer vectorization, convolutional layers for feature extraction, and max-pooling downsampling to process text data. Final category probabilities are determined through a dense-layer classification system. The workflow covers the end-to-end machine learning lifecycle, includin
Trains deep-learning models to sort text into categories using a configurable convolutional architecture.
BLIP is a vision-language model framework that combines contrastive, matching, and language modeling objectives to align images with text. Built on a multimodal encoder-decoder architecture, it supports distributed data-parallel training with cosine learning rate scheduling and sliding-window metric tracking for training stability. The framework provides capabilities for image captioning, visual question answering, and cross-modal retrieval, scoring semantic alignment between images and text through learned embeddings. It includes toolkits for fine-tuning pre-trained models on custom datasets
Trains vision-language models to generate descriptive captions for images using paired image-caption datasets.
Neuraltalk is an automated image captioning system that generates natural language descriptions for images. It utilizes a deep learning model that integrates a pretrained convolutional neural network for visual feature extraction with a recurrent neural network decoder to produce text sequences. The project provides a full workflow for training and evaluating captioning models, including weight optimization via backpropagation and gradient descent. It includes tools for measuring caption accuracy by comparing generated text against reference descriptions. The system covers data preprocessing
Optimizes model parameters to predict sentence descriptions by associating image features with ground-truth text.
Acest proiect este un program educațional cuprinzător și un framework de deep learning conceput pentru a preda deep learning practic folosind PyTorch prin notebook-uri și exemple de cod. Servește drept bibliotecă de nivel înalt pentru construirea, antrenarea și implementarea rețelelor neuronale, acționând ca un orchestrator de antrenare a modelelor care coordonează modelele PyTorch, optimizatoarele și funcțiile de loss. Proiectul oferă toolkit-uri specializate pentru computer vision, procesarea limbajului natural și preprocesarea datelor tabelare. Se distinge prin controale avansate de antrenare, cum ar fi rate de învățare discriminative, un sistem de callback bidirecțional pentru personalizarea logicii de antrenare și o abstractizare de nivel înalt a learner-ului care automatizează plasarea pe dispozitiv și buclele de antrenare. Framework-ul acoperă o suprafață largă de capabilități, inclusiv construcția automată a pipeline-urilor de date, analiza arhitecturii modelelor și evaluarea performanței în sarcini de clasificare, regresie și segmentare. Include, de asemenea, utilitare pentru antrenarea distribuită pe mai multe GPU-uri, antrenarea cu precizie mixtă pentru optimizarea memoriei și suport specializat pentru date de imagistică medicală. Proiectul este livrat sub formă de serie de Jupyter Notebooks.
Concatenates texts into a continuous stream and splits them into sequences for language model training.
Kolors este o implementare de model generativ pentru sintetizarea imaginilor fotorealiste din descrieri în limbaj natural și referințe vizuale. Utilizează un framework de tip latent diffusion model pentru a produce imagini de înaltă fidelitate, operând într-un spațiu latent comprimat pentru a îmbunătăți eficiența și calitatea generării. Sistemul funcționează ca un generator de imagini multilingv, interpretând prompt-uri text în mai multe limbi pentru a produce rezultate vizuale corecte din punct de vedere semantic. Include un pipeline personalizat de antrenare a modelelor care utilizează adaptarea low-rank (LoRA) pentru a învăța modelul subiecte specifice sau stiluri artistice dintr-un set mic de imagini. Proiectul acoperă o gamă largă de capabilități de sinteză și editare a imaginilor, inclusiv transformări text-to-image și image-to-image. Oferă instrumente pentru controlul layout-ului spațial prin hărți de adâncime sau de postură, injectarea identității vizuale pentru consistență estetică și inpainting bazat pe măști pentru a reconstrui sau modifica regiuni specifice ale imaginii. Implementarea include utilitare pentru evaluarea calității imaginilor, punctând imaginile generate pe baza metricilor de preferință umană pentru calitatea estetică și semantică.
Provides the ability to interpret text prompts in multiple languages to produce semantically accurate visual outputs.
Acest proiect este un trainer de modele multimodale și un instrument de fine-tuning pentru machine learning care oferă un flux de lucru containerizat pentru adaptarea modelelor pre-antrenate la sarcini specifice. Dispune de o interfață web no-code și un dashboard pentru antrenarea modelelor de limbaj mari și a altor seturi de date de machine learning fără a scrie cod. Sistemul se distinge prin integrarea unei interfețe no-code cu orchestrarea GPU remote, permițând utilizatorilor să implementeze medii de antrenare containerizate pe infrastructură cloud sau hardware local. Include un integrator dedicat pentru încărcarea ponderilor modelelor antrenate și a configurațiilor direct în Hugging Face Hub. Capabilitățile acoperă o gamă largă de modalități, inclusiv computer vision pentru clasificarea imaginilor și detectarea obiectelor, procesarea limbajului natural pentru clasificarea textului și sarcini sequence-to-sequence, și învățarea supervizată pentru date tabelare. Toolkit-ul suportă, de asemenea, optimizarea specializată a modelelor de limbaj prin fine-tuning eficient din punct de vedere al parametrilor și cuantizare. Fluxurile de lucru de antrenare sunt gestionate prin fișiere de configurare sau o interfață bazată pe browser, cu suport încorporat pentru maparea coloanelor setului de date și monitorizarea progresului antrenării.
Develops models that assign predefined categories or labels to blocks of text.
Spark NLP este un toolkit pentru analiza scalabilă a textului și machine learning, construit pe framework-ul de calcul distribuit Apache Spark. Oferă un framework de machine learning multimodal și un sistem de pipeline distribuit pentru secvențierea adnotatoarelor în vederea procesării datelor lingvistice la scară largă. Biblioteca include un procesor de text de tip transformer pentru generarea de embedding-uri vectoriale contextuale și un motor de inferență dedicat pentru gestionarea modelelor de limbaj mari (LLM). Proiectul se distinge prin capacitatea sa de a procesa tipuri de date eterogene, inclusiv text, audio și imagini, într-o arhitectură unificată vision-language. Suportă capabilități avansate de AI generativ, cum ar fi prompt engineering, extracția structurată a entităților cu output JSON constrâns și inferența locală pentru a elimina latența rețelei. În plus, oferă instrumente pentru traducerea între limbi și clasificare zero-shot pe modalități de text și imagine. Framework-ul acoperă o gamă largă de capabilități, inclusiv antrenarea modelelor supervizate pentru recunoașterea entităților și analiza sentimentelor, precum și răspunsul extractiv la întrebări și sumarizarea documentelor. Integrează suport pentru baze de date vectoriale pentru căutarea de similaritate și oferă infrastructură pentru accelerare GPU și gestionarea ciclului de viață al modelelor printr-un registru centralizat. Toolkit-ul permite distribuirea modelelor și pipeline-urilor personalizate printr-un repository public și suportă implementarea modelelor prin API-uri REST.
Implements deep learning training for single-label multi-class and multi-label text categorization.
Acest proiect este o implementare a arhitecturii modelului lingvistic ALBERT, oferind un framework pentru antrenarea și evaluarea clasificatorilor de text și a modelelor de similaritate bazate pe transformer. Acesta include în mod specific active pre-antrenate și instrumente optimizate pentru generarea de embedding-uri semantice și reprezentări ale textului chinezesc. Framework-ul se distinge prin instrumente pentru conversia checkpoint-urilor modelelor lingvistice grele în formate ușoare pentru a permite inferența cu latență scăzută pe dispozitive mobile. Utilizează tehnici specifice de reducere a ponderilor, inclusiv partajarea cross-parameter și parametrizarea embedding-urilor factorizate, pentru a menține performanța cu o amprentă de memorie mai mică. Sistemul acoperă un pipeline complet pentru procesarea limbajului natural, de la normalizarea textului brut și tokenizarea subword până la pre-antrenarea auto-supervizată folosind masked language modeling. Oferă capacități pentru adaptarea sarcinilor ulterioare, permițând modelelor pre-antrenate să fie reglate fin pentru analiza similarității textului și clasificare supervizată. Proiectul include utilitare pentru conversia datelor de înregistrare binară și transformarea formatului modelului pentru a asigura compatibilitatea între diferite platforme de machine learning.
Provides a supervised pipeline to train and evaluate text classifiers on specific language datasets.
Acest proiect este un framework și un toolkit bazat pe PyTorch pentru recunoașterea textului în scene. Oferă un pipeline de deep learning pentru extragerea caracterelor și cuvintelor din imagini din medii naturale, acoperind întregul proces, de la pregătirea datelor de antrenament până la validarea modelului. Framework-ul funcționează ca un benchmark standardizat pentru măsurarea acurateței și a vitezei de inferență a modelelor de recunoaștere a textului. Include instrumente pentru calcularea acurateței recunoașterii și măsurarea timpului de procesare GPU per imagine pentru a evalua performanța modelului pe seturi de date consistente. Sistemul încorporează etape de procesare vizuală și secvențială, utilizând extracția de caracteristici convoluționale și modelarea secvențială recurentă. Include utilitare de inginerie a datelor pentru conversia textului și a indexului, precum și echilibrarea datelor la nivel de batch pentru a gestiona distribuțiile seturilor de date în timpul antrenamentului.
Provides a complete pipeline for training deep learning models to recognize text from scene images.