5 repository-uri
Architectures designed to assign categorical labels to individual tokens in a text stream.
Distinct from Sequence Label Classification: Focuses on token-level sequence tagging rather than whole-sequence classification.
Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Sequence Labeling Architectures. Refine with filters or upvote what's useful.
Flair is a natural language processing framework for training and applying models for sequence labeling and text classification. It provides a system for generating word embeddings and identifying semantic entities within text. The framework includes a dedicated system for zero and few-shot learning, enabling text classification and entity extraction using minimal training examples by leveraging pre-trained knowledge. Its capabilities cover named entity recognition, sentiment analysis, and the training of specialized models using custom datasets. It also includes tooling for the visual highl
Assigns categorical labels to individual tokens in a text stream using a structured prediction framework.
Grobid este un sistem de machine learning conceput pentru a transforma publicațiile PDF academice și științifice în XML structurat. Funcționează ca un parser de PDF în XML și extractor de metadate științifice, identificând și normalizând titlurile, autorii, afilierile și referințele bibliografice din lucrările de cercetare. Sistemul utilizează un segmentator de documente deep learning pentru a împărți PDF-urile brute în regiuni funcționale și folosește un rezolvator de referințe bibliografice pentru a potrivi citările cu registre externe pentru îmbogățirea metadatelor și rezoluția DOI. Suportă un pipeline complet de antrenare a modelelor de machine learning, permițând generarea de corpusuri de antrenare adnotate, reantrenarea modelelor și exportul binarilor de model. Proiectul acoperă o gamă largă de capabilități de extracție, inclusiv parsarea antetelor documentelor, structurarea corpului textului complet și identificarea entităților specifice domeniului, cum ar fi informațiile de finanțare și citările de brevete. De asemenea, oferă instrumente de analiză spațială pentru extracția bounding box-urilor și maparea coordonatelor pentru a sincroniza etichetele semantice cu layout-ul PDF original. Aplicația poate fi implementată prin imagini containerizate și include utilitare CLI pentru procesarea batch multi-threaded a unor colecții mari de documente.
Implements sequence labeling architectures to segment structural regions of academic documents.
Acest proiect este un sistem de procesare a limbajului natural conceput pentru recunoașterea entităților numite și clasificarea textului. Utilizează o abordare de machine learning pentru a identifica nume specifice și informații cheie din text brut pentru a organiza conținutul nestructurat într-un format structurat. Sistemul implementează o arhitectură multi-strat care combină un transformer pre-antrenat pentru embedding-uri, long short-term memory bidirecțional pentru modelarea secvențelor și un câmp aleatoriu condiționat pentru tranzițiile de etichete. Suportă transfer learning prin fine-tuning-ul acestor modele pe seturi de date specifice sarcinii. Proiectul include capabilități pentru antrenarea modelelor pe seturi de date personalizate folosind configurații și fișiere de vocabular specificate. Oferă, de asemenea, un mecanism pentru a implementa modelul antrenat ca serviciu de rețea, permițând clasificarea textului și recunoașterea entităților printr-un server HTTP.
Employs a conditional random field (CRF) for structured sequence labeling to predict entity transitions.
This project is a collection of scripts and workflows for training, fine-tuning, and deploying large language models using the Hugging Face Transformers toolkit. It functions as a distributed training framework, a library for natural language processing task implementations, and a system for building retrieval-augmented generation chatbots. The repository includes specialized tools for model optimization, such as a Bayesian hyperparameter optimizer for automatically tuning model settings. It provides implementations for scaling model training across multiple graphics processors using data par
Includes token-level classification pipelines to assign category labels to individual words or phrases.
This repository is a collection of educational Jupyter notebooks designed to demonstrate practical machine learning and natural language processing techniques. It serves as a tutorial library for implementing statistical models and neural architectures to solve common linguistic analysis tasks through interactive, modular code execution. The project provides guided workflows for a wide range of applied tasks, including sentiment evaluation, named entity extraction, and document classification. It distinguishes itself by offering concrete implementations for complex operations such as probabil
Implements sequence labeling architectures to classify individual tokens within text streams.