8 repository-uri
The task of assigning labels to individual tokens in a sequence, such as named entity recognition.
Distinct from Chinese Language Segmenters: Focuses on the task of labeling tokens, which is distinct from character support or segmentation.
Explore 8 awesome GitHub repositories matching artificial intelligence & ml · Sequence Labeling. Refine with filters or upvote what's useful.
Chinese-BERT-wwm is a pre-trained transformer model and encoder designed for Chinese natural language processing. It converts Chinese text into dense vector representations to be used across various natural language processing applications. The model utilizes a whole word masking strategy during pre-training, masking entire words rather than individual characters. This approach is designed to improve the capture of semantic meaning and language structure within Chinese datasets. The project covers a range of downstream tasks including text classification, sequence labeling, and reading compr
Supports sequence labeling tasks to identify and extract entities or parts of speech from Chinese text.
Vowpal Wabbit is an open-source machine learning system designed for online learning, where models update incrementally from streaming data without requiring full retraining. It provides a reduction-based learning framework that composes complex tasks from simpler algorithms, and includes a feature hashing trick that maps unbounded feature names into a fixed-size vector space to keep memory usage constant regardless of dataset size. The system supports distributed training across a cluster using an allreduce protocol for synchronized updates, and offers an active learning query strategy that s
Learns to assign labels to each element in a sequence for tasks like named entity recognition.
This project is a collection of educational resources and technical guides focused on the development and implementation of large language models. It provides a comprehensive curriculum covering transformer architectures, training methods, and deployment strategies. The materials provide detailed instructions for building autonomous agents using reasoning loops and tool integration, as well as guides for fine-tuning models through supervised learning and preference optimization. It also includes tutorials for constructing retrieval augmented generation pipelines and implementing transformer m
Identifies named entities in text by combining LSTM networks with conditional random fields.
Lihang este o bibliotecă și un framework de algoritmi de învățare statistică ce oferă implementări ale modelelor de machine learning supervizate și nesupervizate. Funcționează ca un repository de referință care traduce teoriile învățării statistice în cod executabil pentru clasificarea datelor și recunoașterea modelelor. Proiectul dispune de instrumente specializate pentru implementarea modelelor probabilistice, utilizând estimarea verosimilității și metode bayesiene pentru a determina parametrii optimi ai modelului. Include un instrument de etichetare a datelor secvențiale pentru identificarea modelelor în secvențe de date ordonate și suportă atât clasificarea binară liniară, cât și cea neliniară. Framework-ul acoperă o gamă largă de capabilități de machine learning, inclusiv analiza datelor nesupervizate pentru clustering și analiza subiectelor, precum și un pipeline pentru preluarea automată a bibliografiei academice și a materialelor de referință. Proiectul integrează notebook-uri interactive pentru analiza iterativă a datelor și verificarea modelelor.
Implements statistical models for tagging individual tokens within ordered data sequences.
bert4keras este o reimplementare ușoară a arhitecturii transformer BERT pentru framework-ul de deep learning Keras. Acesta servește drept set de instrumente pentru procesarea limbajului natural și bibliotecă de modele transformer utilizată pentru clasificarea textului, etichetarea secvențelor și extracția embedding-urilor semantice. Framework-ul include un sistem de model sequence-to-sequence pentru răspunsul la întrebări și generarea de text, precum și un server de inferență a modelului pentru a implementa transformere antrenate ca API-uri web pentru predicții în timp real. Capabilitățile acoperă o gamă largă de sarcini de înțelegere a limbajului natural, inclusiv înțelegerea lecturii, extracția relațiilor și procesarea textelor lungi. Biblioteca oferă instrumente pentru pre-antrenarea și fine-tuning-ul modelelor de limbaj, alături de tehnici de optimizare precum reducerea parametrilor, antrenarea adversă pentru robustețe și configurarea ratei de învățare pe niveluri. Proiectul include un loader de conversie a ponderilor pentru a transforma ponderile pre-antrenate din formate externe în structuri Keras compatibile.
Classifies individual tokens in a sequence for tasks such as named entity recognition and word segmentation.
Grobid este un sistem de machine learning conceput pentru a transforma publicațiile PDF academice și științifice în XML structurat. Funcționează ca un parser de PDF în XML și extractor de metadate științifice, identificând și normalizând titlurile, autorii, afilierile și referințele bibliografice din lucrările de cercetare. Sistemul utilizează un segmentator de documente deep learning pentru a împărți PDF-urile brute în regiuni funcționale și folosește un rezolvator de referințe bibliografice pentru a potrivi citările cu registre externe pentru îmbogățirea metadatelor și rezoluția DOI. Suportă un pipeline complet de antrenare a modelelor de machine learning, permițând generarea de corpusuri de antrenare adnotate, reantrenarea modelelor și exportul binarilor de model. Proiectul acoperă o gamă largă de capabilități de extracție, inclusiv parsarea antetelor documentelor, structurarea corpului textului complet și identificarea entităților specifice domeniului, cum ar fi informațiile de finanțare și citările de brevete. De asemenea, oferă instrumente de analiză spațială pentru extracția bounding box-urilor și maparea coordonatelor pentru a sincroniza etichetele semantice cu layout-ul PDF original. Aplicația poate fi implementată prin imagini containerizate și include utilitare CLI pentru procesarea batch multi-threaded a unor colecții mari de documente.
Dumps raw sequence-labeling output from internal models to debug the extraction and segmentation pipeline.
snips-nlu este o bibliotecă Python și un motor de înțelegere a limbajului natural (NLU) conceput pentru a converti textul nestructurat în date structurate. Identifică intențiile utilizatorului și extrage entitățile asociate din propoziții în limbaj natural pentru a permite procesarea comenzilor lizibile de către mașină. Motorul funcționează ca un parser multilingv capabil să proceseze text în mai multe limbi. Acesta mapează entitățile identificate la valori canonice sau formate ISO standardizate, cum ar fi marcajele temporale, pentru a asigura consistența datelor. Proiectul acoperă clasificarea intențiilor și recunoașterea entităților numite, utilizând etichetarea secvențelor și tokenizarea pentru a identifica obiectivele utilizatorului și sloturile de date specifice.
Implements sequence labeling using Conditional Random Fields to predict entity labels for tokens in a sentence.
Entity-Relation-Extraction este un framework de machine learning conceput pentru a identifica entități și conexiunile lor logice în text nestructurat. Funcționează ca un pipeline care transformă documentele brute în grafuri de cunoștințe structurate, utilizând modele de deep learning și arhitecturi de tip transformer. Proiectul se distinge printr-o abordare bazată pe schemă, care mapează informațiile extrase către șabloane relaționale predefinite pentru a asigura consistența rezultatelor. Utilizează un proces în mai multe etape care combină clasificarea token-urilor prin etichetarea secvențială cu codificarea contextuală pentru a delimita limitele entităților și a clasifica relațiile dintre acestea. Toolkit-ul oferă componente pentru fine-tuning-ul modelelor de limbaj pre-antrenate și orchestrarea datelor prin grafuri computaționale. Include utilitare pentru evaluarea performanței modelului față de seturi de date de referință (ground truth) pentru a verifica acuratețea procesului de extracție.
Assigns categorical tags to individual tokens to delineate entity boundaries.