awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

8 dépôts

Awesome GitHub RepositoriesSequence Labeling

The task of assigning labels to individual tokens in a sequence, such as named entity recognition.

Distinct from Chinese Language Segmenters: Focuses on the task of labeling tokens, which is distinct from character support or segmentation.

Explore 8 awesome GitHub repositories matching artificial intelligence & ml · Sequence Labeling. Refine with filters or upvote what's useful.

Awesome Sequence Labeling GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • ymcui/chinese-bert-wwmAvatar de ymcui

    ymcui/Chinese-BERT-wwm

    10,212Voir sur GitHub↗

    Chinese-BERT-wwm is a pre-trained transformer model and encoder designed for Chinese natural language processing. It converts Chinese text into dense vector representations to be used across various natural language processing applications. The model utilizes a whole word masking strategy during pre-training, masking entire words rather than individual characters. This approach is designed to improve the capture of semantic meaning and language structure within Chinese datasets. The project covers a range of downstream tasks including text classification, sequence labeling, and reading compr

    Supports sequence labeling tasks to identify and extract entities or parts of speech from Chinese text.

    Pythonbertbert-wwmbert-wwm-ext
    Voir sur GitHub↗10,212
  • vowpalwabbit/vowpal_wabbitAvatar de VowpalWabbit

    VowpalWabbit/vowpal_wabbit

    8,683Voir sur GitHub↗

    Vowpal Wabbit is an open-source machine learning system designed for online learning, where models update incrementally from streaming data without requiring full retraining. It provides a reduction-based learning framework that composes complex tasks from simpler algorithms, and includes a feature hashing trick that maps unbounded feature names into a fixed-size vector space to keep memory usage constant regardless of dataset size. The system supports distributed training across a cluster using an allreduce protocol for synchronized updates, and offers an active learning query strategy that s

    Learns to assign labels to each element in a sequence for tasks like named entity recognition.

    C++active-learningc-plus-pluscontextual-bandits
    Voir sur GitHub↗8,683
  • nndl/llm-beginnerAvatar de nndl

    nndl/llm-beginner

    6,421Voir sur GitHub↗

    This project is a collection of educational resources and technical guides focused on the development and implementation of large language models. It provides a comprehensive curriculum covering transformer architectures, training methods, and deployment strategies. The materials provide detailed instructions for building autonomous agents using reasoning loops and tool integration, as well as guides for fine-tuning models through supervised learning and preference optimization. It also includes tutorials for constructing retrieval augmented generation pipelines and implementing transformer m

    Identifies named entities in text by combining LSTM networks with conditional random fields.

    Pythonagentfudannlpllm
    Voir sur GitHub↗6,421
  • smirkcao/lihangAvatar de SmirkCao

    SmirkCao/Lihang

    6,299Voir sur GitHub↗

    Lihang est une bibliothèque et un framework d'algorithmes d'apprentissage statistique fournissant des implémentations de modèles de machine learning supervisés et non supervisés. Il fonctionne comme un dépôt de référence qui traduit les théories de l'apprentissage statistique en code exécutable pour la classification de données et la reconnaissance de formes. Le projet propose des outils spécialisés pour l'implémentation de modèles probabilistes, utilisant l'estimation de vraisemblance et les méthodes bayésiennes pour déterminer les paramètres de modèle optimaux. Il inclut un outil d'étiquetage de données séquentielles pour identifier des modèles dans des séquences de données ordonnées et prend en charge la classification binaire linéaire et non linéaire. Le framework couvre un large éventail de capacités de machine learning, incluant l'analyse de données non supervisée pour le clustering et l'analyse de sujets, ainsi qu'un pipeline pour la récupération automatisée de bibliographie académique et de documents de référence. Le projet intègre des notebooks interactifs pour l'analyse de données itérative et la vérification de modèles.

    Implements statistical models for tagging individual tokens within ordered data sequences.

    Pythonbooklihangmachine-learning
    Voir sur GitHub↗6,299
  • bojone/bert4kerasAvatar de bojone

    bojone/bert4keras

    5,419Voir sur GitHub↗

    bert4keras est une réimplémentation légère de l'architecture transformer BERT pour le framework de deep learning Keras. Il sert de boîte à outils de traitement du langage naturel et de bibliothèque de modèles transformer utilisée pour la classification de texte, l'étiquetage de séquences et l'extraction d'embeddings sémantiques. Le framework inclut un système de modèle sequence-to-sequence pour la réponse aux questions et la génération de texte, ainsi qu'un serveur d'inférence de modèle pour déployer des transformers entraînés en tant qu'API web pour des prédictions en temps réel. Les capacités couvrent un large éventail de tâches de compréhension du langage naturel, incluant la compréhension de lecture, l'extraction de relations et le traitement de textes longs. La bibliothèque fournit des outils pour le pré-entraînement et le fine-tuning de modèles de langage, aux côtés de techniques d'optimisation telles que la réduction de paramètres, l'entraînement contradictoire pour la robustesse et la configuration du taux d'apprentissage par couche. Le projet inclut un chargeur de conversion de poids pour transformer les poids pré-entraînés depuis des formats externes en structures Keras compatibles.

    Classifies individual tokens in a sequence for tasks such as named entity recognition and word segmentation.

    Python
    Voir sur GitHub↗5,419
  • grobidorg/grobidAvatar de grobidOrg

    grobidOrg/grobid

    4,954Voir sur GitHub↗

    Grobid est un système de machine learning conçu pour transformer les publications académiques et scientifiques PDF en XML structuré. Il fonctionne comme un analyseur PDF vers XML et un extracteur de métadonnées savantes, identifiant et normalisant les titres, auteurs, affiliations et références bibliographiques des articles de recherche. Le système utilise un segmenteur de documents par deep learning pour diviser les PDF bruts en régions fonctionnelles et emploie un résolveur de références bibliographiques pour faire correspondre les citations avec des registres externes pour l'enrichissement des métadonnées et la résolution de DOI. Il prend en charge un pipeline complet d'entraînement de modèles de machine learning, permettant la génération de corpus d'entraînement annotés, le réentraînement de modèles et l'exportation de binaires de modèles. Le projet couvre un large éventail de capacités d'extraction, y compris l'analyse des en-têtes de documents, la structuration du corps du texte intégral et l'identification d'entités spécifiques au domaine comme les informations de financement et les citations de brevets. Il fournit également des outils d'analyse spatiale pour l'extraction de boîtes englobantes et le mappage de coordonnées afin de synchroniser les étiquettes sémantiques avec la mise en page PDF originale. L'application peut être déployée via des images conteneurisées et inclut des utilitaires en ligne de commande pour le traitement par lots multi-threadé de grandes collections de documents.

    Dumps raw sequence-labeling output from internal models to debug the extraction and segmentation pipeline.

    Javabibliographical-referencescrfdeep-learning
    Voir sur GitHub↗4,954
  • snipsco/snips-nluAvatar de snipsco

    snipsco/snips-nlu

    3,972Voir sur GitHub↗

    snips-nlu est une bibliothèque Python et un moteur de compréhension du langage naturel conçu pour convertir du texte non structuré en données structurées. Il identifie les intentions de l'utilisateur et extrait les entités associées à partir de phrases en langage naturel pour permettre le traitement de commandes lisibles par machine. Le moteur fonctionne comme un analyseur multilingue capable de traiter du texte dans plusieurs langues. Il mappe les entités identifiées vers des valeurs canoniques ou des formats ISO standardisés, tels que les horodatages, pour assurer la cohérence des données. Le projet couvre la classification d'intentions et la reconnaissance d'entités nommées, utilisant l'étiquetage de séquences et la tokenisation pour identifier les objectifs de l'utilisateur et les emplacements de données spécifiques.

    Implements sequence labeling using Conditional Random Fields to predict entity labels for tokens in a sentence.

    Python
    Voir sur GitHub↗3,972
  • yuanxiaosc/entity-relation-extractionAvatar de yuanxiaosc

    yuanxiaosc/Entity-Relation-Extraction

    1,231Voir sur GitHub↗

    Entity-Relation-Extraction est un framework de machine learning conçu pour identifier des entités et leurs connexions logiques au sein de textes non structurés. Il fonctionne comme un pipeline qui transforme des documents bruts en graphes de connaissances structurés en utilisant des modèles de deep learning et des architectures de type transformer. Le projet se distingue par une approche basée sur des schémas, qui mappe les informations extraites vers des modèles relationnels prédéfinis pour assurer la cohérence des résultats. Il emploie un processus multi-étapes combinant l'étiquetage de séquences (token classification) et l'encodage contextuel pour délimiter les frontières des entités et classifier les relations entre elles. La boîte à outils fournit des composants pour le fine-tuning de modèles de langage pré-entraînés et l'orchestration de données via des graphes de calcul. Elle inclut des utilitaires pour évaluer les performances du modèle par rapport à des jeux de données de référence afin de vérifier la précision du processus d'extraction.

    Assigns categorical tags to individual tokens to delineate entity boundaries.

    Pythonbert-modelcompetition-codeentity-extraction
    Voir sur GitHub↗1,231
  1. Home
  2. Artificial Intelligence & ML
  3. Sequence Labeling

Explorer les sous-tags

  • Label Inspection ToolsUtilities for dumping and analyzing raw sequence-labeling outputs to debug model performance. **Distinct from Sequence Labeling:** Focuses on the inspection and debugging of labels produced by a model, rather than the general task of sequence labeling.