8 repositorios
The task of assigning labels to individual tokens in a sequence, such as named entity recognition.
Distinct from Chinese Language Segmenters: Focuses on the task of labeling tokens, which is distinct from character support or segmentation.
Explore 8 awesome GitHub repositories matching artificial intelligence & ml · Sequence Labeling. Refine with filters or upvote what's useful.
Chinese-BERT-wwm is a pre-trained transformer model and encoder designed for Chinese natural language processing. It converts Chinese text into dense vector representations to be used across various natural language processing applications. The model utilizes a whole word masking strategy during pre-training, masking entire words rather than individual characters. This approach is designed to improve the capture of semantic meaning and language structure within Chinese datasets. The project covers a range of downstream tasks including text classification, sequence labeling, and reading compr
Supports sequence labeling tasks to identify and extract entities or parts of speech from Chinese text.
Vowpal Wabbit is an open-source machine learning system designed for online learning, where models update incrementally from streaming data without requiring full retraining. It provides a reduction-based learning framework that composes complex tasks from simpler algorithms, and includes a feature hashing trick that maps unbounded feature names into a fixed-size vector space to keep memory usage constant regardless of dataset size. The system supports distributed training across a cluster using an allreduce protocol for synchronized updates, and offers an active learning query strategy that s
Learns to assign labels to each element in a sequence for tasks like named entity recognition.
This project is a collection of educational resources and technical guides focused on the development and implementation of large language models. It provides a comprehensive curriculum covering transformer architectures, training methods, and deployment strategies. The materials provide detailed instructions for building autonomous agents using reasoning loops and tool integration, as well as guides for fine-tuning models through supervised learning and preference optimization. It also includes tutorials for constructing retrieval augmented generation pipelines and implementing transformer m
Identifies named entities in text by combining LSTM networks with conditional random fields.
Lihang es una librería y framework de algoritmos de aprendizaje estadístico que proporciona implementaciones de modelos de machine learning supervisado y no supervisado. Funciona como un repositorio de referencia que traduce teorías de aprendizaje estadístico en código ejecutable para la clasificación de datos y el reconocimiento de patrones. El proyecto cuenta con herramientas especializadas para la implementación de modelos probabilísticos, utilizando estimación de verosimilitud y métodos bayesianos para determinar los parámetros óptimos del modelo. Incluye una herramienta de etiquetado de datos secuenciales para identificar patrones en secuencias de datos ordenadas y admite clasificación binaria tanto lineal como no lineal. El framework cubre una amplia gama de capacidades de machine learning, incluyendo análisis de datos no supervisados para clustering y análisis de temas, así como un pipeline para la recuperación automatizada de bibliografía académica y materiales de referencia. El proyecto integra notebooks interactivos para el análisis iterativo de datos y la verificación de modelos.
Implements statistical models for tagging individual tokens within ordered data sequences.
bert4keras es una reimplementación ligera de la arquitectura de transformador BERT para el framework de aprendizaje profundo Keras. Sirve como un kit de herramientas de procesamiento de lenguaje natural y librería de modelos de transformadores utilizada para clasificación de texto, etiquetado de secuencias y extracción de embeddings semánticos. El framework incluye un sistema de modelos de secuencia a secuencia para responder preguntas y generar texto, así como un servidor de inferencia de modelos para desplegar transformadores entrenados como APIs web para predicciones en tiempo real. Las capacidades cubren una amplia gama de tareas de comprensión del lenguaje natural, incluyendo comprensión de lectura, extracción de relaciones y procesamiento de textos largos. La librería proporciona herramientas para el pre-entrenamiento y ajuste fino de modelos de lenguaje, junto con técnicas de optimización como reducción de parámetros, entrenamiento adversarial para robustez y configuración de tasa de aprendizaje por capa. El proyecto incluye un cargador de conversión de pesos para transformar pesos pre-entrenados de formatos externos en estructuras de Keras compatibles.
Classifies individual tokens in a sequence for tasks such as named entity recognition and word segmentation.
Grobid es un sistema de aprendizaje automático diseñado para transformar publicaciones académicas y científicas en PDF a XML estructurado. Funciona como un analizador de PDF a XML y extractor de metadatos académicos, identificando y normalizando títulos, autores, afiliaciones y referencias bibliográficas de trabajos de investigación. El sistema utiliza un segmentador de documentos de aprendizaje profundo para dividir los PDF sin procesar en regiones funcionales y emplea un resolvedor de referencias bibliográficas para hacer coincidir las citas con registros externos para el enriquecimiento de metadatos y la resolución de DOI. Admite una canalización completa de entrenamiento de modelos de aprendizaje automático, lo que permite la generación de corpus de entrenamiento anotados, reentrenamiento de modelos y la exportación de binarios de modelos. El proyecto cubre una amplia gama de capacidades de extracción, incluyendo el análisis de encabezados de documentos, estructuración del cuerpo del texto completo y la identificación de entidades específicas del dominio como información de financiación y citas de patentes. También proporciona herramientas de análisis espacial para la extracción de cuadros delimitadores y mapeo de coordenadas para sincronizar etiquetas semánticas con el diseño original del PDF. La aplicación se puede desplegar a través de imágenes contenedorizadas e incluye utilidades de línea de comandos para el procesamiento por lotes multiproceso de grandes colecciones de documentos.
Dumps raw sequence-labeling output from internal models to debug the extraction and segmentation pipeline.
snips-nlu es una biblioteca de Python y motor de comprensión de lenguaje natural diseñado para convertir texto no estructurado en datos estructurados. Identifica intenciones del usuario y extrae entidades asociadas de oraciones en lenguaje natural para permitir el procesamiento de comandos legible por máquina. El motor funciona como un parser multilingüe capaz de procesar texto en varios idiomas. Mapea las entidades identificadas a valores canónicos o formatos ISO estandarizados, como marcas de tiempo, para asegurar la consistencia de los datos. El proyecto cubre la clasificación de intenciones y el reconocimiento de entidades nombradas, utilizando etiquetado de secuencias y tokenización para identificar los objetivos del usuario y slots de datos específicos.
Implements sequence labeling using Conditional Random Fields to predict entity labels for tokens in a sentence.
Entity-Relation-Extraction es un framework de machine learning diseñado para identificar entidades y sus conexiones lógicas dentro de texto no estructurado. Funciona como una tubería (pipeline) que transforma documentos crudos en grafos de conocimiento estructurados utilizando modelos de deep learning y arquitecturas transformer. El proyecto se distingue por un enfoque basado en esquemas, que mapea la información extraída a plantillas relacionales predefinidas para asegurar la consistencia de la salida. Emplea un proceso de varias etapas que combina la clasificación de tokens de etiquetado de secuencias con codificación contextual para delinear los límites de las entidades y clasificar las relaciones entre ellas. El kit de herramientas proporciona componentes para ajustar (fine-tuning) modelos de lenguaje preentrenados y orquestar datos a través de grafos computacionales. Incluye utilidades para evaluar el rendimiento del modelo frente a conjuntos de datos de referencia (ground truth) para verificar la precisión del proceso de extracción.
Assigns categorical tags to individual tokens to delineate entity boundaries.