5 repositorios
Architectures designed to assign categorical labels to individual tokens in a text stream.
Distinct from Sequence Label Classification: Focuses on token-level sequence tagging rather than whole-sequence classification.
Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Sequence Labeling Architectures. Refine with filters or upvote what's useful.
Flair is a natural language processing framework for training and applying models for sequence labeling and text classification. It provides a system for generating word embeddings and identifying semantic entities within text. The framework includes a dedicated system for zero and few-shot learning, enabling text classification and entity extraction using minimal training examples by leveraging pre-trained knowledge. Its capabilities cover named entity recognition, sentiment analysis, and the training of specialized models using custom datasets. It also includes tooling for the visual highl
Assigns categorical labels to individual tokens in a text stream using a structured prediction framework.
Grobid es un sistema de aprendizaje automático diseñado para transformar publicaciones académicas y científicas en PDF a XML estructurado. Funciona como un analizador de PDF a XML y extractor de metadatos académicos, identificando y normalizando títulos, autores, afiliaciones y referencias bibliográficas de trabajos de investigación. El sistema utiliza un segmentador de documentos de aprendizaje profundo para dividir los PDF sin procesar en regiones funcionales y emplea un resolvedor de referencias bibliográficas para hacer coincidir las citas con registros externos para el enriquecimiento de metadatos y la resolución de DOI. Admite una canalización completa de entrenamiento de modelos de aprendizaje automático, lo que permite la generación de corpus de entrenamiento anotados, reentrenamiento de modelos y la exportación de binarios de modelos. El proyecto cubre una amplia gama de capacidades de extracción, incluyendo el análisis de encabezados de documentos, estructuración del cuerpo del texto completo y la identificación de entidades específicas del dominio como información de financiación y citas de patentes. También proporciona herramientas de análisis espacial para la extracción de cuadros delimitadores y mapeo de coordenadas para sincronizar etiquetas semánticas con el diseño original del PDF. La aplicación se puede desplegar a través de imágenes contenedorizadas e incluye utilidades de línea de comandos para el procesamiento por lotes multiproceso de grandes colecciones de documentos.
Implements sequence labeling architectures to segment structural regions of academic documents.
Este proyecto es un sistema de procesamiento de lenguaje natural diseñado para el reconocimiento de entidades nombradas y clasificación de texto. Utiliza un enfoque de aprendizaje automático para identificar nombres específicos e información clave a partir de texto sin procesar para organizar contenido no estructurado en un formato estructurado. El sistema implementa una arquitectura multicapa que combina un transformer pre-entrenado para embeddings, memoria a largo plazo bidireccional (BiLSTM) para modelado de secuencias y un campo aleatorio condicional (CRF) para transiciones de etiquetas. Soporta aprendizaje por transferencia mediante el fine-tuning de estos modelos en datasets específicos de la tarea. El proyecto incluye capacidades para entrenar modelos en datasets personalizados utilizando configuraciones y archivos de vocabulario especificados. También proporciona un mecanismo para desplegar el modelo entrenado como un servicio de red, permitiendo la clasificación de texto y el reconocimiento de entidades a través de un servidor HTTP.
Employs a conditional random field (CRF) for structured sequence labeling to predict entity transitions.
This project is a collection of scripts and workflows for training, fine-tuning, and deploying large language models using the Hugging Face Transformers toolkit. It functions as a distributed training framework, a library for natural language processing task implementations, and a system for building retrieval-augmented generation chatbots. The repository includes specialized tools for model optimization, such as a Bayesian hyperparameter optimizer for automatically tuning model settings. It provides implementations for scaling model training across multiple graphics processors using data par
Includes token-level classification pipelines to assign category labels to individual words or phrases.
Este repositorio es una colección de notebooks de Jupyter educativos diseñados para demostrar técnicas prácticas de machine learning y procesamiento de lenguaje natural. Sirve como una librería de tutoriales para implementar modelos estadísticos y arquitecturas neuronales para resolver tareas comunes de análisis lingüístico mediante la ejecución de código interactiva y modular. El proyecto proporciona flujos de trabajo guiados para una amplia gama de tareas aplicadas, incluyendo evaluación de sentimientos, extracción de entidades nombradas y clasificación de documentos. Se distingue por ofrecer implementaciones concretas para operaciones complejas como el modelado probabilístico de temas, el etiquetado de secuencias basado en transformadores y la generación de mapeos semánticos en espacios vectoriales. Estos recursos cubren el ciclo de vida completo del análisis de texto, desde el mapeo de datos lingüísticos en espacios vectoriales numéricos hasta la medición de la similitud semántica y el descubrimiento de estructuras temáticas ocultas dentro de grandes colecciones de documentos. La colección está estructurada para facilitar la experimentación iterativa y la exploración de datos para los usuarios que trabajan con modelos modernos de procesamiento de lenguaje.
Implements sequence labeling architectures to classify individual tokens within text streams.