awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 repositorios

Awesome GitHub RepositoriesText Classifier Training

Training deep-learning models to sort text into predefined categories using convolutional or self-attentive architectures.

Distinct from Text Model Training: Distinct from Text Model Training: specifically targets text classification with convolutional or self-attentive architectures, not general text model training.

Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Text Classifier Training. Refine with filters or upvote what's useful.

Awesome Text Classifier Training GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • facebookresearch/fasttextAvatar de facebookresearch

    facebookresearch/fastText

    26,543Ver en GitHub↗

    fastText is a library and framework for word embedding generation, text vectorization, and supervised text classification. It provides tools to transform raw text into fixed-length vector representations and to train models that assign category labels to sentences or documents. The system utilizes subword-based vectorization and character n-gram embeddings, allowing it to generate meaningful vectors for words that were not present during training. To manage resource usage, it includes a quantized language model implementation that employs product quantization and dimensionality reduction to d

    Trains supervised models to categorize text and evaluates them using precision and recall.

    HTML
    Ver en GitHub↗26,543
  • facebookresearch/pytextAvatar de facebookresearch

    facebookresearch/pytext

    6,298Ver en GitHub↗

    PyText is an extensible PyTorch-based framework for building, training, and deploying custom natural language processing models, including text classifiers, sequence taggers, and intent-slot predictors. It provides a modular toolkit that allows developers to assemble these models using pluggable registries for model architectures, data formats, and tensorizers, all configurable through YAML files without requiring code changes. The framework distinguishes itself through its comprehensive support for the full NLP model lifecycle, from training to production inference. It includes pre-built neu

    Trains deep-learning models to sort text into predefined categories using configurable architectures.

    Python
    Ver en GitHub↗6,298
  • dennybritz/cnn-text-classification-tfAvatar de dennybritz

    dennybritz/cnn-text-classification-tf

    5,684Ver en GitHub↗

    Este proyecto es una implementación en TensorFlow de una red neuronal convolucional diseñada para la clasificación de texto. Funciona como un categorizador de texto de deep learning que asigna etiquetas predefinidas a documentos de texto identificando y analizando patrones aprendidos dentro de los conjuntos de entrenamiento. El modelo utiliza una secuencia de vectorización de capa de embedding, capas convolucionales para la extracción de características y submuestreo de max-pooling para procesar datos de texto. Las probabilidades de categoría final se determinan a través de un sistema de clasificación de capa densa. El flujo de trabajo cubre el ciclo de vida completo del machine learning, incluyendo aprendizaje de texto supervisado, entrenamiento de modelos con dimensiones de embedding y tamaños de filtro configurables, y evaluación del rendimiento utilizando datasets de validación y persistencia de modelos basada en checkpoints.

    Trains deep-learning models to sort text into categories using a configurable convolutional architecture.

    Python
    Ver en GitHub↗5,684
  • huggingface/autotrain-advancedAvatar de huggingface

    huggingface/autotrain-advanced

    4,580Ver en GitHub↗

    Este proyecto es un entrenador de modelos multimodales y una herramienta de ajuste fino (fine-tuning) de aprendizaje automático que proporciona un flujo de trabajo contenedorizado para adaptar modelos preentrenados a tareas específicas. Cuenta con una interfaz web sin código y un tablero para entrenar modelos de lenguaje de gran tamaño y otros conjuntos de datos de aprendizaje automático sin escribir código. El sistema se distingue por integrar una interfaz sin código con orquestación de GPU remota, permitiendo a los usuarios desplegar entornos de entrenamiento contenedorizados en infraestructura en la nube o hardware local. Incluye un integrador dedicado para cargar pesos y configuraciones de modelos entrenados directamente en Hugging Face Hub. Las capacidades cubren una amplia gama de modalidades, incluyendo visión artificial para clasificación de imágenes y detección de objetos, procesamiento de lenguaje natural para clasificación de texto y tareas de secuencia a secuencia, y aprendizaje supervisado para datos tabulares. El kit de herramientas también admite la optimización especializada de modelos de lenguaje a través de ajuste fino eficiente en parámetros y cuantización. Los flujos de trabajo de entrenamiento se gestionan a través de archivos de configuración o una interfaz basada en navegador, con soporte integrado para el mapeo de columnas de conjuntos de datos y el monitoreo del progreso del entrenamiento.

    Develops models that assign predefined categories or labels to blocks of text.

    Python
    Ver en GitHub↗4,580
  • johnsnowlabs/spark-nlpAvatar de JohnSnowLabs

    JohnSnowLabs/spark-nlp

    4,135Ver en GitHub↗

    Spark NLP es un kit de herramientas para el análisis de texto escalable y aprendizaje automático construido sobre el framework de computación distribuida Apache Spark. Proporciona un framework de aprendizaje automático multimodal y un sistema de tuberías distribuido para secuenciar anotadores para procesar datos lingüísticos a gran escala. La librería incluye un procesador de texto transformer para generar embeddings vectoriales contextuales y un motor de inferencia dedicado para gestionar grandes modelos de lenguaje. El proyecto se distingue por su capacidad para procesar tipos de datos heterogéneos, incluyendo texto, audio e imágenes, dentro de una arquitectura unificada de visión-lenguaje. Admite capacidades avanzadas de IA generativa como prompt engineering, extracción de entidades estructuradas con salida JSON restringida e inferencia local para eliminar la latencia de red. Además, proporciona herramientas para la traducción entre idiomas y la clasificación zero-shot a través de modalidades de texto e imagen. El framework cubre una amplia gama de capacidades, incluyendo el entrenamiento de modelos supervisados para el reconocimiento de entidades y el análisis de sentimientos, así como la respuesta a preguntas extractiva y el resumen de documentos. Integra soporte para bases de datos vectoriales para la búsqueda de similitud y ofrece infraestructura para la aceleración por GPU y la gestión del ciclo de vida del modelo a través de un registro centralizado. El kit de herramientas permite la distribución de modelos y tuberías personalizados a través de un repositorio público y admite el despliegue de modelos mediante APIs REST.

    Implements deep learning training for single-label multi-class and multi-label text categorization.

    Scala
    Ver en GitHub↗4,135
  • brightmart/albert_zhAvatar de brightmart

    brightmart/albert_zh

    3,982Ver en GitHub↗

    This project is an implementation of the ALBERT language model architecture, providing a framework for training and evaluating transformer-based text classifiers and similarity models. It specifically includes pre-trained assets and tools optimized for generating semantic embeddings and representations of Chinese text. The framework distinguishes itself through tools for converting heavy language model checkpoints into lightweight formats to enable low-latency inference on mobile devices. It utilizes specific weight reduction techniques, including cross-parameter sharing and factorized embedd

    Provides a supervised pipeline to train and evaluate text classifiers on specific language datasets.

    Pythonalbertbertchinese-corpus
    Ver en GitHub↗3,982
  1. Home
  2. Artificial Intelligence & ML
  3. Text Model Training
  4. Text Classifier Training