4 repositorios
Combining multiple distinct dataset sources into a single training pipeline with balancing techniques.
Distinct from Training Datasets: Focuses on the integration and balancing of multiple sources, not just the curation of a single large dataset.
Explore 4 awesome GitHub repositories matching artificial intelligence & ml · Multi-Source Dataset Integration. Refine with filters or upvote what's useful.
Open CLIP is an open source framework for training and deploying Contrastive Language-Image Pre-training models. It serves as a vision-language training framework and multimodal embedding engine that maps images and text into a shared vector space for similarity searches and zero-shot classification. The project provides a toolkit for distributed training of contrastive models and includes an image-to-text generative model for producing natural language descriptions. It supports custom text encoder integration and utilizes teacher-student model distillation to transfer knowledge from large pr
Combines several dataset sources in a single training run with optional upsampling to balance sizes.
MMSegmentation is an open-source semantic segmentation toolbox built on PyTorch that provides a modular, configurable framework for building, training, evaluating, and deploying segmentation models. At its core, it offers a config-driven pipeline that assembles training, evaluation, and inference workflows by parsing hierarchical configuration files, with a modular component registry that enables plug-and-play composition of neural network modules, optimizers, datasets, and metrics. The framework supports the full model lifecycle through a unified runner interface that controls training, testi
Combines, repeats, or interleaves several datasets during training to increase data diversity.
Este es un framework de machine learning para tratar diversas tareas de procesamiento de lenguaje natural como un problema unificado de texto a texto. Proporciona un toolkit para pre-entrenar y ajustar modelos transformer a gran escala, utilizando un sistema donde tanto las entradas como las salidas se formatean como secuencias de texto crudo. El framework se distingue por su sistema de entrenamiento distribuido, que utiliza estrategias basadas en malla para escalar pesos de modelos y lotes de entrenamiento a través de múltiples núcleos TPU. Soporta aprendizaje multitarea combinando diversos datasets en un único flujo de entrenamiento utilizando tasas de mezcla configurables, permitiendo que un único modelo maneje varias tareas de lenguaje. El sistema cubre una amplia gama de capacidades, incluyendo arquitecturas codificador-decodificador, decodificación de búsqueda de haz (beam-search) para generación de texto y flujos de trabajo de transfer learning. Incluye utilidades para la preparación de datasets de NLP, evaluación del rendimiento del modelo y exportación de checkpoints entrenados para servir en producción. La biblioteca soporta la carga de checkpoints de modelos pre-entrenados de varios tamaños para acelerar el desarrollo.
Combines multiple distinct dataset sources into a single training pipeline using balancing techniques.
Este proyecto es un framework de aprendizaje profundo diseñado para la transcripción de voz a texto de extremo a extremo. Utiliza la arquitectura de red neuronal WaveNet para procesar la entrada de audio hablado y generar transcripciones de texto escrito, aprovechando la clasificación temporal conexionista (CTC) para mapear secuencias de audio de longitud variable a salidas a nivel de carácter. El sistema se distingue por una tubería de entrenamiento integral que soporta la ejecución distribuida a través de múltiples unidades de procesamiento gráfico (GPU). Incluye utilidades especializadas para la aumentación de datos de audio y la transformación de archivos de audio crudos en formatos binarios optimizados, lo que minimiza la latencia de entrada y salida de disco durante el entrenamiento de modelos a gran escala. El software proporciona un entorno completo para gestionar flujos de trabajo de aprendizaje automático, incluyendo herramientas para calcular métricas de pérdida para monitorear la convergencia y precisión del modelo. Todos los componentes, incluyendo el motor de reconocimiento y las tuberías de entrenamiento, están diseñados para el despliegue dentro de entornos contenedorizados para asegurar una ejecución consistente en diversos sistemas host.
Supports ingesting large-scale audio collections from multiple sources to improve the versatility and performance of recognition models.