24 repositorios
Loss function utilities specifically for binary classification and negative sampling tasks.
Distinct from Loss Function Calculators: Distinct from Loss Function Calculators: focuses on the specific binary cross-entropy implementation rather than general loss calculation.
Explore 24 awesome GitHub repositories matching artificial intelligence & ml · Binary Cross-Entropy Calculators. Refine with filters or upvote what's useful.
This project is a collection of educational examples and code for implementing deep learning architectures using the PyTorch framework. It serves as a tutorial and implementation guide for building various neural network architectures for machine learning tasks. The project provides practical implementations for computer vision, including image classification and neural style transfer, as well as natural language processing examples for building sequence models and language predictors. It also covers generative models using adversarial and variational networks to synthesize or transform visua
Implements cross-entropy loss functions to guide the training of classification models.
This project is a comprehensive educational resource and curriculum designed to teach the mathematical foundations and practical implementation of neural networks. It provides a structured path for understanding how computers learn from data, covering core concepts such as gradient descent, backpropagation, and the biological inspiration behind artificial neurons. The platform distinguishes itself by combining theoretical proofs with hands-on implementation exercises. It demonstrates the universal approximation theorem through visual explanations and guides users in building various architect
Uses cross-entropy cost functions to optimize network training and prevent learning saturation.
dalle-mini is a text-to-image model and generative AI system designed to transform natural language descriptions into synthetic images. It functions as an image generation training toolkit and a generative model capable of creating visual representations from text prompts. The project provides a containerized deployment for consistent execution across different computing environments. It includes the necessary scripts and configuration files to train custom generative models from datasets. The system utilizes an autoregressive transformer architecture that treats visual data as discrete toke
Utilizes cross-entropy loss functions to optimize the prediction of image tokens during model training.
This project is a static educational website and comprehensive curriculum focused on computer vision and deep learning. It serves as a public repository of instructional materials, lecture notes, and technical guides specifically detailing convolutional neural networks and visual recognition. The site is developed using static-site generation to host course documentation and student project directories. It provides structured academic resources that guide learners through image classification, generative modeling, and the implementation of various neural network architectures. The curriculum
Instructs on implementing cross-entropy loss functions and regularization to guide the optimization of classifiers.
This project is a comprehensive collection of educational examples and reference implementations for building vision and language models using PyTorch. It serves as a deep learning tutorial covering the end-to-end process of developing neural networks, from initial architecture definition to final production deployment. The repository provides detailed guides on implementing a wide range of domain-specific models, including convolutional neural networks for object detection and segmentation, as well as transformer and recurrent architectures for natural language processing. It emphasizes gene
Implements general cross-entropy loss functions for multi-class classification tasks in PyTorch.
Liger-Kernel is a collection of pre-built fused Triton kernels and patching utilities designed to accelerate large language model training. It provides drop-in kernel replacements for common LLM operations such as RMSNorm, cross-entropy loss, and attention, enabling increased throughput and reduced memory usage while preserving bitwise-exact gradients. The project serves as a toolkit for composing custom model architectures from individual optimized kernels and for patching pre-existing models with minimal code changes. The project distinguishes itself through its ability to perform runtime m
Ships an optimized fused cross-entropy loss kernel for large-vocabulary classification tasks.
tiny-dnn is a header-only C++14 deep learning framework for building, training, and running inference on neural networks. It constructs static computational graphs at compile time using template-based layer composition, with a gradient-based backpropagation engine and minibatch stochastic gradient descent for training, all without external dependencies beyond the C++14 standard library. The framework supports importing pre-trained models from the Caffe framework directly, parsing its binary serialization format without requiring external protocol buffer libraries. It provides CPU-optimized te
Measures the difference between predicted and target values using cross-entropy, mean squared error, or mean absolute error.
Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a config-driven system for instantiating components, orchestrating distributed training, and managing parameter-efficient fine-tuning with quantization support, all through YAML-based configurations and command-line overrides. The library distinguishes itself through its comprehensive post-training workflow orchestration, combining supervised fine-tuning, preference optimization (DPO, PPO, GRPO), knowledge distillation, and quantization-aware training in a single configurable pip
Provides selectable DPO and RSO loss functions for controlling how models penalize un-preferred responses.
Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a configurable training pipeline orchestrated through YAML recipes, with CLI overrides and component swapping, distributed training via FSDP2, memory optimizations, and parameter-efficient fine-tuning methods like LoRA, DoRA, and QLoRA. The library distinguishes itself through its YAML-driven configuration system that defines all training parameters and instantiates components from config files, with full CLI override capability for any field or component at launch time. It suppo
Supports switching between DPO and RSO loss variants via a configuration flag to control alignment strategy.
Flashlight es una biblioteca de aprendizaje automático y de tensores independiente en C++ utilizada para construir y entrenar redes neuronales. Funciona como un framework integral de redes neuronales y motor de diferenciación automática, proporcionando las herramientas para construir grafos de computación y calcular gradientes mediante retropropagación. El proyecto sirve como framework de entrenamiento distribuido, utilizando operaciones all-reduce para sincronizar gradientes y parámetros a través de múltiples nodos de cómputo y dispositivos. Se distingue por una integración profunda de manipulación de tensores de alto rendimiento, interoperabilidad nativa de memoria de dispositivo y un sistema para sincronizar pesos a través de trabajadores distribuidos para acelerar el entrenamiento de modelos a gran escala. El framework cubre una amplia gama de capacidades de aprendizaje profundo, incluyendo composición modular de capas para diseñar arquitecturas complejas como bloques residuales y celdas recurrentes. Proporciona utilidades extensas de gestión de datos para ingesta y prefetching, junto con sistemas de serialización para persistir estados de modelos. Además, incluye una suite de herramientas de monitorización y observabilidad para rastrear métricas de entrenamiento y medir errores de secuencia. La biblioteca está implementada en C++.
Calculates errors between predictions and targets using standard loss functions like Mean Squared Error and Cross Entropy.
Neuraltalk is an automated image captioning system that generates natural language descriptions for images. It utilizes a deep learning model that integrates a pretrained convolutional neural network for visual feature extraction with a recurrent neural network decoder to produce text sequences. The project provides a full workflow for training and evaluating captioning models, including weight optimization via backpropagation and gradient descent. It includes tools for measuring caption accuracy by comparing generated text against reference descriptions. The system covers data preprocessing
Utilizes cross-entropy loss functions to measure the difference between predicted word distributions and ground-truth labels.
xtuner es un motor de entrenamiento integral para modelos de lenguaje grandes, que ofrece un toolkit para pre-entrenamiento, ajuste fino supervisado (fine-tuning) y la optimización de modelos multimodales de visión-lenguaje. Sirve como un acelerador de entrenamiento distribuido y un framework especializado para escalar modelos de Mezcla de Expertos (MoE) y alinear el comportamiento del modelo mediante aprendizaje por refuerzo a partir de retroalimentación humana (RLHF). El proyecto se distingue por optimizaciones avanzadas de memoria y cómputo, como el paralelismo de secuencia para ventanas de contexto ultra largas y el paralelismo de pipeline entrelazado para reducir el tiempo de inactividad de la GPU. Proporciona una suite dedicada para la optimización de preferencias, implementando técnicas como Group Relative Policy Optimization y Direct Preference Optimization para refinar las políticas del modelo y los sistemas de recompensa. Las áreas de capacidad cubren el entrenamiento distribuido de modelos a través de múltiples nodos, la preparación de datasets multimodales y la gestión del ajuste fino basado en adaptadores. El motor también incluye herramientas para la evaluación de modelos, fusión de pesos y exportación de parámetros entrenados a motores de inferencia. El entrenamiento se gestiona mediante archivos de configuración estandarizados y lanzadores distribuidos para asegurar resultados consistentes a través de clusters de computación.
Compute objective functions for cross-entropy or reinforcement learning to guide model optimization.
LightFM es una biblioteca de recomendación de Python y framework de machine learning diseñado para predecir las preferencias de los usuarios. Implementa un motor de recomendación híbrido que combina filtrado colaborativo con filtrado basado en contenido mediante la integración de datos de interacción usuario-ítem con metadatos descriptivos. El sistema utiliza factorización de matrices híbrida para aprender representaciones latentes de usuarios e ítems. Está diseñado específicamente para manejar retroalimentación implícita, utilizando funciones de pérdida especializadas como Weighted Approximate Rank Pairwise (WARP) y Bayesian Personalized Ranking (BPR) para optimizar las preferencias de ítems para conjuntos de datos que carecen de calificaciones negativas. La biblioteca proporciona herramientas para entrenar modelos mediante descenso de gradiente estocástico, calcular predicciones de preferencia de ítems y evaluar la precisión del modelo. Admite la clasificación personalizada de ítems y la predicción del comportamiento del usuario mediante la síntesis de matrices de interacción con embeddings de características.
Optimizes item preferences using WARP and BPR loss functions for datasets without negative ratings.
Este proyecto es una implementación en PyTorch de una red neuronal convolucional U-Net diseñada para la segmentación de imágenes a nivel de píxel. Funciona como un procesador de imágenes biomédicas que genera máscaras precisas para aislar estructuras anatómicas dentro de imágenes médicas. La arquitectura utiliza una estructura simétrica de codificador-decodificador para capturar el contexto y permitir una localización precisa. Emplea fusión de características mediante conexiones de salto (skip-connections) para combinar características de alta resolución de la ruta de contracción con salidas muestreadas hacia arriba, recuperando detalles espaciales. El sistema cubre el entrenamiento de modelos de deep learning utilizando pérdida de entropía cruzada binaria e incorpora técnicas de aumento de datos, como interpolación cúbica, rotación y volteo, para ampliar la variedad del conjunto de datos de entrenamiento. La implementación se proporciona como un Jupyter Notebook.
Implements binary cross-entropy as the loss function to optimize the image segmentation mask generation.
Este repositorio es un programa educativo integral y un framework de deep learning diseñado para enseñar aprendizaje profundo práctico usando PyTorch a través de notebooks y ejemplos de código. Sirve como una librería de alto nivel para construir, entrenar y desplegar redes neuronales, actuando como un orquestador de entrenamiento de modelos que coordina modelos de PyTorch, optimizadores y funciones de pérdida. El proyecto proporciona kits de herramientas especializados para visión artificial, procesamiento de lenguaje natural y preprocesamiento de datos tabulares. Se distingue por controles de entrenamiento avanzados como tasas de aprendizaje discriminativas, un sistema de callbacks bidireccional para personalizar la lógica de entrenamiento y una abstracción de learner de alto nivel que automatiza la colocación en dispositivos y los bucles de entrenamiento. El framework cubre una amplia superficie de capacidades, incluyendo la construcción automatizada de pipelines de datos, análisis de arquitectura de modelos y evaluación de rendimiento en tareas de clasificación, regresión y segmentación. También incluye utilidades para entrenamiento distribuido en múltiples GPUs, entrenamiento de precisión mixta para optimización de memoria y soporte especializado para datos de imágenes médicas. El proyecto se entrega como una serie de Jupyter Notebooks.
Computes model loss using a variety of algorithms including Cross Entropy and Mean Squared Error.
Este proyecto es un framework de re-identificación de personas en PyTorch diseñado para entrenar y evaluar modelos que identifican individuos a través de diferentes vistas de cámara. Proporciona un pipeline completo de entrenamiento de modelos, un extractor de características de deep learning para convertir imágenes en vectores numéricos y una suite de herramientas de benchmarking de visión artificial para medir la precisión de recuperación de identidad. El framework incluye un toolkit de aprendizaje por transferencia (transfer learning) especializado que soporta congelación de capas, optimización de tasa de aprendizaje por etapas y tasas de aprendizaje diferenciales para el ajuste fino de modelos preentrenados. Se distingue por un motor extensible que permite el desarrollo de lógica de entrenamiento personalizada y la implementación de objetivos de optimización específicos como la minería de triplet loss de muestras difíciles y el suavizado de etiquetas (label smoothing). El sistema cubre la gestión integral de datasets, incluyendo soporte para benchmarks estándar, muestreo de lotes equilibrado y aumento de imágenes. Proporciona utilidades de evaluación para calcular rangos de recuperación y distancias de características, así como herramientas de visualización para generar mapas de calor de activación y galerías de recuperación clasificadas. El proyecto está implementado en Python y aprovecha PyTorch para sus operaciones de deep learning.
Implements cross-entropy loss with optional label smoothing to regularize the training of classification models.
Este es un framework de clasificación de imágenes de PyTorch diseñado para entrenar y evaluar redes neuronales convolucionales. Proporciona una biblioteca integral de arquitecturas predefinidas y un pipeline de entrenamiento implementado específicamente para el conjunto de datos de referencia CIFAR-100. El framework incluye una variedad de implementaciones de redes neuronales convolucionales, que van desde modelos de investigación estándar hasta versiones ligeras optimizadas para dispositivos móviles. Cuenta con un registro de modelos modular para inicializar arquitecturas específicas y un sistema de benchmarking para comparar la efectividad de diferentes diseños de red. El proyecto cubre flujos de trabajo de entrenamiento y evaluación de aprendizaje profundo, incorporando persistencia de puntos de control de estado, aumento de datos basado en simetría y calentamiento de la tasa de aprendizaje. También incluye utilidades para medir la precisión del modelo cargando pesos guardados para pruebas predictivas.
Implements multi-class cross-entropy loss functions to guide the training of image classification models.
This is an educational implementation that builds a generative pre-trained transformer (GPT) language model from scratch using PyTorch. The project is structured as a step-by-step tutorial, walking through the construction of a decoder-only transformer architecture and its training loop with clean git commits and an accompanying video lecture for a hands-on learning experience. What sets this implementation apart is its focus on practical reproduction: it provides a workflow to train a 124-million-parameter model from scratch in about one hour on cloud GPU hardware, costing under ten dollars.
Uses cross-entropy loss as the objective function for next-token prediction during language model training.
Este proyecto es un recurso educativo integral y un curso para construir redes neuronales usando PyTorch. Cubre los bloques de construcción fundamentales del deep learning, incluyendo la manipulación de tensores, la diferenciación automática y la construcción de componentes modulares de redes neuronales. El repositorio sirve como guía técnica para varios dominios especializados. Proporciona detalles de implementación para tareas de visión artificial como clasificación de imágenes, detección de objetos y segmentación semántica, así como flujos de trabajo de procesamiento de lenguaje natural que involucran transformers, redes recurrentes y modelos generativos. Además, incluye una referencia para IA generativa, centrándose específicamente en la síntesis de imágenes mediante modelos de difusión y redes adversarias. El material se extiende a pipelines de optimización y despliegue de modelos. Cubre técnicas para reducir el tamaño del modelo y aumentar la velocidad de inferencia mediante cuantización y la exportación de modelos a formatos como ONNX y TensorRT. Otras áreas de capacidad incluyen ingeniería de datos para carga paralela, evaluación de modelos mediante métricas personalizadas y el despliegue de modelos de lenguaje grandes (LLM) de código abierto. El proyecto se entrega principalmente como una serie de Jupyter Notebooks.
Implements general cross-entropy loss functions used to optimize classification performance.
Este proyecto es un framework de clasificación de texto en chino basado en PyTorch. Proporciona un pipeline basado en transformers diseñado para categorizar secuencias de idioma chino en etiquetas predefinidas utilizando modelos de deep learning. La implementación admite modelos de lenguaje BERT y ERNIE para procesar y etiquetar texto complejo en chino. Estos modelos se utilizan para realizar tareas como análisis de sentimiento y categorización general de texto. El sistema utiliza codificación de texto basada en transformers y pooling de secuencias ponderado por atención para convertir caracteres sin procesar en vectores de documento. Emplea ajuste fino (fine-tuning) de modelos preentrenados y optimización de pérdida de entropía cruzada para adaptar los modelos a tareas de clasificación específicas.
Employs cross-entropy loss optimization to measure prediction error and update model weights during training.