21 repository-uri
Generates binary masks to distinguish target objects from backgrounds at a pixel level.
Distinct from Point-Based Mask Generators: Focuses on general pixel-level binary masking rather than specifically point-based mask generation
Explore 21 awesome GitHub repositories matching artificial intelligence & ml · Binary Mask Generators. Refine with filters or upvote what's useful.
This project is a TensorFlow and Keras implementation of the Mask R-CNN architecture. It provides a framework for performing simultaneous object detection and instance segmentation, transforming raw images into segmented masks and bounding boxes for individual object identification. The toolset enables custom computer vision training through fine-tuning pre-trained weights and integrating user-provided datasets. It includes capabilities for distributed GPU training to accelerate the optimization of large vision models. The framework covers model evaluation using standard precision metrics an
Implements a parallel convolutional branch to generate binary masks for isolating individual object instances at the pixel level.
Moondream is a small-scale vision language model designed to reason across images to generate captions and answer natural language questions. It functions as an edge-optimized system capable of performing visual question answering, image captioning, and object detection. The project distinguishes itself through a lightweight architecture designed for local inference on embedded devices, workstations, and air-gapped hardware. It supports the execution of models on local GPUs and Apple Silicon to ensure data privacy and low latency. The system's capabilities include identifying precise object
Isolates visual elements by generating pixel-level binary masks to distinguish objects from backgrounds.
YOLOv9 is a real-time computer vision framework and deep learning model designed for image classification, object detection, and instance segmentation. It functions as both a vision model and a trainer, allowing for the optimization of neural network weights on custom datasets using single or multiple GPUs. The framework utilizes programmable gradient information to perform high-speed identification and location of multiple objects within images and video streams. It extends beyond bounding box detection to provide instance segmentation and panoptic segmentation, which labels every pixel in a
Generates precise binary masks at the pixel level to separate individual object instances from the background.
This project is a modular PyTorch framework for training and evaluating object detection and instance segmentation models. It serves as a computer vision research tool and a deep learning inference engine designed to identify object locations, classes, and pixel-level masks within images. The framework implements a two-stage inference pipeline that utilizes region proposal networks and a symmetric mask-head architecture. It provides specialized capabilities for instance segmentation, object bounding box detection, and human pose estimation via anatomical keypoint detection. The system includ
Implements binary mask generators via a symmetric mask-head architecture to produce pixel-level object masks.
FastSAM is an image segmentation framework that uses convolutional neural networks to isolate visual elements and generate masks for detectable objects within images. It provides a system for both automatic all-object segmentation and promptable image segmentation. The project utilizes an inference-optimized architecture to reduce computational overhead, enabling faster mask generation and real-time visual analysis. It supports the creation of precise masks through various prompt inputs, including points, bounding boxes, and text descriptions. The framework covers broader computer vision cap
Implements a convolutional neural network to generate pixel-level binary masks for object isolation.
This project is a comprehensive collection of educational examples and reference implementations for building vision and language models using PyTorch. It serves as a deep learning tutorial covering the end-to-end process of developing neural networks, from initial architecture definition to final production deployment. The repository provides detailed guides on implementing a wide range of domain-specific models, including convolutional neural networks for object detection and segmentation, as well as transformer and recurrent architectures for natural language processing. It emphasizes gene
Converts raw probability maps into binary or categorical masks using thresholding for visualization purposes.
Backgroundremover is an AI-powered tool that removes backgrounds from both images and videos, accessible through a command-line interface and a Python API. At its core, it uses a pre-trained deep learning model to classify each pixel as foreground or background, producing a binary mask for removal. The tool distinguishes itself through multiple integration methods and output capabilities. It can process images and videos via Unix pipeline data streams, operate as an HTTP API server, or be called programmatically within Python scripts. Users can choose among different AI models to balance proc
Outputs black-and-white mask images indicating which pixels belong to the foreground subject.
mmagic is a multimodal training pipeline and framework for generative AI, focusing on visual synthesis and restoration. It provides the infrastructure to build and train models for tasks such as text-to-image and text-to-video generation, 3D-aware content synthesis, and high-fidelity image translation using diffusion models and generative adversarial networks. The project distinguishes itself through specialized capabilities for generative model personalization, including techniques for fine-tuning subjects and styles. It also supports advanced visual manipulations such as latent space interp
Generates binary or soft masks and trimaps from alpha mattes for foreground matting tasks.
Yolact este un framework de viziune computerizată și un model de segmentare a instanțelor în timp real. Utilizează o rețea neuronală complet convoluțională pentru a detecta obiecte și a genera măști la nivel de pixel pentru imagini și fluxuri video. Sistemul folosește generarea de măști prototipice pentru a crea prototipuri globale de măști care sunt combinate liniar pentru rezultate specifice instanței. Încorporează straturi convoluționale deformabile și pooling de regiuni de interes (RoI) deformabile pentru a adapta eșantionarea spațială la formele neregulate ale obiectelor. Framework-ul acoperă întregul ciclu de viață al dezvoltării modelului, inclusiv antrenarea pe seturi de date personalizate, evaluarea acurateței folosind media Average Precision și utilizarea antrenării distribuite multi-GPU pentru a scala viteza de procesare. Oferă, de asemenea, utilitare de procesare media pentru aplicarea măștilor de segmentare pe imagini și exportul fișierelor video adnotate. Proiectul include instrumente de persistență a stării pentru gestionarea checkpoint-urilor și reluarea antrenării, alături de logare pentru înregistrarea metricilor și a valorilor de pierdere (loss).
Generates global mask prototypes that are linearly combined to produce final instance-specific segmentation masks.
Acest proiect este un framework de segmentare a imaginilor multi-modal și un model de viziune text-to-mask. Acesta servește ca un segmentator vizual bazat pe SAM, conceput pentru a izola obiecte distincte în imagini și video prin convertirea prompt-urilor în limbaj natural și a altor input-uri în măști semantice la nivel de pixel. Sistemul funcționează ca un framework de segmentare a imaginilor multi-modal care integrează semnale text, imagine și audio pentru a genera măști. Include un tracker interactiv de obiecte video care izolează și urmărește entitățile vizuale în cadrele video folosind imagini de referință sau interogări textuale. Framework-ul oferă capabilități pentru etichetarea semantică a imaginilor, atribuind nume de categorii măștilor printr-un vocabular predefinit. De asemenea, suportă editarea interactivă a imaginilor prin memoria istoricului sesiunii și se referă la potrivirea caracteristicilor pentru a extrage obiecte pe baza regiunilor din imaginea de referință.
Produces precise object masks by processing user-defined or learned queries through a predictive decoder.
Adetailer este o extensie de inpainting pentru Stable Diffusion și un îmbunătățitor automat de detalii care identifică regiuni specifice ale imaginii pentru a îmbunătăți calitatea prin inpainting țintit. Funcționează ca un instrument AI de mascare a imaginilor care utilizează modele de detecție pentru a crea măști precise pentru editarea automată a imaginilor. Sistemul se distinge prin integrarea ghidurilor structurale, cum ar fi adâncimea și postura, pentru a constrânge procesul de inpainting și a menține consistența anatomică. De asemenea, suportă atribuirea de prompt-uri specifice obiectelor, permițând maparea unor instrucțiuni text unice către mai multe obiecte detectate în cadrul unei singure imagini, folosind token-uri de separare. Instrumentul oferă un pipeline complet pentru rafinarea imaginilor, acoperind generarea automată a măștilor, transformările morfologice ale măștilor și filtrarea obiectelor pe baza pragurilor de încredere și a rapoartelor de dimensiune. Combină aceste capabilități într-un proces iterativ de detecție, mascare și difuzie pentru a rafina detaliile fără a altera compoziția globală.
Automatically generates binary masks around detected objects to isolate them for targeted processing.
This software is a watermark removal system that uses machine learning and image inpainting to delete unwanted text or logos from images. It reconstructs missing pixels to match the original background, ensuring visual consistency through pretrained models. The project includes a masking utility to isolate specific regions for content replacement using binary masks, bounding boxes, or brush strokes. It also features a batch processor that applies these cleaning tasks to large sets of images via a predefined file list. The system handles image preparation by normalizing dimensions and aspect
Generates binary masks to define the exact pixel-level regions where watermarks should be replaced.
Acest proiect este un toolkit Python de bio-imagistică și o suită de analiză concepută pentru procesarea și analizarea imaginilor de microscopie și medicale. Oferă o colecție de instrumente pentru cuantificarea imaginilor, segmentarea imaginilor medicale și fluxuri de lucru generale de bio-imagistică. Suita include capabilități specializate pentru cuantificarea datelor biologice, cum ar fi măsurarea complexității ramificațiilor neuronale prin analiza Sholl, calcularea distribuțiilor dimensiunilor particulelor și urmărirea zonei rănilor în scratch assays. De asemenea, dispune de o bibliotecă de segmentare a imaginilor medicale care implementează arhitecturi U-Net pentru izolarea structurilor anatomice în date 3D și folosește rețele generative adversariale (GAN) pentru a crea imagini științifice sintetice pentru augmentarea seturilor de date. În linii mari, proiectul acoperă primitive de procesare a imaginilor, inclusiv denoising, îmbunătățirea contrastului și transformări morfologice. Oferă utilitare de gestionare a seturilor de date pentru conversia adnotărilor între formatele COCO, YOLO și măști binare, precum și instrumente de machine learning pentru antrenarea rețelelor neuronale și implementarea transferului de ponderi bazat pe autoencodere. Fluxurile de lucru de analiză sunt furnizate sub formă de serie de Jupyter Notebooks interactive.
Refines segmented binary masks using morphological closing operations to fill holes and connect fragments.
MODNet este un segmentator de imagini de deep learning și un model de matting pentru portrete conceput pentru a izola subiecții umani de fundaluri. Generează alpha matte-uri de înaltă calitate pentru imagini și video folosind doar input RGB standard, eliminând cerința pentru ghiduri trimap manuale. Framework-ul este optimizat pentru inferență în timp real și oferă utilitare pentru a exporta ponderile modelelor pre-antrenate în formate specializate pentru implementarea pe hardware-ul țintă. Proiectul acoperă fluxul de lucru complet pentru izolarea portretelor, inclusiv antrenarea modelului de matting supervizat pe seturi de date etichetate, eliminarea fundalului video în timp real și implementarea pe hardware edge.
Predicts high-quality alpha transparency masks directly from RGB input without requiring manual trimap guides.
AnyDoor este un framework de personalizare a imaginilor zero-shot conceput pentru a transfera obiecte specifice din imagini de referință în scene noi fără a necesita antrenament suplimentar al modelului. Funcționează ca un instrument de inserare a obiectelor bazat pe difuzie care permite plasarea obiectelor în medii țintă, păstrându-le în același timp identitatea, iluminarea și postura originală. Sistemul suportă inserarea atât a unui singur obiect, cât și a mai multor obiecte, permițând compunerea mai multor obiecte distincte din referințe diferite într-o singură imagine țintă. Utilizează un mecanism de segmentare pentru rafinarea măștilor pentru a curăța și ascuți marginile obiectelor, asigurând o îmbinare precisă între obiectele inserate și fundal. Proiectul oferă capabilități pentru editarea imaginilor la nivel de obiect și generarea regională ghidată de măști spațiale. Include, de asemenea, utilitare pentru antrenarea modelelor personalizate pe seturi de date specifice folosind hiperparametri configurabili pentru a îmbunătăți rezultatele transferului de obiecte.
Implements mask refinement techniques to clean object boundaries for higher quality image customization.
sam-hq este o colecție de modele fundamentale de viziune pre-antrenate și adaptoare concepute pentru segmentarea imaginilor de înaltă calitate, extracția de caracteristici multimodale și estimarea adâncimii. Oferă un model de viziune zero-shot capabil să efectueze segmentare și clasificare în domenii diverse fără a necesita antrenament specific sarcinii. Proiectul include un instrument de segmentare a imaginilor de înaltă calitate bazat pe Segment Anything Model care generează măști precise din prompt-uri spațiale. Include un extractor de caracteristici multimodale pentru a genera embedding-uri vectoriale de înaltă dimensiune atât din input-uri de imagine, cât și de text, precum și un instrument convoluțional pentru prezicerea distanței sau a înălțimii coronamentului din date vizuale. Framework-ul acoperă o gamă largă de capabilități de computer vision, inclusiv clasificarea imaginilor, extracția de caracteristici multi-rezoluție și preprocesarea imaginilor. Suportă adaptarea la domeniu prin fine-tuning pe seturi de date personalizate pentru aplicații specializate precum imagistica medicală și teledetecția. Decoderul de măști poate fi convertit într-un format deschis pentru execuție în medii cu un runtime standard.
Generates precise binary segmentation masks based on spatial points or bounding box queries.
Segment Geospatial este un toolkit Python pentru izolarea caracteristicilor geografice în imagini de teledetecție folosind Segment Anything Model. Funcționează ca un procesor de imagini de teledetecție care convertește tile-urile de hartă în formate georeferențiate pentru a genera măști de segmentare din date satelitare. Sistemul permite extragerea obiectelor geografice prin generarea automată de măști sau prompt-uri manuale, cum ar fi descrieri text, bounding box-uri și markere interactive. Suportă segmentarea imaginilor timeseries pentru a urmări sau identifica obiecte în secvențe de imagini pe date diferite și oferă un vizualizator de măști geospațiale pentru randarea rezultatelor pe hărți interactive. Proiectul acoperă o gamă largă de operațiuni spațiale, inclusiv achiziția de tile-uri de hartă, conversia raster-la-vector și reconstrucția marginilor caracteristicilor pentru a rafina limitele obiectelor. Include, de asemenea, un API REST care expune aceste funcții de segmentare și procesare a datelor către aplicații remote. Capabilitățile de export suportă imagini raster georeferențiate și formate vectoriale standard, inclusiv GeoJSON, Shapefile și GeoPackage.
Produces object masks across an entire image automatically without requiring manual user input or prompts.
TextRecognitionDataGenerator is a system for creating synthetic text images and character masks to train and test optical character recognition models. It functions as a dataset tool that generates artificial images by combining dictionary words with specific fonts and backgrounds to produce training sets for machine learning. The project includes a handwriting simulation engine that uses machine learning models to produce synthetic handwritten text. It also features a document degradation simulator that applies skew, blur, and distortion to images to mimic the visual quality of scanned physi
Produces binary masks at the pixel level to isolate characters from backgrounds for machine learning training.
BiRefNet is a PyTorch image segmentation framework designed for high-precision binary mask generation. It functions as a bilateral image segmentation model used to isolate foreground objects from complex backgrounds, as well as a specialized tool for camouflaged object detection and industrial defect detection. The project is designed for export to the ONNX format, which facilitates cross-platform deployment and inference. It supports custom model fine-tuning on user-provided image and mask datasets to adapt the model for specialized professional use cases. The system covers high-resolution
Generates precise pixel-level binary masks for high-resolution industrial and medical imagery.
TotalSegmentator is a medical image segmentation tool and AI-driven organ segmenter designed to isolate anatomical structures from CT scans. It functions as a deep learning anatomy parser and quantitative radiomics analyzer, providing a framework for identifying diverse body tissues and bones to create precise anatomical masks. The system distinguishes itself through a comprehensive medical analysis suite that includes patient biometric estimation for demographics such as age, sex, weight, and height. It further provides specialized clinical index calculations and modality and phase classific
Merges multiple specific anatomical subclasses into single binary masks for simplified regional analysis.