awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 repository-uri

Awesome GitHub RepositoriesTabular Duplicate Detection

Identifying and counting repeated records or unique entries within a data table.

Distinguishing note: Shortlist candidates focus on entity matching, code clones, or images; this is about exact row/value duplication in tables.

Explore 2 awesome GitHub repositories matching data & databases · Tabular Duplicate Detection. Refine with filters or upvote what's useful.

Awesome Tabular Duplicate Detection GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • jabref/jabrefAvatar JabRef

    JabRef/jabref

    4,373Vezi pe GitHub↗

    This project is a desktop-based bibliographic reference manager designed to organize academic research libraries and automate citation workflows. It functions as a research assistant that integrates directly with word processors and text editors, enabling users to insert and format references while writing. The application is built on a Java-based portable runtime, allowing it to operate as a self-contained tool that stores preferences and data in local configuration files. The platform distinguishes itself through a modular plugin architecture and a commitment to human-readable, text-based f

    Provides interfaces for comparing and merging repeated bibliographic records to maintain library data integrity.

    Javaacademiaacademic-publicationsai
    Vezi pe GitHub↗4,373
  • rdatatable/data.tableAvatar Rdatatable

    Rdatatable/data.table

    3,894Vezi pe GitHub↗

    Acest proiect este un framework de procesare a datelor tabelare de înaltă performanță pentru R, conceput pentru a gestiona seturi de date masive cu eficiență a memoriei și viteză. Oferă o structură de date îmbunătățită care utilizează semantica de referință și modificarea in-place pentru a efectua transformări complexe fără overhead-ul copierii inutile a obiectelor. Biblioteca se distinge prin optimizările sale arhitecturale de nivel scăzut, inclusiv procesarea paralelă multi-threaded, sortarea bazată pe radix și parsarea fișierelor mapate în memorie. Prin descărcarea rutinelor critice de manipulare și agregare a datelor către cod C compilat, permite execuția rapidă a sarcinilor care altfel ar fi costisitoare din punct de vedere computațional. Motorul său de bază suportă operațiuni relaționale avansate, cum ar fi join-uri non-equi, rolling și intervale suprapuse, alături de indexarea secundară automată pentru a accelera accesul repetat la date. Dincolo de capabilitățile sale primare de procesare, proiectul oferă o suită cuprinzătoare de instrumente pentru gestionarea ciclului de viață al datelor. Aceasta include utilitare de ingestie și serializare de mare viteză cu detectare automată a tipului, precum și suport specializat pentru analiza seriilor temporale și agregarea multidimensională. Framework-ul este construit pentru a scala, permițând utilizatorilor să efectueze operațiuni complexe de grupare, filtrare și remodelare pe seturi de date care conțin miliarde de rânduri, menținând în același timp stabilitatea și performanța sistemului.

    Identifies and counts repeated records or unique entries within a data table.

    R
    Vezi pe GitHub↗3,894
  1. Home
  2. Data & Databases
  3. Tabular Duplicate Detection

Explorează sub-etichetele

  • Bibliographic Duplicate ResolversInterfaces for comparing and merging repeated bibliographic records. **Distinct from Tabular Duplicate Detection:** Distinct from Tabular Duplicate Detection: focuses on bibliographic record comparison and resolution rather than generic table row deduplication.