awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

4 dépôts

Awesome GitHub RepositoriesTabular Data Wrangling

Utilities for cleaning, transforming, and reshaping datasets using expressions, regular expressions, and column operations.

Distinct from Python Data Pipeline Frameworks: Existing candidates are too narrow (PDFs, Mobile, Git) or focus on batch pipeline orchestration rather than interactive data transformation.

Explore 4 awesome GitHub repositories matching data & databases · Tabular Data Wrangling. Refine with filters or upvote what's useful.

Awesome Tabular Data Wrangling GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • saulpw/visidataAvatar de saulpw

    saulpw/visidata

    8,834Voir sur GitHub↗

    VisiData is a terminal-based interactive data analysis tool and browser designed for exploring, filtering, and sorting large tabular datasets. It functions as a structured data inspector that loads and flattens complex formats like JSON, XML, and PCAP into interactive sheets, as well as a terminal file manager for navigating directories and performing staged filesystem operations. The project distinguishes itself by rendering data visualizations, such as scatter plots and histograms, directly in the terminal using Unicode Braille characters. It provides a Python-based data wrangling environme

    A utility for cleaning and transforming datasets using Python expressions, regular expressions, and column manipulation.

    Pythonclicsvdatajournalism
    Voir sur GitHub↗8,834
  • hadley/r4dsAvatar de hadley

    hadley/r4ds

    5,070Voir sur GitHub↗

    r4ds est un cursus de science des données et une ressource pédagogique conçue pour maîtriser le langage de programmation R. Il fournit un chemin d'apprentissage structuré pour le processus de bout en bout d'importation, de nettoyage, de transformation et de visualisation des données. Le projet met l'accent sur un guide de science des données reproductible et un cursus complet pour le data wrangling. Il inclut des tutoriels spécialisés sur la grammaire des graphiques pour la visualisation de données en couches et des publications techniques créées avec Quarto qui mélangent code exécutable et prose narrative. Le matériel couvre un large éventail de capacités analytiques, incluant l'ingestion de données à partir de sources diverses, la jointure de données relationnelles et la gestion des variables catégorielles. Il aborde également le nettoyage de données, la modélisation mathématique et la génération de rapports et présentations professionnels multi-formats. Le cursus se concentre sur l'application pratique de la programmation fonctionnelle et des principes de tidy data pour créer des analyses transparentes et répétables.

    Provides a comprehensive curriculum for cleaning, transforming, and reshaping tabular datasets to prepare them for analysis.

    R
    Voir sur GitHub↗5,070
  • rdatatable/data.tableAvatar de Rdatatable

    Rdatatable/data.table

    3,894Voir sur GitHub↗

    Ce projet est un framework de traitement de données tabulaires haute performance pour R, conçu pour gérer des jeux de données massifs avec efficacité mémoire et vitesse. Il fournit une structure de données améliorée qui utilise la sémantique de référence et la modification sur place pour effectuer des transformations complexes sans la surcharge de copies d'objets inutiles. La bibliothèque se distingue par ses optimisations architecturales de bas niveau, incluant le traitement parallèle multi-threadé, le tri basé sur radix et l'analyse de fichiers mappés en mémoire. En déchargeant les routines critiques de manipulation et d'agrégation de données vers du code C compilé, elle permet une exécution rapide des tâches qui seraient autrement coûteuses en calcul. Son moteur principal prend en charge des opérations relationnelles avancées, telles que les jointures non-équi, glissantes et à intervalles chevauchants, parallèlement à l'indexation secondaire automatique pour accélérer l'accès répété aux données. Au-delà de ses capacités de traitement principales, le projet offre une suite complète d'outils pour la gestion du cycle de vie des données. Cela inclut des utilitaires d'ingestion et de sérialisation à haute vitesse avec détection automatique de type, ainsi qu'un support spécialisé pour l'analyse de séries temporelles et l'agrégation multidimensionnelle. Le framework est conçu pour évoluer, permettant aux utilisateurs d'effectuer des opérations complexes de regroupement, de filtrage et de remodelage sur des jeux de données contenant des milliards de lignes tout en maintenant la stabilité et les performances du système.

    Provides high-performance tools for cleaning, transforming, and reshaping large tabular datasets.

    R
    Voir sur GitHub↗3,894
  • dathere/qsvAvatar de dathere

    dathere/qsv

    3,687Voir sur GitHub↗

    qsv is a high-performance command line toolkit for querying, transforming, and analyzing comma-separated value files. It functions as a data wrangling interface and a tabular data profiler, featuring a query engine capable of executing SQL statements and joins directly on flat files without requiring a database. The project is distinguished by its ability to process massive datasets that exceed available system memory. This is achieved through disk-based external memory processing, including multithreaded merge sorting, on-disk hash tables for deduplication, and lightweight file indexing for

    Provides a high-performance toolkit for cleaning, transforming, and reshaping tabular datasets using expressions and scripts.

    Rustaickancsv
    Voir sur GitHub↗3,687
  1. Home
  2. Data & Databases
  3. Tabular Data Wrangling

Explorer les sous-tags

  • DSL-Based WranglingUse of a domain-specific language to perform computed column creation and data aggregation. **Distinct from Tabular Data Wrangling:** Focuses on the specific use of a DSL for transformation logic, distinct from general wrangling tools.