awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectDespreCum realizăm clasamentulPresăServer MCP
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·
Data-Centric-AI-Community avatar

Data-Centric-AI-Community/fg-data-profiling

0
View on GitHub↗
13,609 stele·1,792 fork-uri·Python·MIT·8 vizualizăridocs.sdk.ydata.ai↗

Fg Data Profiling

This project is a data profiling and exploratory data analysis tool designed to generate automated quality reports for Pandas and Spark dataframes. It serves as a system for computing descriptive statistics, identifying correlations, and analyzing univariate and multivariate data patterns.

The tool provides specialized capabilities for comparing different versions of datasets to identify changes in data quality and distributions. It includes a dedicated profiler for time-dependent data to extract statistical information such as seasonality and auto-correlation.

The software covers a broad analysis surface including text data composition, multivariate interaction mapping, and the extraction of technical file metadata. Analysis results can be exported as HTML files, JSON data, or interactive widgets.

A command line interface is available for processing CSV files and generating reports using local configuration files.

Features

  • Data Profiling - Provides automated statistical profiling to analyze data patterns and validate data quality.
  • Data Observability Profilings - Provides automated profiling of data distributions to detect shifts and quality issues in Pandas DataFrames.
  • Univariate Statistical Profiling - Computes descriptive statistics and generates distribution histograms for individual variables.
  • Automated - Provides a unified system for automated data quality reporting and profiling for both Pandas and Spark.
  • Data Quality Reports - Produces human-readable exploratory data analysis reports featuring descriptive statistics and quality alerts.
  • Statistical Aggregators - Computes descriptive statistics and distribution histograms for individual columns to determine central tendency.
  • Automated Exploratory Analysis - Automatically generates statistical summaries and visual insights to discover patterns and anomalies in new datasets.
  • Dataset Comparators - Provides utilities for calculating statistical differences and drift between different versions of dataframes.
  • Agnostic Interfaces - Implements a unified API to execute profiling logic across both Pandas and Spark data structures.
  • Distributed Dataframe Analysis - Implements large-scale data quality checks and exploratory analysis specifically for Spark DataFrames.
  • Multivariate Relationship Visualizers - Calculates pairwise interactions and correlations between multiple variables to identify dataset dependencies.
  • Time Series Analysis - Calculates temporal trends, seasonality, and auto-correlation for time-dependent datasets.
  • Time-Series Statistical Profiling - Extracts statistical information from time-dependent data, including seasonality and auto-correlation plots.
  • Time Series Decomposition - Analyzes temporal data using auto-correlation and partial auto-correlation to identify seasonality and trends.
  • Analysis Result Exporters - Serializes profiling reports into HTML, JSON, and interactive widgets for external system integration.
  • Time Series Analysis Tools - Provides specialized tools for calculating statistical properties of temporal data, such as seasonality and auto-correlation.
  • Command Line Interfaces - Provides a command line tool for processing CSV files and generating profiling reports via local configurations.
  • Analysis Report Serialization - Transforms analysis results into HTML, JSON, and interactive widgets for external viewing and integration.
  • Data Analysis - Generates data profiling reports for DataFrames.
  • Data Analysis and Processing - Data quality profiling for Pandas and Spark.

Istoric stele

Graficul istoricului de stele pentru data-centric-ai-community/fg-data-profilingGraficul istoricului de stele pentru data-centric-ai-community/fg-data-profiling

Căutare AI

Explorează mai multe repository-uri excelente

Descrie ce ai nevoie în limbaj simplu — AI-ul sortează mii de proiecte open source selectate în funcție de relevanță.

Start searching with AI

Alternative open-source pentru Fg Data Profiling

Proiecte open-source similare, clasificate după numărul de funcționalități comune cu Fg Data Profiling.
  • ydataai/pandas-profilingAvatar ydataai

    ydataai/pandas-profiling

    13,610Vezi pe GitHub↗

    This project is an exploratory data analysis framework and profiling tool designed to generate comprehensive statistical reports from Pandas and Spark DataFrames. It functions as a data quality profiler that identifies missing values, duplicates, and high correlations within tabular datasets. The tool distinguishes itself through specialized capabilities for time-series analysis, extracting temporal statistics, seasonality, and auto-correlation plots. It also includes a dataset comparison utility to identify structural or content changes between different versions of a dataset. The analysis

    Python
    Vezi pe GitHub↗13,610
  • ydataai/ydata-profilingAvatar ydataai

    ydataai/ydata-profiling

    13,388Vezi pe GitHub↗

    Ydata-profiling is an automated exploratory data analysis framework designed to generate comprehensive statistical reports and visual summaries from dataframes. It functions as a diagnostic tool for assessing data quality, identifying missing values, duplicates, and outliers, while providing a scalable engine for profiling massive datasets across distributed enterprise environments. The project distinguishes itself through its ability to handle large-scale data through distributed task orchestration and lazy stream processing, which minimizes memory overhead during complex computations. It in

    Pythonbig-data-analyticsdata-analysisdata-exploration
    Vezi pe GitHub↗13,388
  • pandas-profiling/pandas-profilingAvatar pandas-profiling

    pandas-profiling/pandas-profiling

    13,609Vezi pe GitHub↗

    This project is an exploratory data analysis library and profiling tool for Pandas and Spark DataFrames. It automates the initial investigation of datasets by generating comprehensive descriptive analysis reports, statistical summaries, and data quality warnings. The system functions as a data quality profiler to detect missing values, duplicate rows, and type inconsistencies. It includes a dataset comparison tool for identifying structural and content shifts between different versions of the same data, as well as specialized tools for time-series analysis to calculate auto-correlation and se

    Python
    Vezi pe GitHub↗13,609
  • hosseinmoein/dataframeAvatar hosseinmoein

    hosseinmoein/DataFrame

    2,917Vezi pe GitHub↗

    DataFrame is a C++ tabular data library and manipulation engine designed for managing heterogeneous data in contiguous memory. It functions as a statistical analysis framework and time series analysis toolkit, providing the means to store, index, and transform multidimensional datasets. The project distinguishes itself through a high-performance execution model that utilizes column-major storage, SIMD-aligned memory allocation, and a thread-pool for parallel computations. It employs a visitor-based algorithm dispatch system and policy-driven transformations to decouple data processing logic f

    C++aicppdata-analysis
    Vezi pe GitHub↗2,917
Vezi toate cele 30 alternative pentru Fg Data Profiling→

Întrebări frecvente

Ce face data-centric-ai-community/fg-data-profiling?

This project is a data profiling and exploratory data analysis tool designed to generate automated quality reports for Pandas and Spark dataframes. It serves as a system for computing descriptive statistics, identifying correlations, and analyzing univariate and multivariate data patterns.

Care sunt principalele funcționalități ale data-centric-ai-community/fg-data-profiling?

Principalele funcționalități ale data-centric-ai-community/fg-data-profiling sunt: Data Profiling, Data Observability Profilings, Univariate Statistical Profiling, Automated, Data Quality Reports, Statistical Aggregators, Automated Exploratory Analysis, Dataset Comparators.

Care sunt câteva alternative open-source pentru data-centric-ai-community/fg-data-profiling?

Alternativele open-source pentru data-centric-ai-community/fg-data-profiling includ: ydataai/pandas-profiling — This project is an exploratory data analysis framework and profiling tool designed to generate comprehensive… ydataai/ydata-profiling — Ydata-profiling is an automated exploratory data analysis framework designed to generate comprehensive statistical… pandas-profiling/pandas-profiling — This project is an exploratory data analysis library and profiling tool for Pandas and Spark DataFrames. It automates… hosseinmoein/dataframe — DataFrame is a C++ tabular data library and manipulation engine designed for managing heterogeneous data in contiguous… pandas-dev/pandas — Pandas is a high-performance data analysis library that provides a comprehensive framework for manipulating, cleaning,… saulpw/visidata — VisiData is a terminal-based interactive data analysis tool and browser designed for exploring, filtering, and sorting…