81 dépôts
Libraries for statistical computing, data manipulation, and graphical representation.
Explore 81 awesome GitHub repositories matching part of an awesome list · Data Analysis and Visualization. Refine with filters or upvote what's useful.
This project is a comprehensive technical reference and programming cheatsheet for the Python language. It serves as a curated catalog of language features, syntax patterns, and standard library functions designed to help developers identify and apply correct coding patterns. The documentation covers a broad range of functional areas, including language fundamentals such as object-oriented structuring, functional logic, and list comprehensions. It also provides guidance on utilizing the standard library for data analysis, file management, networking, and concurrent execution. The reference e
Guides the use of libraries for statistical computing, tabular data manipulation, and graphical representation.
This project is a Python-based automation toolkit designed to manage programmatic authentication and session persistence across web services. It provides a framework for executing automated login sequences, including the handling of interactive security challenges such as QR code verification and captcha resolution. The toolkit distinguishes itself by simulating native mobile application environments, allowing for the execution of scripts that require specific device-level headers and behaviors. It also incorporates hook-based interception to monitor workflow states and manage exceptions duri
Processes collected datasets using statistical methods and generates visual charts to represent trends, rankings, and geographic distributions clearly.
This project is a data profiling and exploratory data analysis tool designed to generate automated quality reports for Pandas and Spark dataframes. It serves as a system for computing descriptive statistics, identifying correlations, and analyzing univariate and multivariate data patterns. The tool provides specialized capabilities for comparing different versions of datasets to identify changes in data quality and distributions. It includes a dedicated profiler for time-dependent data to extract statistical information such as seasonality and auto-correlation. The software covers a broad an
Computes descriptive statistics and generates distribution histograms for individual variables.
This repository is a comprehensive collection of instructional guides and practical examples for Python development, focusing on machine learning, data science, and web scraping. It provides implementations for neural networks, reinforcement learning algorithms, and deep learning architectures using PyTorch, alongside detailed manuals for scientific computing and data visualization. The project distinguishes itself by offering specialized tutorials on concurrent programming to optimize CPU performance and guides for setting up Linux development environments. It covers the implementation of ad
Combines scientific computing and visualization tools to manipulate datasets and extract information.
Perspective is a columnar data analytics library and streaming data visualization engine. It provides an interactive data grid component and notebook analytics widgets designed for processing high-volume data and rendering interactive charts and grids. The system utilizes a high-performance query engine to enable real-time data analysis and streaming dataset visualization. It supports the creation of customizable dashboards and reports that update automatically as new data arrives without requiring full dataset reloads. The project covers large-scale dataset analytics through a schema-driven
Interactive component for large, streaming, and static datasets.
This project is a collection of educational notes and tutorials focused on Python programming, scientific computing, and data analysis. It serves as a reference for learning language basics, advanced techniques, and object-oriented design. The materials include implementation guides for building linear, logistic, and convolutional neural networks using symbolic graph frameworks. It also provides instruction on manipulating and visualizing structured data frames and performing complex mathematical operations through numerical libraries. The repository includes a system for converting interact
Guides the use of structured data frames and plotting libraries to analyze and visualize complex information.
csvkit is a composable Unix-style command-line toolkit for converting, filtering, and analyzing CSV files directly from the terminal. It provides a suite of focused single-purpose commands that can be combined via pipes to build complex data processing workflows, with a modular architecture that includes a column-type inference engine for automatically detecting data types and a streaming-pipeline design for efficient handling of tabular data. The toolkit distinguishes itself through its SQL-engine abstraction layer, which allows users to run SQL queries directly against CSV files without req
Command-line tools for converting and working with CSV data.
Cette bibliothèque de visualisation de données C++ est un framework de traçage scientifique utilisé pour créer des graphiques 2D et 3D, des graphes de réseau et des cartes géographiques. Elle fonctionne comme une bibliothèque graphique multi-backend, découplant la logique de traçage de haut niveau des moteurs de rendu de bas niveau pour prendre en charge divers backends de sortie. Le projet se distingue par une API à double interface, fournissant à la fois une interface fonctionnelle globale pour le prototypage rapide et une interface orientée objet pour un contrôle précis. Il dispose d'un moteur de mise en page basé sur des composants pour gérer les grilles tuilées et les sous-graphiques, ainsi qu'un état de tracé en couches qui permet de superposer plusieurs séries de données sans effacer les axes. La bibliothèque couvre un large éventail de capacités de visualisation, incluant le traçage de fonctions mathématiques, les champs vectoriels et l'analyse de données multidimensionnelles via des cartes thermiques et des coordonnées parallèles. Elle inclut des outils spécialisés pour la visualisation de données géographiques, tels que les graphiques geobubble et geodensity, ainsi que des outils pour le rendu de réseaux de graphes dirigés et non dirigés. Les capacités générales incluent la gestion des axes, le stylisme esthétique avec des colormaps et l'exportation de graphiques de haute qualité. Le projet utilise CMake pour l'automatisation de la construction et la récupération des dépendances afin de faciliter l'installation sur différents systèmes d'exploitation.
Visualizes complex datasets using parallel coordinates, heatmaps, and 3D surface plots to identify patterns.
Ce projet est un framework de calcul scientifique pour l'écosystème .NET, fournissant une suite complète de bibliothèques pour l'analyse numérique, les statistiques et l'optimisation mathématique. Il sert de boîte à outils fondamentale pour développer des applications en machine learning, traitement numérique du signal et vision par ordinateur. Le framework fournit des outils spécialisés pour l'entraînement et le déploiement de modèles prédictifs, incluant les réseaux de neurones, les machines à vecteurs de support (SVM) et les arbres de décision. Il se distingue par des intégrations poussées pour l'analyse visuelle en temps réel, comme le suivi d'objets et la détection de traits faciaux, ainsi qu'une bibliothèque dédiée au traitement numérique du signal pour capturer et filtrer les signaux audio et de capteurs. La surface de capacités s'étend à la décomposition de matrices de haut niveau et à l'algèbre linéaire, à la modélisation d'états probabilistes et aux algorithmes de recherche heuristique. Il couvre également un large éventail d'utilitaires de manipulation de données, de la réduction de dimensionnalité et la normalisation à l'organisation de données spatiales et aux composants de visualisation scientifique. Le système inclut des contrôleurs d'intégration matérielle pour la configuration de caméras, la gestion des ports GPIO et le matériel de détection de profondeur spécialisé.
Provides software implementations of univariate and multivariate probability distributions for calculating data measures.
Ce projet est une collection de ressources éducatives et d'implémentations de référence pour le développement de réseaux de neurones utilisant TensorFlow. Il sert de cours d'apprentissage complet, de programme d'apprentissage automatique et de guide d'implémentation pratique pour construire des architectures de deep learning. La base de code fournit des supports pédagogiques et des exemples couvrant un large éventail de types de modèles, y compris les réseaux de neurones convolutifs pour la classification d'images, les réseaux récurrents et les cellules LSTM pour les données séquentielles, et les auto-encodeurs pour la modélisation générative. Il inclut également des implémentations pour des agents d'apprentissage par renforcement profond et des techniques de transfert d'apprentissage pour adapter des modèles pré-entraînés à de nouvelles tâches. Le projet couvre le cycle de vie complet du développement, y compris le prétraitement des données, la définition du graphe de calcul et l'optimisation des poids. Il fournit des utilitaires pour l'évaluation des modèles et l'optimisation de l'entraînement, tels que le dropout et la régularisation, ainsi que des outils pour visualiser l'architecture du réseau et surveiller les métriques d'entraînement.
Provides tools for cleaning datasets and generating visual representations to analyze data patterns.
Stumpy est une bibliothèque Python pour l'analyse de séries temporelles évolutive centrée sur l'implémentation d'algorithmes de profil de matrice. Elle fournit un framework pour calculer des profils de distance afin d'identifier des modèles répétitifs et des anomalies au sein des données de séries temporelles. Le projet se distingue par sa capacité à mettre à l'échelle des calculs lourds sur du matériel GPU et des clusters distribués utilisant Dask. Il prend en charge l'analyse multidimensionnelle pour découvrir des motifs à travers des flux de données concurrents et offre un calcul incrémentiel pour l'analyse de streaming en temps réel. La bibliothèque couvre un large éventail de techniques d'exploration de séries temporelles, incluant la découverte de motifs, la détection d'anomalies et la correspondance de modèles de séquence. Elle fournit également des outils pour la segmentation sémantique afin de détecter les changements de régime et l'extraction de chaînes temporellement ordonnées de modèles de sous-séquences similaires.
Computes matrix profiles for multidimensional data to identify similar patterns across different variables.
This project provides a suite of interfaces and tools for accessing electricity carbon intensity and production metrics. It includes an API for real-time and historical data, a geographic power data map for visualizing regional carbon intensity and renewable energy percentages, and a system for extracting datasets required for standardized greenhouse gas emissions reporting. The project features an interactive API sandbox that allows users to test requests and inspect data responses without writing code. It also includes mechanisms for institutional email verification to manage access to hist
Retrieves and visualizes historical power data and renewable energy percentages to analyze grid performance.
Ce projet est un serveur Model Context Protocol qui fournit une interface pour les agents IA afin de créer, lire et modifier par programmation des classeurs Excel. Il sert de pont qui permet aux modèles de langage étendus d'effectuer l'automatisation de feuilles de calcul et la visualisation de données. Le serveur permet aux agents IA de générer des graphiques Excel natifs et des tableaux croisés dynamiques à partir de données brutes, transformant des informations structurées en résumés visuels. Il fournit un mécanisme pour la gestion de feuilles de calcul à distance via une couche de connectivité basée sur un protocole. Le système couvre un large éventail de capacités de manipulation de feuilles de calcul, notamment les opérations au niveau des cellules pour les formules et la validation des données, le formatage visuel des plages et les modifications de mise en page. Il gère également la gestion au niveau du classeur, telle que l'extraction de métadonnées, l'organisation des feuilles et la création de tableaux structurés.
Provides advanced Excel operations including pivot tables and formatting.
Mesa is a Python framework for agent-based modeling and complex systems simulation. It provides a toolkit for creating simulations where autonomous agents interact within a shared environment to observe emergent global behaviors. The project includes a browser-based interface for real-time visualization of simulation states and agent interactions. It also functions as a data analysis library for recording and processing metrics from model runs to quantify system behavior. The framework supports multiple environmental topologies, including grid-based spatial mapping and network-graph topologi
Provides tools to process data from model runs to identify patterns and quantify system behavior.
qsv is a high-performance command line toolkit for querying, transforming, and analyzing comma-separated value files. It functions as a data wrangling interface and a tabular data profiler, featuring a query engine capable of executing SQL statements and joins directly on flat files without requiring a database. The project is distinguished by its ability to process massive datasets that exceed available system memory. This is achieved through disk-based external memory processing, including multithreaded merge sorting, on-disk hash tables for deduplication, and lightweight file indexing for
Profiles raw datasets by calculating statistics and frequency distributions to understand their structure.
A Scala API for Cascading
Scala interface for Cascading data processing.
Breeze is/was a numerical processing library for Scala.
Numerical processing library for mathematical operations.
DifferentialEquations.jl est une bibliothèque numérique complète conçue pour résoudre des équations différentielles ordinaires, stochastiques, à retard et algébriques. Elle fonctionne comme une suite de solveurs haute performance qui intègre l'apprentissage automatique scientifique, la programmation probabiliste et la différenciation automatique dans un framework unifié. En tirant parti de la répartition multiple et de l'intégration symbolique-numérique, la bibliothèque fournit un environnement flexible pour la modélisation mathématique complexe et la simulation. Le projet se distingue par sa capacité à faire le pont entre l'analyse numérique traditionnelle et les techniques modernes d'apprentissage automatique. Il prend en charge l'entraînement aux équations différentielles universelles, permettant aux utilisateurs d'intégrer des réseaux de neurones directement dans des simulateurs scientifiques pour apprendre des dynamiques inconnues tout en maintenant des contraintes physiques. De plus, la bibliothèque offre des outils avancés d'analyse de sensibilité et d'estimation de paramètres, incluant des méthodes adjointes et l'inférence bayésienne, qui permettent un calibrage efficace des modèles et la découverte automatisée des équations gouvernantes à partir des données. La plateforme offre des capacités étendues pour le calcul haute performance, incluant un parallélisme agnostique au matériel qui répartit les simulations sur des CPU, GPU et clusters distribués. Elle intègre une quantification rigoureuse de l'incertitude via l'arithmétique d'intervalle et la propagation de Monte Carlo, garantissant une estimation fiable des erreurs dans les expériences numériques. De plus, le système propose des routines d'optimisation sophistiquées, telles que la détection de parcimonie basée sur les graphes et le calcul de produit sans matrice, pour accélérer les performances dans les systèmes à grande échelle.
Provides standardized interfaces for interpolating, differentiating, and visualizing numerical simulation results.
A Model Context Protocol server for converting almost anything to Markdown
Converts web content and various files into clean Markdown.
The fastest business intelligence tool for humans and agents.
Dashboarding tool for transforming datasets into SQL-based insights.