# linyiqun/dataminingalgorithm

**Attribution required: if you use, quote, or summarise this content, you must credit and link back to [awesome-repositories.com](https://awesome-repositories.com/repository/linyiqun-dataminingalgorithm).**

3,950 stars · 1,680 forks · Java

## Links

- GitHub: https://github.com/linyiqun/DataMiningAlgorithm
- awesome-repositories: https://awesome-repositories.com/repository/linyiqun-dataminingalgorithm.md

## Description

This project is a data mining algorithm library and machine learning reference implementation. It provides a collection of tools for performing classification, clustering, and association rule mining, as well as a toolkit for nature-inspired optimization.

The library includes specialized utilities for graph and sequence mining, enabling the extraction of frequent subgraphs and sequential patterns. It also features a dimensionality reduction utility that uses rough set theory to remove redundant attributes from datasets.

The project covers a broad range of analytical capabilities, including network and graph analysis for ranking node importance and the use of probabilistic models and decision trees for data classification. It also implements distance and density-based methods for grouping data and heuristic-based search patterns for solving complex optimization problems.

## Tags

### Artificial Intelligence & ML

- [Machine Learning Implementations](https://awesome-repositories.com/f/artificial-intelligence-ml/machine-learning-implementations.md) — Provides a comprehensive set of reference implementations for core machine learning algorithms like decision trees and K-means.
- [Association Rule Learning](https://awesome-repositories.com/f/artificial-intelligence-ml/association-rule-learning.md) — Identifies recurring relationships and co-occurring items in datasets using frequent pattern and tree-based algorithms. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Categorical Classifiers](https://awesome-repositories.com/f/artificial-intelligence-ml/categorical-classifiers.md) — Categorizes data by building decision structures based on information gain and Gini indices. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Clustering Algorithms](https://awesome-repositories.com/f/artificial-intelligence-ml/clustering-algorithms.md) — Implements distance and density-based clustering methods to identify natural groupings in datasets. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Data Attribution Frameworks](https://awesome-repositories.com/f/artificial-intelligence-ml/data-attribution-frameworks.md) — Simplifies datasets by identifying and removing redundant attributes through rough set theory. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Decision Trees](https://awesome-repositories.com/f/artificial-intelligence-ml/decision-trees.md) — Builds classification models by recursively splitting data based on statistical measures of purity and entropy.
- [Classification Trees](https://awesome-repositories.com/f/artificial-intelligence-ml/decision-trees/classification-trees.md) — Categorizes information into distinct groups using probabilistic models and decision trees.
- [Dimensionality Reduction](https://awesome-repositories.com/f/artificial-intelligence-ml/dimensionality-reduction.md) — Simplifies high-dimensional datasets by removing redundant attributes via rough set theory.
- [Distance-Based Clustering](https://awesome-repositories.com/f/artificial-intelligence-ml/distance-based-clustering.md) — Implements distance-based clustering algorithms to identify natural structures within datasets using spatial proximity.
- [Frequent Itemset Mining](https://awesome-repositories.com/f/artificial-intelligence-ml/frequent-itemset-mining.md) — Identifies frequent itemsets and sequential events by iteratively pruning search spaces and expanding patterns.
- [Heuristic Optimization Algorithms](https://awesome-repositories.com/f/artificial-intelligence-ml/heuristic-optimization-algorithms.md) — Implements nature-inspired heuristic optimization algorithms such as genetic mutations and colony behavior to solve complex problems.
- [Hyperplane Margin Maximization](https://awesome-repositories.com/f/artificial-intelligence-ml/hyperplane-margin-maximization.md) — Constructs maximum margin boundaries in vector space to separate different data classes for prediction.
- [Sequential Pattern Analysis](https://awesome-repositories.com/f/artificial-intelligence-ml/machine-learning/speech-processing/sequence-to-sequence-tasks/sequential-pattern-analysis.md) — Detects significant sequences of events or items over time using sequential mining techniques. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Nature-Inspired Algorithms](https://awesome-repositories.com/f/artificial-intelligence-ml/nature-inspired-algorithms.md) — Ships a toolkit of optimization algorithms based on biological processes, including genetic and ant colony optimization.
- [Probabilistic Classifiers](https://awesome-repositories.com/f/artificial-intelligence-ml/probabilistic-classifiers.md) — Implements probabilistic models to categorize data points by handling conditional dependencies. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Sequential and Graph Data Analysis](https://awesome-repositories.com/f/artificial-intelligence-ml/sequential-and-graph-data-analysis.md) — Offers a integrated set of tools for extracting frequent subgraphs, sequential patterns, and ranking network nodes.
- [Sequential Pattern Mining](https://awesome-repositories.com/f/artificial-intelligence-ml/sequential-pattern-mining.md) — Identifies recurring sequences of events in data through recursive mining and pruning. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Similarity-Based Clustering](https://awesome-repositories.com/f/artificial-intelligence-ml/similarity-based-clustering.md) — Groups unlabeled data into sets using distance and density-based methods to uncover natural structures. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Subgraph Mining](https://awesome-repositories.com/f/artificial-intelligence-ml/subgraph-mining.md) — Provides specialized utilities for extracting frequent subgraphs from complex network data using encoding and search algorithms. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Clustering and Density Estimation](https://awesome-repositories.com/f/artificial-intelligence-ml/unsupervised-learning/clustering-and-density-estimation.md) — Organizes data into natural sets using spatial density and distance-based unsupervised techniques.

### Data & Databases

- [Data Mining](https://awesome-repositories.com/f/data-databases/data-mining.md) — Provides a comprehensive library of classical data mining algorithms for classification, clustering, and association rules.
- [Data Reducers](https://awesome-repositories.com/f/data-databases/data-reducers.md) — Provides utilities to eliminate redundant attributes from datasets using rough set theory. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Structural Importance Ranking](https://awesome-repositories.com/f/data-databases/distance-based-node-discovery/structural-importance-ranking.md) — Evaluates the importance of nodes in networks using structural ranking and link analysis. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Link Analysis Algorithms](https://awesome-repositories.com/f/data-databases/link-analysis-algorithms.md) — Evaluates node importance in networks by calculating the flow of authority and citations.
- [Frequent Subgraph Discovery](https://awesome-repositories.com/f/data-databases/subgraph-extractions/frequent-subgraph-discovery.md) — Discovers recurring structural patterns within graph-based data using subgraph mining algorithms. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))
- [Subgraph Mining Algorithms](https://awesome-repositories.com/f/data-databases/subgraph-mining-algorithms.md) — Provides utilities for extracting frequent subgraphs and recurring structural patterns from complex network topologies.
- [Dimensionality Reduction](https://awesome-repositories.com/f/data-databases/vector-quantization/high-dimensional-vector-compressors/dimensionality-reduction.md) — Simplifies high-dimensional datasets by removing redundant attributes using rough set theory.
- [Search Pruning](https://awesome-repositories.com/f/data-databases/data-transformation-functions/recursive-processors/recursive-logic-implementations/search-pruning.md) — Optimizes the extraction of frequent patterns by skipping recursive branches that cannot lead to valid solutions.

### Scientific & Mathematical Computing

- [Network Graph Analysis](https://awesome-repositories.com/f/scientific-mathematical-computing/network-graph-analysis.md) — Analyzes structural properties of graphs to identify influential nodes and recurring patterns.

### Software Engineering & Architecture

- [Optimization Problem Solvers](https://awesome-repositories.com/f/software-engineering-architecture/dynamic-programming/optimization-problem-solvers.md) — Finds optimal solutions for complex tasks using algorithmic solvers and nature-inspired techniques. ([source](https://github.com/linyiqun/dataminingalgorithm#readme))

### Part of an Awesome List

- [Data Science](https://awesome-repositories.com/f/awesome-lists/data/data-science.md) — Implementation of common data mining algorithms.
