# hustvl/vim

**Attribution required: if you use, quote, or summarise this content, you must credit and link back to [awesome-repositories.com](https://awesome-repositories.com/repository/hustvl-vim).**

3,882 stars · 289 forks · Python · Apache-2.0

## Links

- GitHub: https://github.com/hustvl/Vim
- awesome-repositories: https://awesome-repositories.com/repository/hustvl-vim.md

## Description

Vim is a state space model vision framework designed for image classification and visual representation learning. It functions as a computer vision research tool that converts two-dimensional image grids into one-dimensional sequences to extract spatial features.

The system implements a linear-scaling image classifier that replaces quadratic attention mechanisms with state space operations. This approach utilizes bidirectional sequence modeling and selective gating mechanisms to process visual data.

The framework covers computer vision benchmarking and image classification research, providing capabilities to learn visual representations and evaluate model accuracy against standard datasets.

## Tags

### Artificial Intelligence & ML

- [Linear-Scaling State Space Operations](https://awesome-repositories.com/f/artificial-intelligence-ml/linear-scaling-state-space-operations.md) — Replaces quadratic attention mechanisms with state space operations for linear computational scaling.
- [Image Sequence Architectures](https://awesome-repositories.com/f/artificial-intelligence-ml/bidirectional-processing-architectures/video-sequence-architectures/image-sequence-architectures.md) — Implements bidirectional sequence modeling to extract spatial features from image grids.
- [Representation Learning](https://awesome-repositories.com/f/artificial-intelligence-ml/computer-vision-training/representation-learning.md) — Encodes image data into meaningful mathematical representations for downstream tasks.
- [Selective State Space Implementations](https://awesome-repositories.com/f/artificial-intelligence-ml/deep-learning-framework-implementations/selective-state-space-implementations.md) — Implements selective state space blocks for linear-time sequence modeling of images.
- [Grid-to-Sequence Conversions](https://awesome-repositories.com/f/artificial-intelligence-ml/grid-to-sequence-conversions.md) — Transforms spatial image pixels into linear sequences for state space model compatibility.
- [Image Classification](https://awesome-repositories.com/f/artificial-intelligence-ml/image-classification.md) — Implements deep learning models to categorize images into predefined classes.
- [Linear-Scaling Image Classifiers](https://awesome-repositories.com/f/artificial-intelligence-ml/linear-classifiers/linear-scaling-image-classifiers.md) — Implements an image classification architecture that scales linearly relative to input sequence length.
- [Visual Representation Learning Frameworks](https://awesome-repositories.com/f/artificial-intelligence-ml/machine-learning/infrastructure/machine-learning-training/visual-representation-learning-frameworks.md) — Provides a framework for training image encoders to capture complex visual representations. ([source](https://cdn.jsdelivr.net/gh/hustvl/vim@main/README.md))
- [State Space Model Vision Frameworks](https://awesome-repositories.com/f/artificial-intelligence-ml/state-space-model-vision-frameworks.md) — Provides a vision-specific state space model framework for image classification and representation learning.
- [Bidirectional Sequence Modeling Tools](https://awesome-repositories.com/f/artificial-intelligence-ml/bidirectional-sequence-modeling-tools.md) — Extracts spatial image features using bidirectional sequence modeling and selective gating.
- [Computer Vision Benchmarks](https://awesome-repositories.com/f/artificial-intelligence-ml/computer-vision-benchmarks.md) — Measures vision model accuracy and performance against standard industry datasets.
- [Hierarchical Feature Computations](https://awesome-repositories.com/f/artificial-intelligence-ml/computer-vision-features/feature-descriptor-computation/hierarchical-feature-computations.md) — Organizes visual data across multiple abstraction levels to capture local and global context.
- [Computer Vision Research](https://awesome-repositories.com/f/artificial-intelligence-ml/computer-vision-research.md) — Provides an implementation of experimental algorithms for visual analysis and image processing research.
- [Gated Sequence Models](https://awesome-repositories.com/f/artificial-intelligence-ml/gated-sequence-models.md) — Utilizes selective gating mechanisms to prioritize relevant visual features during sequence processing.

### Part of an Awesome List

- [Attention Free Architectures](https://awesome-repositories.com/f/awesome-lists/ai/attention-free-architectures.md) — Bidirectional state space model for efficient visual learning.
