awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

33 repository-uri

Awesome GitHub RepositoriesIndex Construction

Utilities for initializing and populating searchable vector structures.

Distinguishing note: Focuses on the construction phase of indexing.

Explore 33 awesome GitHub repositories matching data & databases · Index Construction. Refine with filters or upvote what's useful.

Awesome Index Construction GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • elasticsearch/elasticsearchAvatar elasticsearch

    elasticsearch/elasticsearch

    77,171Vezi pe GitHub↗

    Elasticsearch is a distributed search engine and NoSQL document store designed for full-text search and real-time data retrieval. It functions as a RESTful data indexer and vector database, allowing for the storage and management of structured JSON documents across multiple nodes. The system distinguishes itself through its ability to serve as a log analytics platform for monitoring system health and security events. It incorporates vector search implementation using mathematical embeddings to support generative AI and augmented generation applications. The platform covers a broad range of c

    Uses inverted indexes to map terms to documents for high-performance full-text search.

    Java
    Vezi pe GitHub↗77,171
  • facebookresearch/faissAvatar facebookresearch

    facebookresearch/faiss

    40,302Vezi pe GitHub↗

    This project is a high-performance library designed for the similarity search and clustering of dense vectors across massive datasets. It functions as a vector similarity search engine, providing the necessary tools to organize complex numerical data into specialized structures that facilitate rapid retrieval and efficient querying of millions of records. The library distinguishes itself through a variety of advanced indexing and compression techniques, including hierarchical navigable small worlds for logarithmic time complexity and inverted file indexing to partition vector spaces into mana

    Initializes searchable structures with specific dimensions and populates them with database vectors to ensure efficient similarity lookups.

    C++
    Vezi pe GitHub↗40,302
  • netease-youdao/qanythingAvatar netease-youdao

    netease-youdao/QAnything

    14,020Vezi pe GitHub↗

    QAnything is a retrieval-augmented generation application framework and self-hosted AI interface. It functions as a system that combines a vector database knowledge base, a document parsing service, and a hybrid search engine to generate answers based on private user data. The project features a modular pipeline architecture that allows users to independently replace components such as parsers, embedding models, and reranking engines. It supports local-first model deployment and offline operation to ensure data privacy, and includes a two-stage retrieval pipeline that merges dense vector embe

    Implements end-to-end processes for parsing documents, generating embeddings, and storing chunks for semantic retrieval.

    Python
    Vezi pe GitHub↗14,020
  • tporadowski/redisAvatar tporadowski

    tporadowski/redis

    9,987Vezi pe GitHub↗

    Redis is a high-performance in-memory key-value store that functions as a distributed cache, message broker, and NoSQL database. It provides sub-millisecond read and write access to data stored in RAM and can operate as a vector database for indexing high-dimensional embeddings. The system supports a wide range of data storage and synchronization primitives, including the management of strings, hashes, lists, sets, and JSON documents. It enables real-time data operations through atomic transactions, hybrid persistence using snapshots and append-only logs, and high-availability configurations

    Parses documents and creates vector embeddings to build searchable knowledge bases for semantic search.

    Credisredis-for-windowsredis-msi-installer
    Vezi pe GitHub↗9,987
  • yusufkaraaslan/skill_seekersAvatar yusufkaraaslan

    yusufkaraaslan/Skill_Seekers

    9,641Vezi pe GitHub↗

    Skill Seekers is a toolset for generating large language model knowledge bases, featuring a multi-source content scraper and a dedicated RAG data pipeline. It extracts technical data from documentation, code, and video to create structured assets and configuration files for AI-powered IDE extensions. The project distinguishes itself through the ability to transform raw data into polished tutorials and specialized skills for AI plugin marketplaces. It utilizes abstract syntax tree parsing and optical character recognition to analyze GitHub repositories, PDFs, and video frames, converting these

    Converts documentation and diverse data sources into structured formats for retrieval pipelines and vector databases.

    Pythonai-toolsast-parserautomation
    Vezi pe GitHub↗9,641
  • liaokongvfx/langchain-chinese-getting-started-guideAvatar liaokongVFX

    liaokongVFX/LangChain-Chinese-Getting-Started-Guide

    9,039Vezi pe GitHub↗

    This project is a collection of tutorials and guides for building large language model applications using the LangChain framework, written in Chinese. It serves as a learning resource for developing software that integrates language models with memory and chain-based logic. The resource provides specific walkthroughs for implementing retrieval augmented generation systems using vector stores and document loaders. It includes guides on creating autonomous agents that dynamically select and execute external tools, as well as tutorials for translating plain text queries into executable database

    Walks through the full pipeline of parsing documents and generating embeddings for semantic retrieval.

    Vezi pe GitHub↗9,039
  • 53ai/53aihubAvatar 53AI

    53AI/53AIHub

    9,025Vezi pe GitHub↗

    53AIHub is a centralized orchestration platform for deploying and managing AI agents and prompts across multiple large language model providers. It functions as a multi-model AI gateway and an operation portal for AI services, providing a unified interface to coordinate agents and prompts from various external platforms. The project distinguishes itself as a white-label AI portal designed for self-hosted infrastructure, allowing for full control over operational data on private servers or containers. It includes a comprehensive AI SaaS administration layer with a multi-tenant subscription eng

    Implements end-to-end processes for parsing documents and generating embeddings for semantic retrieval.

    Gocozedifyfastgpt
    Vezi pe GitHub↗9,025
  • intel/ipex-llmAvatar intel

    intel/ipex-llm

    8,836Vezi pe GitHub↗

    Intel XPU LLM Acceleration Library is a toolkit designed to accelerate large language model inference and finetuning on Intel CPUs, GPUs, and NPUs. It provides a distributed inference engine for scaling models across multiple accelerators, a multimodal model runtime for vision and speech tasks, and a low-bit model quantization tool for converting weights into INT4, FP8, and GGUF formats. The project features a parameter-efficient finetuning framework that enables model adaptation using QLoRA and DPO on Intel hardware. It distinguishes itself by providing specialized optimizations for Intel XP

    Processes knowledge files to create searchable vector-based knowledge bases for question-answering tasks.

    Python
    Vezi pe GitHub↗8,836
  • kevin-wayne/algs4Avatar kevin-wayne

    kevin-wayne/algs4

    7,519Vezi pe GitHub↗

    algs4 is a Java data structures library and algorithm reference collection designed as the source code for a standard computer science textbook curriculum. It provides a comprehensive suite of fundamental implementations for sorting, searching, and core data organization. The project serves as a graph theory framework, offering tools for representing directed and undirected graphs and performing complex traversals and pathfinding. It also includes a broad sorting algorithm suite and a specialized library of Java data structures, including stacks, queues, priority queues, and symbol tables. I

    Implements an inverted index that maps individual words to the files containing them for fast document retrieval.

    Java
    Vezi pe GitHub↗7,519
  • eto-ai/lanceAvatar eto-ai

    eto-ai/lance

    6,671Vezi pe GitHub↗

    Lance is a versioned columnar data format and storage engine designed as a multimodal AI lakehouse. It serves as a vector database storage engine and a cloud object store dataset manager, organizing images, video, audio, and embeddings into a unified format optimized for machine learning workflows. The project distinguishes itself by combining a columnar layout for structured data with a specialized blob store for large multimodal tensors. It implements a hybrid search engine that integrates vector similarity search, full-text search, and SQL analytics on a single dataset, supported by a stor

    Coordinates multiple workers to build index segments in parallel, optimizing the construction process across CPU cores.

    Rust
    Vezi pe GitHub↗6,671
  • redisearch/redisearchAvatar RediSearch

    RediSearch/RediSearch

    6,161Vezi pe GitHub↗

    RediSearch is a Redis module that adds secondary indexing, full-text search, aggregation, and vector similarity search directly into the in-memory data store. It operates as an in-process search engine, extending the core key-value store with capabilities for indexing hash and JSON documents, enabling fast field-level lookups beyond primary key access. The module provides a full-text search engine built on inverted indexes, supporting stemming, fuzzy matching, and relevance scoring via tf-idf. It also includes a vector similarity search engine using a Hierarchical Navigable Small World graph

    Builds token-level inverted lists from indexed text fields for fast term lookups and relevance scoring.

    Cfulltextgeospatialgis
    Vezi pe GitHub↗6,161
  • hound-search/houndAvatar hound-search

    hound-search/hound

    5,846Vezi pe GitHub↗

    Hound is a self-hosted code search engine that indexes source code repositories and provides fast regular expression search results using a trigram-based index. It is designed to be deployed on your own infrastructure, enabling you to search across multiple public and private code repositories simultaneously. The engine builds its search index by decomposing source code into three-character trigrams, which allows for fast substring matching with regular expressions. It supports searching across multiple repositories in parallel, returning results from the pre-built trigram index. Hound can in

    Builds a search index by decomposing source code into three-character trigrams for fast substring matching with regular expressions.

    JavaScript
    Vezi pe GitHub↗5,846
  • wonderwhy-er/desktopcommandermcpAvatar wonderwhy-er

    wonderwhy-er/DesktopCommanderMCP

    5,493Vezi pe GitHub↗

    DesktopCommanderMCP is a Model Context Protocol (MCP) server that gives AI agents direct access to local files, shell commands, and system processes through natural language instructions. It acts as a unified bridge between conversational commands and desktop operations, enabling an AI to translate plain English into file management, code editing, system command execution, data analysis, and software scaffolding tasks without needing its own API. The server exposes these capabilities as structured tools via the MCP protocol, so any compatible agent can interact with the local environment in a

    Creates, updates, and organizes local markdown notes and converts scattered data into structured living documents.

    TypeScriptagentaicode-analysis
    Vezi pe GitHub↗5,493
  • pagefind/pagefindAvatar Pagefind

    Pagefind/pagefind

    5,287Vezi pe GitHub↗

    Pagefind este un motor de căutare pentru site-uri statice care indexează fișiere HTML pentru a oferi o experiență de căutare bazată pe browser, fără a fi nevoie de un server backend sau API. Constă dintr-un indexator de căutare multilingv și un set de componente de interfață preconstruite și personalizabile pentru randarea input-urilor de căutare și a listelor de rezultate. Sistemul este conceput pentru conținut global, utilizând un indexator de căutare multilingv care detectează limbile paginilor și creează bundle-uri de index independente pentru a oferi stemming și rezultate specifice limbii. Optimizează performanța prin utilizarea unui index comprimat și delegarea execuției interogărilor către un web worker pentru a menține interfața utilizatorului responsivă. Instrumentul acoperă o gamă largă de capabilități de indexare și recuperare, inclusiv capacitatea de a procesa tipuri de conținut diverse precum PDF-uri și JSON, precum și filtrarea prin căutare fațetată bazată pe metadate personalizate. Oferă mecanisme pentru ajustarea relevanței rezultatelor, împărțirea secțiunilor paginii pentru o precizie îmbunătățită și un kit UI cuprinzător care include modale, panouri de filtrare și evidențierea termenilor. Proiectul include instrumente de dezvoltare pentru servirea site-ului local și exporturi de tip playground pentru diagnosticare, pentru a depana comportamentul indexului.

    Creates separate index bundles based on ISO language codes to provide language-specific stemming and search results.

    Rust
    Vezi pe GitHub↗5,287
  • modelengine-group/nexentAvatar ModelEngine-Group

    ModelEngine-Group/nexent

    5,265Vezi pe GitHub↗

    Nexent este un plan de control AI enterprise și o platformă de orchestrare a agenților LLM. Oferă un mediu zero-code pentru proiectarea, implementarea și gestionarea agenților AI de producție printr-un framework de colaborare multi-agent care coordonează agenți autonomi specializați folosind protocoale de mesagerie standardizate. Platforma integrează Model Context Protocol pentru a conecta agenții cu instrumente, plugin-uri și servicii externe printr-o interfață de comunicare universală. Se distinge în continuare printr-un manager dedicat de baze de cunoștințe RAG care importă documente nestructurate și utilizează căutarea hibridă pentru a oferi context fundamentat pentru răspunsurile modelului. Sistemul acoperă o gamă largă de capabilități, inclusiv controlul accesului multi-tenant bazat pe roluri, interacțiunea multimodală prin text, voce și imagini, și regăsirea vectorială hibridă. Include, de asemenea, o piață pentru distribuția și descoperirea agenților, alături de instrumente de observabilitate pentru capturarea urmelor de execuție. Platforma suportă deployment securizat prin împachetare offline containerizată pentru infrastructuri air-gapped.

    Parses and vectorizes various document formats into searchable knowledge bases with integrated access controls.

    Pythonagentagentic-aiagentic-framework
    Vezi pe GitHub↗5,265
  • nmslib/hnswlibAvatar nmslib

    nmslib/hnswlib

    5,253Vezi pe GitHub↗

    hnswlib este o bibliotecă C++ header-only și un motor de indexare vectorială conceput pentru căutarea aproximativă a celui mai apropiat vecin în spații cu dimensiuni mari. Acesta organizează colecții mari de embedding-uri într-o structură de graf care poate fi căutată pentru a permite interogări rapide de proximitate și calcule de distanță. Sistemul utilizează grafuri Hierarchical Navigable Small World pentru a obține o căutare rapidă a similarității vectoriale. Se distinge prin permiterea definirii de metrici de distanță personalizate și funcții de similaritate pentru a adapta calculele la cerințe specifice de date. Motorul acoperă întregul ciclu de viață al indexării, inclusiv construcția incrementală a indexului și gestionarea punctelor de date prin adăugări și eliminarea elementelor. Capabilitățile de interogare includ atât căutarea aproximativă, cât și cea exactă a celui mai apropiat vecin, completată de filtrarea căutării booleene pentru a exclude candidații pe baza etichetelor elementelor. Biblioteca suportă persistența indexului prin serializarea fișierelor binare și oferă configurații pentru execuția paralelă pentru a distribui sarcinile de interogare și indexare pe mai multe nuclee CPU.

    Constructs hierarchical proximity graphs by configuring link density to balance memory usage and retrieval recall.

    C++
    Vezi pe GitHub↗5,253
  • alibaba/zvecAvatar alibaba

    alibaba/zvec

    5,198Vezi pe GitHub↗

    zvec is an embedded vector database engine and indexing library designed for high-dimensional similarity search. It functions as a hybrid search engine and a retrieval-augmented generation knowledge base, allowing for the storage and retrieval of dense and sparse vectors. The system is distinguished by its hybrid retrieval pipeline, which fuses vector similarity, full-text keyword matching, and scalar metadata filtering into single query operations. It supports a plugin-based model integration system for registering custom embedding models and rerankers, as well as language bindings for nativ

    Provides utilities to create permanent indexes from staged vectors to optimize similarity search speed.

    C++ann-searchembedded-databaserag
    Vezi pe GitHub↗5,198
  • tencentmusic/cube-studioAvatar tencentmusic

    tencentmusic/cube-studio

    5,062Vezi pe GitHub↗

    Cube Studio este o platformă MLOps cloud-native și un orchestrator AI bazat pe Kubernetes, conceput pentru întregul ciclu de viață al învățării automate. Oferă un framework de antrenare distribuită pentru fine-tuning-ul modelelor la scară largă, un manager de resurse GPU pentru virtualizarea hardware și un orchestrator de pipeline-uri ML care utilizează grafuri aciclice direcționate vizuale pentru a gestiona fluxurile de lucru end-to-end. Platforma se distinge prin serverul său specializat de inferență LLM, care suportă generarea augmentată prin recuperare (RAG) și construirea de baze de cunoștințe private. Dispune de un sistem dedicat pentru fine-tuning supervizat și învățare prin consolidare a modelelor de limbaj mari, completat de instrumente vizuale de căutare a hiperparametrilor. Sistemul acoperă o gamă largă de capabilități operaționale, inclusiv etichetarea datelor multimodale, pipeline-uri de date distribuite și programarea sarcinilor de lucru multi-cluster. De asemenea, oferă medii de dezvoltare interactive bazate pe browser, gestionarea imaginilor de containere și un registru de modele pentru versionarea și implementarea API-urilor de inferență scalabile cu împărțirea traficului. Infrastructura include monitorizarea integrată a stării clusterului și controlul accesului bazat pe roluri cu integrare single sign-on.

    Integrates domain-specific data using embeddings and semantic retrieval to build private knowledge bases.

    Pythonaiaihubargo
    Vezi pe GitHub↗5,062
  • microsoft/muzicAvatar microsoft

    microsoft/muzic

    4,928Vezi pe GitHub↗

    Muzic este o platformă și un framework de deep learning pentru analiza, compoziția și sinteza muzicală bazată pe AI. Acesta funcționează ca un framework de generare muzicală și instrument de analiză, utilizând modele de limbaj mari și agenți autonomi pentru a orchestra crearea și interpretarea muzicii simbolice și audio. Proiectul se distinge prin capabilitățile sale cross-modal, mapând limbajul natural și muzica simbolică într-un spațiu de embedding comun pentru clasificare zero-shot și regăsirea informațiilor. Utilizează o varietate de arhitecturi specializate, inclusiv framework-uri de difuzie pentru sinteza audio, mecanisme de atenție dual-grain pentru consistența structurală a secvențelor lungi și un sistem hibrid care combină regulile teoriei muzicale cu rețelele neuronale. Platforma acoperă o gamă largă de capabilități, inclusiv generarea de secvențe MIDI din text și versuri, sinteza vocală neuronală și transcrierea automată a versurilor. De asemenea, oferă instrumente pentru modelarea structurii muzicale, generarea simbolică bazată pe atribute și orchestrarea instrumentelor muzicale externe prin agenți autonomi. Utilitarele de suport includ pipeline-uri de inginerie a datelor pentru binarizarea MIDI la scară largă, codificarea seturilor de date și procesarea semnalului audio pentru extragerea notelor melodice și alinierea vorbirii la foneme.

    Builds a searchable repository of musical pieces by extracting pitch embeddings and annotating structural elements.

    Pythonai-musicdeep-learningmusic
    Vezi pe GitHub↗4,928
  • oracle/opengrokAvatar oracle

    oracle/opengrok

    4,868Vezi pe GitHub↗

    OpenGrok este un motor de căutare și indexator de cod sursă bazat pe Java, conceput pentru a procesa arbori mari de surse și binare într-un index căutabil. Funcționează ca un browser de versionare, permițând explorarea și căutarea istoricelor de revizuire integrate cu sistemele de versionare. Sistemul oferă referințe încrucișate bazate pe simboluri pentru a lega definițiile și utilizările codului, permițând navigarea printr-un codebase. Utilizează un motor de căutare cu index inversat pentru a efectua recuperarea full-text a codului sursă. Aplicația suportă sincronizarea periodică a surselor și reindexarea pentru a menține datele locale actualizate. Deployment-ul este suportat prin imagini de container pentru a menține medii consistente pe platformele de găzduire.

    Implements inverted indexes that map words to locations to enable efficient full-text retrieval of source code.

    Javacodeenginejava
    Vezi pe GitHub↗4,868
Înapoi12Înainte
  1. Home
  2. Data & Databases
  3. Index Construction

Explorează sub-etichetele

  • Full-Text Inverted Indexes2 sub-tag-uriIndexes that map individual words to documents to enable efficient full-text retrieval. **Distinct from Index Construction:** Distinct from general index construction by focusing specifically on the word-to-document mapping for text search.
  • GraphThe process of building a searchable proximity graph, including configuring link density for recall and memory trade-offs. **Distinct from Index Construction:** Specifically focuses on the construction of a vector proximity graph, distinct from general index initialization or knowledge graph indexing.
  • Knowledge Base Construction2 sub-tag-uriEnd-to-end processes for parsing documents, generating embeddings, and storing chunks for semantic retrieval. **Distinct from Index Construction:** Covers the full pipeline from parsing to storage, whereas index construction focuses only on populating the structure.
  • Language-Specific Partial Indexing1 sub-tagCreates specialized indices for subsets of data using unique language configurations. **Distinct from Index Construction:** Focuses on partial indexes for multilingual support rather than general vector structure initialization.
  • Musical Embedding DatabasesSearchable repositories of musical pieces indexed by pitch embeddings and structural annotations. **Distinct from Index Construction:** Distinct from Index Construction: specifically handles the extraction and indexing of music-specific features like pitch embeddings.
  • Parallel ConstructionUsing multiple worker processes to build index structures concurrently. **Distinct from Index Construction:** Distinct from Index Construction: focuses specifically on the parallelization of the build process across CPU cores.