awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 repository-uri

Awesome GitHub RepositoriesIndexed Document Retrieval

Extracting full document content and identifiers from an index backend.

Distinct from Search Indexing: Distinct from Search Indexing: focuses on the extraction of the original documents rather than the search process.

Explore 6 awesome GitHub repositories matching data & databases · Indexed Document Retrieval. Refine with filters or upvote what's useful.

Awesome Indexed Document Retrieval GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • genkit-ai/genkitAvatar genkit-ai

    genkit-ai/genkit

    6,141Vezi pe GitHub↗

    Genkit este un framework pentru aplicații LLM și un toolkit pentru dezvoltatori de AI generativ, conceput pentru construirea de aplicații AI de producție. Acesta servește drept orchestrator de fluxuri de lucru AI care coordonează apelurile către modele și utilizarea instrumentelor agentice prin fluxuri de execuție type-safe. Proiectul oferă o interfață unificată pentru modele și o arhitectură de plugin-uri pentru a standardiza accesul la diverse modele de limbaj mari (LLM), vector stores și backend-uri de telemetrie. Se distinge printr-o suită dedicată de observabilitate pentru trasarea pașilor de execuție și un toolkit pentru dezvoltatori pentru prompting, debugging și evaluarea logicii AI printr-o interfață locală. Framework-ul acoperă o suprafață largă de capabilități, inclusiv orchestrarea agenților cu tool-calling și delegarea către sub-agenți, retrieval-augmented generation (RAG) prin integrarea bazelor de date vectoriale și generarea de output structurat folosind validarea bazată pe schemă. Include, de asemenea, sisteme pentru gestionarea stării sesiunilor, streaming de răspunsuri bazat pe evenimente și capacitatea de a expune fluxurile AI ca endpoint-uri HTTP scalabile. Dezvoltarea este susținută de o interfață în linie de comandă (CLI) pentru rularea funcțiilor și gestionarea log-urilor.

    Searches vector stores to retrieve documents related to a specific query.

    TypeScript
    Vezi pe GitHub↗6,141
  • go-ego/riotAvatar go-ego

    go-ego/riot

    6,059Vezi pe GitHub↗

    Riot is a Go-based distributed search engine and indexing server designed for full-text indexing and retrieval. It functions as a retrieval system that sorts documents by relevance using BM25 ranking algorithms, term frequency, and inverse document frequency. The engine provides specialized support for the Chinese language, featuring concurrent text segmentation and phonetic Pinyin mapping to match romanized input with characters. It utilizes a distributed architecture that employs hash-based index sharding to balance data load and throughput across multiple server nodes. The system covers a

    Extracts document identifiers and their associated content from the distributed storage backend.

    Gogogolanggwk
    Vezi pe GitHub↗6,059
  • apache/kvrocksAvatar apache

    apache/kvrocks

    4,338Vezi pe GitHub↗

    Kvrocks este un magazin distribuit de tip cheie-valoare și o bază de date NoSQL compatibilă cu Redis. Utilizează un motor de stocare RocksDB pentru a oferi persistență pe disc, permițând stocarea datelor de mare capacitate cu costuri de memorie reduse comparativ cu sistemele in-memory. Sistemul funcționează ca o bază de date vectorială și un motor de căutare full-text, suportând căutări de tip nearest-neighbor pe embedding-uri vectoriale și interogări complexe de documente prin potrivirea textului. Utilizează o arhitectură de cluster fără proxy, cu rutare bazată pe sloturi, pentru a distribui datele și a scala capacitatea pe mai multe noduri. Platforma acoperă o gamă largă de capabilități de gestionare a datelor, inclusiv gestionarea documentelor JSON, date de tip time-series și procesarea fluxurilor în timp real. Oferă căutare și indexare avansată prin interogări geospațiale, indexare secundară și analiza planurilor de interogare, oferind în același timp tehnici de sketching probabilistic pentru estimarea eficientă a cardinalității și a apartenenței. Funcționalitățile operaționale suplimentare includ tranzacții atomice, mesagerie pub/sub și izolarea datelor pe namespace-uri pentru medii multi-tenant.

    Allows retrieval of documents and records from indexes using sorting and limiting.

    C++databasedistributedkv
    Vezi pe GitHub↗4,338
  • isar/isarAvatar isar

    isar/isar

    4,019Vezi pe GitHub↗

    Isar este un magazin de documente NoSQL local, type-safe și compatibil ACID, conceput pentru stocarea și regăsirea datelor de înaltă performanță. Funcționează ca un motor de bază de date încorporat care persistă seturi de date mari pe dispozitiv, asigurând în același timp integritatea tranzacțională prin rollback-uri automate ale operațiunilor de scriere eșuate. Proiectul se distinge prin validarea interogărilor bazei de date la momentul compilării folosind tipizarea statică pentru a preveni erorile de runtime. Încorporează un motor de căutare full-text cu indexare specializată pentru potrivirea eficientă a cuvintelor cheie și frazelor și utilizează execuția paralelă pe mai multe izolate pentru a preveni blocarea thread-ului principal al aplicației. Sistemul oferă capabilități cuprinzătoare pentru gestionarea asincronă a datelor, inclusiv operațiuni CRUD, indexare compozită și multi-intrare, și modificarea filtrată a datelor. Gestionează definițiile de schemă și configurarea instanței bazei de date pentru a menține starea locală a aplicației între sesiuni.

    Retrieves specific datasets efficiently by utilizing internal indexes and query modifiers.

    Dartandroidcross-platformdart
    Vezi pe GitHub↗4,019
  • answerdotai/ragatouilleAvatar AnswerDotAI

    AnswerDotAI/RAGatouille

    3,937Vezi pe GitHub↗

    RAGatouille este un framework de regăsire și un motor de căutare conceput pentru implementarea și antrenarea modelelor de regăsire cu interacțiune tardivă (late-interaction). Acesta servește ca o componentă modulară de regăsire pentru pipeline-urile de AI generativ, concentrându-se pe ranking-ul documentelor de înaltă performanță pentru a îmbunătăți acuratețea căutării. Proiectul oferă un toolkit pentru antrenarea și fine-tuning-ul modelelor de regăsire folosind perechi și triplete, având minare automată de hard-negative pentru adaptarea la domeniu. Implementează un mecanism de interacțiune tardivă care echilibrează viteza de regăsire cu precizia prin utilizarea embedding-urilor comprimate. Sistemul acoperă operațiunile de indexare și regăsire a documentelor, utilizând stocarea vectorială pe disc pentru a gestiona seturi de date care depășesc memoria disponibilă a sistemului. De asemenea, suportă crearea de fluxuri de lucru de tip „retrieval augmented generation” prin maparea embedding-urilor la nivel de token pentru a păstra informații semantice granulare.

    Retrieves the most relevant documents from a vector index based on late-interaction scoring.

    Python
    Vezi pe GitHub↗3,937
  • arabold/docs-mcp-serverAvatar arabold

    arabold/docs-mcp-server

    1,052Vezi pe GitHub↗

    This project is a server implementation of the Model Context Protocol designed to function as an AI knowledge retrieval tool. It acts as a semantic search engine and web scraping framework that indexes technical documentation from web sources, local files, and archives, making this information directly accessible to AI coding assistants for context-aware research and querying. The system distinguishes itself through a hybrid search architecture that combines vector-based embeddings with full-text retrieval to improve the accuracy of documentation lookups. It features a modular pipeline for co

    Enables agents to perform natural language queries against indexed documentation for context-aware research.

    TypeScriptagentic-aicopilotcursor
    Vezi pe GitHub↗1,052
  1. Home
  2. Data & Databases
  3. Search Indexing
  4. Indexed Document Retrieval

Explorează sub-etichetele

  • Natural Language Query InterfacesInterfaces that allow users or agents to query indexed documentation using natural language. **Distinct from Indexed Document Retrieval:** Distinct from Indexed Document Retrieval: focuses on the natural language query interface for agents, not just raw document extraction.