6 repository-uri
Extracting full document content and identifiers from an index backend.
Distinct from Search Indexing: Distinct from Search Indexing: focuses on the extraction of the original documents rather than the search process.
Explore 6 awesome GitHub repositories matching data & databases · Indexed Document Retrieval. Refine with filters or upvote what's useful.
Genkit este un framework pentru aplicații LLM și un toolkit pentru dezvoltatori de AI generativ, conceput pentru construirea de aplicații AI de producție. Acesta servește drept orchestrator de fluxuri de lucru AI care coordonează apelurile către modele și utilizarea instrumentelor agentice prin fluxuri de execuție type-safe. Proiectul oferă o interfață unificată pentru modele și o arhitectură de plugin-uri pentru a standardiza accesul la diverse modele de limbaj mari (LLM), vector stores și backend-uri de telemetrie. Se distinge printr-o suită dedicată de observabilitate pentru trasarea pașilor de execuție și un toolkit pentru dezvoltatori pentru prompting, debugging și evaluarea logicii AI printr-o interfață locală. Framework-ul acoperă o suprafață largă de capabilități, inclusiv orchestrarea agenților cu tool-calling și delegarea către sub-agenți, retrieval-augmented generation (RAG) prin integrarea bazelor de date vectoriale și generarea de output structurat folosind validarea bazată pe schemă. Include, de asemenea, sisteme pentru gestionarea stării sesiunilor, streaming de răspunsuri bazat pe evenimente și capacitatea de a expune fluxurile AI ca endpoint-uri HTTP scalabile. Dezvoltarea este susținută de o interfață în linie de comandă (CLI) pentru rularea funcțiilor și gestionarea log-urilor.
Searches vector stores to retrieve documents related to a specific query.
Riot is a Go-based distributed search engine and indexing server designed for full-text indexing and retrieval. It functions as a retrieval system that sorts documents by relevance using BM25 ranking algorithms, term frequency, and inverse document frequency. The engine provides specialized support for the Chinese language, featuring concurrent text segmentation and phonetic Pinyin mapping to match romanized input with characters. It utilizes a distributed architecture that employs hash-based index sharding to balance data load and throughput across multiple server nodes. The system covers a
Extracts document identifiers and their associated content from the distributed storage backend.
Kvrocks este un magazin distribuit de tip cheie-valoare și o bază de date NoSQL compatibilă cu Redis. Utilizează un motor de stocare RocksDB pentru a oferi persistență pe disc, permițând stocarea datelor de mare capacitate cu costuri de memorie reduse comparativ cu sistemele in-memory. Sistemul funcționează ca o bază de date vectorială și un motor de căutare full-text, suportând căutări de tip nearest-neighbor pe embedding-uri vectoriale și interogări complexe de documente prin potrivirea textului. Utilizează o arhitectură de cluster fără proxy, cu rutare bazată pe sloturi, pentru a distribui datele și a scala capacitatea pe mai multe noduri. Platforma acoperă o gamă largă de capabilități de gestionare a datelor, inclusiv gestionarea documentelor JSON, date de tip time-series și procesarea fluxurilor în timp real. Oferă căutare și indexare avansată prin interogări geospațiale, indexare secundară și analiza planurilor de interogare, oferind în același timp tehnici de sketching probabilistic pentru estimarea eficientă a cardinalității și a apartenenței. Funcționalitățile operaționale suplimentare includ tranzacții atomice, mesagerie pub/sub și izolarea datelor pe namespace-uri pentru medii multi-tenant.
Allows retrieval of documents and records from indexes using sorting and limiting.
Isar este un magazin de documente NoSQL local, type-safe și compatibil ACID, conceput pentru stocarea și regăsirea datelor de înaltă performanță. Funcționează ca un motor de bază de date încorporat care persistă seturi de date mari pe dispozitiv, asigurând în același timp integritatea tranzacțională prin rollback-uri automate ale operațiunilor de scriere eșuate. Proiectul se distinge prin validarea interogărilor bazei de date la momentul compilării folosind tipizarea statică pentru a preveni erorile de runtime. Încorporează un motor de căutare full-text cu indexare specializată pentru potrivirea eficientă a cuvintelor cheie și frazelor și utilizează execuția paralelă pe mai multe izolate pentru a preveni blocarea thread-ului principal al aplicației. Sistemul oferă capabilități cuprinzătoare pentru gestionarea asincronă a datelor, inclusiv operațiuni CRUD, indexare compozită și multi-intrare, și modificarea filtrată a datelor. Gestionează definițiile de schemă și configurarea instanței bazei de date pentru a menține starea locală a aplicației între sesiuni.
Retrieves specific datasets efficiently by utilizing internal indexes and query modifiers.
RAGatouille este un framework de regăsire și un motor de căutare conceput pentru implementarea și antrenarea modelelor de regăsire cu interacțiune tardivă (late-interaction). Acesta servește ca o componentă modulară de regăsire pentru pipeline-urile de AI generativ, concentrându-se pe ranking-ul documentelor de înaltă performanță pentru a îmbunătăți acuratețea căutării. Proiectul oferă un toolkit pentru antrenarea și fine-tuning-ul modelelor de regăsire folosind perechi și triplete, având minare automată de hard-negative pentru adaptarea la domeniu. Implementează un mecanism de interacțiune tardivă care echilibrează viteza de regăsire cu precizia prin utilizarea embedding-urilor comprimate. Sistemul acoperă operațiunile de indexare și regăsire a documentelor, utilizând stocarea vectorială pe disc pentru a gestiona seturi de date care depășesc memoria disponibilă a sistemului. De asemenea, suportă crearea de fluxuri de lucru de tip „retrieval augmented generation” prin maparea embedding-urilor la nivel de token pentru a păstra informații semantice granulare.
Retrieves the most relevant documents from a vector index based on late-interaction scoring.
This project is a server implementation of the Model Context Protocol designed to function as an AI knowledge retrieval tool. It acts as a semantic search engine and web scraping framework that indexes technical documentation from web sources, local files, and archives, making this information directly accessible to AI coding assistants for context-aware research and querying. The system distinguishes itself through a hybrid search architecture that combines vector-based embeddings with full-text retrieval to improve the accuracy of documentation lookups. It features a modular pipeline for co
Enables agents to perform natural language queries against indexed documentation for context-aware research.