5 repository-uri
Systems that manage indexing strategies and retrieval logic across one or more vector databases.
Distinct from Vector Stores: Distinct from Vector Stores: focuses on the orchestration and management of retrieval strategies rather than the storage itself.
Explore 5 awesome GitHub repositories matching data & databases · Vector Store Orchestrators. Refine with filters or upvote what's useful.
Llama-stack este un stack de orchestrare standardizat și un gateway API pentru AI generativ. Oferă un strat de comunicare unificat și o interfață consistentă pentru implementarea, gestionarea și interacțiunea cu diverși furnizori și implementări de modele de limbaj mari (LLM). Sistemul funcționează ca un framework de agenți care gestionează execuția sarcinilor și pachete de abilități versionate pentru a automatiza sarcini complexe. Include un sistem de procesare în loturi pentru gestionarea volumelor mari de cereri asincrone prin procesare offline și o interfață de bază de date vectorială pentru stocarea și căutarea documentelor, permițând generarea augmentată prin recuperare (RAG). Stack-ul acoperă capabilități de nivel înalt, inclusiv orchestrarea agenților AI, implementarea modelelor și standardizarea API-urilor de model pentru a permite comutarea între furnizori fără a rescrie codul aplicației.
Ships a standardized interface to manage indexing and retrieval logic across vector stores to enable retrieval augmented generation.
Chonkie este o bibliotecă de chunking (segmentare) a textului concepută pentru pipeline-uri de retrieval-augmented generation (RAG). Funcționează ca un splitter semantic de text și un pipeline de ingestie RAG, transformând textul brut în segmente încorporate pentru stocare în baze de date vectoriale. Proiectul se distinge prin strategii de segmentare specializate, inclusiv un splitter de cod bazat pe AST pentru păstrarea limitelor logice în codul sursă și un splitter semantic de text care utilizează modele de embedding pentru a determina limitele bazate pe semnificație. De asemenea, oferă un ingestor pentru baze de date vectoriale pentru a automatiza generarea embedding-urilor și exportul acestora către diverse stocuri. Biblioteca acoperă o gamă largă de capabilități, inclusiv parsarea documentelor prin OCR și extragerea markdown, o varietate de metode de segmentare precum numărarea token-urilor și segmentarea ierarhică, și orchestrarea fluxului de lucru prin pipeline-uri reutilizabile. Suportă o gamă largă de integrări cu vector store-uri, inclusiv Qdrant, Milvus, Weaviate și Elasticsearch, precum și exportul datelor către JSON și seturi de date Hugging Face. Utilizatorii pot executa aceste operațiuni printr-o interfață în linie de comandă sau pot implementa sistemul ca serviciu API containerizat.
Manages the process of embedding text segments and exporting them to various managed vector databases.
bRAG-langchain is a framework for building retrieval augmented generation pipelines using LangChain to connect documents with language models. It functions as a vector store orchestrator that manages document indexing and retrieval strategies to improve context accuracy. The system implements an advanced retrieval pipeline featuring a semantic query router that directs natural language inputs to specific data sources or prompts. It includes a metadata filtering engine that translates natural language queries into structured schemas to narrow search results. The project covers hybrid search o
Indexes documents and manages retrieval strategies across vector databases to improve context accuracy.
This project is a retrieval augmented generation framework designed to build pipelines that connect unstructured data and knowledge graphs with large language models. It functions as a vector database orchestrator for indexing text and multimodal content, as well as a system for translating natural language queries into structured database commands. The framework integrates a hybrid retrieval engine that combines dense vector search with sparse keyword matching to increase the precision of retrieved contexts. It further enhances reasoning and relationship mapping through a graph-augmented ret
Orchestrates the indexing of text and multimodal content into vector databases for high-performance retrieval.
Langroid is a multi-agent orchestration framework and tool integration suite designed for building complex AI applications. It serves as a multi-modal integration layer that connects diverse local and remote language models with an agentic retrieval-augmented generation system. The project distinguishes itself through a collaborative message-exchange paradigm, allowing specialized agents to delegate tasks hierarchically and coordinate via structured communication. It features an advanced state management system for conversational AI, including the ability to rewind and prune conversation hist
Parses raw text into chunks and stores them in a remote vector database.