3 dépôts
Configuration and connectivity for Milvus vector stores.
Explore 3 awesome GitHub repositories matching data & databases · Milvus Integrations. Refine with filters or upvote what's useful.
This project is a privacy-first backend service designed to facilitate retrieval-augmented generation by processing local documents into searchable vector representations. It provides a modular architecture that allows users to ingest diverse file formats, manage document metadata, and perform semantic searches to provide context-aware responses for chat and completion requests. The system distinguishes itself through a database-agnostic abstraction layer that supports various storage backends, ranging from local disk storage to enterprise-grade vector databases. It offers flexible deployment
Connects to Milvus vector databases by managing necessary dependencies and collection-specific connection strings.
Unstructured is an enterprise-grade data orchestration engine designed to transform raw, unstructured files into structured, machine-readable formats. It functions as a comprehensive platform for document ingestion, partitioning, and enrichment, specifically engineered to prepare complex data for retrieval-augmented generation and agentic AI workflows. The platform distinguishes itself through its sophisticated document processing strategies, which combine rule-based extraction with vision-language models to handle diverse file layouts, tables, and images. It provides a modular architecture t
Transfers processed document data into vector database collections to enable downstream retrieval and search operations.
Chonkie est une bibliothèque de découpage de texte conçue pour les pipelines de génération augmentée par récupération (RAG). Elle fonctionne comme un séparateur de texte sémantique et un pipeline d'ingestion RAG, transformant le texte brut en segments intégrés pour le stockage dans des bases de données vectorielles. Le projet se distingue par des stratégies de découpage spécialisées, incluant un séparateur de code basé sur AST pour préserver les limites logiques dans le code source et un séparateur de texte sémantique qui utilise des modèles d'embedding pour déterminer les limites basées sur le sens. Il fournit également un ingesteur de base de données vectorielle pour automatiser la génération d'embeddings et leur exportation vers divers magasins. La bibliothèque couvre un large éventail de capacités, incluant l'analyse de documents via OCR et l'extraction markdown, une variété de méthodes de découpage telles que le comptage de jetons et la segmentation hiérarchique, et l'orchestration de flux de travail via des pipelines réutilisables. Elle prend en charge un large éventail d'intégrations de magasins vectoriels, incluant Qdrant, Milvus, Weaviate et Elasticsearch, ainsi que l'exportation de données vers JSON et les jeux de données Hugging Face. Les utilisateurs peuvent exécuter ces opérations via une interface en ligne de commande ou déployer le système en tant que service API conteneurisé.
Embeds text chunks and stores them in Milvus collections with automatic schema creation.