3 repositorios
Offloads intensive document ingestion and processing tasks to background workers to maintain system responsiveness.
Distinct from High-Performance Ingestion: Distinct from High-Performance Ingestion: focuses on the asynchronous execution pattern for background tasks rather than the throughput of the ingestion pipeline itself.
Explore 3 awesome GitHub repositories matching data & databases · Asynchronous Processing. Refine with filters or upvote what's useful.
Chonkie es una librería de fragmentación de texto (chunking) diseñada para pipelines de generación aumentada por recuperación (RAG). Funciona como un divisor de texto semántico y pipeline de ingesta RAG, transformando texto sin procesar en segmentos incrustados para su almacenamiento en bases de datos vectoriales. El proyecto se distingue por estrategias de división especializadas, incluyendo un divisor de código basado en AST para preservar límites lógicos en el código fuente y un divisor de texto semántico que utiliza modelos de embedding para determinar límites basados en el significado. También proporciona un ingestor de bases de datos vectoriales para automatizar la generación de embeddings y su exportación a varios almacenes. La librería cubre una amplia gama de capacidades, incluyendo el análisis de documentos mediante OCR y extracción de markdown, una variedad de métodos de división como conteo de tokens y segmentación jerárquica, y orquestación de flujos de trabajo a través de pipelines reutilizables. Admite una amplia gama de integraciones de almacenes vectoriales, incluyendo Qdrant, Milvus, Weaviate y Elasticsearch, así como la exportación de datos a JSON y datasets de Hugging Face. Los usuarios pueden ejecutar estas operaciones a través de una interfaz de línea de comandos o desplegar el sistema como un servicio API contenerizado.
Utilizes non-blocking asynchronous calls to handle high-throughput text ingestion and concurrent API requests.
Este proyecto es una plataforma basada en la web diseñada para la generación aumentada por recuperación, proporcionando una interfaz conversacional que conecta modelos de lenguaje a colecciones de documentos privados. Funciona como un sistema integral para gestionar bases de conocimiento empresariales, permitiendo a los usuarios consultar documentos internos y recibir respuestas conscientes del contexto y verificadas por fuentes a través de una interfaz de chat en lenguaje natural. La plataforma se distingue por integrar la búsqueda semántica basada en vectores con la gestión modular de bases de conocimiento, permitiendo la ingesta, segmentación e indexación de documentos en embeddings buscables. Admite entornos seguros y multiusuario implementando autenticación y autorización basadas en sesiones para proteger información sensible. Además, el sistema está construido para manejar operaciones de datos de alto volumen descargando el procesamiento de documentos a trabajadores asíncronos en segundo plano y entregando respuestas del modelo mediante streaming en tiempo real para mantener la capacidad de respuesta de la interfaz. Más allá de sus capacidades conversacionales centrales, el framework incluye utilidades para el mantenimiento de bases de datos, como copias de seguridad y restauración, y expone funciones de recuperación de conocimiento a través de API estándar para la integración con aplicaciones externas. El sistema está diseñado para admitir modelos de lenguaje tanto locales como basados en la nube, proporcionando una arquitectura flexible para desplegar herramientas de inteligencia de documentos privados.
Offloads document processing to asynchronous background workers to keep the interface responsive during intensive data operations.
This platform is a self-hosted knowledge management system designed for interacting with documents through natural language. It functions as a retrieval-augmented generation engine, allowing users to upload files and query them using large language models. The system provides a unified interface for document-based chat, ensuring that responses are grounded in the source material through specific citations. The platform distinguishes itself through a multi-tenant architecture that enforces strict data isolation between users and organizations. It features a flexible AI gateway that standardize
Offloads intensive document ingestion and processing tasks to background workers to maintain system responsiveness.