3 repository-uri
Offloads intensive document ingestion and processing tasks to background workers to maintain system responsiveness.
Distinct from High-Performance Ingestion: Distinct from High-Performance Ingestion: focuses on the asynchronous execution pattern for background tasks rather than the throughput of the ingestion pipeline itself.
Explore 3 awesome GitHub repositories matching data & databases · Asynchronous Processing. Refine with filters or upvote what's useful.
Chonkie este o bibliotecă de chunking (segmentare) a textului concepută pentru pipeline-uri de retrieval-augmented generation (RAG). Funcționează ca un splitter semantic de text și un pipeline de ingestie RAG, transformând textul brut în segmente încorporate pentru stocare în baze de date vectoriale. Proiectul se distinge prin strategii de segmentare specializate, inclusiv un splitter de cod bazat pe AST pentru păstrarea limitelor logice în codul sursă și un splitter semantic de text care utilizează modele de embedding pentru a determina limitele bazate pe semnificație. De asemenea, oferă un ingestor pentru baze de date vectoriale pentru a automatiza generarea embedding-urilor și exportul acestora către diverse stocuri. Biblioteca acoperă o gamă largă de capabilități, inclusiv parsarea documentelor prin OCR și extragerea markdown, o varietate de metode de segmentare precum numărarea token-urilor și segmentarea ierarhică, și orchestrarea fluxului de lucru prin pipeline-uri reutilizabile. Suportă o gamă largă de integrări cu vector store-uri, inclusiv Qdrant, Milvus, Weaviate și Elasticsearch, precum și exportul datelor către JSON și seturi de date Hugging Face. Utilizatorii pot executa aceste operațiuni printr-o interfață în linie de comandă sau pot implementa sistemul ca serviciu API containerizat.
Utilizes non-blocking asynchronous calls to handle high-throughput text ingestion and concurrent API requests.
Acest proiect este o platformă bazată pe web concepută pentru retrieval-augmented generation, oferind o interfață conversațională care conectează modelele de limbaj la colecții de documente private. Funcționează ca un sistem cuprinzător pentru gestionarea bazelor de cunoștințe enterprise, permițând utilizatorilor să interogheze documente interne și să primească răspunsuri conștiente de context, verificate prin surse, printr-o interfață de chat în limbaj natural. Platforma se distinge prin integrarea căutării semantice bazate pe vectori cu gestionarea modulară a bazei de cunoștințe, permițând ingestia, segmentarea și indexarea documentelor în embedding-uri căutabile. Susține medii securizate, multi-utilizator, prin implementarea autentificării și autorizării bazate pe sesiune pentru a proteja informațiile sensibile. Mai mult, sistemul este construit pentru a gestiona operațiuni cu date de volum mare prin descărcarea procesării documentelor către worker-i asincroni în fundal și livrarea răspunsurilor modelului prin streaming în timp real pentru a menține responsivitatea interfeței. Dincolo de capabilitățile sale conversaționale de bază, framework-ul include utilitare pentru mentenanța bazei de date, cum ar fi backup-ul și restaurarea, și expune funcții de recuperare a cunoștințelor prin API-uri standard pentru integrarea cu aplicații externe. Sistemul este conceput pentru a susține atât modele de limbaj locale, cât și bazate pe cloud, oferind o arhitectură flexibilă pentru deployment-ul instrumentelor de inteligență a documentelor private.
Offloads document processing to asynchronous background workers to keep the interface responsive during intensive data operations.
This platform is a self-hosted knowledge management system designed for interacting with documents through natural language. It functions as a retrieval-augmented generation engine, allowing users to upload files and query them using large language models. The system provides a unified interface for document-based chat, ensuring that responses are grounded in the source material through specific citations. The platform distinguishes itself through a multi-tenant architecture that enforces strict data isolation between users and organizations. It features a flexible AI gateway that standardize
Offloads intensive document ingestion and processing tasks to background workers to maintain system responsiveness.