awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 Repos

Awesome GitHub RepositoriesAsynchronous Processing

Offloads intensive document ingestion and processing tasks to background workers to maintain system responsiveness.

Distinct from High-Performance Ingestion: Distinct from High-Performance Ingestion: focuses on the asynchronous execution pattern for background tasks rather than the throughput of the ingestion pipeline itself.

Explore 3 awesome GitHub repositories matching data & databases · Asynchronous Processing. Refine with filters or upvote what's useful.

Awesome Asynchronous Processing GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • chonkie-inc/chonkieAvatar von chonkie-inc

    chonkie-inc/chonkie

    4,170Auf GitHub ansehen↗

    Chonkie ist eine Text-Chunking-Bibliothek, die für Retrieval-Augmented-Generation-Pipelines (RAG) konzipiert wurde. Sie fungiert als semantischer Text-Splitter und RAG-Ingestion-Pipeline und transformiert Rohtext in eingebettete Segmente für die Speicherung in Vektordatenbanken. Das Projekt zeichnet sich durch spezialisierte Splitting-Strategien aus, einschließlich eines AST-basierten Code-Splitters zur Bewahrung logischer Grenzen im Quellcode und eines semantischen Text-Splitters, der Embedding-Modelle verwendet, um Grenzen basierend auf der Bedeutung zu bestimmen. Es bietet zudem einen Vektordatenbank-Ingestor, um die Generierung von Embeddings und deren Export in verschiedene Speicher zu automatisieren. Die Bibliothek deckt ein breites Spektrum an Funktionen ab, einschließlich Dokumenten-Parsing via OCR und Markdown-Extraktion, einer Vielzahl von Splitting-Methoden wie Token-Count und hierarchische Segmentierung sowie Workflow-Orchestrierung durch wiederverwendbare Pipelines. Sie unterstützt eine breite Palette an Vektorspeicher-Integrationen, einschließlich Qdrant, Milvus, Weaviate und Elasticsearch, sowie den Datenexport in JSON- und Hugging-Face-Datensätze. Nutzer können diese Operationen über eine Kommandozeilenschnittstelle ausführen oder das System als containerisierten API-Dienst bereitstellen.

    Utilizes non-blocking asynchronous calls to handle high-throughput text ingestion and concurrent API requests.

    Pythonaichonkiechunker
    Auf GitHub ansehen↗4,170
  • rag-web-ui/rag-web-uiAvatar von rag-web-ui

    rag-web-ui/rag-web-ui

    3,048Auf GitHub ansehen↗

    Dieses Projekt ist eine webbasierte Plattform für Retrieval-Augmented Generation (RAG) und bietet ein Konversations-Interface, das Sprachmodelle mit privaten Dokumentensammlungen verbindet. Es fungiert als umfassendes System zur Verwaltung von Unternehmenswissensdatenbanken und ermöglicht es Benutzern, interne Dokumente abzufragen und kontextbezogene, quellenverifizierte Antworten über ein natürliches Sprach-Chat-Interface zu erhalten. Die Plattform zeichnet sich durch die Integration vektorbasierter semantischer Suche mit modularem Wissensdatenbank-Management aus, was die Aufnahme, Segmentierung und Indizierung von Dokumenten in durchsuchbare Embeddings ermöglicht. Sie unterstützt sichere Multi-User-Umgebungen durch die Implementierung sitzungsbasierter Authentifizierung und Autorisierung zum Schutz sensibler Informationen. Darüber hinaus ist das System darauf ausgelegt, hochvolumige Datenoperationen zu bewältigen, indem die Dokumentenverarbeitung an asynchrone Hintergrund-Worker ausgelagert und Modellantworten via Echtzeit-Streaming geliefert werden, um die Reaktionsfähigkeit des Interfaces zu wahren. Über ihre Kern-Konversationsfähigkeiten hinaus enthält das Framework Dienstprogramme für die Datenbankwartung, wie Backup und Wiederherstellung, und stellt Wissensabruffunktionen über Standard-APIs für die Integration in externe Anwendungen bereit. Das System ist darauf ausgelegt, sowohl lokale als auch Cloud-basierte Sprachmodelle zu unterstützen und bietet eine flexible Architektur für die Bereitstellung privater Dokumenten-Intelligenz-Tools.

    Offloads document processing to asynchronous background workers to keep the interface responsive during intensive data operations.

    TypeScriptaideepseeklangchain
    Auf GitHub ansehen↗3,048
  • watat83/document-chat-systemAvatar von watat83

    watat83/document-chat-system

    145Auf GitHub ansehen↗

    This platform is a self-hosted knowledge management system designed for interacting with documents through natural language. It functions as a retrieval-augmented generation engine, allowing users to upload files and query them using large language models. The system provides a unified interface for document-based chat, ensuring that responses are grounded in the source material through specific citations. The platform distinguishes itself through a multi-tenant architecture that enforces strict data isolation between users and organizations. It features a flexible AI gateway that standardize

    Offloads intensive document ingestion and processing tasks to background workers to maintain system responsiveness.

    TypeScriptchatbotdocument-managementdocument-processing
    Auf GitHub ansehen↗145
  1. Home
  2. Data & Databases
  3. High-Performance Ingestion
  4. Asynchronous Processing