8 Repos
Dividing long documents into overlapping chunks using recursive logic to fit token limits.
Distinct from Text Tokenization: Focuses on recursive chunking for RAG ingestion rather than standard linguistic tokenization.
Explore 8 awesome GitHub repositories matching artificial intelligence & ml · Recursive Text Splitting. Refine with filters or upvote what's useful.
Minimal, clean code for the Byte Pair Encoding (BPE) algorithm commonly used in LLM tokenization.
Splits text by character category before tokenization to prevent cross-category BPE merges.
This project is a collection of tutorials and guides for building large language model applications using the LangChain framework, written in Chinese. It serves as a learning resource for developing software that integrates language models with memory and chain-based logic. The resource provides specific walkthroughs for implementing retrieval augmented generation systems using vector stores and document loaders. It includes guides on creating autonomous agents that dynamically select and execute external tools, as well as tutorials for translating plain text queries into executable database
Implements recursive text splitting to ensure long documents fit within the input token limits of language models.
This project is a collection of educational resources and technical guides focused on the development and implementation of large language models. It provides a comprehensive curriculum covering transformer architectures, training methods, and deployment strategies. The materials provide detailed instructions for building autonomous agents using reasoning loops and tool integration, as well as guides for fine-tuning models through supervised learning and preference optimization. It also includes tutorials for constructing retrieval augmented generation pipelines and implementing transformer m
Splits raw text into segments using recursive or semantic methods for vector search preparation.
🎤 微软语音合成工具,使用 Electron Vue ElementPlus Vite 构建。
Automatically divides lengthy text or files into smaller segments for processing.
pgai ist ein PostgreSQL-KI-Toolkit und -Framework, das darauf ausgelegt ist, Large Language Models und Vektor-Embeddings direkt in eine Datenbank zu integrieren. Es dient als Brücke für die Ausführung von Anfragen an Machine-Learning-Modelle und die Durchführung von Text-zu-SQL-Übersetzungen innerhalb von Standard-Datenbankabfragen. Das Projekt bietet eine automatisierte Pipeline für Vektor-Embeddings, die das Laden, Parsen und Chunking von Text aus Tabellen und unstrukturierten Dokumenten übernimmt. Dieses System nutzt einen Hintergrund-Worker, um Embeddings automatisch zu synchronisieren, wenn sich Quelldaten ändern, und enthält spezialisierte Tools für den Aufbau von RAG-Anwendungen (Retrieval-Augmented Generation) und semantischen Suchmaschinen. Das Toolkit deckt breite Funktionsbereiche ab, darunter die Verarbeitung unstrukturierter Daten mittels OCR, die Erstellung semantischer Kataloge zur Abbildung von Datenbankschemata auf natürliche Sprache sowie die Implementierung von Hochleistungs-Ähnlichkeitssuchen durch Vektorindizierung und Result-Reranking. Zudem ermöglicht es Datenanreicherung, Klassifizierung und Content-Moderation durch den Aufruf externer Modelle via SQL.
Implements recursive splitting functions to divide large bodies of text into chunks for AI model consumption.
AutoRAG ist eine Automatisierungsschicht und ein Optimierungstool für Retrieval-Augmented Generation (RAG). Es bietet ein Framework zur Messung der Pipeline-Performance durch ein Bewertungssystem sowie eine automatisierte Suchstrategie, die die effektivsten Kombinationen aus Retrieval- und Generierungsmodulen identifiziert. Das System zeichnet sich durch AutoML-artige Optimierung aus, wobei Hyperparameter-Rastersuchen und automatisierte Testläufe verwendet werden, um die leistungsfähigste Architekturkonfiguration für einen spezifischen Datensatz zu finden. Es enthält einen spezialisierten Datensatz-Generator, der synthetische Frage-Antwort-Paare und Ground-Truth-Korpora aus Rohdokumenten erstellt, um Benchmarks für Tests zu etablieren. Das Projekt deckt den gesamten RAG-Lebenszyklus ab, einschließlich multimodaler Dokumentenanalyse mit OCR und Tabellenerkennung, semantischem Chunking von Dokumenten und metrikbasierter Knotenbewertung. Es enthält zudem Hilfsmittel zur Visualisierung von Testergebnissen und zum Export optimierter Konfigurationen für die Bereitstellung als Skripte oder API-Server. Die Pipeline wird über YAML-Konfigurationsdateien mit Unterstützung für die Injektion von Umgebungsvariablen verwaltet.
Integrates external tokenizers and custom splitting logic to support specialized text segmentation and multiple languages.
jdpro ist ein dockerisierter Automatisierungs-Bot und Task-Runner für geplante Aufgaben, der entwickelt wurde, um das Sammeln von Belohnungen und die Konvertierung ablaufender digitaler Assets zu automatisieren. Er arbeitet als eine Reihe von Skripten, die über Container bereitgestellt werden, um eine konsistente Installation und Ausführung auf verschiedenen Hosts zu gewährleisten. Das Projekt enthält ein spezialisiertes Authentifizierungssystem, das Rohschlüssel transformiert und Session-Cookies über Umgebungsvariablen verwaltet, um automatisierte Login-Zustände aufrechtzuerhalten. Es verfügt zudem über einen Webhook-Benachrichtigungsmanager, der Aufgaben-Updates an externe Dienste weiterleitet und dabei schlüsselwortbasierte Filterung sowie Payload-Splitting nutzt, um die Nachrichtenübermittlung zu steuern und Rauschen zu reduzieren. Das System deckt ein breiteres Spektrum an Funktionen ab, einschließlich der Planung von Asset-Konvertierungen, der Verwaltung von Account-Sessions und der Formatierung benutzerdefinierter Benachrichtigungen. Es bietet Dienstprogramme zur Reparatur von Repository-Installationen und zur Orchestrierung von Deployments mittels Docker Compose.
Divides long notification strings into smaller segments to avoid character limit failures in external APIs.
Chonkie ist eine Text-Chunking-Bibliothek, die für Retrieval-Augmented-Generation-Pipelines (RAG) konzipiert wurde. Sie fungiert als semantischer Text-Splitter und RAG-Ingestion-Pipeline und transformiert Rohtext in eingebettete Segmente für die Speicherung in Vektordatenbanken. Das Projekt zeichnet sich durch spezialisierte Splitting-Strategien aus, einschließlich eines AST-basierten Code-Splitters zur Bewahrung logischer Grenzen im Quellcode und eines semantischen Text-Splitters, der Embedding-Modelle verwendet, um Grenzen basierend auf der Bedeutung zu bestimmen. Es bietet zudem einen Vektordatenbank-Ingestor, um die Generierung von Embeddings und deren Export in verschiedene Speicher zu automatisieren. Die Bibliothek deckt ein breites Spektrum an Funktionen ab, einschließlich Dokumenten-Parsing via OCR und Markdown-Extraktion, einer Vielzahl von Splitting-Methoden wie Token-Count und hierarchische Segmentierung sowie Workflow-Orchestrierung durch wiederverwendbare Pipelines. Sie unterstützt eine breite Palette an Vektorspeicher-Integrationen, einschließlich Qdrant, Milvus, Weaviate und Elasticsearch, sowie den Datenexport in JSON- und Hugging-Face-Datensätze. Nutzer können diese Operationen über eine Kommandozeilenschnittstelle ausführen oder das System als containerisierten API-Dienst bereitstellen.
Breaks long, structured documents into smaller segments by recursively applying splitting rules.