awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

8 repositorios

Awesome GitHub RepositoriesRecursive Text Splitting

Dividing long documents into overlapping chunks using recursive logic to fit token limits.

Distinct from Text Tokenization: Focuses on recursive chunking for RAG ingestion rather than standard linguistic tokenization.

Explore 8 awesome GitHub repositories matching artificial intelligence & ml · Recursive Text Splitting. Refine with filters or upvote what's useful.

Awesome Recursive Text Splitting GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • karpathy/minbpeAvatar de karpathy

    karpathy/minbpe

    10,582Ver en GitHub↗

    Minimal, clean code for the Byte Pair Encoding (BPE) algorithm commonly used in LLM tokenization.

    Splits text by character category before tokenization to prevent cross-category BPE merges.

    Python
    Ver en GitHub↗10,582
  • liaokongvfx/langchain-chinese-getting-started-guideAvatar de liaokongVFX

    liaokongVFX/LangChain-Chinese-Getting-Started-Guide

    9,039Ver en GitHub↗

    This project is a collection of tutorials and guides for building large language model applications using the LangChain framework, written in Chinese. It serves as a learning resource for developing software that integrates language models with memory and chain-based logic. The resource provides specific walkthroughs for implementing retrieval augmented generation systems using vector stores and document loaders. It includes guides on creating autonomous agents that dynamically select and execute external tools, as well as tutorials for translating plain text queries into executable database

    Implements recursive text splitting to ensure long documents fit within the input token limits of language models.

    Ver en GitHub↗9,039
  • nndl/llm-beginnerAvatar de nndl

    nndl/llm-beginner

    6,421Ver en GitHub↗

    This project is a collection of educational resources and technical guides focused on the development and implementation of large language models. It provides a comprehensive curriculum covering transformer architectures, training methods, and deployment strategies. The materials provide detailed instructions for building autonomous agents using reasoning loops and tool integration, as well as guides for fine-tuning models through supervised learning and preference optimization. It also includes tutorials for constructing retrieval augmented generation pipelines and implementing transformer m

    Splits raw text into segments using recursive or semantic methods for vector search preparation.

    Pythonagentfudannlpllm
    Ver en GitHub↗6,421
  • lokerl/tts-vueAvatar de LokerL

    LokerL/tts-vue

    6,098Ver en GitHub↗

    🎤 微软语音合成工具,使用 Electron Vue ElementPlus Vite 构建。

    Automatically divides lengthy text or files into smaller segments for processing.

    TypeScriptelectronelement-plustts
    Ver en GitHub↗6,098
  • timescale/pgaiAvatar de timescale

    timescale/pgai

    5,802Ver en GitHub↗

    pgai es un kit de herramientas y framework de IA para PostgreSQL diseñado para integrar modelos de lenguaje de gran tamaño (LLM) y embeddings vectoriales directamente en la base de datos. Actúa como un puente para ejecutar solicitudes de modelos de machine learning y realizar traducciones de texto a SQL dentro de consultas estándar de base de datos. El proyecto proporciona un pipeline automatizado de embeddings vectoriales que gestiona la carga, el análisis y la fragmentación de texto desde tablas y documentos no estructurados. Este sistema utiliza un worker en segundo plano para sincronizar los embeddings automáticamente a medida que cambian los datos de origen e incluye herramientas especializadas para crear aplicaciones de generación aumentada por recuperación (RAG) y motores de búsqueda semántica. El kit de herramientas cubre amplias áreas de capacidad, incluyendo el procesamiento de datos no estructurados con OCR, la creación de catálogos semánticos para mapear esquemas de bases de datos a lenguaje natural, y la implementación de búsquedas de similitud de alto rendimiento mediante indexación vectorial y reordenamiento de resultados. También permite el enriquecimiento de datos, la clasificación y la moderación de contenido llamando a modelos externos mediante SQL.

    Implements recursive splitting functions to divide large bodies of text into chunks for AI model consumption.

    PLpgSQL
    Ver en GitHub↗5,802
  • marker-inc-korea/autoragAvatar de Marker-Inc-Korea

    Marker-Inc-Korea/AutoRAG

    4,833Ver en GitHub↗

    AutoRAG es una capa de automatización y herramienta de optimización para la generación aumentada por recuperación (RAG). Proporciona un framework para medir el rendimiento de la tubería a través de un sistema de evaluación y una estrategia de búsqueda automatizada que identifica las combinaciones más efectivas de módulos de recuperación y generación. El sistema se distingue por la optimización al estilo AutoML, utilizando búsquedas en cuadrícula de hiperparámetros y pruebas automatizadas para encontrar la configuración arquitectónica de mayor rendimiento para un conjunto de datos específico. Incluye un generador de conjuntos de datos especializado que crea pares pregunta-respuesta sintéticos y corpora de verdad fundamental (ground truth) a partir de documentos sin procesar para establecer puntos de referencia para las pruebas. El proyecto cubre el ciclo de vida completo de RAG, incluyendo el análisis de documentos multimodales con OCR y detección de tablas, fragmentación (chunking) semántica de documentos y evaluación de nodos basada en métricas. También incluye utilidades para visualizar los resultados de las pruebas y exportar configuraciones optimizadas para su despliegue como scripts o servidores API. La tubería se gestiona mediante archivos de configuración YAML con soporte para inyección de variables de entorno.

    Integrates external tokenizers and custom splitting logic to support specialized text segmentation and multiple languages.

    Python
    Ver en GitHub↗4,833
  • 6dylan6/jdproAvatar de 6dylan6

    6dylan6/jdpro

    4,427Ver en GitHub↗

    jdpro es un bot de automatización dockerizado y ejecutor de tareas programadas diseñado para automatizar la recolección de recompensas y la conversión de activos digitales que expiran. Opera como un conjunto de scripts desplegados mediante contenedores para garantizar una instalación y ejecución consistentes en diferentes hosts. El proyecto incluye un sistema de autenticación especializado que transforma claves sin procesar y gestiona cookies de sesión a través de variables de entorno para mantener estados de inicio de sesión automatizados. También cuenta con un gestor de notificaciones por webhook que enruta las actualizaciones de tareas a servicios externos, utilizando filtrado basado en palabras clave y división de carga útil para gestionar la entrega de mensajes y reducir el ruido. El sistema cubre una gama más amplia de capacidades, incluyendo la programación de conversión de activos, gestión de sesiones de cuenta y formato de notificaciones personalizadas. Proporciona utilidades para reparar instalaciones de repositorios y orquestar despliegues utilizando Docker Compose.

    Divides long notification strings into smaller segments to avoid character limit failures in external APIs.

    JavaScriptcrontab-taskqinglong
    Ver en GitHub↗4,427
  • chonkie-inc/chonkieAvatar de chonkie-inc

    chonkie-inc/chonkie

    4,170Ver en GitHub↗

    Chonkie es una librería de fragmentación de texto (chunking) diseñada para pipelines de generación aumentada por recuperación (RAG). Funciona como un divisor de texto semántico y pipeline de ingesta RAG, transformando texto sin procesar en segmentos incrustados para su almacenamiento en bases de datos vectoriales. El proyecto se distingue por estrategias de división especializadas, incluyendo un divisor de código basado en AST para preservar límites lógicos en el código fuente y un divisor de texto semántico que utiliza modelos de embedding para determinar límites basados en el significado. También proporciona un ingestor de bases de datos vectoriales para automatizar la generación de embeddings y su exportación a varios almacenes. La librería cubre una amplia gama de capacidades, incluyendo el análisis de documentos mediante OCR y extracción de markdown, una variedad de métodos de división como conteo de tokens y segmentación jerárquica, y orquestación de flujos de trabajo a través de pipelines reutilizables. Admite una amplia gama de integraciones de almacenes vectoriales, incluyendo Qdrant, Milvus, Weaviate y Elasticsearch, así como la exportación de datos a JSON y datasets de Hugging Face. Los usuarios pueden ejecutar estas operaciones a través de una interfaz de línea de comandos o desplegar el sistema como un servicio API contenerizado.

    Breaks long, structured documents into smaller segments by recursively applying splitting rules.

    Pythonaichonkiechunker
    Ver en GitHub↗4,170
  1. Home
  2. Artificial Intelligence & ML
  3. Natural Language Processing
  4. Text Tokenization
  5. Recursive Text Splitting

Explorar subetiquetas

  • API-Based SplittingOffloading text segmentation to specialized external APIs for domain-specific structural requirements. **Distinct from Recursive Text Splitting:** Distinct from Recursive Text Splitting: relies on external specialized services for domain-specific boundaries rather than internal recursive logic.
  • Agentic SplittingUsing generative AI models to autonomously determine optimal semantic boundaries for text segmentation. **Distinct from Recursive Text Splitting:** Distinct from Recursive Text Splitting: uses LLM-driven semantic analysis rather than deterministic recursive rules to find split points.
  • Category-Based SplittersSplitting text by category (letters, numbers, punctuation) before tokenization to prevent cross-category merges. **Distinct from Recursive Text Splitting:** Distinct from Recursive Text Splitting: splits by character category for BPE preprocessing, not recursive chunking for token limits.
  • Character-Limited SegmentersDivides lengthy text or files into smaller segments based on character limits and punctuation boundaries. **Distinct from Recursive Text Splitting:** Distinct from Recursive Text Splitting: uses fixed character limits and punctuation boundaries, not recursive overlap strategies for RAG ingestion.
  • Custom Sentence SplittingLogic for segmenting text into sentences based on specific language requirements or custom tokenizers. **Distinct from Recursive Text Splitting:** Focuses on the boundary identification of sentences for specific languages, whereas Recursive Text Splitting focuses on chunking for token limits.