8 مستودعات
Dividing long documents into overlapping chunks using recursive logic to fit token limits.
Distinct from Text Tokenization: Focuses on recursive chunking for RAG ingestion rather than standard linguistic tokenization.
Explore 8 awesome GitHub repositories matching artificial intelligence & ml · Recursive Text Splitting. Refine with filters or upvote what's useful.
Minimal, clean code for the Byte Pair Encoding (BPE) algorithm commonly used in LLM tokenization.
Splits text by character category before tokenization to prevent cross-category BPE merges.
This project is a collection of tutorials and guides for building large language model applications using the LangChain framework, written in Chinese. It serves as a learning resource for developing software that integrates language models with memory and chain-based logic. The resource provides specific walkthroughs for implementing retrieval augmented generation systems using vector stores and document loaders. It includes guides on creating autonomous agents that dynamically select and execute external tools, as well as tutorials for translating plain text queries into executable database
Implements recursive text splitting to ensure long documents fit within the input token limits of language models.
This project is a collection of educational resources and technical guides focused on the development and implementation of large language models. It provides a comprehensive curriculum covering transformer architectures, training methods, and deployment strategies. The materials provide detailed instructions for building autonomous agents using reasoning loops and tool integration, as well as guides for fine-tuning models through supervised learning and preference optimization. It also includes tutorials for constructing retrieval augmented generation pipelines and implementing transformer m
Splits raw text into segments using recursive or semantic methods for vector search preparation.
🎤 微软语音合成工具,使用 Electron Vue ElementPlus Vite 构建。
Automatically divides lengthy text or files into smaller segments for processing.
pgai هو مجموعة أدوات وإطار عمل لـ PostgreSQL مصمم لدمج نماذج اللغات الكبيرة وتضمينات المتجهات (vector embeddings) مباشرة داخل قاعدة البيانات. يعمل كجسر لتنفيذ طلبات نماذج تعلم الآلة وإجراء ترجمات النص إلى SQL ضمن استعلامات قاعدة البيانات القياسية. يوفر المشروع خط أنابيب آلي لتضمين المتجهات يتولى تحميل وتحليل وتقسيم النصوص من الجداول والمستندات غير المهيكلة. يستخدم هذا النظام عاملاً في الخلفية لمزامنة التضمينات تلقائياً مع تغير البيانات المصدرية، ويتضمن أدوات متخصصة لبناء تطبيقات التوليد المعزز بالاسترجاع (RAG) ومحركات البحث الدلالي. تغطي مجموعة الأدوات مجالات واسعة تشمل معالجة البيانات غير المهيكلة باستخدام OCR، وإنشاء فهارس دلالية لربط مخططات قاعدة البيانات باللغة الطبيعية، وتنفيذ عمليات بحث عن التشابه عالية الأداء من خلال فهرسة المتجهات وإعادة ترتيب النتائج. كما يتيح إثراء البيانات وتصنيفها والإشراف على المحتوى عن طريق استدعاء نماذج خارجية عبر SQL.
Implements recursive splitting functions to divide large bodies of text into chunks for AI model consumption.
AutoRAG هو طبقة أتمتة وأداة تحسين لتوليد الاسترجاع المعزز (RAG). يوفر إطار عمل لقياس أداء خط الأنابيب من خلال نظام تقييم واستراتيجية بحث آلية تحدد أكثر مجموعات وحدات الاسترجاع والتوليد فعالية. يتميز النظام بالتحسين على نمط AutoML، باستخدام عمليات بحث شبكة المعلمات الفائقة والتجارب الآلية للعثور على أعلى تكوين معماري أداءً لمجموعة بيانات معينة. يتضمن مولد مجموعات بيانات متخصصاً ينشئ أزواج سؤال وجواب اصطناعية ومجموعات بيانات حقيقية من المستندات الخام لإنشاء معايير للاختبار. يغطي المشروع دورة حياة RAG الكاملة، بما في ذلك تحليل المستندات متعدد الوسائط مع OCR واكتشاف الجداول، وتقسيم المستندات الدلالي، وتقييم العقد القائم على المقاييس. كما يتضمن أدوات لتصور نتائج التجارب وتصدير التكوينات المحسنة للنشر كبرامج نصية أو خوادم API. تتم إدارة خط الأنابيب عبر ملفات إعدادات YAML مع دعم لحقن متغيرات البيئة.
Integrates external tokenizers and custom splitting logic to support specialized text segmentation and multiple languages.
jdpro هو بوت أتمتة يعمل داخل حاوية (dockerized) ومشغل مهام مجدول مصمم لأتمتة جمع المكافآت وتحويل الأصول الرقمية منتهية الصلاحية. يعمل كمجموعة من النصوص البرمجية (scripts) المنشورة عبر حاويات لضمان التثبيت والتنفيذ المتسق عبر مضيفين مختلفين. يتضمن المشروع نظام مصادقة متخصصاً يحول المفاتيح الخام ويدير ملفات تعريف الارتباط للجلسة (session cookies) من خلال متغيرات البيئة للحفاظ على حالات تسجيل الدخول التلقائي. كما يتميز بمدير إشعارات عبر الويب (webhook) يوجه تحديثات المهام إلى خدمات خارجية، مستخدماً الترشيح القائم على الكلمات المفتاحية وتقسيم الحمولة (payload splitting) لإدارة تسليم الرسائل وتقليل الضجيج. يغطي النظام مجموعة أوسع من القدرات بما في ذلك جدولة تحويل الأصول، وإدارة جلسات الحساب، وتنسيق الإشعارات المخصصة. كما يوفر أدوات لإصلاح تثبيتات المستودعات وتنسيق عمليات النشر باستخدام Docker Compose.
Divides long notification strings into smaller segments to avoid character limit failures in external APIs.
Chonkie هي مكتبة لتقسيم النصوص مصممة لخطوط أنابيب التوليد المعزز بالاسترجاع (RAG). تعمل كمقسم نصوص دلالي وخط أنابيب استيعاب RAG، حيث تحول النص الخام إلى أجزاء مضمنة للتخزين في قواعد بيانات المتجهات. يتميز المشروع باستراتيجيات تقسيم متخصصة، بما في ذلك مقسم كود يعتمد على AST للحفاظ على الحدود المنطقية في الكود المصدري ومقسم نص دلالي يستخدم نماذج التضمين لتحديد الحدود بناءً على المعنى. كما يوفر مستوعباً لقاعدة بيانات المتجهات لأتمتة توليد التضمينات وتصديرها إلى متاجر مختلفة. تغطي المكتبة مجموعة واسعة من الإمكانيات، بما في ذلك تحليل المستندات عبر OCR واستخراج markdown، ومجموعة متنوعة من طرق التقسيم مثل عدد الرموز والتقسيم الهرمي، وتنسيق سير العمل من خلال خطوط أنابيب قابلة لإعادة الاستخدام. تدعم مجموعة واسعة من تكاملات مخزن المتجهات، بما في ذلك Qdrant وMilvus وWeaviate وElasticsearch، بالإضافة إلى تصدير البيانات إلى JSON ومجموعات بيانات Hugging Face. يمكن للمستخدمين تنفيذ هذه العمليات عبر واجهة سطر الأوامر أو نشر النظام كخدمة API محاوية.
Breaks long, structured documents into smaller segments by recursively applying splitting rules.