awesome-repositories.com
المدونة
MCP
awesome-repositories.com

اكتشف أفضل مستودعات المصادر المفتوحة باستخدام بحث مدعوم بالذكاء الاصطناعي.

استكشفعمليات بحث منسقةبدائل مفتوحة المصدربرمجيات ذاتية الاستضافةالمدونةخريطة الموقع
المشروعخادم MCPحولكيفية ترتيب النتائجالصحافة
قانونيالخصوصيةالشروط
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 مستودعات

Awesome GitHub RepositoriesSemantic Document Retrieval

Fetching relevant documents from an index using vector embeddings for semantic similarity.

Distinct from Vector Document Indexing: Distinct from Vector Document Indexing: focuses on the retrieval step using embeddings, not the indexing workflow.

Explore 6 awesome GitHub repositories matching data & databases · Semantic Document Retrieval. Refine with filters or upvote what's useful.

Awesome Semantic Document Retrieval GitHub Repositories

اعثر على أفضل المستودعات باستخدام الذكاء الاصطناعي.سنبحث عن أفضل المستودعات المطابقة باستخدام الذكاء الاصطناعي.
  • facebookresearch/llama-recipesالصورة الرمزية لـ facebookresearch

    facebookresearch/llama-recipes

    18,379عرض على GitHub↗

    This repository is a collection of frameworks and guides for Llama models, functioning as a fine-tuning framework, an inference pipeline, and an AI workflow orchestrator. It provides tools for adapting large language models to specific datasets and domains. The project includes a parameter-efficient fine-tuning toolkit that utilizes techniques like low-rank adaptation to reduce memory and compute requirements. It also serves as an implementation guide for retrieval-augmented generation, combining model inference with external data retrieval to improve response accuracy. The capability surfac

    Queries external databases for relevant text chunks using semantic similarity to ground responses.

    Jupyter Notebook
    عرض على GitHub↗18,379
  • firebase/genkitالصورة الرمزية لـ firebase

    firebase/genkit

    6,121عرض على GitHub↗

    Genkit is an open-source framework for building AI-powered applications. It provides a unified interface for connecting to hundreds of generative AI models from multiple providers, enabling text, image, audio, and video generation through a single API. The framework structures multi-step AI interactions—including chat, retrieval-augmented generation, tool use, and agentic workflows—as composable, traceable flows with built-in streaming and state management. The framework distinguishes itself through a comprehensive developer toolkit that includes a command-line interface and a local developer

    Fetches relevant documents from an index using vector embeddings for semantic similarity.

    TypeScript
    عرض على GitHub↗6,121
  • brianpetro/obsidian-smart-connectionsالصورة الرمزية لـ brianpetro

    brianpetro/obsidian-smart-connections

    5,195عرض على GitHub↗

    هذا المشروع عبارة عن إضافة لقاعدة المعرفة ومدير سياق RAG يستخدم واجهة قاعدة بيانات متجهة محلية لتمكين البحث الدلالي ورسم خرائط العلاقات. يقوم بتحويل النص إلى متجهات رقمية للعثور على ملاحظات ومقتطفات ذات صلة دلالياً بناءً على المعنى المفاهيمي بدلاً من مطابقة الكلمات الرئيسية. يتميز النظام من خلال مصور رسوم بيانية دلالي يقوم بتعيين الملاحظات في مجموعات للكشف عن الروابط المفاهيمية. كما يتميز بمدير سياق قادر على تجميع الملاحظات والمقتطفات المحلية في حزم قابلة لإعادة الاستخدام لتوفير قواعد واقعية راسخة لمحادثات النماذج اللغوية الكبيرة. تغطي الأداة مجموعة واسعة من الإمكانيات بما في ذلك استعلام المعرفة باللغة الطبيعية، وتنفيذ سير العمل المؤتمت لإنشاء الملاحظات، والقدرة على توجيه المطالبات بين نماذج الذكاء الاصطناعي المحلية والسحابية. يوفر واجهات اكتشاف متعددة، مثل مؤشرات المحتوى ذي الصلة المضمنة ولوحة تذييل لعرض المستندات المشابهة أثناء عملية التحرير.

    Surfaces semantically similar excerpts based on the active document to discover relevant prior work.

    JavaScriptchatgptclaudeembeddings
    عرض على GitHub↗5,195
  • facebookresearch/drqaالصورة الرمزية لـ facebookresearch

    facebookresearch/DrQA

    4,468عرض على GitHub↗

    DrQA هو نظام للإجابة على الأسئلة مفتوح النطاق يسترجع المستندات ذات الصلة من مجموعة كبيرة ويستخرج إجابات محددة لأسئلة اللغة الطبيعية. تم تنفيذه كنظام شبكة عصبية يجمع بين محرك استرجاع المستندات ونموذج فهم القراءة الآلي. يستخدم النظام بنية خط أنابيب من مرحلتين. يستخدم مسترجع مستندات خشن الحبيبات متجهات كلمات مرجحة لتحديد المستندات المحتملة، بينما يحدد نموذج فهم القراءة الآلي دقيق الحبيبات ويستخرج نطاق النص الدقيق الذي يحتوي على الإجابة. يتضمن المشروع أيضاً مولد مجموعة بيانات معالجة اللغة الطبيعية الخاضع للإشراف. تنشئ هذه الأداة أمثلة تدريبية من خلال مطابقة أزواج السؤال والجواب مع الفقرات الداعمة باستخدام استدلالات السلسلة الآلية. توفر قاعدة الكود قدرات إضافية لمعالجة النصوص والترميز لإعداد النص الخام لمعالجة الشبكة العصبية.

    Uses vector embeddings for semantic document retrieval within a large unstructured corpus.

    Python
    عرض على GitHub↗4,468
  • rag-web-ui/rag-web-uiالصورة الرمزية لـ rag-web-ui

    rag-web-ui/rag-web-ui

    3,048عرض على GitHub↗

    This project is a web-based platform designed for retrieval-augmented generation, providing a conversational interface that connects language models to private document collections. It functions as a comprehensive system for managing enterprise knowledge bases, allowing users to query internal documents and receive context-aware, source-verified answers through a natural language chat interface. The platform distinguishes itself by integrating vector-based semantic search with modular knowledge base management, enabling the ingestion, segmentation, and indexing of documents into searchable em

    Uses vector embeddings to perform rapid semantic similarity searches during query generation.

    TypeScriptaideepseeklangchain
    عرض على GitHub↗3,048
  • kennethleungty/llama-2-open-source-llm-cpu-inferenceالصورة الرمزية لـ kennethleungty

    kennethleungty/Llama-2-Open-Source-LLM-CPU-Inference

    973عرض على GitHub↗

    This project provides a framework for executing large language models and performing document-based question answering entirely on local consumer hardware. By integrating a CPU-based inference engine with a local vector database, it enables users to process information without relying on cloud-based APIs or specialized graphics processing units. The system functions as a command-line tool that manages the full lifecycle of private information processing. It transforms local text files into searchable vector embeddings, allowing the model to retrieve relevant context and ground its generated r

    Fetches relevant document segments from an index using vector embeddings for semantic similarity.

    Pythonc-transformerschatgptcpu
    عرض على GitHub↗973
  1. Home
  2. Data & Databases
  3. Database Management Systems
  4. Database Engines
  5. Vector Databases
  6. Vector Document Indexing
  7. Semantic Document Retrieval