8 مستودعات
The task of assigning labels to individual tokens in a sequence, such as named entity recognition.
Distinct from Chinese Language Segmenters: Focuses on the task of labeling tokens, which is distinct from character support or segmentation.
Explore 8 awesome GitHub repositories matching artificial intelligence & ml · Sequence Labeling. Refine with filters or upvote what's useful.
Chinese-BERT-wwm is a pre-trained transformer model and encoder designed for Chinese natural language processing. It converts Chinese text into dense vector representations to be used across various natural language processing applications. The model utilizes a whole word masking strategy during pre-training, masking entire words rather than individual characters. This approach is designed to improve the capture of semantic meaning and language structure within Chinese datasets. The project covers a range of downstream tasks including text classification, sequence labeling, and reading compr
Supports sequence labeling tasks to identify and extract entities or parts of speech from Chinese text.
Vowpal Wabbit is an open-source machine learning system designed for online learning, where models update incrementally from streaming data without requiring full retraining. It provides a reduction-based learning framework that composes complex tasks from simpler algorithms, and includes a feature hashing trick that maps unbounded feature names into a fixed-size vector space to keep memory usage constant regardless of dataset size. The system supports distributed training across a cluster using an allreduce protocol for synchronized updates, and offers an active learning query strategy that s
Learns to assign labels to each element in a sequence for tasks like named entity recognition.
This project is a collection of educational resources and technical guides focused on the development and implementation of large language models. It provides a comprehensive curriculum covering transformer architectures, training methods, and deployment strategies. The materials provide detailed instructions for building autonomous agents using reasoning loops and tool integration, as well as guides for fine-tuning models through supervised learning and preference optimization. It also includes tutorials for constructing retrieval augmented generation pipelines and implementing transformer m
Identifies named entities in text by combining LSTM networks with conditional random fields.
Lihang هي مكتبة وإطار عمل لخوارزميات التعلم الإحصائي توفر تطبيقات لنماذج التعلم الآلي الخاضعة للإشراف وغير الخاضعة للإشراف. تعمل كمستودع مرجعي يترجم نظريات التعلم الإحصائي إلى كود قابل للتنفيذ لتصنيف البيانات والتعرف على الأنماط. يتميز المشروع بأدوات متخصصة لتنفيذ النماذج الاحتمالية، باستخدام تقدير الاحتمالية والطرق البايزية لتحديد معلمات النموذج المثلى. ويتضمن أداة لتسمية البيانات التسلسلية لتحديد الأنماط في تسلسلات البيانات المرتبة ويدعم التصنيف الثنائي الخطي وغير الخطي. يغطي إطار العمل مجموعة واسعة من قدرات التعلم الآلي، بما في ذلك تحليل البيانات غير الخاضعة للإشراف للتجميع وتحليل الموضوع، بالإضافة إلى خط معالجة للاسترجاع التلقائي للببليوغرافيا الأكاديمية والمواد المرجعية. يدمج المشروع دفاتر ملاحظات تفاعلية لتحليل البيانات التكراري والتحقق من النموذج.
Implements statistical models for tagging individual tokens within ordered data sequences.
bert4keras هو تطبيق خفيف الوزن لبنية محول BERT لإطار عمل التعلم العميق Keras. يعمل كمجموعة أدوات لمعالجة اللغات الطبيعية ومكتبة نماذج محول تُستخدم لتصنيف النص، وتسمية التسلسل، واستخراج التضمين الدلالي. يتضمن إطار العمل نظام نموذج تسلسل إلى تسلسل للإجابة على الأسئلة وتوليد النص، بالإضافة إلى خادم استنتاج النموذج لنشر المحولات المدربة كواجهات برمجة تطبيقات ويب للتنبؤات في الوقت الفعلي. تغطي القدرات مجموعة واسعة من مهام فهم اللغة الطبيعية، بما في ذلك فهم القراءة، واستخراج العلاقات، ومعالجة النصوص الطويلة. توفر المكتبة أدوات للتدريب المسبق للغة والضبط الدقيق، إلى جانب تقنيات التحسين مثل تقليل المعلمات، والتدريب العدائي للمتانة، وتكوين معدل التعلم لكل طبقة. يتضمن المشروع محمل تحويل الأوزان لتحويل الأوزان المدربة مسبقاً من تنسيقات خارجية إلى هياكل Keras متوافقة.
Classifies individual tokens in a sequence for tasks such as named entity recognition and word segmentation.
Grobid هو نظام تعلم آلي مصمم لتحويل المنشورات العلمية والأكاديمية بتنسيق PDF إلى XML مهيكل. يعمل كمحلل PDF إلى XML ومستخرج للبيانات الوصفية العلمية، حيث يحدد ويطبع العناوين، والمؤلفين، والانتماءات، والمراجع الببليوغرافية من الأوراق البحثية. يستخدم النظام مقسماً للمستندات يعتمد على التعلم العميق لتقسيم ملفات PDF الخام إلى مناطق وظيفية، ويستخدم محللاً للمراجع الببليوغرافية لمطابقة الاستشهادات مقابل سجلات خارجية لإثراء البيانات الوصفية وحل معرفات DOI. يدعم خط أنابيب تدريب نموذج تعلم آلي كامل، مما يسمح بإنشاء مجموعات تدريب مشروحة، وإعادة تدريب النماذج، وتصدير ثنائيات النماذج. يغطي المشروع مجموعة واسعة من قدرات الاستخراج، بما في ذلك تحليل ترويسة المستند، وهيكلة نص الجسم الكامل، وتحديد الكيانات الخاصة بالمجال مثل معلومات التمويل واستشهادات براءات الاختراع. كما يوفر أدوات تحليل مكاني لاستخراج مربعات الإحاطة ورسم خرائط الإحداثيات لمزامنة التسميات الدلالية مع تخطيط PDF الأصلي. يمكن نشر التطبيق عبر صور حاويات (containerized) ويتضمن أدوات سطر أوامر لمعالجة الدفعات متعددة الخيوط لمجموعات المستندات الكبيرة.
Dumps raw sequence-labeling output from internal models to debug the extraction and segmentation pipeline.
snips-nlu هي مكتبة Python ومحرك فهم اللغة الطبيعية مصمم لتحويل النصوص غير المهيكلة إلى بيانات مهيكلة. يحدد نوايا المستخدم ويستخرج الكيانات المرتبطة من جمل اللغة الطبيعية لتمكين معالجة الأوامر القابلة للقراءة آلياً. يعمل المحرك كمحلل متعدد اللغات قادر على معالجة النصوص عبر لغات متعددة. يقوم بتعيين الكيانات المحددة إلى قيم قانونية أو تنسيقات ISO موحدة، مثل الطوابع الزمنية، لضمان اتساق البيانات. يغطي المشروع تصنيف النوايا والتعرف على الكيانات المسماة، باستخدام وضع علامات التسلسل والترميز لتحديد أهداف المستخدم وفتحات بيانات محددة.
Implements sequence labeling using Conditional Random Fields to predict entity labels for tokens in a sentence.
Entity-Relation-Extraction هو إطار عمل للتعلم الآلي مصمم لتحديد الكيانات وعلاقاتها المنطقية داخل النصوص غير المهيكلة. يعمل كخط أنابيب يحول المستندات الخام إلى رسوم بيانية معرفية مهيكلة باستخدام نماذج التعلم العميق ومعماريات المحولات (transformers). يتميز المشروع بنهج قائم على المخططات (schema-driven)، والذي يربط المعلومات المستخرجة بقوالب علائقية محددة مسبقاً لضمان اتساق المخرجات. ويستخدم عملية متعددة المراحل تجمع بين تصنيف الرموز (token classification) وتشفير السياق لتحديد حدود الكيانات وتصنيف العلاقات بينها. توفر مجموعة الأدوات مكونات لضبط النماذج اللغوية المدربة مسبقاً وتنسيق البيانات عبر الرسوم البيانية الحسابية. كما تتضمن أدوات لتقييم أداء النموذج مقابل مجموعات بيانات الحقيقة الأساسية للتحقق من دقة عملية الاستخراج.
Assigns categorical tags to individual tokens to delineate entity boundaries.