awesome-repositories.comالتصنيفاتالمدونة
MCP
awesome-repositories.com

اكتشف أفضل مستودعات المصادر المفتوحة باستخدام بحث مدعوم بالذكاء الاصطناعي.

استكشفعمليات بحث منسقةبدائل مفتوحة المصدربرمجيات ذاتية الاستضافةالمدونةخريطة الموقع
المشروعخادم MCPحولكيفية ترتيب النتائجالصحافة
قانونيالخصوصيةالشروط
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·
MikeGu721 avatar

MikeGu721/XiezhiBenchmark

0
View on GitHub↗
98 نجوم·4 تفرعات·Python·4 مشاهدات

XiezhiBenchmark

Xiezhi (獬豸) is a comprehensive evaluation suite for Language Models (LMs). It consists of 249587 multi-choice questions spanning 516 diverse disciplines and four difficulty levels, as shown below. Please check our paper for more details, and our website will be open later on.

Features

  • Model Evaluation - Multidisciplinary benchmark for evaluating domain-specific knowledge.
  • Evaluation Benchmarks - Academic benchmark for evaluating models across diverse disciplines.
  • Evaluation Benchmarks - Multi-disciplinary benchmark for domain knowledge assessment.

سجل النجوم

مخطط تاريخ النجوم لـ mikegu721/xiezhibenchmarkمخطط تاريخ النجوم لـ mikegu721/xiezhibenchmark

بحث بالذكاء الاصطناعي

استكشف المزيد من المستودعات الرائعة

صف ما تحتاجه بلغة بسيطة — وسيقوم الذكاء الاصطناعي بترتيب آلاف المشاريع مفتوحة المصدر المنسقة حسب الصلة.

Start searching with AI

الأسئلة الشائعة

ما هي وظيفة mikegu721/xiezhibenchmark؟

Xiezhi (獬豸) is a comprehensive evaluation suite for Language Models (LMs). It consists of 249587 multi-choice questions spanning 516 diverse disciplines and four difficulty levels, as shown below. Please check our paper for more details, and our website will be open later on.

ما هي الميزات الرئيسية لـ mikegu721/xiezhibenchmark؟

الميزات الرئيسية لـ mikegu721/xiezhibenchmark هي: Model Evaluation, Evaluation Benchmarks.

ما هي البدائل مفتوحة المصدر لـ mikegu721/xiezhibenchmark؟

تشمل البدائل مفتوحة المصدر لـ mikegu721/xiezhibenchmark: sjtu-lit/ceval — Official github repo for C-Eval, a Chinese evaluation suite for foundation models [NeurIPS 2023]. michael-wzhu/promptcblue — PromptCBLUE: a large-scale instruction-tuning dataset for multi-task and few-shot learning in the medical domain in… flagopen/flageval — FlagEval, launched by BAAI in 2023, is a comprehensive large model evaluation system that encompasses over 800… cluebenchmark/supercluelyb — SuperCLUE琅琊榜:中文通用大模型匿名对战评价基准. haonan-li/cmmlu — CMMLU: Measuring massive multitask language understanding in Chinese. open-compass/opencompass — OpenCompass is an open-source framework for standardized benchmarking of large language models. It provides a…

بدائل مفتوحة المصدر لـ XiezhiBenchmark

مشاريع مفتوحة المصدر مشابهة، مرتبة حسب عدد الميزات المشتركة مع XiezhiBenchmark.
  • sjtu-lit/cevalالصورة الرمزية لـ SJTU-LIT

    SJTU-LIT/ceval

    1,854عرض على GitHub↗

    Official github repo for C-Eval, a Chinese evaluation suite for foundation models NeurIPS 2023

    Python
    عرض على GitHub↗1,854
  • flagopen/flagevalالصورة الرمزية لـ FlagOpen

    FlagOpen/FlagEval

    13عرض على GitHub↗

    FlagEval, launched by BAAI in 2023, is a comprehensive large model evaluation system that encompasses over 800 open-source and closed-source models from around the globe. It features more than 40 capability dimensions, including reasoning, mathematical skills, and task-solving abilities, along…

    عرض على GitHub↗13
  • cluebenchmark/supercluelybالصورة الرمزية لـ CLUEbenchmark

    CLUEbenchmark/SuperCLUElyb

    144عرض على GitHub↗

    SuperCLUE琅琊榜:中文通用大模型匿名对战评价基准

    عرض على GitHub↗144
  • haonan-li/cmmluالصورة الرمزية لـ haonan-li

    haonan-li/CMMLU

    821عرض على GitHub↗

    CMMLU: Measuring massive multitask language understanding in Chinese

    Python
    عرض على GitHub↗821
عرض جميع البدائل الـ 30 لـ XiezhiBenchmark
→