awesome-repositories.com
Blog
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektÜber unsRanking-MethodikPresseMCP-Server
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·
THUDM avatar

THUDM/DataSciBench

0
View on GitHub↗
62 Stars·7 Forks·Python·1 Aufruf

DataSciBench

📃 [DataSciBench] [GitHub] [Evaluation Data] [Website]

Features

  • Coding Benchmarks - Benchmark for data science-focused LLM agents.

Star-Verlauf

Star-Verlauf für thudm/datascibenchStar-Verlauf für thudm/datascibench

KI-Suche

Entdecke weitere awesome Repositories

Beschreibe in einfachen Worten, was du brauchst — die KI bewertet tausende kuratierte Open-Source-Projekte nach Relevanz.

Start searching with AI

Häufig gestellte Fragen

Was macht thudm/datascibench?

📃 [DataSciBench] [GitHub] [Evaluation Data] [Website]

Was sind die Hauptfunktionen von thudm/datascibench?

Die Hauptfunktionen von thudm/datascibench sind: Coding Benchmarks.

Welche Open-Source-Alternativen gibt es zu thudm/datascibench?

Open-Source-Alternativen zu thudm/datascibench sind unter anderem: swe-bench/swe-bench — SWE-bench is an automated evaluation framework that tests large language models on real-world software engineering…

Open-Source-Alternativen zu DataSciBench

Ähnliche Open-Source-Projekte, sortiert nach der Anzahl der gemeinsamen Funktionen mit DataSciBench.
  • swe-bench/swe-benchAvatar von SWE-bench

    SWE-bench/SWE-bench

    4,321Auf GitHub ansehen↗

    SWE-bench is an automated evaluation framework that tests large language models on real-world software engineering tasks. It measures how effectively models can generate and apply code patches that resolve actual GitHub issues, using a standardized dataset and scoring system built around Docker-based patch verification against original project test suites. The framework provides curated benchmark datasets spanning comprehensive, fast, verified, multilingual, and multimodal evaluation splits, allowing targeted assessment of model capabilities across different programming languages and issue ty

    Pythonbenchmarklanguage-modelsoftware-engineering
    Auf GitHub ansehen↗4,321