awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

28 Repos

Awesome GitHub RepositoriesPre-training Datasets

Large-scale raw text corpora for foundational model training.

Explore 28 awesome GitHub repositories matching part of an awesome list · Pre-training Datasets. Refine with filters or upvote what's useful.

Awesome Pre-training Datasets GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • togethercomputer/redpajama-dataAvatar von togethercomputer

    togethercomputer/RedPajama-Data

    4,947Auf GitHub ansehen↗

    RedPajama-Data ist ein Toolset für das Preprocessing großskaliger Textdatensätze, die zum Training großer Sprachmodelle verwendet werden. Es bietet eine Preprocessing-Pipeline, die sich auf das Bereinigen, Deduplizieren und Bewerten massiver Textsammlungen konzentriert, um Datenqualität und -vielfalt sicherzustellen. Das Projekt nutzt ein Framework zur Bewertung der Dokumentqualität, das Machine Learning und statistische Heuristiken einsetzt, um zu bewerten, ob Dokumente für das Training geeignet sind. Es enthält eine Datensatz-Filter-Pipeline, die Klassifikatoren und Blocklisten verwendet, um unerwünschte Wörter oder URLs zu entfernen. Das System verfügt über ein Text-Deduplizierungstoolset, das redundante Inhalte sowohl mit exakten als auch mit Fuzzy-Matching-Techniken eliminiert. Diese Funktionen ermöglichen die Identifizierung und Entfernung doppelter oder nahezu identischer Dokumente innerhalb eines Korpus.

    Reproduced dataset for training large-scale language models.

    Python
    Auf GitHub ansehen↗4,947
  • esbatmop/mnbvcAvatar von esbatmop

    esbatmop/MNBVC

    4,123Auf GitHub ansehen↗

    MNBVC is a dataset pipeline and toolkit designed for the collection, cleaning, and normalization of massive text and code corpora used to train large language models. It provides specialized tools for harvesting source code, commit histories, and repository metadata from version control platforms, alongside a multilingual text corpus collector for gathering parallel text and academic papers. The project distinguishes itself through comprehensive capabilities for processing diverse document types, including a PDF-to-text converter that transforms complex layouts and formulas into structured JS

    Massive, diverse Chinese text corpus from internet sources.

    chinesechinese-languagechinese-nlp
    Auf GitHub ansehen↗4,123
  • luodian/otterAvatar von Luodian

    Luodian/Otter

    3,410Auf GitHub ansehen↗

    🦦 Otter, a multi-modal model based on OpenFlamingo (open-sourced version of DeepMind's Flamingo), trained on MIMIC-IT and showcasing improved instruction-following and in-context learning ability.

    Multimodal in-context instruction tuning data.

    Python
    Auf GitHub ansehen↗3,410
  • opengvlab/internvideoAvatar von OpenGVLab

    OpenGVLab/InternVideo

    2,292Auf GitHub ansehen↗

    ECCV2024 Video Foundation Models & Data for Multimodal Understanding

    Video-centric instruction dataset for chat-based understanding.

    Pythonaction-recognitionbenchmarkcontrastive-learning
    Auf GitHub ansehen↗2,292
  • microsoft/llava-medAvatar von microsoft

    microsoft/LLaVA-Med

    2,214Auf GitHub ansehen↗

    Large Language-and-Vision Assistant for Biomedicine, built towards multimodal GPT-4 level capabilities.

    Biomedical instruction-following dataset for vision-language models.

    Python
    Auf GitHub ansehen↗2,214
  • openmotionlab/motiongptAvatar von OpenMotionLab

    OpenMotionLab/MotionGPT

    1,938Auf GitHub ansehen↗

    NeurIPS 2023 MotionGPT: Human Motion as a Foreign Language, a unified motion-language generation model using LLMs

    Human motion-related instruction tuning tasks.

    Python3d-generationchatgptgpt
    Auf GitHub ansehen↗1,938
  • lyuchenyang/macaw-llmAvatar von lyuchenyang

    lyuchenyang/Macaw-LLM

    1,590Auf GitHub ansehen↗

    Macaw-LLM: Multi-Modal Language Modeling with Image, Video, Audio, and Text Integration

    Multi-turn dialogue dataset for multimodal integration.

    Pythondeep-learninglanguage-modelmachine-learning
    Auf GitHub ansehen↗1,590
  • mbzuai-oryx/video-chatgptAvatar von mbzuai-oryx

    mbzuai-oryx/Video-ChatGPT

    1,504Auf GitHub ansehen↗

    ACL 2024 🔥 Video-ChatGPT is a video conversation model capable of generating meaningful conversation about videos. It combines the capabilities of LLMs with a pretrained visual encoder adapted for spatiotemporal video representation. We also introduce a rigorous 'Quantitative Evaluation Benchmarking' for video-based conversational models.

    High-quality video instruction dataset for detailed understanding.

    Pythonchatbotclipgpt-4
    Auf GitHub ansehen↗1,504
  • kakaobrain/coyo-datasetAvatar von kakaobrain

    kakaobrain/coyo-dataset

    1,256Auf GitHub ansehen↗

    COYO-700M: Large-scale Image-Text Pair Dataset

    Large-scale image-text pairs for pre-training.

    Python
    Auf GitHub ansehen↗1,256
  • cluebenchmark/cluecorpus2020Avatar von CLUEbenchmark

    CLUEbenchmark/CLUECorpus2020

    1,012Auf GitHub ansehen↗

    Large-scale Pre-training Corpus for Chinese 100G 中文预训练语料

    Cleaned 100GB Chinese corpus for pre-training and NLP tasks.

    albertbertchinese
    Auf GitHub ansehen↗1,012
  • plexpt/chatgpt-corpusAvatar von PlexPt

    PlexPt/chatgpt-corpus

    964Auf GitHub ansehen↗

    This project provides a comprehensive Chinese language corpus designed to support the training and fine-tuning of large language models. It serves as a structured natural language processing resource, offering a collection of text data that includes dialogue, customer service interactions, and creative writing. The dataset is organized into distinct thematic categories, allowing for targeted model development across specific conversational and narrative contexts. By providing information in standardized, schema-agnostic text formats, the collection ensures portability across various machine l

    Provides a large-scale Chinese language text collection including dialogue and fiction for training large language models.

    awesomecorpuscorpus-data
    Auf GitHub ansehen↗964
  • optimalscale/detgptAvatar von OptimalScale

    OptimalScale/DetGPT

    788Auf GitHub ansehen↗

    2023-06-13 Added tuned linear weights for Vicuna-7b. 2023-05-25 Our paper is available at this link. 2023-05-09 We have launched our project website. 2023-05-08 The first version of DetGPT is available now! Try our demo.

    Query-answer pairs for visual detection and reasoning.

    Jupyter Notebook
    Auf GitHub ansehen↗788
  • stevengrove/gpt4toolsAvatar von StevenGrove

    StevenGrove/GPT4Tools

    771Auf GitHub ansehen↗

    GPT4Tools is an intelligent system that can automatically decide, control, and utilize different visual foundation models, allowing the user to interact with images during a conversation.

    Tool-use instruction datasets for language models.

    Python
    Auf GitHub ansehen↗771
  • phellonchen/x-llmAvatar von phellonchen

    phellonchen/X-LLM

    318Auf GitHub ansehen↗

    X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages

    Chinese multimodal instruction dataset for foreign language treatment.

    Python
    Auf GitHub ansehen↗318
  • openlamm/lammAvatar von OpenLAMM

    OpenLAMM/LAMM

    317Auf GitHub ansehen↗

    NeurIPS 2023 Datasets and Benchmarks Track LAMM: Multi-Modal Large Language Models and Applications as AI Agents

    Comprehensive dataset for language-assisted multimodal tuning.

    Python
    Auf GitHub ansehen↗317
  • fuxiaoliu/lrv-instructionAvatar von FuxiaoLiu

    FuxiaoLiu/LRV-Instruction

    297Auf GitHub ansehen↗

    ICLR'24 Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning

    Robust instruction tuning to mitigate model hallucinations.

    Pythonchatgptevaluationevaluation-metrics
    Auf GitHub ansehen↗297
  • mobvoi/seq-monkey-dataAvatar von mobvoi

    mobvoi/seq-monkey-data

    178Auf GitHub ansehen↗

    Large-scale dataset used for training general-purpose language models.

    Auf GitHub ansehen↗178
  • vt-nlp/multiinstructAvatar von VT-NLP

    VT-NLP/MultiInstruct

    135Auf GitHub ansehen↗

    MultiInstruct: Improving Multi-Modal Zero-Shot Learning via Instruction Tuning

    Benchmark dataset for multimodal zero-shot learning.

    Python
    Auf GitHub ansehen↗135
  • icoz69/stablellavaAvatar von icoz69

    icoz69/StableLLAVA

    95Auf GitHub ansehen↗

    Official repo for StableLLAVA

    Synthesized image-dialogue data for instruction tuning.

    Python
    Auf GitHub ansehen↗95
  • polyu-chenlab/etbenchAvatar von PolyU-ChenLab

    PolyU-ChenLab/ETBench

    74Auf GitHub ansehen↗

    👾 E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding (NeurIPS 2024)

    Time-sensitive video understanding instruction dataset.

    Python
    Auf GitHub ansehen↗74
Vorherige12Nächste
  1. Home
  2. Part of an Awesome List
  3. Databases & Data
  4. Pre-training Datasets