awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 Repos

Awesome GitHub RepositoriesPre-training Processing

Specialized text processing for preparing large-scale corpora for model pre-training.

Distinct from Text Processing Pipelines: Focuses on pre-training specific needs like sequence filtering and document concatenation, unlike general linguistic normalization.

Explore 5 awesome GitHub repositories matching data & databases · Pre-training Processing. Refine with filters or upvote what's useful.

Awesome Pre-training Processing GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • tingsongyu/pytorch_tutorialAvatar von TingsongYu

    TingsongYu/PyTorch_Tutorial

    8,018Auf GitHub ansehen↗

    This project is a comprehensive collection of educational examples and reference implementations for building vision and language models using PyTorch. It serves as a deep learning tutorial covering the end-to-end process of developing neural networks, from initial architecture definition to final production deployment. The repository provides detailed guides on implementing a wide range of domain-specific models, including convolutional neural networks for object detection and segmentation, as well as transformer and recurrent architectures for natural language processing. It emphasizes gene

    Provides routines for filtering sequences and concatenating documents with special tokens for model pre-training.

    Python
    Auf GitHub ansehen↗8,018
  • tingsongyu/pytorch-tutorial-2ndAvatar von TingsongYu

    TingsongYu/PyTorch-Tutorial-2nd

    4,555Auf GitHub ansehen↗

    Dieses Projekt ist eine umfassende Lehrressource und ein Kurs zum Aufbau neuronaler Netze mit PyTorch. Es deckt die grundlegenden Bausteine des Deep Learning ab, einschließlich Tensor-Manipulation, automatischer Differenzierung und der Konstruktion modularer Komponenten für neuronale Netze. Das Repository dient als technischer Leitfaden für verschiedene spezialisierte Bereiche. Es bietet Implementierungsdetails für Computer-Vision-Aufgaben wie Bildklassifizierung, Objekterkennung und semantische Segmentierung sowie Workflows für die Verarbeitung natürlicher Sprache (NLP) mit Transformern, rekurrenten Netzen und generativen Modellen. Zudem enthält es eine Referenz für generative KI, mit Fokus auf die Synthese von Bildern mittels Diffusionsmodellen und adversarialen Netzwerken. Das Material erstreckt sich auf Modelloptimierung und Deployment-Pipelines. Es behandelt Techniken zur Reduzierung der Modellgröße und zur Erhöhung der Inferenzgeschwindigkeit durch Quantisierung und den Export von Modellen in Formate wie ONNX und TensorRT. Weitere Kompetenzbereiche umfassen Data Engineering für paralleles Laden, Modellevaluierung mittels benutzerdefinierter Metriken und das Deployment von Open-Source Large Language Models. Das Projekt wird primär als eine Reihe von Jupyter Notebooks bereitgestellt.

    Processes raw text files into numerical indices via concatenation and boundary markers for model pre-training.

    Jupyter Notebookcomputer-visiondeepsortdiffusion-models
    Auf GitHub ansehen↗4,555
  • datawhalechina/llms-from-scratch-cnAvatar von datawhalechina

    datawhalechina/llms-from-scratch-cn

    4,211Auf GitHub ansehen↗

    Dieses Projekt ist ein Bildungskurs mit Lehrmaterialien, um Large Language Models von Grund auf mit Python zu entwickeln. Es bietet eine Schritt-für-Schritt-Anleitung und praktische Tutorials, die sich auf die internen Mechanismen von Transformer-Architekturen und Pre-Training-Workflows konzentrieren. Das Repository enthält ein Framework zur Implementierung und zum Vergleich verschiedener Modellfamilien, darunter Llama, GLM und RWKV. Es nutzt einen konfigurationsgesteuerten Ansatz, um die strukturellen Unterschiede und internen Mechanismen dieser Architekturen zu analysieren. Die Codebasis deckt die komplette Entwicklungspipeline ab, einschließlich Text-Preprocessing, Byte-Pair-Encoding und der Implementierung von Multi-Head-Attention mit kausaler Maskierung. Zudem sind Trainings-Utilities wie Gradient Clipping, Learning Rate Scheduling und Hyperparameter-Optimierung für das Pre-Training auf ungelabelten Korpora enthalten. Das Projekt ist in Jupyter Notebooks umgesetzt.

    Provides practical instructions for cleaning text and training models on unlabeled corpora.

    Jupyter Notebookglmllamallm
    Auf GitHub ansehen↗4,211
  • brightmart/albert_zhAvatar von brightmart

    brightmart/albert_zh

    3,982Auf GitHub ansehen↗

    Dieses Projekt ist eine Implementierung der ALBERT-Sprachmodellarchitektur und bietet ein Framework zum Trainieren und Evaluieren von Transformer-basierten Textklassifikatoren und Ähnlichkeitsmodellen. Es enthält spezifisch vortrainierte Assets und Tools, die für die Generierung semantischer Embeddings und Repräsentationen chinesischer Texte optimiert sind. Das Framework zeichnet sich durch Tools zur Konvertierung schwerer Sprachmodell-Checkpoints in leichtgewichtige Formate aus, um Inferenz mit geringer Latenz auf Mobilgeräten zu ermöglichen. Es nutzt spezifische Techniken zur Gewichtsreduktion, einschließlich Cross-Parameter-Sharing und faktorisierter Embedding-Parametrisierung, um die Leistung bei geringerem Speicherbedarf aufrechtzuerhalten. Das System deckt eine vollständige Pipeline für Natural Language Processing ab, von der Normalisierung roher Texte und Subword-Tokenisierung bis hin zum selbstüberwachten Pre-training mittels Masked Language Modeling. Es bietet Funktionen für die Anpassung an nachgelagerte Aufgaben, wodurch vortrainierte Modelle für Textähnlichkeitsanalysen und überwachte Klassifizierungen feinabgestimmt werden können. Das Projekt enthält Dienstprogramme für die Konvertierung von Binärdatensätzen und die Transformation von Modellformaten, um die Kompatibilität über verschiedene Machine-Learning-Plattformen hinweg sicherzustellen.

    Provides specialized text processing and language-specific masking to prepare large-scale corpora for pre-training.

    Pythonalbertbertchinese-corpus
    Auf GitHub ansehen↗3,982
  • generalnewsextractor/generalnewsextractorAvatar von GeneralNewsExtractor

    GeneralNewsExtractor/GeneralNewsExtractor

    3,779Auf GitHub ansehen↗

    GeneralNewsExtractor is a specialized system for identifying and extracting structured news data through configurable HTML filtering and XPath-based parsing. It functions as an automated news scraper and web page content parser that isolates article bodies and metadata from news webpages. The system uses YAML or JSON configuration files to manage extraction rules and XPath definitions, decoupling the processing logic from site-specific selectors. This allows for targeted noise removal and the isolation of titles, authors, and publication dates through customizable filtering. The tool covers

    Provides pre-processing capabilities to eliminate irrelevant HTML elements using blacklisted XPaths before extraction.

    Pythonpython3webcrawlerwebspider
    Auf GitHub ansehen↗3,779
  1. Home
  2. Data & Databases
  3. Text Processing Pipelines
  4. Pre-training Processing

Unter-Tags erkunden

  • HTML Noise RemovalRemoving irrelevant HTML elements and boilerplate from web pages during pre-processing. **Distinct from Pre-training Processing:** Distinct from Pre-training Processing: focuses on structural HTML element removal via XPaths rather than linguistic corpora preparation.
  • Pre-training TutorialsInstructional guides for cleaning data and training models on unlabeled corpora. **Distinct from Pre-training Processing:** Focuses on the educational tutorial aspect of pre-training rather than just the technical processing pipeline.