awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 repository-uri

Awesome GitHub RepositoriesPre-training Processing

Specialized text processing for preparing large-scale corpora for model pre-training.

Distinct from Text Processing Pipelines: Focuses on pre-training specific needs like sequence filtering and document concatenation, unlike general linguistic normalization.

Explore 5 awesome GitHub repositories matching data & databases · Pre-training Processing. Refine with filters or upvote what's useful.

Awesome Pre-training Processing GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • tingsongyu/pytorch_tutorialAvatar TingsongYu

    TingsongYu/PyTorch_Tutorial

    8,018Vezi pe GitHub↗

    This project is a comprehensive collection of educational examples and reference implementations for building vision and language models using PyTorch. It serves as a deep learning tutorial covering the end-to-end process of developing neural networks, from initial architecture definition to final production deployment. The repository provides detailed guides on implementing a wide range of domain-specific models, including convolutional neural networks for object detection and segmentation, as well as transformer and recurrent architectures for natural language processing. It emphasizes gene

    Provides routines for filtering sequences and concatenating documents with special tokens for model pre-training.

    Python
    Vezi pe GitHub↗8,018
  • tingsongyu/pytorch-tutorial-2ndAvatar TingsongYu

    TingsongYu/PyTorch-Tutorial-2nd

    4,555Vezi pe GitHub↗

    Acest proiect este o resursă educațională cuprinzătoare și un curs pentru construirea de rețele neuronale folosind PyTorch. Acoperă elementele fundamentale ale deep learning-ului, inclusiv manipularea tensorilor, diferențierea automată și construcția componentelor modulare de rețele neuronale. Repository-ul servește drept ghid tehnic pentru mai multe domenii specializate. Oferă detalii de implementare pentru sarcini de computer vision, cum ar fi clasificarea imaginilor, detecția obiectelor și segmentarea semantică, precum și fluxuri de lucru de procesare a limbajului natural (NLP) care implică transformatoare, rețele recurente și modele generative. În plus, include o referință pentru AI generativ, concentrându-se în mod specific pe sinteza de imagini prin modele de difuzie și rețele adversariale. Materialul se extinde către optimizarea modelelor și pipeline-uri de deployment. Acoperă tehnici pentru reducerea dimensiunii modelelor și creșterea vitezei de inferență prin cuantizare și exportul modelelor în formate precum ONNX și TensorRT. Alte domenii de capabilitate includ ingineria datelor pentru încărcarea paralelă, evaluarea modelelor folosind metrici personalizate și deployment-ul modelelor de limbaj mari (LLM) open-source. Proiectul este livrat în principal sub formă de serie de Jupyter Notebooks.

    Processes raw text files into numerical indices via concatenation and boundary markers for model pre-training.

    Jupyter Notebookcomputer-visiondeepsortdiffusion-models
    Vezi pe GitHub↗4,555
  • datawhalechina/llms-from-scratch-cnAvatar datawhalechina

    datawhalechina/llms-from-scratch-cn

    4,211Vezi pe GitHub↗

    Acest proiect este un curs educațional și un set de materiale instrucționale pentru construirea de la zero a modelelor de limbaj mari (LLM), folosind Python. Oferă un ghid pas cu pas și tutoriale practice axate pe mecanismele interne ale arhitecturilor de tip transformer și fluxurile de lucru de pre-antrenare. Repository-ul include un framework pentru implementarea și compararea diverselor familii de modele, inclusiv Llama, GLM și RWKV. Utilizează o abordare de asamblare bazată pe configurație pentru a analiza diferențele structurale și mecanismele interne ale acestor arhitecturi. Codul sursă acoperă întregul pipeline de dezvoltare, inclusiv preprocesarea textului, byte-pair encoding și implementarea mecanismului de multi-head attention cu causal masking. Include, de asemenea, utilitare de antrenare precum gradient clipping, learning rate scheduling și optimizarea hiperparametrilor pentru pre-antrenarea pe corpusuri neetichetate. Proiectul este implementat folosind Jupyter Notebooks.

    Provides practical instructions for cleaning text and training models on unlabeled corpora.

    Jupyter Notebookglmllamallm
    Vezi pe GitHub↗4,211
  • brightmart/albert_zhAvatar brightmart

    brightmart/albert_zh

    3,982Vezi pe GitHub↗

    Acest proiect este o implementare a arhitecturii modelului lingvistic ALBERT, oferind un framework pentru antrenarea și evaluarea clasificatorilor de text și a modelelor de similaritate bazate pe transformer. Acesta include în mod specific active pre-antrenate și instrumente optimizate pentru generarea de embedding-uri semantice și reprezentări ale textului chinezesc. Framework-ul se distinge prin instrumente pentru conversia checkpoint-urilor modelelor lingvistice grele în formate ușoare pentru a permite inferența cu latență scăzută pe dispozitive mobile. Utilizează tehnici specifice de reducere a ponderilor, inclusiv partajarea cross-parameter și parametrizarea embedding-urilor factorizate, pentru a menține performanța cu o amprentă de memorie mai mică. Sistemul acoperă un pipeline complet pentru procesarea limbajului natural, de la normalizarea textului brut și tokenizarea subword până la pre-antrenarea auto-supervizată folosind masked language modeling. Oferă capacități pentru adaptarea sarcinilor ulterioare, permițând modelelor pre-antrenate să fie reglate fin pentru analiza similarității textului și clasificare supervizată. Proiectul include utilitare pentru conversia datelor de înregistrare binară și transformarea formatului modelului pentru a asigura compatibilitatea între diferite platforme de machine learning.

    Provides specialized text processing and language-specific masking to prepare large-scale corpora for pre-training.

    Pythonalbertbertchinese-corpus
    Vezi pe GitHub↗3,982
  • generalnewsextractor/generalnewsextractorAvatar GeneralNewsExtractor

    GeneralNewsExtractor/GeneralNewsExtractor

    3,779Vezi pe GitHub↗

    GeneralNewsExtractor is a specialized system for identifying and extracting structured news data through configurable HTML filtering and XPath-based parsing. It functions as an automated news scraper and web page content parser that isolates article bodies and metadata from news webpages. The system uses YAML or JSON configuration files to manage extraction rules and XPath definitions, decoupling the processing logic from site-specific selectors. This allows for targeted noise removal and the isolation of titles, authors, and publication dates through customizable filtering. The tool covers

    Provides pre-processing capabilities to eliminate irrelevant HTML elements using blacklisted XPaths before extraction.

    Pythonpython3webcrawlerwebspider
    Vezi pe GitHub↗3,779
  1. Home
  2. Data & Databases
  3. Text Processing Pipelines
  4. Pre-training Processing

Explorează sub-etichetele

  • HTML Noise RemovalRemoving irrelevant HTML elements and boilerplate from web pages during pre-processing. **Distinct from Pre-training Processing:** Distinct from Pre-training Processing: focuses on structural HTML element removal via XPaths rather than linguistic corpora preparation.
  • Pre-training TutorialsInstructional guides for cleaning data and training models on unlabeled corpora. **Distinct from Pre-training Processing:** Focuses on the educational tutorial aspect of pre-training rather than just the technical processing pipeline.