5 repository-uri
Specialized text processing for preparing large-scale corpora for model pre-training.
Distinct from Text Processing Pipelines: Focuses on pre-training specific needs like sequence filtering and document concatenation, unlike general linguistic normalization.
Explore 5 awesome GitHub repositories matching data & databases · Pre-training Processing. Refine with filters or upvote what's useful.
This project is a comprehensive collection of educational examples and reference implementations for building vision and language models using PyTorch. It serves as a deep learning tutorial covering the end-to-end process of developing neural networks, from initial architecture definition to final production deployment. The repository provides detailed guides on implementing a wide range of domain-specific models, including convolutional neural networks for object detection and segmentation, as well as transformer and recurrent architectures for natural language processing. It emphasizes gene
Provides routines for filtering sequences and concatenating documents with special tokens for model pre-training.
Acest proiect este o resursă educațională cuprinzătoare și un curs pentru construirea de rețele neuronale folosind PyTorch. Acoperă elementele fundamentale ale deep learning-ului, inclusiv manipularea tensorilor, diferențierea automată și construcția componentelor modulare de rețele neuronale. Repository-ul servește drept ghid tehnic pentru mai multe domenii specializate. Oferă detalii de implementare pentru sarcini de computer vision, cum ar fi clasificarea imaginilor, detecția obiectelor și segmentarea semantică, precum și fluxuri de lucru de procesare a limbajului natural (NLP) care implică transformatoare, rețele recurente și modele generative. În plus, include o referință pentru AI generativ, concentrându-se în mod specific pe sinteza de imagini prin modele de difuzie și rețele adversariale. Materialul se extinde către optimizarea modelelor și pipeline-uri de deployment. Acoperă tehnici pentru reducerea dimensiunii modelelor și creșterea vitezei de inferență prin cuantizare și exportul modelelor în formate precum ONNX și TensorRT. Alte domenii de capabilitate includ ingineria datelor pentru încărcarea paralelă, evaluarea modelelor folosind metrici personalizate și deployment-ul modelelor de limbaj mari (LLM) open-source. Proiectul este livrat în principal sub formă de serie de Jupyter Notebooks.
Processes raw text files into numerical indices via concatenation and boundary markers for model pre-training.
Acest proiect este un curs educațional și un set de materiale instrucționale pentru construirea de la zero a modelelor de limbaj mari (LLM), folosind Python. Oferă un ghid pas cu pas și tutoriale practice axate pe mecanismele interne ale arhitecturilor de tip transformer și fluxurile de lucru de pre-antrenare. Repository-ul include un framework pentru implementarea și compararea diverselor familii de modele, inclusiv Llama, GLM și RWKV. Utilizează o abordare de asamblare bazată pe configurație pentru a analiza diferențele structurale și mecanismele interne ale acestor arhitecturi. Codul sursă acoperă întregul pipeline de dezvoltare, inclusiv preprocesarea textului, byte-pair encoding și implementarea mecanismului de multi-head attention cu causal masking. Include, de asemenea, utilitare de antrenare precum gradient clipping, learning rate scheduling și optimizarea hiperparametrilor pentru pre-antrenarea pe corpusuri neetichetate. Proiectul este implementat folosind Jupyter Notebooks.
Provides practical instructions for cleaning text and training models on unlabeled corpora.
Acest proiect este o implementare a arhitecturii modelului lingvistic ALBERT, oferind un framework pentru antrenarea și evaluarea clasificatorilor de text și a modelelor de similaritate bazate pe transformer. Acesta include în mod specific active pre-antrenate și instrumente optimizate pentru generarea de embedding-uri semantice și reprezentări ale textului chinezesc. Framework-ul se distinge prin instrumente pentru conversia checkpoint-urilor modelelor lingvistice grele în formate ușoare pentru a permite inferența cu latență scăzută pe dispozitive mobile. Utilizează tehnici specifice de reducere a ponderilor, inclusiv partajarea cross-parameter și parametrizarea embedding-urilor factorizate, pentru a menține performanța cu o amprentă de memorie mai mică. Sistemul acoperă un pipeline complet pentru procesarea limbajului natural, de la normalizarea textului brut și tokenizarea subword până la pre-antrenarea auto-supervizată folosind masked language modeling. Oferă capacități pentru adaptarea sarcinilor ulterioare, permițând modelelor pre-antrenate să fie reglate fin pentru analiza similarității textului și clasificare supervizată. Proiectul include utilitare pentru conversia datelor de înregistrare binară și transformarea formatului modelului pentru a asigura compatibilitatea între diferite platforme de machine learning.
Provides specialized text processing and language-specific masking to prepare large-scale corpora for pre-training.
GeneralNewsExtractor is a specialized system for identifying and extracting structured news data through configurable HTML filtering and XPath-based parsing. It functions as an automated news scraper and web page content parser that isolates article bodies and metadata from news webpages. The system uses YAML or JSON configuration files to manage extraction rules and XPath definitions, decoupling the processing logic from site-specific selectors. This allows for targeted noise removal and the isolation of titles, authors, and publication dates through customizable filtering. The tool covers
Provides pre-processing capabilities to eliminate irrelevant HTML elements using blacklisted XPaths before extraction.