2 repository-uri
Training BERT models on text error correction data to learn and correct character-level mistakes in Chinese text.
Distinct from Text Model Training: Distinct from Text Model Training: specifically trains models for error correction, not general text model training.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Error Correction Model Training. Refine with filters or upvote what's useful.
pycorrector is an open-source toolkit for detecting and correcting spelling and grammar errors in Chinese text. It combines multiple correction approaches, including rule-based methods using Kenlm n-gram language models and confusion sets, as well as deep learning correctors built on BERT, GPT, and T5 models. The toolkit also provides a command-line interface for batch processing Chinese text files with configurable detection and output options. The project distinguishes itself by offering a range of correction strategies that can be mixed and matched. Rule-based correction uses character-lev
Provides training scripts for BERT models on paired error-correction data to learn character-level corrections.
Spark NLP este un toolkit pentru analiza scalabilă a textului și machine learning, construit pe framework-ul de calcul distribuit Apache Spark. Oferă un framework de machine learning multimodal și un sistem de pipeline distribuit pentru secvențierea adnotatoarelor în vederea procesării datelor lingvistice la scară largă. Biblioteca include un procesor de text de tip transformer pentru generarea de embedding-uri vectoriale contextuale și un motor de inferență dedicat pentru gestionarea modelelor de limbaj mari (LLM). Proiectul se distinge prin capacitatea sa de a procesa tipuri de date eterogene, inclusiv text, audio și imagini, într-o arhitectură unificată vision-language. Suportă capabilități avansate de AI generativ, cum ar fi prompt engineering, extracția structurată a entităților cu output JSON constrâns și inferența locală pentru a elimina latența rețelei. În plus, oferă instrumente pentru traducerea între limbi și clasificare zero-shot pe modalități de text și imagine. Framework-ul acoperă o gamă largă de capabilități, inclusiv antrenarea modelelor supervizate pentru recunoașterea entităților și analiza sentimentelor, precum și răspunsul extractiv la întrebări și sumarizarea documentelor. Integrează suport pentru baze de date vectoriale pentru căutarea de similaritate și oferă infrastructură pentru accelerare GPU și gestionarea ciclului de viață al modelelor printr-un registru centralizat. Toolkit-ul permite distribuirea modelelor și pipeline-urilor personalizate printr-un repository public și suportă implementarea modelelor prin API-uri REST.
Provides tools for training models to detect and correct character-level spelling mistakes in text.