2 Repos
Processes raw text into a standardized format using tokenization and stemming to simplify linguistic analysis.
Distinct from Text Tokenization: Broadens the scope from simple segmentation (tokenization) to include root-form reduction (stemming) and normalization.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Text Normalization. Refine with filters or upvote what's useful.
nlp.js is a JavaScript natural language processing library and development framework used to build natural language understanding engines. It provides a toolkit for creating local machine learning models for intent classification and acts as a multilingual text processor that detects languages and normalizes text across various dialects. The framework distinguishes itself by supporting local execution on both servers and mobile devices, enabling chatbot functionality without an internet connection. It features a specialized system for conversational slot filling to collect mandatory informati
Provides comprehensive text normalization utilities including tokenizers and stemmers to prepare text for natural language understanding.
Dieses Projekt ist eine Implementierung der ALBERT-Sprachmodellarchitektur und bietet ein Framework zum Trainieren und Evaluieren von Transformer-basierten Textklassifikatoren und Ähnlichkeitsmodellen. Es enthält spezifisch vortrainierte Assets und Tools, die für die Generierung semantischer Embeddings und Repräsentationen chinesischer Texte optimiert sind. Das Framework zeichnet sich durch Tools zur Konvertierung schwerer Sprachmodell-Checkpoints in leichtgewichtige Formate aus, um Inferenz mit geringer Latenz auf Mobilgeräten zu ermöglichen. Es nutzt spezifische Techniken zur Gewichtsreduktion, einschließlich Cross-Parameter-Sharing und faktorisierter Embedding-Parametrisierung, um die Leistung bei geringerem Speicherbedarf aufrechtzuerhalten. Das System deckt eine vollständige Pipeline für Natural Language Processing ab, von der Normalisierung roher Texte und Subword-Tokenisierung bis hin zum selbstüberwachten Pre-training mittels Masked Language Modeling. Es bietet Funktionen für die Anpassung an nachgelagerte Aufgaben, wodurch vortrainierte Modelle für Textähnlichkeitsanalysen und überwachte Klassifizierungen feinabgestimmt werden können. Das Projekt enthält Dienstprogramme für die Konvertierung von Binärdatensätzen und die Transformation von Modellformaten, um die Kompatibilität über verschiedene Machine-Learning-Plattformen hinweg sicherzustellen.
Provides text normalization to clean raw input data via whitespace removal and Unicode standardization.