awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 dépôts

Awesome GitHub RepositoriesChinese

Pre-trained vector sets specifically trained on Chinese corpora to capture language-specific patterns.

Distinct from Word Embeddings: Specifies the language domain as Chinese, distinguishing it from general word embeddings

Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Chinese. Refine with filters or upvote what's useful.

Awesome Chinese GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • embedding/chinese-word-vectorsAvatar de Embedding

    Embedding/Chinese-Word-Vectors

    12,227Voir sur GitHub↗

    This project is a collection of pre-trained dense and sparse word vectors trained on diverse Chinese corpora. It serves as a library of linguistic representations and an NLP vector dataset designed to improve the accuracy of semantic and morphological analysis in text models. The collection provides corpus-specific representations and utilizes n-gram co-occurrence modeling to capture diverse linguistic patterns. It includes a hybrid of dense-sparse vectors to balance computational efficiency and semantic precision. The project covers semantic vector search and the development of Chinese natu

    Provides various pre-trained vector sets trained on different Chinese corpora to capture diverse linguistic patterns.

    Pythonchinesechinese-word-segmentationembedding
    Voir sur GitHub↗12,227
  • ymcui/chinese-bert-wwmAvatar de ymcui

    ymcui/Chinese-BERT-wwm

    10,212Voir sur GitHub↗

    Chinese-BERT-wwm is a pre-trained transformer model and encoder designed for Chinese natural language processing. It converts Chinese text into dense vector representations to be used across various natural language processing applications. The model utilizes a whole word masking strategy during pre-training, masking entire words rather than individual characters. This approach is designed to improve the capture of semantic meaning and language structure within Chinese datasets. The project covers a range of downstream tasks including text classification, sequence labeling, and reading compr

    Provides specialized processing for Chinese text to capture language-specific semantic patterns.

    Pythonbertbert-wwmbert-wwm-ext
    Voir sur GitHub↗10,212
  • huyingxi/synonymsAvatar de huyingxi

    huyingxi/Synonyms

    5,107Voir sur GitHub↗

    Synonyms est un outil de traitement du langage naturel (NLP) chinois axé sur l'analyse sémantique. Il fournit des capacités pour la segmentation des mots chinois, l'étiquetage morphosyntaxique (part-of-speech tagging) et la récupération de synonymes basés sur la proximité sémantique. Le projet convertit les mots et les phrases en représentations vectorielles numériques pour calculer des scores de similarité. Cela permet la détermination de la proximité sémantique entre différentes phrases et l'identification de l'intention d'un chatbot via la comparaison de phrases. Le système inclut également des outils pour l'extraction automatisée de mots-clés et le classement par importance pour identifier les termes significatifs au sein d'un texte. Les utilisateurs peuvent gérer des dictionnaires de segmentation de mots spécifiques et des fichiers de modèle via une configuration pilotée par l'environnement.

    Finds synonyms and calculates semantic proximity between different Chinese phrases.

    Python
    Voir sur GitHub↗5,107
  • wechatpy/wechatpyAvatar de wechatpy

    wechatpy/wechatpy

    4,290Voir sur GitHub↗

    wechatpy est un SDK d'API Python conçu pour interagir avec les comptes officiels, les mini-programmes et les API de communication d'entreprise. Il fournit une interface unifiée pour gérer les utilisateurs, les médias et les messages, et inclut un framework de bot pour traiter les événements entrants et générer des réponses structurées. Le projet implémente une fabrique de clients basée sur des composants pour effectuer des actions sur différents types de comptes et orchestre les flux OAuth2 pour la vérification d'identité. Il dispose d'une architecture de bot pilotée par les événements et d'un système de stockage de jetons enfichable pour persister les sessions d'authentification à travers les environnements. La bibliothèque couvre un large éventail de domaines fonctionnels, notamment le traitement des paiements et la facturation financière, l'administration d'espaces de travail d'entreprise, et la gestion des actifs numériques et des vitrines e-commerce. Elle fournit également des outils pour les opérations de base de données cloud, la liaison d'appareils et l'automatisation des flux de travail d'entreprise. Des capacités supplémentaires incluent des primitives de sécurité pour le chiffrement de charge utile basé sur AES, la vérification de l'authenticité des requêtes et l'audit du contenu utilisateur.

    Extracts intent and entities from natural language text for semantic analysis.

    Pythonpythonsdkwechat
    Voir sur GitHub↗4,290
  • konsheng/sensitive-lexiconAvatar de konsheng

    konsheng/Sensitive-lexicon

    3,137Voir sur GitHub↗

    Sensitive-lexicon is a sensitive word detection service and content moderation tool designed to identify prohibited text. It utilizes a curated lexicon of thousands of categorized terms and a fuzzy matching text scanner to detect restricted words and phrases. The project features specialized filters for Chinese language content across political, social, and adult domains. It supports approximate string matching to identify terms that use noise characters or whitespace to evade standard keyword filters. The system includes a network interface for hosting the detection service, allowing for re

    Provides a specialized moderation tool for detecting sensitive and prohibited text within Chinese communications.

    Voir sur GitHub↗3,137
  1. Home
  2. Artificial Intelligence & ML
  3. Natural Language Processing
  4. Word Embeddings
  5. Chinese

Explorer les sous-tags

  • Moderation ToolsTools specifically for detecting prohibited and sensitive content in Chinese language communications. **Distinct from Chinese:** Focuses on moderation tools rather than NLP word embeddings.
  • Semantic AnalysisAnalysis of meaning, synonyms, and semantic proximity within the Chinese language. **Distinct from Chinese:** Focuses on meaning and synonymy rather than just pre-trained vector set identity.