awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

7 dépôts

Awesome GitHub RepositoriesTokenization Pipelines

Sequential processing pipelines that normalize, stem, and filter raw text into searchable tokens.

Distinct from Text Tokenization: Broadens simple text tokenization to a configurable pipeline including stop-word removal and stemming.

Explore 7 awesome GitHub repositories matching artificial intelligence & ml · Tokenization Pipelines. Refine with filters or upvote what's useful.

Awesome Tokenization Pipelines GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • olivernn/lunr.jsAvatar de olivernn

    olivernn/lunr.js

    9,203Voir sur GitHub↗

    lunr.js is a JavaScript full-text search library and client-side search engine. It creates in-memory search indexes for fast keyword retrieval and ranked document matching within browser or Node.js environments. The library utilizes a JSON serializable search index, allowing the search structure to be converted to and from JSON for storage and distribution of pre-built search data. This enables search functionality for static websites by indexing content into portable files. The system supports advanced querying capabilities, including fuzzy text matching to account for typos, field-scoped i

    Utilizes a pipeline-based tokenization process to normalize text, stem words, and remove stop words before indexing.

    JavaScript
    Voir sur GitHub↗9,203
  • vespa-engine/vespaAvatar de vespa-engine

    vespa-engine/vespa

    6,961Voir sur GitHub↗

    Vespa is a distributed search engine, vector database, and machine learning ranking engine. It serves as an AI search platform designed to handle large-scale document indexing and complex query processing across a cluster of nodes, combining keyword retrieval with high-dimensional embedding storage for semantic similarity search. The platform distinguishes itself by integrating machine learning models directly into the search pipeline to perform real-time inference and ranking. It converts these models into ranking expressions to score and order results based on relevance, while providing a s

    Provides configurable tokenization pipelines including normalization, stemming, and stop-word removal to prepare text for search indexing.

    Java
    Voir sur GitHub↗6,961
  • lucaong/minisearchAvatar de lucaong

    lucaong/minisearch

    5,804Voir sur GitHub↗

    Accepts custom tokenizers and term processors for controlling text splitting and normalization during indexing and search.

    TypeScriptautocompleteautosuggestionedge-computing
    Voir sur GitHub↗5,804
  • zombodb/zombodbAvatar de zombodb

    zombodb/zombodb

    4,730Voir sur GitHub↗

    Zombodb est une extension de base de données et un indexeur de données relationnelles qui intègre PostgreSQL avec Elasticsearch. Il fournit une interface de recherche SQL, permettant aux utilisateurs d'exécuter des requêtes de recherche complexes et des agrégations en utilisant des fonctions et une syntaxe SQL standard au lieu d'API JSON natives. Le projet synchronise les données relationnelles de PostgreSQL vers un moteur de recherche distant pour permettre une recherche plein texte et des analyses haute performance. Le système se distingue en reliant les structures relationnelles aux capacités des moteurs de recherche, spécifiquement via l'intégration de recherche géospatiale pour les types géométriques et géographiques. Il implémente une couche de mappage de requête SQL-vers-JSON qui permet une analyse de texte avancée — incluant la correspondance floue, les recherches de proximité et le scoring de pertinence — directement dans un environnement relationnel. Le projet couvre de larges domaines de capacités incluant la gestion du cycle de vie des index, la synchronisation automatisée des données relationnelles et des agrégations analytiques complexes. Il prend en charge l'indexation spatiale pour les requêtes basées sur la localisation, des pipelines d'analyse de texte personnalisés et des outils de surveillance pour auditer les statistiques d'index et la santé du cluster. La sécurité est gérée via des connexions chiffrées entre la base de données et le moteur de recherche utilisant TLS.

    Evaluates how custom analysis pipelines and tokenizers process text before it is applied to a search index.

    PLpgSQL
    Voir sur GitHub↗4,730
  • whisperspeech/whisperspeechAvatar de WhisperSpeech

    WhisperSpeech/WhisperSpeech

    4,617Voir sur GitHub↗

    WhisperSpeech est un synthétiseur vocal multilingue et un système de synthèse vocale (TTS) neuronal. Il fonctionne en inversant l'architecture du modèle Whisper pour convertir du texte en audio synthétique haute fidélité. Le système permet le clonage vocal en utilisant des fichiers audio de référence pour imiter des locuteurs spécifiques. Il prend en charge la production vocale multilingue, ce qui inclut la capacité de générer de l'audio dans différentes langues et de gérer le changement de langue au sein d'une même phrase. Le projet couvre un large éventail de capacités vocales, incluant la génération de synthèse vocale et la préparation de jeux de données vocaux. Il intègre des outils pour transcrire la parole en texte, extraire des jetons acoustiques et détecter l'activité vocale.

    Ships a multi-stage pipeline that separates linguistic and sonic features via semantic and acoustic tokenization.

    Jupyter Notebookpytorchspeech-synthesistts
    Voir sur GitHub↗4,617
  • kevinwang676/bark-voice-cloningAvatar de KevinWang676

    KevinWang676/Bark-Voice-Cloning

    2,957Voir sur GitHub↗

    Bark Voice Cloning est un moteur de synthèse texte-parole conçu pour générer un audio au son naturel et répliquer des caractéristiques vocales spécifiques. Le système utilise un modèle autorégressif basé sur transformer pour convertir le texte écrit en parole haute fidélité, prenant en charge la sortie multilingue et une livraison expressive. Le projet se distingue par le clonage de voix zero-shot, qui extrait les embeddings d'identité du locuteur à partir de courts échantillons audio pour conditionner le modèle génératif sans nécessiter de réglage fin étendu. Il fournit également des flux de travail spécialisés pour la conversion d'identité vocale, permettant aux utilisateurs de transformer le locuteur d'un enregistrement existant tout en préservant la livraison émotionnelle et les modèles rythmiques originaux. La plateforme englobe une suite complète d'outils pour la synthèse vocale et la manipulation audio. Cela inclut des utilitaires pour extraire l'audio source des médias, entraîner des modèles vocaux personnalisés et mapper le contenu linguistique sémantique vers des jetons acoustiques fins. Le logiciel est distribué sous forme d'une collection de notebooks Jupyter qui facilitent l'exécution de ces pipelines d'inférence multi-étapes.

    Converts high-level linguistic representations into fine-grained acoustic codes that capture speech nuances.

    Jupyter Notebook
    Voir sur GitHub↗2,957
  • dllxw/baby-llama2-chineseAvatar de DLLXW

    DLLXW/baby-llama2-chinese

    2,891Voir sur GitHub↗

    This project is a training pipeline and framework for developing Chinese language models based on the Llama 2 architecture. It functions as a distributed GPU trainer and dataset preprocessing toolkit designed for both the initial pre-training of baseline models and subsequent supervised fine-tuning. The system distinguishes itself through a specialized workflow for Chinese text, incorporating a data curation pipeline that uses similarity hashing for deduplication and a tokenization process that converts raw text into memory-mapped binary files for efficient disk access. It implements a superv

    Implements a sequential pipeline that converts raw text into binary, memory-mapped formats for training.

    Python
    Voir sur GitHub↗2,891
  1. Home
  2. Artificial Intelligence & ML
  3. Natural Language Processing
  4. Text Tokenization
  5. Tokenization Pipelines

Explorer les sous-tags

  • Acoustic Token PipelinesPipelines that transform text into semantic and then acoustic tokens to isolate linguistic and sonic features. **Distinct from Tokenization Pipelines:** Distinct from Tokenization Pipelines: specifically handles the transition from semantic to acoustic tokens for speech synthesis.
  • Customizable PipelinesApplies user-defined tokenizers and term processors to control text splitting and normalization during indexing and search. **Distinct from Tokenization Pipelines:** Distinct from Tokenization Pipelines: allows user-provided tokenizers and term processors, not a fixed pipeline.
  • Tokenization TestingUtilities to evaluate how text analyzers break down raw text into tokens before indexing. **Distinct from Tokenization Pipelines:** Focuses on testing the analyzer's output for correctness, while the parent refers to the operational pipelines themselves.