awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

8 dépôts

Awesome GitHub RepositoriesByte-Level Tokenizers

Tokenization methods that operate on raw byte sequences to handle diverse vocabularies.

Explore 8 awesome GitHub repositories matching artificial intelligence & ml · Byte-Level Tokenizers. Refine with filters or upvote what's useful.

Awesome Byte-Level Tokenizers GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • openai/whisperAvatar de openai

    openai/whisper

    102,828Voir sur GitHub↗

    This project is a speech recognition and translation engine that utilizes a sequence-to-sequence transformer architecture to convert audio into text. It is built upon a weakly supervised learning framework, which leverages large-scale, unlabelled audio-transcript data to create generalized speech representations capable of performing simultaneous transcription, language identification, and translation. The system distinguishes itself through a unified multi-task modeling approach that shares token sequences across different objectives, allowing it to handle diverse languages and vocabularies

    Converts raw text into subword units using byte-level sequences to handle diverse languages without requiring language-specific rules.

    Python
    Voir sur GitHub↗102,828
  • google/sentencepieceAvatar de google

    google/sentencepiece

    11,657Voir sur GitHub↗

    SentencePiece is a text segmentation engine and tokenization library designed for machine learning workflows. It provides a comprehensive toolkit for transforming raw text into subword units or numerical identifiers, enabling consistent data representation for neural network training and inference. The library supports the training of segmentation models from raw text, allowing for the creation of custom vocabularies tailored to specific domain requirements. The project distinguishes itself through its byte-level encoding and fallback mechanisms, which ensure that every input can be represent

    Decomposes unknown characters into UTF-8 byte sequences to ensure full vocabulary coverage without unknown tokens.

    C++natural-language-processingneural-machine-translationword-segmentation
    Voir sur GitHub↗11,657
  • karpathy/minbpeAvatar de karpathy

    karpathy/minbpe

    10,582Voir sur GitHub↗

    Minimal, clean code for the Byte Pair Encoding (BPE) algorithm commonly used in LLM tokenization.

    Provides a clean implementation of the BPE training algorithm to learn merge rules from text corpora.

    Python
    Voir sur GitHub↗10,582
  • microsoft/llmlinguaAvatar de microsoft

    microsoft/LLMLingua

    5,844Voir sur GitHub↗

    LLMLingua is a prompt compression tool that reduces token count in prompts before they are sent to a large language model, cutting API costs and latency while preserving task performance. It operates as an extractive pipeline using a BERT-level Transformer encoder to classify each token for removal based on full bidirectional context from the prompt, retaining only key information and discarding non-essential tokens. The tool is trained through a knowledge distillation process, where a compact compression model learns from an extractive dataset derived from a large language model's output to

    Removes redundant tokens identified by a small language model to cut API costs and latency.

    Python
    Voir sur GitHub↗5,844
  • biolab/orange3Avatar de biolab

    biolab/orange3

    5,635Voir sur GitHub↗

    Orange3 is a visual data mining platform that provides an interactive canvas for building data analysis workflows without writing code. At its core, it offers a widget-based visual programming environment where users connect configurable components to perform data preprocessing, machine learning model training, statistical evaluation, and interactive visualization. The platform is built on NumPy-backed data tables with domain descriptors that define variable names, types, and roles, and includes a lazy SQL query proxy for working with database tables without loading all data into memory. The

    Provides a widget to drop constant attributes and unused categorical values from datasets.

    Python
    Voir sur GitHub↗5,635
  • onnxsim/onnxsimAvatar de onnxsim

    onnxsim/onnxsim

    4,353Voir sur GitHub↗

    onnxsim est un optimiseur de graphes de deep learning et un simplificateur de modèles conçu pour réduire la complexité des graphes de calcul ONNX. Il fonctionne comme un compresseur de modèle qui remplace des séquences d'opérateurs complexes par des sorties constantes simplifiées afin de réduire la surcharge opérationnelle. Le projet réalise cette simplification grâce à l'inférence par pliage de constantes (constant folding), qui remplace les sous-graphes d'opérateurs constants par des tenseurs constants pré-calculés. Il utilise la réécriture de graphes basée sur des motifs et l'analyse statique de graphes de calcul pour identifier et supprimer les nœuds redondants ou les opérations inaccessibles. L'outil couvre de larges capacités d'optimisation de modèles, notamment l'élimination de la redondance des opérateurs et la suppression des nœuds de reshape ou d'identité inutiles. Ces processus rationalisent le flux d'exécution et réduisent l'empreinte mémoire du modèle.

    Eliminates identity operations and unnecessary reshape nodes that do not alter mathematical output.

    C++deep-learningonnxpytorch
    Voir sur GitHub↗4,353
  • mbloch/mapshaperAvatar de mbloch

    mbloch/mapshaper

    4,133Voir sur GitHub↗

    Mapshaper est un outil pour traiter, simplifier et convertir des données vectorielles géographiques, disponible sous forme d'interface en ligne de commande, d'outil de navigateur web et de bibliothèque Node.js. Il fonctionne comme un projecteur de coordonnées, un convertisseur de données vectorielles et un optimiseur d'actifs de carte web conçu pour transformer les jeux de données spatiaux entre différents systèmes de référence de coordonnées et formats de fichiers. Le projet se distingue par sa simplification de géométrie préservant la topologie, qui réduit le nombre de sommets tout en maintenant les limites partagées pour éviter les lacunes et les chevauchements. Il optimise davantage les actifs pour le web grâce à la quantification des coordonnées et au filtrage des attributs pour réduire la taille des fichiers. Le système couvre un large éventail de capacités, y compris la reprojection de coordonnées utilisant des chaînes PROJ et des codes EPSG, et la conversion de données entre des formats tels que Shapefile, GeoJSON, TopoJSON, GeoPackage et KML. Il fournit des outils de traitement de géométrie étendus pour la mise en mémoire tampon, le découpage, la dissolution et la réparation des topologies, ainsi que des utilitaires de gestion de données pour la jointure, le filtrage et la transformation d'attributs. De plus, il inclut des fonctionnalités de visualisation pour générer des exportations SVG stylisées, des graticules et des cartes à symboles proportionnels. Les capacités de traitement spatial peuvent être intégrées directement dans les applications JavaScript et les pipelines de build via sa bibliothèque Node.js.

    Deletes features that share the same identifier as a previous feature to clean datasets.

    JavaScript
    Voir sur GitHub↗4,133
  • huawei-noah/pretrained-language-modelAvatar de huawei-noah

    huawei-noah/Pretrained-Language-Model

    3,163Voir sur GitHub↗

    Pretrained-Language-Model is a machine learning library and natural language processing toolkit designed for pretraining, tokenizing, and compressing large language models using transformer architectures and specialized optimization techniques. It supports Chinese and multilingual natural language processing tasks, including text classification and conversational response generation. The framework provides specialized capabilities for training large-scale autoregressive and contextual language models, alongside model compression techniques like knowledge distillation and quantization to reduc

    Splits raw text streams into subword tokens using byte-level vocabularies for downstream NLP processing.

    Pythonknowledge-distillationlarge-scale-distributedmodel-compression
    Voir sur GitHub↗3,163
  1. Home
  2. Artificial Intelligence & ML
  3. Natural Language Processing
  4. Tokenizers
  5. Byte-Level Tokenizers

Explorer les sous-tags

  • Redundancy Removers2 sous-tagsReduces token count by removing redundant tokens identified by a small language model, cutting API costs and latency while preserving task performance. **Distinct from Byte-Level Tokenizers:** Distinct from Byte-Level Tokenizers: focuses on removing redundant tokens for compression, not tokenization methods.
  • TrainingLearns merge rules by iteratively pairing the most frequent adjacent byte sequences in a corpus until a target vocabulary size is reached. **Distinct from Byte-Level Tokenizers:** Distinct from Byte-Level Tokenizers: focuses on the training process to learn merge rules, not the application of an existing tokenizer.