4 dépôts
Convert arbitrary strings or SMILES into fixed-length one-hot encoded arrays for sequence-based machine learning models.
Distinct from Sequence Encoders: Distinct from Sequence Encoders: specifically produces one-hot encoded representations, not general context vectors.
Explore 4 awesome GitHub repositories matching artificial intelligence & ml · One-Hot. Refine with filters or upvote what's useful.
DeepChem is an open-source Python framework for applying deep learning to molecular, chemical, and biological data, serving as a comprehensive toolkit for drug discovery and materials science. At its core, it provides a featurizer-pipeline abstraction that converts raw molecular data into numerical representations, including graph-based molecular structures, SMILES tokenization vocabularies, and disk-sharded dataset persistence for handling large-scale data that exceeds RAM capacity. The framework distinguishes itself through integrated molecular docking workflows that automate pocket detecti
Converts arbitrary strings or SMILES into fixed-length one-hot encoded arrays for sequence-based models.
Danfo.js est une bibliothèque d'analyse et de prétraitement de données pour JavaScript qui fournit des structures de données étiquetées haute performance. Elle implémente des dataframes et des séries pour permettre une analyse de données complexe, le calcul statistique et la manipulation de données tabulaires structurées. Le projet sert de bibliothèque de prétraitement pour le machine learning, offrant des utilitaires pour l'encodage d'étiquettes catégorielles, l'encodage one-hot, ainsi que la mise à l'échelle et la standardisation des caractéristiques numériques. Elle facilite spécifiquement la conversion de structures de données étiquetées en tenseurs pour l'entraînement et l'évaluation de modèles. La bibliothèque couvre un large ensemble de capacités incluant les statistiques descriptives, les opérations relationnelles comme la fusion et la jointure, et le traitement de séries temporelles. Elle inclut des outils pour le nettoyage, le filtrage et le regroupement de données, ainsi qu'une interface de visualisation pour générer des graphiques interactifs directement à partir des dataframes. Le système prend en charge l'importation et l'exportation de données via les formats CSV, JSON et Excel.
Converts categorical labels into one-hot numeric arrays for machine learning tasks.
Ce projet est un cours éducatif et un ensemble de supports pédagogiques pour construire des modèles de langage (LLM) à partir de zéro en Python. Il propose un guide étape par étape et des tutoriels pratiques axés sur les mécanismes internes des architectures transformer et les workflows de pré-entraînement. Le dépôt propose un framework pour implémenter et comparer diverses familles de modèles, dont Llama, GLM et RWKV. Il utilise une approche d'assemblage basée sur la configuration pour analyser les différences structurelles et les mécanismes internes de ces diverses architectures. La base de code couvre l'intégralité du pipeline de développement, incluant le prétraitement du texte, l'encodage par paires d'octets (BPE) et l'implémentation de l'attention multi-têtes avec masquage causal. Il inclut également des utilitaires d'entraînement tels que le gradient clipping, la planification du taux d'apprentissage et l'optimisation des hyperparamètres pour le pré-entraînement sur des corpus non étiquetés. Le projet est implémenté via des Jupyter Notebooks.
Implements the mathematical transition from one-hot encoded tokens to dense embedding vectors.
This is a structured deep learning curriculum for programmers, delivered as a collection of Jupyter notebooks. It teaches the fundamentals of training neural networks for computer vision, natural language processing, tabular data analysis, and collaborative filtering using PyTorch and the fastai library. The course is designed to be hands-on, guiding learners from building a training loop from scratch to fine-tuning pretrained models for a variety of practical tasks. The curriculum distinguishes itself by covering the full lifecycle of a deep learning project, from data preparation and augmen
Encodes multi-category targets into one-hot vectors for multi-label classification tasks.