1 dépôt
Processes raw nucleotide sequences into discrete tokens for structured genomic analysis.
Distinct from Genomic Sequence Interpreters: Focuses on the encoding/tokenization process for genomic data, whereas Genomic Sequence Interpreters focus on the analysis of the resulting data.
Explore 1 awesome GitHub repository matching data & databases · Genomic Tokenization. Refine with filters or upvote what's useful.
evo2 est un modèle de langage étendu (LLM) et un modèle de fondation génomique conçu pour prédire, générer et analyser des informations génétiques à travers différentes espèces. Il fonctionne comme un modeleur de séquences nucléotidiques et un générateur de séquences d'ADN, utilisant la modélisation de séquences basée sur les transformers pour traiter les données génomiques. Le système offre des capacités de génération d'ADN synthétique, créant de nouvelles séquences génétiques basées sur des prompts biologiques ou des tags spécifiques à une espèce. Il effectue également la prédiction de probabilité nucléotidique pour noter les variants génomiques et analyser les propriétés biologiques au sein des séquences d'ADN. Le modèle prend en charge l'analyse de séquences génomiques grâce à l'extraction de représentations de haute dimension à partir des couches intermédiaires. Ces embeddings permettent une classification spécialisée et une analyse en aval des données génétiques.
Converts raw nucleotide sequences into discrete tokens that the model processes as a structured vocabulary.