1 Repo
Processes raw nucleotide sequences into discrete tokens for structured genomic analysis.
Distinct from Genomic Sequence Interpreters: Focuses on the encoding/tokenization process for genomic data, whereas Genomic Sequence Interpreters focus on the analysis of the resulting data.
Explore 1 awesome GitHub repository matching data & databases · Genomic Tokenization. Refine with filters or upvote what's useful.
evo2 ist ein genomisches Large Language Model und Foundation Model, das darauf ausgelegt ist, genetische Informationen über verschiedene Spezies hinweg vorherzusagen, zu generieren und zu analysieren. Es fungiert als Nukleotid-Sequenz-Modellierer und DNA-Sequenz-Generator und nutzt Transformer-basiertes Sequenz-Modeling zur Verarbeitung genomischer Daten. Das System bietet Funktionen zur synthetischen DNA-Generierung, um neue genetische Sequenzen basierend auf biologischen Prompts oder spezies-spezifischen Tags zu erstellen. Es führt zudem Nukleotid-Wahrscheinlichkeitsvorhersagen durch, um genomische Varianten zu bewerten und biologische Eigenschaften innerhalb von DNA-Sequenzen zu analysieren. Das Modell unterstützt die Analyse genomischer Sequenzen durch die Extraktion hochdimensionaler Repräsentationen aus Zwischenschichten. Diese Embeddings ermöglichen spezialisierte Klassifizierungen und weiterführende Analysen genetischer Daten.
Converts raw nucleotide sequences into discrete tokens that the model processes as a structured vocabulary.