awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

1 Repo

Awesome GitHub RepositoriesGenomic Tokenization

Processes raw nucleotide sequences into discrete tokens for structured genomic analysis.

Distinct from Genomic Sequence Interpreters: Focuses on the encoding/tokenization process for genomic data, whereas Genomic Sequence Interpreters focus on the analysis of the resulting data.

Explore 1 awesome GitHub repository matching data & databases · Genomic Tokenization. Refine with filters or upvote what's useful.

Awesome Genomic Tokenization GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • arcinstitute/evo2Avatar von ArcInstitute

    ArcInstitute/evo2

    3,951Auf GitHub ansehen↗

    evo2 ist ein genomisches Large Language Model und Foundation Model, das darauf ausgelegt ist, genetische Informationen über verschiedene Spezies hinweg vorherzusagen, zu generieren und zu analysieren. Es fungiert als Nukleotid-Sequenz-Modellierer und DNA-Sequenz-Generator und nutzt Transformer-basiertes Sequenz-Modeling zur Verarbeitung genomischer Daten. Das System bietet Funktionen zur synthetischen DNA-Generierung, um neue genetische Sequenzen basierend auf biologischen Prompts oder spezies-spezifischen Tags zu erstellen. Es führt zudem Nukleotid-Wahrscheinlichkeitsvorhersagen durch, um genomische Varianten zu bewerten und biologische Eigenschaften innerhalb von DNA-Sequenzen zu analysieren. Das Modell unterstützt die Analyse genomischer Sequenzen durch die Extraktion hochdimensionaler Repräsentationen aus Zwischenschichten. Diese Embeddings ermöglichen spezialisierte Klassifizierungen und weiterführende Analysen genetischer Daten.

    Converts raw nucleotide sequences into discrete tokens that the model processes as a structured vocabulary.

    Jupyter Notebook
    Auf GitHub ansehen↗3,951
  1. Home
  2. Data & Databases
  3. Data Analysis & Visualization
  4. Analytical Platforms and Engines
  5. Sequence Analysis
  6. Genomic Sequence Interpreters
  7. Genomic Tokenization