awesome-repositories.com
Blog
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektÜber unsRanking-MethodikPresseMCP-Server
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 Repos

Awesome GitHub RepositoriesEmbedding Model Fine-Tuning

Processes for adapting transformer networks using specific loss functions to optimize vector representations for similarity and retrieval tasks.

Distinct from Multimodal Fine-Tuning: The candidates focus on deployment, function calling, or multimodal tuning; none cover general dense/sparse embedding fine-tuning for semantic similarity.

Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Embedding Model Fine-Tuning. Refine with filters or upvote what's useful.

Awesome Embedding Model Fine-Tuning GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • huggingface/sentence-transformersAvatar von huggingface

    huggingface/sentence-transformers

    18,817Auf GitHub ansehen↗

    This project is a transformer-based framework for generating dense and sparse vector embeddings of text and multimodal data. It serves as a library for fine-tuning models to perform semantic similarity tasks, retrieval, and reranking. The system is distinguished by its support for diverse architectural patterns, including bi-encoders for fast similarity search and cross-encoders for high-precision reranking. It provides dedicated pipelines for multimodal embeddings, mapping text and images into a shared vector space, and implements knowledge distillation to compress large models into smaller,

    Fine-tunes transformer networks using various loss functions to improve performance for tasks like paraphrase mining or clustering.

    Python
    Auf GitHub ansehen↗18,817
  • lmcinnes/umapAvatar von lmcinnes

    lmcinnes/umap

    8,215Auf GitHub ansehen↗

    This project is a manifold learning and non-linear dimensionality reduction library used to project high-dimensional data into lower-dimensional spaces while preserving topological structure. It functions as a parametric embedding framework and a topological data visualization library for identifying clusters and patterns within complex datasets. The library distinguishes itself through parametric neural mapping, which uses neural networks to learn functional mappings that allow for out-of-sample projections and the reconstruction of original data. It supports supervised and semi-supervised d

    Fine-tunes learned embedding models to incorporate new information while preserving structure via landmark constraints.

    Pythondimensionality-reductionmachine-learningtopological-data-analysis
    Auf GitHub ansehen↗8,215
  • datawhalechina/so-large-lmAvatar von datawhalechina

    datawhalechina/so-large-lm

    7,400Auf GitHub ansehen↗

    This project is a comprehensive educational curriculum and structured learning path covering the full lifecycle of large language models. It provides a guided progression through the theory, architecture, training, and deployment of these models. The curriculum includes specialized guides on transformer architecture, model training tutorials, and frameworks for designing autonomous agents. It also provides dedicated resources for studying model safety and ethics. The material covers a wide range of technical capabilities, including distributed training strategies, parameter-efficient fine-tu

    Provides a guide on tuning model behavior by prepending learnable continuous token embeddings.

    Auf GitHub ansehen↗7,400
  • nvidia/isaac-gr00tAvatar von NVIDIA

    NVIDIA/Isaac-GR00T

    6,222Auf GitHub ansehen↗

    Customizes embedding models on domain-specific data to improve relevance for specialized applications.

    Jupyter Notebook
    Auf GitHub ansehen↗6,222
  • shibing624/text2vecAvatar von shibing624

    shibing624/text2vec

    4,970Auf GitHub ansehen↗

    text2vec ist ein Text-Vektorisierungs-Toolkit und Framework für semantische Ähnlichkeit, das verwendet wird, um Wörter und Sätze in numerische Vektoren umzuwandeln. Es bietet integrierte Toolsets zur Generierung von Embeddings, zur Berechnung semantischer Nähe sowie zur Implementierung von lexikalischer und semantischer Suche. Das Projekt enthält eine Modell-Fine-Tuning-Pipeline zur Optimierung von Embedding- und Matching-Modellen unter Verwendung von überwachten oder unüberwachten Datensätzen. Es zeichnet sich zudem dadurch aus, dass es eine Text-Embedding-API bereitstellt, die es ermöglicht, Vektorisierungsmodelle als Netzwerkdienste über gRPC- oder HTTP-Protokolle bereitzustellen. Das Framework deckt ein breites Spektrum an Funktionen ab, einschließlich semantischer Analyse, neuronaler Textkodierung und Vektorsuchabruf. Es unterstützt sowohl dichte Vektor-Embeddings als auch Term-Overlap-Algorithmen wie BM25, um Ähnlichkeiten zu bestimmen und verwandte Begriffe zu identifizieren. Zusätzliche Leistungsoptimierungen umfassen Model-Distillation, PCA-basierte Dimensionsreduktion und Multi-GPU-verteilte Inferenz für groß angelegte Datensätze.

    Implements processes for fine-tuning embedding models to optimize vector representations for specific domains.

    Pythonembeddingsnlpsentence-embeddings
    Auf GitHub ansehen↗4,970
  • xlang-ai/instructor-embeddingAvatar von xlang-ai

    xlang-ai/instructor-embedding

    2,024Auf GitHub ansehen↗

    Instructor-embedding ist ein Framework für die Verarbeitung natürlicher Sprache (NLP), das unstrukturierte Texte in hochdimensionale numerische Vektoren umwandelt. Durch die Nutzung einer Transformer-basierten Encoder-Architektur erleichtert das System den semantischen Abruf, die Datenklassifizierung und die Ähnlichkeitsanalyse über große Datensätze hinweg. Das Framework zeichnet sich durch instruktionsbedingte Vektorprojektion aus, die natürlichsprachliche Anweisungen direkt in den Embedding-Prozess einbezieht, um die Leistung für spezifische Aufgaben ohne zusätzliches Training zu verbessern. Es fungiert als Bibliothek für kontrastives Lernen, die es Benutzern ermöglicht, vortrainierte Sprachmodelle auf benutzerdefinierten Datensätzen für Nischendomänen zu spezialisieren. Das Projekt bietet eine umfassende Suite von Tools zur Verwaltung von Vektorrepräsentationen, einschließlich Funktionen für das Benchmarking der Modellgenauigkeit gegen standardisierte Metriken und die Indizierung von Embeddings für die schnelle Ähnlichkeitssuche. Zur Unterstützung des Deployments in ressourcenbeschränkten Umgebungen enthält das Framework Optimierungsfunktionen wie Mixed-Precision-Modellquantisierung, um den Speicherverbrauch zu reduzieren und die Inferenzgeschwindigkeit zu erhöhen.

    Fine-tunes pretrained language models on specialized datasets to create high-performance embedding systems tailored for unique industry or niche subject areas.

    Pythonembeddingsinformation-retrievallanguage-model
    Auf GitHub ansehen↗2,024
  1. Home
  2. Artificial Intelligence & ML
  3. Embedding Model Fine-Tuning

Unter-Tags erkunden

  • Landmark-Constrained Fine-TuningFine-tuning embeddings using fixed landmark points to preserve existing manifold structure. **Distinct from Embedding Model Fine-Tuning:** Uses landmark constraints to prevent structural collapse during fine-tuning, distinct from general task adaptation
  • Prompt Embedding AdaptationPrepending learnable continuous token embeddings to input sequences to tune model behavior. **Distinct from Embedding Model Fine-Tuning:** Focuses on adapting the model via input embeddings rather than fine-tuning the entire embedding model for similarity tasks.