awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 repositorios

Awesome GitHub RepositoriesSpeaker Adaptation

Adapting a pre-trained multi-speaker model to a new speaker using a small amount of speech data.

Distinct from Multi-Speaker Training: Distinct from Multi-Speaker Training: focuses on adapting an existing multi-speaker model to a new voice with minimal data, not training a model from scratch on multiple speakers.

Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Speaker Adaptation. Refine with filters or upvote what's useful.

  1. Home
  2. Artificial Intelligence & ML
  3. Machine Learning
  4. Speech Processing
  5. Voice Synthesis
  6. Modular Voice Configurations
  7. Voice Synthesizer Training
  8. Multi-Speaker Training
  9. Speaker Adaptation

Awesome Speaker Adaptation GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • yl4579/styletts2Avatar de yl4579

    yl4579/StyleTTS2

    6,294Ver en GitHub↗

    StyleTTS2 is an adversarial text-to-speech model that uses style diffusion and large speech language models to generate natural-sounding speech from text input. It combines adversarial training with large pre-trained speech models to improve speech quality and reduce artifacts, while employing a style diffusion process that extracts prosodic and timbral features from reference audio to guide speech generation. The model supports multi-speaker voice synthesis by conditioning the diffusion process on speaker-specific embeddings derived from reference utterances, enabling voice cloning and adapt

    Adapt a pre-trained multi-speaker model to a new speaker using a small amount of speech data to reduce training time.

    Pythonadversarial-trainingdeep-learningdiffusion-models
    Ver en GitHub↗6,294
  • plachtaa/vits-fast-fine-tuningAvatar de Plachtaa

    Plachtaa/VITS-fast-fine-tuning

    5,016Ver en GitHub↗

    VITS-fast-fine-tuning es un pipeline para adaptar modelos de síntesis de voz a voces objetivo específicas utilizando pequeños conjuntos de datos de audio. Funciona como una herramienta de adaptación rápida de hablante y un sintetizador de voz multilingüe capaz de generar audio hablado en diferentes idiomas. El sistema proporciona un framework para la conversión de voz muchos-a-muchos, transformando la identidad de un hablante en otro mientras se preserva el contenido lingüístico original. Permite la adaptación de una voz para texto-a-voz mediante el fine-tuning de un modelo pre-entrenado con clips de audio o fuentes de video. El proyecto cubre la síntesis de voz end-to-end y el procesamiento de audio, utilizando generación de formas de onda adversarias y búsqueda de alineación monótona para producir audio de alta fidelidad. Incorpora un predictor de duración estocástico para gestionar variaciones en el ritmo del habla y admite la transferencia de modelos pre-entrenados.

    Quickly recreates a specific person's voice by adapting a pre-trained multi-speaker model with small audio datasets.

    Python
    Ver en GitHub↗5,016