2 repositorios
Adapting a pre-trained multi-speaker model to a new speaker using a small amount of speech data.
Distinct from Multi-Speaker Training: Distinct from Multi-Speaker Training: focuses on adapting an existing multi-speaker model to a new voice with minimal data, not training a model from scratch on multiple speakers.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Speaker Adaptation. Refine with filters or upvote what's useful.
StyleTTS2 is an adversarial text-to-speech model that uses style diffusion and large speech language models to generate natural-sounding speech from text input. It combines adversarial training with large pre-trained speech models to improve speech quality and reduce artifacts, while employing a style diffusion process that extracts prosodic and timbral features from reference audio to guide speech generation. The model supports multi-speaker voice synthesis by conditioning the diffusion process on speaker-specific embeddings derived from reference utterances, enabling voice cloning and adapt
Adapt a pre-trained multi-speaker model to a new speaker using a small amount of speech data to reduce training time.
VITS-fast-fine-tuning es un pipeline para adaptar modelos de síntesis de voz a voces objetivo específicas utilizando pequeños conjuntos de datos de audio. Funciona como una herramienta de adaptación rápida de hablante y un sintetizador de voz multilingüe capaz de generar audio hablado en diferentes idiomas. El sistema proporciona un framework para la conversión de voz muchos-a-muchos, transformando la identidad de un hablante en otro mientras se preserva el contenido lingüístico original. Permite la adaptación de una voz para texto-a-voz mediante el fine-tuning de un modelo pre-entrenado con clips de audio o fuentes de video. El proyecto cubre la síntesis de voz end-to-end y el procesamiento de audio, utilizando generación de formas de onda adversarias y búsqueda de alineación monótona para producir audio de alta fidelidad. Incorpora un predictor de duración estocástico para gestionar variaciones en el ritmo del habla y admite la transferencia de modelos pre-entrenados.
Quickly recreates a specific person's voice by adapting a pre-trained multi-speaker model with small audio datasets.