awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

27 repository-uri

Awesome GitHub RepositoriesText-to-Speech Synthesis

Systems that convert written text into spoken audio output using artificial intelligence.

Distinct from CLI Speech Synthesizers: The candidates are either CLI-specific, bilingual-specific, or on-device specific, whereas this is a general cloud-based synthesis capability.

Explore 27 awesome GitHub repositories matching artificial intelligence & ml · Text-to-Speech Synthesis. Refine with filters or upvote what's useful.

Awesome Text-to-Speech Synthesis GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • aidc-ai/pixelle-videoAvatar AIDC-AI

    AIDC-AI/Pixelle-Video

    23,403Vezi pe GitHub↗

    Pixelle-Video is a text-to-video automation platform and generation engine that converts text topics into complete videos with synchronized narration, images, and music. It functions as a modular system for producing short-form content, utilizing large language models to automate script composition, visual asset generation, and voiceover production. The platform features a node-based workflow orchestrator that allows the composition of custom generation pipelines by linking different AI models. It includes a dynamic video layout designer that uses HTML templates to define aspect ratios and vi

    Converts written script text into spoken audio narration using AI synthesis engines.

    Pythonaigccomfyuiimage-generation
    Vezi pe GitHub↗23,403
  • thu-maic/openmaicAvatar THU-MAIC

    THU-MAIC/OpenMAIC

    18,781Vezi pe GitHub↗

    OpenMAIC is an LLM multi-agent education platform designed to create immersive, interactive classroom simulations. It functions as a learning environment where multiple AI agents collaborate through a state-machine orchestration framework to coordinate conversational turns and interactions. The platform features an AI-driven interactive lesson generator that transforms documents and topics into educational experiences including slides, quizzes, and project activities. It integrates a speech-enabled interface that combines speech-to-text and text-to-speech for voice-based interaction, alongsid

    Synthesizes natural-sounding spoken audio from text using automated voice providers and voice cloning.

    TypeScript
    Vezi pe GitHub↗18,781
  • hillya51/lunatranslatorAvatar HIllya51

    HIllya51/LunaTranslator

    12,030Vezi pe GitHub↗

    LunaTranslator is a real-time translation tool designed for visual novels and games. It functions as a multi-engine translation hub and text extractor that captures dialogue via memory hooking or optical character recognition to convert it into a target language. The project distinguishes itself through specialized linguistic tools, including a Japanese text analyzer for sentence segmentation and phonetic readings. It also operates as a digital dictionary aggregator, querying multiple online and offline databases simultaneously to provide comprehensive vocabulary definitions for language lear

    Converts translated on-screen text into spoken audio output using AI-driven synthesis.

    C++galgameocrreverse-engineering
    Vezi pe GitHub↗12,030
  • mozilla/ttsAvatar mozilla

    mozilla/TTS

    10,151Vezi pe GitHub↗

    This project is a comprehensive suite for neural speech synthesis, featuring a deep learning text-to-speech engine, a neural speech synthesis trainer, and a voice cloning toolkit. It provides a system for synthesizing human-like speech from text using neural network models and high-fidelity vocoders. The suite includes a speech model conversion utility to transform deep learning models between different formats for deployment across various hardware runtimes. It also provides a self-contained HTTP server to expose pre-trained text-to-speech models as a remote audio API. Capabilities include

    Offers a deep learning engine that converts written text into human-like audible speech across multiple languages.

    Jupyter Notebookdataset-analysisdeep-learninggantts
    Vezi pe GitHub↗10,151
  • ripperhe/bobAvatar ripperhe

    ripperhe/Bob

    9,693Vezi pe GitHub↗

    Bob is an extensible macOS utility designed for screen text extraction, translation aggregation, and speech synthesis. It functions as a wrapper that integrates multiple optical character recognition and translation services into a single interface, allowing users to capture screen areas, decode QR codes, and convert visual text into editable strings. The tool distinguishes itself through a plugin-based architecture that supports the integration of custom translation, speech synthesis, and image recognition APIs. It enables multi-engine parallel execution, allowing a single request to be proc

    Synthesizes translated text into spoken audio using local system voices or external cloud providers.

    bobappchatgptdeepseek
    Vezi pe GitHub↗9,693
  • jianchang512/clone-voiceAvatar jianchang512

    jianchang512/clone-voice

    8,959Vezi pe GitHub↗

    This project is a GPU-accelerated speech engine and AI voice cloning tool. It functions as a text-to-speech synthesizer and voice-to-voice converter that replicates specific human voices to generate synthetic speech. The system creates digital voice profiles by analyzing short audio samples or capturing live microphone input. These profiles enable the transformation of existing audio recordings into a target speaker's voice or the synthesis of new audio from written text. The engine supports subtitle-based speech generation for batch processing and automated dubbing workflows. A web-based au

    Converts written text and subtitle files into spoken audio using artificial intelligence and cloned voices.

    Pythonclonevoicespeech-analysissts
    Vezi pe GitHub↗8,959
  • fishaudio/bert-vits2Avatar fishaudio

    fishaudio/Bert-VITS2

    8,761Vezi pe GitHub↗

    Bert-VITS2 is a neural speech synthesis system and AI voice generator designed to convert written text into natural sounding audio. It utilizes a VITS2 engine and a neural speech synthesis model to produce high-fidelity human voices. The system incorporates a multilingual BERT language processor to improve the prosody and emotional accuracy of the generated speech. It supports multilingual voice generation and custom voice cloning to replicate specific human speech patterns and tones. The architecture covers text-to-speech synthesis through a multi-stage pipeline involving phoneme alignment,

    Converts written text into natural-sounding synthetic speech using neural voice models.

    Pythonagentbertbert-vits
    Vezi pe GitHub↗8,761
  • luruke/browser-2020Avatar luruke

    luruke/browser-2020

    7,979Vezi pe GitHub↗

    This project is a comprehensive reference guide and directory of web browser capabilities. It serves as a technical map for accessing native operating system functions, hardware interfaces, and standard web APIs to bridge the gap between web applications and desktop or mobile environments. The resource provides detailed guidance on implementing Progressive Web App features, including offline caching, push notifications, and native installation prompts. It also catalogs methods for interacting with hardware peripherals via USB, Bluetooth, and NFC, as well as reading raw data from device sensor

    References APIs for converting text to spoken audio and recognizing spoken words.

    Vezi pe GitHub↗7,979
  • jianchang512/chattts-uiAvatar jianchang512

    jianchang512/ChatTTS-ui

    7,607Vezi pe GitHub↗

    ChatTTS-ui este o interfață web și un wrapper API pentru modelul ChatTTS, conceput pentru a converti textul scris și input-ul mixt de limbaj în audio vorbit. Acesta funcționează ca un tablou de bord pentru sinteza vocală AI și un generator programabil pentru crearea de output vocal natural. Proiectul se concentrează pe profilarea vocală personalizată și controlul nuanțelor vorbirii. Permite menținerea unor caracteristici vocale consistente folosind valori seed și fișiere de date, oferind în același timp controale pentru ton, râs și pauze prin prompturi comportamentale și parametri de eșantionare. Sistemul include o arhitectură client-server care gestionează procesarea audio asincronă și oferă o interfață programabilă pentru integrarea în aplicații externe. Gestionează profilurile vocale și configurațiile audio printr-o interfață cu stare gestionată pentru a asigura o sinteză consistentă.

    Converts written text and mixed language input into natural-sounding spoken audio.

    Python
    Vezi pe GitHub↗7,607
  • rayventura/shortgptAvatar RayVentura

    RayVentura/ShortGPT

    7,413Vezi pe GitHub↗

    ShortGPT is an automated short-form video creation framework that combines large language model-driven scripting with neural voice synthesis, visual asset retrieval, and programmatic video editing. The project provides a modular pipeline architecture that chains script generation, voiceover synthesis, caption rendering, and video assembly into automated workflows, enabling the production of complete short videos from a topic prompt. The framework distinguishes itself through an LLM-oriented editing language that controls video assembly and rendering tasks programmatically, and a multilingual

    Converts written scripts into human-like spoken audio in over 30 languages using neural text-to-speech engines.

    Pythonaiartificial-intelligenceautomation
    Vezi pe GitHub↗7,413
  • espeak-ng/espeak-ngAvatar espeak-ng

    espeak-ng/espeak-ng

    6,604Vezi pe GitHub↗

    espeak-ng este un motor multilingv de text-to-speech și o bibliotecă bazată pe C care convertește textul scris în audio vorbit în diverse limbi, accente și dialecte regionale. Funcționează atât ca interfață programatică pentru încorporarea capabilităților de sinteză în aplicații externe, cât și ca un convertor fonetic de text care traduce textul scris în coduri de foneme. Sistemul utilizează metode multiple de sinteză, inclusiv sinteza prin formante pentru a genera sunete vocale matematic și sinteza prin difoni pentru a produce audio prin concatenarea segmentelor fonetice preînregistrate. Încorporează un procesor de vorbire capabil să parseze tag-uri SSML și HTML pentru a controla înălțimea și sincronizarea audio. Motorul oferă instrumente pentru designul de voci personalizate și personalizarea pronunției limbii prin hărți de traducere a fonemelor și fișiere de definiție. Susține exportul fișierelor audio în format WAV, ajustarea vitezei de redare și generarea de date fonetice pentru analiză lingvistică. O interfață în linie de comandă este disponibilă pentru declanșarea generării vorbirii și gestionarea setărilor de output audio.

    Provides controls for modifying the speaking rate, pitch, and voice profiles to adjust synthesis output.

    C
    Vezi pe GitHub↗6,604
  • ddean2009/moneyprinterplusAvatar ddean2009

    ddean2009/MoneyPrinterPlus

    6,582Vezi pe GitHub↗

    MoneyPrinterPlus is an automated video production system designed for the mass creation of short-form AI content. It functions as an end-to-end pipeline that uses large language models to generate scripts, synthesize voiceovers, and produce visual assets to assemble complete videos. The project is distinguished by its ability to batch-process high volumes of unique content through automated mixing and randomized asset pairing. It includes a social media auto-publisher that uses browser simulation to automate the upload and distribution of generated videos to platforms such as TikTok and Xiaoh

    Features a synthesis system that converts scripts into spoken narration using local and cloud AI models.

    Python
    Vezi pe GitHub↗6,582
  • lokerl/tts-vueAvatar LokerL

    LokerL/tts-vue

    6,098Vezi pe GitHub↗

    🎤 微软语音合成工具,使用 Electron Vue ElementPlus Vite 构建。

    Converts written text into spoken audio using Microsoft's synthesis engine, with automatic long-text slicing and punctuation-based segmentation.

    TypeScriptelectronelement-plustts
    Vezi pe GitHub↗6,098
  • snakers4/silero-modelsAvatar snakers4

    snakers4/silero-models

    5,977Vezi pe GitHub↗

    Aceasta este o colecție de modele neuronale pre-antrenate pentru recunoașterea vorbirii, sinteză și detectarea activității vocale. Oferă o bibliotecă de active concepute pentru speech-to-text, text-to-speech și identificarea segmentelor de vorbire umană în cadrul fișierelor audio. Proiectul include sinteză text-to-speech cu suport pentru mai multe limbi și utilizarea Speech Synthesis Markup Language pentru a controla prozodia, intonația și sincronizarea. Pentru recunoașterea vorbirii, sistemul include capabilități pentru transcrierea audio în text cu extragerea timestamp-urilor la nivel de cuvânt și un restaurator automat de punctuație pentru a insera majuscule și punctuație în textul brut. Modelele sunt exportate în formatul Open Neural Network Exchange și TorchScript pentru a permite execuția de înaltă performanță pe diferite acceleratoare hardware și sisteme de operare.

    Provides pre-trained neural models that convert written text into natural sounding spoken audio.

    Jupyter Notebookarmenianazerbaijanibelarus
    Vezi pe GitHub↗5,977
  • mindcraft-bots/mindcraftAvatar mindcraft-bots

    mindcraft-bots/mindcraft

    5,416Vezi pe GitHub↗

    Mindcraft este un framework pentru conectarea modelelor de limbaj mari la clienții de jocuri pentru a crea personaje autonome care comunică și efectuează acțiuni într-un mediu simulat. Acesta funcționează ca un orchestrator pentru boți, utilizând un sistem care face legătura între instrucțiunile AI de nivel înalt și pachetele de protocol de joc de nivel scăzut pentru a permite executarea sarcinilor în joc. Sistemul utilizează retrieval-augmented generation pentru a selecta istoricul conversațiilor relevante și exemplele de cod prin regăsirea contextului bazată pe embedding-uri. Suportă dezvoltarea unor personaje AI specifice prin configurații de profil și facilitează coordonarea multi-agent, permițând mai multor personaje autonome să colaboreze prin limbaj natural și partajarea resurselor pentru a atinge obiective comune. Framework-ul include un sistem de sarcini orientat pe obiective care descompune obiectivele complexe în pași procedurali și îi validează în raport cu stările lumii. Oferă capabilități pentru orchestrarea lumilor paralele pentru a rula experimente concurente în medii izolate, alături de integrarea text-to-speech pentru narațiunea audio în timp real a acțiunilor agentului. Proiectul include utilitare pentru importarea fișierelor de lume personalizate și sincronizarea fișierelor de log și a configurațiilor colectate către stocarea cloud la distanță.

    Converts generated text responses into spoken audio for real-time narration of agent activities.

    JavaScript
    Vezi pe GitHub↗5,416
  • ownthink/knowledgegraphdataAvatar ownthink

    ownthink/KnowledgeGraphData

    5,181Vezi pe GitHub↗

    KnowledgeGraphData este o colecție de seturi de date structurate și corpora concepute pentru a oferi un strat fundamental pentru sistemele de inteligență cognitivă și inteligență artificială. Acesta constă în principal din seturi de date de grafuri de cunoștințe chinezești la scară largă, incluzând date entitate-relație și seturi de antrenament NLP utilizate pentru a conduce înțelegerea semantică și răspunsul automat la întrebări. Proiectul se concentrează pe construcția și exportul de grafuri masive entitate-atribut-valoare, organizând cunoștințele în formate portabile. Oferă partiționare pe domenii specializate pentru a adapta regăsirea informațiilor pentru domenii profesionale precum sănătatea, armata și securitatea publică. Repository-ul acoperă o gamă largă de capabilități, inclusiv procesarea limbajului natural chinezesc, căutarea semantică și sistemele de dialog cognitiv. Setul său de instrumente cuprinde analiza lingvistică, extracția entităților, detectarea sentimentelor și rezumarea textului, precum și analiza conținutului vizual pentru auditarea site-urilor web și conversia vorbirii în text.

    Converts written text into audible spoken language using digital synthesis to produce human-like voice output.

    Python
    Vezi pe GitHub↗5,181
  • cbh123/narratorAvatar cbh123

    cbh123/narrator

    4,423Vezi pe GitHub↗

    Narrator este un sistem de inteligență artificială care convertește fluxurile video în timp real în descrieri audio în limbaj natural. Funcționează ca un narator vizual multimodal și descriptor de scenă, folosind computer vision pentru a transforma datele de mediu de la o cameră în vorbire sintetică. Instrumentul operează ca un pipeline care capturează imagini periodice dintr-un flux și utilizează un model de limbaj mare multimodal pentru a analiza evenimentele vizuale. Aceste analize sunt apoi convertite prin sinteză text-to-speech într-un voiceover care descrie activitățile și împrejurimile din lumea reală. Sistemul suportă monitorizarea automată a mediului și asistența vizuală prin eșantionarea cadrelor camerei și generarea de descrieri vorbite ale mediului curent al utilizatorului.

    Converts the AI-generated textual descriptions of the environment into spoken audio narration.

    Python
    Vezi pe GitHub↗4,423
  • jing332/tts-server-androidAvatar jing332

    jing332/tts-server-android

    4,419Vezi pe GitHub↗

    tts-server-android este un serviciu de text-to-speech la nivel de sistem pentru Android care direcționează cererile de sinteză către API-uri cloud externe sau motoare locale. Funcționează ca un gateway HTTP de sinteză vocală, convertind cererile vocale ale sistemului în cereri HTTP customizabile pentru servicii cloud remote. Proiectul include un parser de dialog narativ care utilizează ghilimele pentru a diferenția între narațiune și dialog, permițând stiluri diferite de citire. Dispune, de asemenea, de un manager de voce și o interfață de sinteză pentru a implementa reguli de înlocuire a textului și reîncercări automate pentru a îmbunătăți acuratețea output-ului vocal. Serviciul acoperă capabilități mai largi, inclusiv gestionarea motorului local pentru funcționalitatea vocală offline, rutarea API-urilor cloud și personalizarea pronunției prin preprocesarea textului bazată pe reguli.

    Includes a voice manager to customize audio output through styles and pronunciation configurations.

    Kotlinandroidcompose-uigolang
    Vezi pe GitHub↗4,419
  • koljab/realtimevoicechatAvatar KoljaB

    KoljaB/RealtimeVoiceChat

    3,771Vezi pe GitHub↗

    RealtimeVoiceChat is a conversational AI gateway and voice chat interface that enables real-time spoken interactions with large language models. It functions as a streaming audio pipeline that integrates speech-to-text transcription and text-to-speech synthesis to facilitate natural voice conversations. The system utilizes WebSocket-based audio streaming and an asynchronous text-to-speech pipeline to maintain low latency. It includes specialized conversational controls such as silence-based turn detection and client-side interrupt handling, which stops active audio playback when new user spee

    Converts AI-generated text into audible speech to provide voice-based responses to users.

    Python
    Vezi pe GitHub↗3,771
  • kevinwang676/bark-voice-cloningAvatar KevinWang676

    KevinWang676/Bark-Voice-Cloning

    2,957Vezi pe GitHub↗

    Bark Voice Cloning este un motor de sinteză text-to-speech conceput pentru a genera audio cu sunet natural și a replica caracteristici vocale specifice. Sistemul utilizează un model autoregresiv bazat pe transformatoare pentru a converti textul scris în vorbire de înaltă fidelitate, susținând output-ul multilingv și livrarea expresivă. Proiectul se distinge prin voice cloning de tip zero-shot, care extrage embedding-uri de identitate a vorbitorului din mostre audio scurte pentru a condiționa modelul generativ fără a necesita fine-tuning extins. De asemenea, oferă fluxuri de lucru specializate pentru conversia identității vocale, permițând utilizatorilor să transforme vorbitorul unei înregistrări existente, păstrând în același timp livrarea emoțională originală și tiparele ritmice. Platforma cuprinde o suită cuprinzătoare de instrumente pentru sinteza vorbirii și manipularea audio. Aceasta include utilitare pentru extragerea audio-ului sursă din media, antrenarea modelelor vocale personalizate și maparea conținutului lingvistic semantic la token-uri acustice fine. Software-ul este distribuit ca o colecție de Jupyter Notebooks care facilitează execuția acestor pipeline-uri de inferență în mai multe etape.

    Converts written text into high-fidelity audio using pre-trained neural models capable of expressive speech generation.

    Jupyter Notebook
    Vezi pe GitHub↗2,957
Înapoi12Înainte
  1. Home
  2. Artificial Intelligence & ML
  3. Text-to-Speech Synthesis

Explorează sub-etichetele

  • ONNX-Based EnginesText-to-speech systems that use the Open Neural Network Exchange format for fast offline inference. **Distinct from Text-to-Speech Synthesis:** Specifically focuses on the ONNX runtime for inference rather than general TTS AI systems.
  • Synthesis Parameter ConfigurationControls for adjusting the speaking rate, pitch, and voice profile of synthesized speech. **Distinct from Text-to-Speech Synthesis:** Focuses on the runtime configuration of synthesis parameters rather than the general AI synthesis process.
  • Voice ManagementTools for organizing and switching between different voice styles and acoustic profiles. **Distinct from Text-to-Speech Synthesis:** Distinct from Text-to-Speech Synthesis: focuses on the management and configuration of voices rather than the actual conversion process.