awesome-repositories.com
المدونة
MCP
awesome-repositories.com

اكتشف أفضل مستودعات المصادر المفتوحة باستخدام بحث مدعوم بالذكاء الاصطناعي.

استكشفعمليات بحث منسقةبدائل مفتوحة المصدربرمجيات ذاتية الاستضافةالمدونةخريطة الموقع
المشروعخادم MCPحولكيفية ترتيب النتائجالصحافة
قانونيالخصوصيةالشروط
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

14 مستودعات

Awesome GitHub RepositoriesDeep Learning Audio Libraries

Libraries focused on high-fidelity audio synthesis and processing using neural architectures.

Distinct from Deep Learning Libraries: Shortlist targets general DL libraries or simple audio processing; this is a deep learning library for synthesis.

Explore 14 awesome GitHub repositories matching artificial intelligence & ml · Deep Learning Audio Libraries. Refine with filters or upvote what's useful.

Awesome Deep Learning Audio Libraries GitHub Repositories

اعثر على أفضل المستودعات باستخدام الذكاء الاصطناعي.سنبحث عن أفضل المستودعات المطابقة باستخدام الذكاء الاصطناعي.
  • deezer/spleeterالصورة الرمزية لـ deezer

    deezer/spleeter

    28,252عرض على GitHub↗

    Spleeter is an AI audio source separation library and deep learning toolkit designed to split mixed music files into individual audio stems, such as vocals and drums. It provides a suite of pretrained models for isolating different instruments and voices from a recording. The toolkit includes capabilities for training and evaluating custom audio separation models using labeled datasets and configuration files. It also features utilities for measuring model performance by comparing separation outputs against reference datasets. The system manages audio processing through spectral representati

    Functions as a deep learning library for splitting music files into individual audio stems.

    Pythonaudio-processingbassdeep-learning
    عرض على GitHub↗28,252
  • facebookresearch/audiocraftالصورة الرمزية لـ facebookresearch

    facebookresearch/audiocraft

    23,379عرض على GitHub↗

    Audiocraft is a deep learning audio library and machine learning framework designed for training, fine-tuning, and evaluating generative models for music and sound effects. It functions as a text-to-music generative model and a neural audio codec, providing the tools necessary to compress audio signals into discrete representations and synthesize high-fidelity waveforms from textual descriptions. The framework is distinguished by its ability to combine multiple conditioning signals, allowing for the generation of audio based on text prompts, melodic excerpts, or style-based audio clips. It al

    Ships a library for processing and generating high-fidelity audio using neural networks and transformer models.

    Jupyter Notebook
    عرض على GitHub↗23,379
  • wwmm/easyeffectsالصورة الرمزية لـ wwmm

    wwmm/easyeffects

    9,690عرض على GitHub↗

    EasyEffects is a real-time audio processor and system-wide effects manager designed for PipeWire audio streams. It functions as a comprehensive suite for applying filters, equalizers, and limiters to both input and output audio across the entire system. The project distinguishes itself through its use of deep learning for neural network noise suppression and voice isolation, as well as its ability to simulate physical acoustic environments using impulse-response convolution. It includes a sophisticated preset management system that allows users to associate specific audio configurations with

    Uses deep learning models to isolate voice from ambient noise and preserve speech intelligibility.

    HTMLauto-volumecompressorequalizer
    عرض على GitHub↗9,690
  • jaywalnut310/vitsالصورة الرمزية لـ jaywalnut310

    jaywalnut310/vits

    7,862عرض على GitHub↗

    This project is an end-to-end text-to-speech engine and deep learning voice synthesizer. It functions as a neural speech synthesis framework that converts written text directly into audio waveforms using a single neural network. The system implements an adversarial framework and a conditional variational autoencoder to generate high-fidelity artificial speech. It utilizes a generative adversarial network to ensure synthesized audio is indistinguishable from real human speech. The toolkit provides capabilities for neural speech synthesis, text-to-audio generation, and the training of custom v

    Functions as a deep learning audio library for training high-fidelity speech models from text and audio.

    Pythondeep-learningpytorchspeech-synthesis
    عرض على GitHub↗7,862
  • ibab/tensorflow-wavenetالصورة الرمزية لـ ibab

    ibab/tensorflow-wavenet

    5,432عرض على GitHub↗

    هذا المشروع عبارة عن تطبيق TensorFlow لشبكة عصبية لتوليد موجات صوتية خام. يعمل كنموذج لتوليف الكلام المشروط ينتج عينات صوتية اصطناعية باستخدام بنية شبكة عصبية تلافيفية موسعة (dilated convolutional neural network). يدعم النظام نمذجة الصوت المخصصة من خلال دمج التكييف العالمي والمعرفات الفئوية أثناء التدريب والتوليد. يسمح هذا للنموذج بتقليد متحدثين معينين أو خصائص صوتية مميزة لتطبيقات تحويل النص إلى كلام عصبية. يغطي إطار العمل توليف الصوت بالتعلم العميق، بما في ذلك معالجة مجموعات البيانات الصوتية، وتدريب النموذج من ملفات الموجات، وتوليد ملفات صوتية قابلة للتشغيل. يستخدم مكونات فنية مثل التلافيف السببية الموسعة، وضغط mu-law، ومخرجات softmax المكممة للتعامل مع التبعيات طويلة المدى في البيانات الصوتية.

    Implements a deep learning library for high-fidelity audio synthesis using dilated convolutional architectures.

    Python
    عرض على GitHub↗5,432
  • microsoft/muzicالصورة الرمزية لـ microsoft

    microsoft/muzic

    4,928عرض على GitHub↗

    Muzic هي منصة وإطار عمل للتعلم العميق لتحليل الموسيقى وتأليفها وتوليفها بواسطة الذكاء الاصطناعي. تعمل كإطار عمل لتوليد الموسيقى وأداة تحليل، باستخدام نماذج لغة كبيرة ووكلاء مستقلين لتنسيق إنشاء وتفسير الموسيقى الرمزية والصوتية. يتميز المشروع بقدراته عبر الوسائط، حيث يربط اللغة الطبيعية والموسيقى الرمزية في مساحة تضمين مشتركة للتصنيف بدون أمثلة (zero-shot) واسترجاع المعلومات. يوظف مجموعة متنوعة من المعماريات المتخصصة، بما في ذلك أطر عمل الانتشار لتوليف الصوت، وآليات الانتباه ثنائية الحبيبات لاتساق الهيكل طويل التسلسل، ونظام هجين يجمع بين قواعد نظرية الموسيقى والشبكات العصبية. تغطي المنصة مجموعة واسعة من القدرات، بما في ذلك توليد تسلسلات MIDI من النص والكلمات، وتوليف صوت الغناء العصبي، ونسخ الكلمات تلقائيًا. كما توفر أدوات لنمذجة هيكل الموسيقى، والتوليد الرمزي القائم على السمات، وتنسيق أدوات الموسيقى الخارجية عبر وكلاء مستقلين. تشمل الأدوات المساعدة خطوط أنابيب هندسة البيانات لتحويل MIDI إلى ثنائي على نطاق واسع، وترميز مجموعات البيانات، ومعالجة الإشارات الصوتية لاستخراج نوتات اللحن ومحاذاة الكلام إلى فونيم.

    Synthesizes musical audio and MIDI sequences using neural networks and deep learning models.

    Pythonai-musicdeep-learningmusic
    عرض على GitHub↗4,928
  • google/lyraالصورة الرمزية لـ google

    google/lyra

    3,964عرض على GitHub↗

    Lyra هو إطار عمل لضغط الصوت وبرنامج ترميز (codec) للكلام بمعدل بت منخفض مصمم لنقل صوت عالي الجودة عبر الشبكات ذات النطاق الترددي المحدود. يستخدم برنامج ترميز صوتي تكيفي لموازنة جودة الصوت والنطاق الترددي للشبكة أثناء الجلسات النشطة. يستخدم المشروع ضغط الصوت التوليدي، مستخدماً الشبكات العصبية لتوليف إشارات الكلام من الحد الأدنى من البيانات وإعادة بناء تفاصيل الصوت المفقودة. وهذا يسمح بإعادة بناء صوت عالي الجودة من تدفقات بايت مضغوطة للغاية. يغطي النظام تقنية نقل الصوت عبر بروتوكول الإنترنت (VoIP) المحسنة للنطاق الترددي والاتصالات الصوتية في الوقت الفعلي، مع التركيز على ضغط الكلام بمعدل بت منخفض للحفاظ على استقرار المكالمات. تشمل قدراته تعديل معدل بت الصوت الديناميكي ومعالجة الصوت لمنع التأخير وانقطاع الإشارة في بيئات الشبكة غير المستقرة.

    Recreates high-quality speech signals from compressed byte streams using deep learning models.

    C++
    عرض على GitHub↗3,964
  • andabi/deep-voice-conversionالصورة الرمزية لـ andabi

    andabi/deep-voice-conversion

    3,941عرض على GitHub↗

    This project is a TensorFlow voice conversion framework and deep learning audio toolkit designed for neural voice style transfer. It functions as a speech synthesis engine that transforms the spectral characteristics of a source speaker's voice to match the vocal identity of a target speaker. The system employs a phoneme-based approach to voice conversion, classifying audio utterances into speaker-independent phonemes and resynthesizing them using a target voice. This pipeline allows for the transformation of voice characteristics by mapping audio features between different speakers. The too

    Provides a toolkit for training voice models and normalizing tensor data using neural architectures.

    Python
    عرض على GitHub↗3,941
  • riffusion/riffusion-hobbyالصورة الرمزية لـ riffusion

    riffusion/riffusion-hobby

    3,895عرض على GitHub↗

    Riffusion-hobby هي أداة ذكاء اصطناعي توليدي تنشئ الموسيقى عن طريق إنتاج صور طيفية عبر Stable Diffusion وتحويلها إلى صوت قابل للتشغيل. تعمل كمركب صوتي طيفي، مستخدمة التعلم العميق لتحويل تمثيلات التردد القائمة على الصور للصوت إلى ملفات صوتية. يعمل المشروع كخادم استدلال موسيقي بالذكاء الاصطناعي، ويوفر نقطة نهاية لواجهة برمجة تطبيقات قائمة على الويب لتوليد الصوت من مطالبات نصية وصور أولية. يتضمن أيضاً واجهة سطر أوامر لتنفيذ مهام توليد الموسيقى وتكوين نماذج الانتشار لأتمتة إنشاء الصوت، بالإضافة إلى مولد صوت في الوقت الفعلي لمعالجة تمثيلات الصوت. يغطي النظام مجموعة واسعة من الإمكانات بما في ذلك نشر النماذج السحابية، واستضافة الاستدلال عن بُعد، ومعالجة الإشارات الرقمية لتحويل الصورة إلى صوت. كما يوفر ملعباً تفاعلياً قائماً على الويب لتجربة معلمات النموذج واستكشاف إعدادات توليد الموسيقى.

    Uses deep learning models to convert image-based spectrograms into playable audio files.

    Pythonaiaudiodiffusers
    عرض على GitHub↗3,895
  • stability-ai/stable-audio-toolsالصورة الرمزية لـ Stability-AI

    Stability-AI/stable-audio-tools

    3,790عرض على GitHub↗

    Stable-audio-tools is a toolkit for training and deploying latent diffusion models for high-fidelity audio synthesis. It provides a framework for generating audio by iteratively refining noise within a compressed latent space, using specialized encoders to preserve temporal and spectral features of the audio signal. The project features a system for adapting pre-trained audio checkpoints to new datasets through modular initialization and configuration files. It includes utilities for weight extraction and inference model export, which remove training metadata and optimizer states to create li

    Implements a deep learning library for high-fidelity audio synthesis and processing using neural architectures.

    Python
    عرض على GitHub↗3,790
  • xiph/opusالصورة الرمزية لـ xiph

    xiph/opus

    3,035عرض على GitHub↗

    Opus is a lossy audio compression standard and codec designed for high-quality speech and music transmission over the internet. It functions as a low-latency audio codec and network-resilient streamer, providing a framework for encoding and decoding digital audio. The project distinguishes itself through the support of multi-channel ambisonics for immersive three-dimensional spatial audio reproduction. It is specifically optimized for real-time interactive communication, utilizing dynamic bitrate adjustment and forward error correction to maintain audio quality on unstable networks. The syst

    Embeds recovery data within packet padding using deep learning to maintain audio quality across lossy networks.

    Caudioccodec
    عرض على GitHub↗3,035
  • pannous/tensorflow-speech-recognitionالصورة الرمزية لـ pannous

    pannous/tensorflow-speech-recognition

    2,172عرض على GitHub↗

    توفر هذه المكتبة إطار عمل للتعلم العميق لتدريب الشبكات العصبية على أداء التعرف على الكلام وتصنيف الصوت. وهي تستخدم معماريات تسلسل إلى تسلسل (sequence-to-sequence) لتعيين مدخلات الصوت ذات الطول المتغير إلى مخرجات نصية أو رقمية، مما يتيح تطوير نماذج مخصصة لتحويل الكلام إلى نص. يتميز المشروع بقدرات معالجة صوتية متكاملة تحول الموجات الخام إلى مخططات طيفية (spectrograms) ومتجهات رقمية عالية الأبعاد. تسمح هذه الأدوات باستخراج الخصائص الصوتية الفريدة لتحديد المتحدثين، بالإضافة إلى تصنيف مصادر صوتية محددة وأرقام منطوقة. لدعم تطوير النموذج، تتضمن المكتبة مرافق لتعزيز الصوت وإعادة بناء الإشارة. من خلال تعديل عينات الصوت برمجياً لمحاكاة بيئات صوتية متنوعة والتحقق من سلامة الميزات المتعلمة من خلال إعادة بناء الفضاء الكامن (latent-space)، يحسن النظام من متانة شبكاته العصبية الأساسية.

    Regenerates original spectrograms from compressed latent representations to verify the quality of learned audio features.

    Pythondeep-learningneural-networkspeech-recognition
    عرض على GitHub↗2,172
  • voice-cloning-app/voice-cloning-appالصورة الرمزية لـ voice-cloning-app

    voice-cloning-app/Voice-Cloning-App

    1,438عرض على GitHub↗

    هذا التطبيق عبارة عن منصة لتوليف الصوت بالذكاء الاصطناعي واستنساخ الصوت العصبي. يوفر مجموعة أدوات شاملة لتحويل النص إلى كلام بشري يبدو طبيعياً من خلال تطبيق نماذج شبكة عصبية مدربة خصيصاً على عينات صوتية محددة. تسهل المنصة دورة حياة تطوير النموذج الصوتي بالكامل، بما في ذلك إعداد الكتب الصوتية الخام ونسخ الفيديو في مجموعات بيانات تدريب منظمة. كما تدعم تدريب هذه النماذج على أجهزة محلية أو بعيدة، باستخدام المعالجة الموزعة متعددة وحدات معالجة الرسومات (multi-GPU) للتعامل مع البيانات واسعة النطاق وتسريع تقارب النموذج. بعيداً عن التدريب، تتضمن المنصة قدرات لإدارة ونقل مجموعات البيانات الصوتية عبر بيئات تخزين مختلفة. يمكن للمستخدمين إجراء الاستدلال عن طريق ضبط المتغيرات الكامنة ومعلمات التوليف لتعديل النبرة، والتصريف العاطفي، والصفات الأسلوبية للمخرجات الصوتية المولدة. يعتمد التطبيق على تقنيات التعلم العميق لتحويل التمثيلات الصوتية إلى أشكال موجية عالية الدقة.

    Provides a toolkit for managing and processing large-scale voice datasets to facilitate high-performance speech synthesis.

    Pythondeep-learningpythonpytorch
    عرض على GitHub↗1,438
  • bytedance/music_source_separationالصورة الرمزية لـ bytedance

    bytedance/music_source_separation

    1,385عرض على GitHub↗

    هذا المشروع عبارة عن مجموعة أدوات للتعلم العميق مصممة لفصل مصادر الصوت واسترجاع معلومات الموسيقى. يوفر إطار عمل لتحليل إشارات الصوت متعددة الأصوات إلى مكونات متميزة، مثل الغناء، والطبول، والباس، عن طريق معالجة الأشكال الموجية الخام من خلال بنيات الشبكة العصبية. تمكن المكتبة المستخدمين من تدريب نماذج فصل مخصصة أو ضبط النماذج الموجودة لتحسين الدقة في مجموعات بيانات صوتية محددة. تدعم المكتبة دورة حياة النموذج بالكامل، بما في ذلك تحويل الصوت الخام إلى تنسيقات منظمة ومفهرسة لتحسين تحميل البيانات وكفاءة التدريب. يتضمن النظام قدرات لاستخراج ميزات نطاق التردد وخطوط أنابيب البيانات القائمة على الموتر لتسهيل مهام معالجة الإشارات المعقدة. تم هيكلة النظام لدعم سير العمل الموجه نحو البحث، مما يسمح بالتحسين التكراري للنماذج من خلال الاستمرارية القائمة على نقاط التحقق (checkpoint-based) وتنسيق التدريب الآلي.

    Provides a toolkit for training and fine-tuning neural networks to perform complex signal separation on audio waveforms.

    Pythonresearch
    عرض على GitHub↗1,385
  1. Home
  2. Artificial Intelligence & ML
  3. Deep Learning Audio Libraries

استكشف الوسوم الفرعية

  • Audio Synthesis Models1 وسم فرعيNeural network models specifically designed to generate high-fidelity audio waveforms. **Distinct from Deep Learning Audio Libraries:** Focuses on the model implementation for audio generation rather than a general-purpose library of audio tools.
  • Neural Audio Reconstruction1 وسم فرعيUsing deep learning to fill gaps or recover audio quality in lossy streams. **Distinct from Deep Learning Audio Libraries:** Distinct from Deep Learning Audio Libraries: specifically applied to the problem of packet loss recovery in network streams.
  • Voice Isolation ModelsNeural network models specifically designed to separate human speech from ambient background noise. **Distinct from Deep Learning Audio Libraries:** Focuses on the application of speech isolation rather than general audio synthesis or library infrastructure.