14 مستودعات
Libraries focused on high-fidelity audio synthesis and processing using neural architectures.
Distinct from Deep Learning Libraries: Shortlist targets general DL libraries or simple audio processing; this is a deep learning library for synthesis.
Explore 14 awesome GitHub repositories matching artificial intelligence & ml · Deep Learning Audio Libraries. Refine with filters or upvote what's useful.
Spleeter is an AI audio source separation library and deep learning toolkit designed to split mixed music files into individual audio stems, such as vocals and drums. It provides a suite of pretrained models for isolating different instruments and voices from a recording. The toolkit includes capabilities for training and evaluating custom audio separation models using labeled datasets and configuration files. It also features utilities for measuring model performance by comparing separation outputs against reference datasets. The system manages audio processing through spectral representati
Functions as a deep learning library for splitting music files into individual audio stems.
Audiocraft is a deep learning audio library and machine learning framework designed for training, fine-tuning, and evaluating generative models for music and sound effects. It functions as a text-to-music generative model and a neural audio codec, providing the tools necessary to compress audio signals into discrete representations and synthesize high-fidelity waveforms from textual descriptions. The framework is distinguished by its ability to combine multiple conditioning signals, allowing for the generation of audio based on text prompts, melodic excerpts, or style-based audio clips. It al
Ships a library for processing and generating high-fidelity audio using neural networks and transformer models.
EasyEffects is a real-time audio processor and system-wide effects manager designed for PipeWire audio streams. It functions as a comprehensive suite for applying filters, equalizers, and limiters to both input and output audio across the entire system. The project distinguishes itself through its use of deep learning for neural network noise suppression and voice isolation, as well as its ability to simulate physical acoustic environments using impulse-response convolution. It includes a sophisticated preset management system that allows users to associate specific audio configurations with
Uses deep learning models to isolate voice from ambient noise and preserve speech intelligibility.
This project is an end-to-end text-to-speech engine and deep learning voice synthesizer. It functions as a neural speech synthesis framework that converts written text directly into audio waveforms using a single neural network. The system implements an adversarial framework and a conditional variational autoencoder to generate high-fidelity artificial speech. It utilizes a generative adversarial network to ensure synthesized audio is indistinguishable from real human speech. The toolkit provides capabilities for neural speech synthesis, text-to-audio generation, and the training of custom v
Functions as a deep learning audio library for training high-fidelity speech models from text and audio.
هذا المشروع عبارة عن تطبيق TensorFlow لشبكة عصبية لتوليد موجات صوتية خام. يعمل كنموذج لتوليف الكلام المشروط ينتج عينات صوتية اصطناعية باستخدام بنية شبكة عصبية تلافيفية موسعة (dilated convolutional neural network). يدعم النظام نمذجة الصوت المخصصة من خلال دمج التكييف العالمي والمعرفات الفئوية أثناء التدريب والتوليد. يسمح هذا للنموذج بتقليد متحدثين معينين أو خصائص صوتية مميزة لتطبيقات تحويل النص إلى كلام عصبية. يغطي إطار العمل توليف الصوت بالتعلم العميق، بما في ذلك معالجة مجموعات البيانات الصوتية، وتدريب النموذج من ملفات الموجات، وتوليد ملفات صوتية قابلة للتشغيل. يستخدم مكونات فنية مثل التلافيف السببية الموسعة، وضغط mu-law، ومخرجات softmax المكممة للتعامل مع التبعيات طويلة المدى في البيانات الصوتية.
Implements a deep learning library for high-fidelity audio synthesis using dilated convolutional architectures.
Muzic هي منصة وإطار عمل للتعلم العميق لتحليل الموسيقى وتأليفها وتوليفها بواسطة الذكاء الاصطناعي. تعمل كإطار عمل لتوليد الموسيقى وأداة تحليل، باستخدام نماذج لغة كبيرة ووكلاء مستقلين لتنسيق إنشاء وتفسير الموسيقى الرمزية والصوتية. يتميز المشروع بقدراته عبر الوسائط، حيث يربط اللغة الطبيعية والموسيقى الرمزية في مساحة تضمين مشتركة للتصنيف بدون أمثلة (zero-shot) واسترجاع المعلومات. يوظف مجموعة متنوعة من المعماريات المتخصصة، بما في ذلك أطر عمل الانتشار لتوليف الصوت، وآليات الانتباه ثنائية الحبيبات لاتساق الهيكل طويل التسلسل، ونظام هجين يجمع بين قواعد نظرية الموسيقى والشبكات العصبية. تغطي المنصة مجموعة واسعة من القدرات، بما في ذلك توليد تسلسلات MIDI من النص والكلمات، وتوليف صوت الغناء العصبي، ونسخ الكلمات تلقائيًا. كما توفر أدوات لنمذجة هيكل الموسيقى، والتوليد الرمزي القائم على السمات، وتنسيق أدوات الموسيقى الخارجية عبر وكلاء مستقلين. تشمل الأدوات المساعدة خطوط أنابيب هندسة البيانات لتحويل MIDI إلى ثنائي على نطاق واسع، وترميز مجموعات البيانات، ومعالجة الإشارات الصوتية لاستخراج نوتات اللحن ومحاذاة الكلام إلى فونيم.
Synthesizes musical audio and MIDI sequences using neural networks and deep learning models.
Lyra هو إطار عمل لضغط الصوت وبرنامج ترميز (codec) للكلام بمعدل بت منخفض مصمم لنقل صوت عالي الجودة عبر الشبكات ذات النطاق الترددي المحدود. يستخدم برنامج ترميز صوتي تكيفي لموازنة جودة الصوت والنطاق الترددي للشبكة أثناء الجلسات النشطة. يستخدم المشروع ضغط الصوت التوليدي، مستخدماً الشبكات العصبية لتوليف إشارات الكلام من الحد الأدنى من البيانات وإعادة بناء تفاصيل الصوت المفقودة. وهذا يسمح بإعادة بناء صوت عالي الجودة من تدفقات بايت مضغوطة للغاية. يغطي النظام تقنية نقل الصوت عبر بروتوكول الإنترنت (VoIP) المحسنة للنطاق الترددي والاتصالات الصوتية في الوقت الفعلي، مع التركيز على ضغط الكلام بمعدل بت منخفض للحفاظ على استقرار المكالمات. تشمل قدراته تعديل معدل بت الصوت الديناميكي ومعالجة الصوت لمنع التأخير وانقطاع الإشارة في بيئات الشبكة غير المستقرة.
Recreates high-quality speech signals from compressed byte streams using deep learning models.
This project is a TensorFlow voice conversion framework and deep learning audio toolkit designed for neural voice style transfer. It functions as a speech synthesis engine that transforms the spectral characteristics of a source speaker's voice to match the vocal identity of a target speaker. The system employs a phoneme-based approach to voice conversion, classifying audio utterances into speaker-independent phonemes and resynthesizing them using a target voice. This pipeline allows for the transformation of voice characteristics by mapping audio features between different speakers. The too
Provides a toolkit for training voice models and normalizing tensor data using neural architectures.
Riffusion-hobby هي أداة ذكاء اصطناعي توليدي تنشئ الموسيقى عن طريق إنتاج صور طيفية عبر Stable Diffusion وتحويلها إلى صوت قابل للتشغيل. تعمل كمركب صوتي طيفي، مستخدمة التعلم العميق لتحويل تمثيلات التردد القائمة على الصور للصوت إلى ملفات صوتية. يعمل المشروع كخادم استدلال موسيقي بالذكاء الاصطناعي، ويوفر نقطة نهاية لواجهة برمجة تطبيقات قائمة على الويب لتوليد الصوت من مطالبات نصية وصور أولية. يتضمن أيضاً واجهة سطر أوامر لتنفيذ مهام توليد الموسيقى وتكوين نماذج الانتشار لأتمتة إنشاء الصوت، بالإضافة إلى مولد صوت في الوقت الفعلي لمعالجة تمثيلات الصوت. يغطي النظام مجموعة واسعة من الإمكانات بما في ذلك نشر النماذج السحابية، واستضافة الاستدلال عن بُعد، ومعالجة الإشارات الرقمية لتحويل الصورة إلى صوت. كما يوفر ملعباً تفاعلياً قائماً على الويب لتجربة معلمات النموذج واستكشاف إعدادات توليد الموسيقى.
Uses deep learning models to convert image-based spectrograms into playable audio files.
Stable-audio-tools is a toolkit for training and deploying latent diffusion models for high-fidelity audio synthesis. It provides a framework for generating audio by iteratively refining noise within a compressed latent space, using specialized encoders to preserve temporal and spectral features of the audio signal. The project features a system for adapting pre-trained audio checkpoints to new datasets through modular initialization and configuration files. It includes utilities for weight extraction and inference model export, which remove training metadata and optimizer states to create li
Implements a deep learning library for high-fidelity audio synthesis and processing using neural architectures.
Opus is a lossy audio compression standard and codec designed for high-quality speech and music transmission over the internet. It functions as a low-latency audio codec and network-resilient streamer, providing a framework for encoding and decoding digital audio. The project distinguishes itself through the support of multi-channel ambisonics for immersive three-dimensional spatial audio reproduction. It is specifically optimized for real-time interactive communication, utilizing dynamic bitrate adjustment and forward error correction to maintain audio quality on unstable networks. The syst
Embeds recovery data within packet padding using deep learning to maintain audio quality across lossy networks.
توفر هذه المكتبة إطار عمل للتعلم العميق لتدريب الشبكات العصبية على أداء التعرف على الكلام وتصنيف الصوت. وهي تستخدم معماريات تسلسل إلى تسلسل (sequence-to-sequence) لتعيين مدخلات الصوت ذات الطول المتغير إلى مخرجات نصية أو رقمية، مما يتيح تطوير نماذج مخصصة لتحويل الكلام إلى نص. يتميز المشروع بقدرات معالجة صوتية متكاملة تحول الموجات الخام إلى مخططات طيفية (spectrograms) ومتجهات رقمية عالية الأبعاد. تسمح هذه الأدوات باستخراج الخصائص الصوتية الفريدة لتحديد المتحدثين، بالإضافة إلى تصنيف مصادر صوتية محددة وأرقام منطوقة. لدعم تطوير النموذج، تتضمن المكتبة مرافق لتعزيز الصوت وإعادة بناء الإشارة. من خلال تعديل عينات الصوت برمجياً لمحاكاة بيئات صوتية متنوعة والتحقق من سلامة الميزات المتعلمة من خلال إعادة بناء الفضاء الكامن (latent-space)، يحسن النظام من متانة شبكاته العصبية الأساسية.
Regenerates original spectrograms from compressed latent representations to verify the quality of learned audio features.
هذا التطبيق عبارة عن منصة لتوليف الصوت بالذكاء الاصطناعي واستنساخ الصوت العصبي. يوفر مجموعة أدوات شاملة لتحويل النص إلى كلام بشري يبدو طبيعياً من خلال تطبيق نماذج شبكة عصبية مدربة خصيصاً على عينات صوتية محددة. تسهل المنصة دورة حياة تطوير النموذج الصوتي بالكامل، بما في ذلك إعداد الكتب الصوتية الخام ونسخ الفيديو في مجموعات بيانات تدريب منظمة. كما تدعم تدريب هذه النماذج على أجهزة محلية أو بعيدة، باستخدام المعالجة الموزعة متعددة وحدات معالجة الرسومات (multi-GPU) للتعامل مع البيانات واسعة النطاق وتسريع تقارب النموذج. بعيداً عن التدريب، تتضمن المنصة قدرات لإدارة ونقل مجموعات البيانات الصوتية عبر بيئات تخزين مختلفة. يمكن للمستخدمين إجراء الاستدلال عن طريق ضبط المتغيرات الكامنة ومعلمات التوليف لتعديل النبرة، والتصريف العاطفي، والصفات الأسلوبية للمخرجات الصوتية المولدة. يعتمد التطبيق على تقنيات التعلم العميق لتحويل التمثيلات الصوتية إلى أشكال موجية عالية الدقة.
Provides a toolkit for managing and processing large-scale voice datasets to facilitate high-performance speech synthesis.
هذا المشروع عبارة عن مجموعة أدوات للتعلم العميق مصممة لفصل مصادر الصوت واسترجاع معلومات الموسيقى. يوفر إطار عمل لتحليل إشارات الصوت متعددة الأصوات إلى مكونات متميزة، مثل الغناء، والطبول، والباس، عن طريق معالجة الأشكال الموجية الخام من خلال بنيات الشبكة العصبية. تمكن المكتبة المستخدمين من تدريب نماذج فصل مخصصة أو ضبط النماذج الموجودة لتحسين الدقة في مجموعات بيانات صوتية محددة. تدعم المكتبة دورة حياة النموذج بالكامل، بما في ذلك تحويل الصوت الخام إلى تنسيقات منظمة ومفهرسة لتحسين تحميل البيانات وكفاءة التدريب. يتضمن النظام قدرات لاستخراج ميزات نطاق التردد وخطوط أنابيب البيانات القائمة على الموتر لتسهيل مهام معالجة الإشارات المعقدة. تم هيكلة النظام لدعم سير العمل الموجه نحو البحث، مما يسمح بالتحسين التكراري للنماذج من خلال الاستمرارية القائمة على نقاط التحقق (checkpoint-based) وتنسيق التدريب الآلي.
Provides a toolkit for training and fine-tuning neural networks to perform complex signal separation on audio waveforms.