3 dépôts
Toolsets that combine multiple generative models to produce various forms of AI-driven visual media.
Distinct from Short-Form Video Generation: Covers the combined production of both imagery and video, whereas siblings focus on a single modality
Explore 3 awesome GitHub repositories matching artificial intelligence & ml · AI Multimedia Generators. Refine with filters or upvote what's useful.
lollms-webui est une interface utilisateur basée sur le web et un orchestrateur de modèles IA locaux conçu pour interagir avec et gérer des grands modèles de langage et l'IA multimodale sur du matériel local. Il fonctionne comme une suite multimédia IA générative qui permet la création de texte, d'images, de vidéo et de musique via des modèles de diffusion et de langage intégrés. Le projet dispose d'un gestionnaire de persona dédié pour configurer des profils comportementaux et des personnalités distinctes, contrôlant le style et le ton des réponses du modèle. Il inclut un système de mémoire locale pour maintenir le contexte de conversation à long terme et l'historique de chat via un mécanisme de stockage persistant. Le système couvre de larges capacités, y compris le routage dynamique de prompt pour l'optimisation de l'inférence, l'accélération GPU et un système de liaison modulaire pour se connecter à des fournisseurs de modèles locaux ou distants. Il fournit également des outils pour visualiser les processus de raisonnement de l'IA, gérer les historiques de chat dans une base de données locale et étendre l'interface via un système d'outils basé sur des plugins. Le déploiement est pris en charge via des images conteneurisées pour assurer une exécution cohérente à travers différents systèmes d'exploitation.
Functions as a unified multimedia suite for creating diverse AI-driven content from a single interface.
MikuTools est une suite d'utilitaires web polyvalents et une plateforme de génération multimédia par IA. Elle fournit une collection d'outils légers basés sur navigateur pour créer et éditer des images, des vidéos et de l'audio en utilisant divers modèles d'intelligence artificielle. La plateforme se distingue par des capacités intégrées de traduction et d'édition de contenu par IA, y compris l'échange de visages, la suppression d'arrière-plan, l'upscaling haute résolution et le clonage de voix. Elle permet également la génération d'actifs numériques professionnels tels que des cartes de visite, des signatures d'e-mail et des captures d'écran de code stylisées. La boîte à outils couvre une large gamme d'utilitaires techniques, y compris la conversion de format en ligne pour les documents et les médias, les calculs de configuration réseau pour les plages CIDR et IP, et les transformations de données techniques pour l'encodage de code et de texte. Les capacités supplémentaires incluent le calcul de hachage cryptographique, la gestion de palettes de couleurs et la récupération de données publiques.
Combines multiple generative models to produce high-fidelity AI images, videos, and audio.
This project is an AI content automation pipeline and LLM agent orchestration framework. It provides a system for generating research-backed text, images, and videos, and scheduling their distribution to social platforms. The framework allows for the development of specialized AI agents and custom tool servers. These servers expose capabilities such as video editing and story generation as API endpoints, enabling agents to execute complex tasks through a combination of AI models and custom tooling. The system covers automated content creation across text, image, and video media, utilizing hu
Integrates various generative models to produce both short and long form videos and infographics.