1 dépôt
Systems capable of performing human animation tasks using diverse input types within a single model.
Distinct from Multi-Modal Embedding Models: Covers the general architectural capability of multi-modal input for animation, which is not captured by prompt integration or LLMs.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multi-Modal Animation Frameworks. Refine with filters or upvote what's useful.
EchoMimic est un framework d'animation humaine multimodale et un générateur de vidéo basé sur la diffusion. Il produit des animations faciales et semi-corporelles réalistes d'une image de référence en synthétisant le mouvement et l'apparence à partir de diverses données sources. Le système permet une animation de portrait pilotée par l'audio, des séquences de pose ou des vidéos de pilote. Il dispose d'un outil de conditionnement par points de repère qui permet un contrôle précis des mouvements faciaux en modifiant des points de repère spécifiques. Le framework couvre la synthèse de mouvement multimodale et la synchronisation des images de référence pour correspondre aux mouvements physiques d'un pilote cible. Cela inclut la capacité de transformer des signaux audio en paramètres de pose faciale pour piloter les images vidéo générées.
Executes human animation tasks across audio and pose inputs using a unified high-parameter model.