awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

22 repository-uri

Awesome GitHub RepositoriesVideo Diffusion Models

Diffusion models that generate video by iteratively denoising latent representations in a compressed spatio-temporal space.

Distinct from Latent Diffusion Models: Distinct from Latent Diffusion Models: focuses on video generation with temporal consistency, not general image generation.

Explore 22 awesome GitHub repositories matching artificial intelligence & ml · Video Diffusion Models. Refine with filters or upvote what's useful.

Awesome Video Diffusion Models GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • humanaigc/animateanyoneAvatar HumanAIGC

    HumanAIGC/AnimateAnyone

    14,774Vezi pe GitHub↗

    AnimateAnyone is an appearance-preserving video synthesizer designed for character animation from a single static image. It functions as a diffusion image-to-video generator that transforms a source image into a high-fidelity video sequence while maintaining consistent character identity, clothing, and visual details across all frames. The system enables video-driven character reenactment by transferring motions, facial expressions, and body movements from a reference video onto a static character. It employs pose-guided video generation to control movement via skeleton keypoints and pose sig

    Implements a video generation process based on iterative denoising of latent representations for temporal consistency.

    Vezi pe GitHub↗14,774
  • magic-research/magic-animateAvatar magic-research

    magic-research/magic-animate

    10,908Vezi pe GitHub↗

    Magic Animate is a diffusion model video generator designed for human image animation. It transforms a static human photo into a temporally consistent video by mapping movements from a reference motion clip, acting as a tool to create realistic animations from a single image. The system ensures visual stability and minimizes flicker through temporal attention injection and motion-controlled noise scheduling. To accelerate the generation of high-resolution video, it includes a distributed GPU inference engine that splits model workloads across multiple graphics cards. The project covers a com

    Utilizes a video diffusion model to iteratively denoise latent representations for temporally consistent animation.

    Python
    Vezi pe GitHub↗10,908
  • nvidia/cosmosAvatar NVIDIA

    NVIDIA/cosmos

    10,494Vezi pe GitHub↗

    Cosmos is an open platform of world models, datasets, and tools for building physical AI systems such as robots and autonomous vehicles. It provides video generation and video understanding models that can generate synthetic videos and world simulations from text, image, video, or action inputs, and analyze videos to produce captions, event timestamps, spatial bounding boxes, and next-action predictions. The platform includes a world simulation generator that produces images, videos, synchronized audio, and action-conditioned rollouts for synthetic data, alongside a visual content analyzer th

    Converts raw video frames into discrete latent tokens and reconstructs them using a diffusion-based decoder for high-fidelity generation.

    Jupyter Notebook
    Vezi pe GitHub↗10,494
  • brycedrennan/imaginairyAvatar brycedrennan

    brycedrennan/imaginAIry

    8,155Vezi pe GitHub↗

    imaginAIry is a system for generating and refining images and videos using diffusion models. It operates as a web-based server that triggers generation requests through standard API calls, allowing for the creation of visuals and video sequences from text prompts or existing files. The project provides a suite for AI image editing and upscaling, enabling the modification of visuals through natural language instructions and super-resolution tools to increase detail and image size. The system includes capabilities for structural image control using depth maps, edge maps, and body poses to main

    Produces moving image sequences and video clips using specialized latent diffusion models.

    Python
    Vezi pe GitHub↗8,155
  • humanaigc/emoAvatar HumanAIGC

    HumanAIGC/EMO

    7,616Vezi pe GitHub↗

    EMO este un model de animație a portretelor AI și de difuzie audio-video conceput pentru a genera videoclipuri expresive cu capete vorbitoare. Acesta transformă o singură imagine statică de portret și o pistă audio într-un videoclip sincronizat al unei persoane care vorbește. Sistemul se concentrează pe sinteza digitală a oamenilor, producând mișcări faciale de înaltă fidelitate și indicii emoționale. Sincronizează mișcările buzelor și gesturile faciale cu înregistrările vocale pentru a crea animații realiste ale portretelor. Framework-ul utilizează un proces de difuzie și un mecanism de aliniere cross-modal pentru a asigura sincronizarea între semnalele audio și punctele de reper vizuale. Utilizează condiționarea imaginii bazată pe referință pentru a menține consistența identității și un strat de consistență temporală pentru a asigura o mișcare fluidă între cadre.

    Implements a diffusion process to generate synchronized video frames from audio features.

    Vezi pe GitHub↗7,616
  • hvision-nku/storydiffusionAvatar HVision-NKU

    HVision-NKU/StoryDiffusion

    6,430Vezi pe GitHub↗

    StoryDiffusion is a generative AI system designed for consistent character image and video generation. It utilizes a pluggable cross-attention module to inject shared character representations into pretrained diffusion models, allowing for visual identity stability across multiple images and scenes without retraining the base model. The project features a video generation pipeline that produces temporally coherent sequences from text prompts or condition images. It employs a latent space motion interpolator to predict intermediate frames and semantic motion, enabling long-range video generati

    Uses a latent diffusion model to produce temporally coherent video sequences from text prompts.

    Jupyter Notebook
    Vezi pe GitHub↗6,430
  • doubiiu/tooncrafterAvatar Doubiiu

    Doubiiu/ToonCrafter

    5,972Vezi pe GitHub↗

    ToonCrafter is a model that combines latent diffusion, reference-based colorization, and sketch-guided control for cartoon animation and interpolation. It functions as a cartoon video interpolation model, a reference-based colorization model, and a sketch-guided animation tool, all built on a latent diffusion animation framework. The project distinguishes itself by integrating three core capabilities into a single pipeline: generating smooth intermediate frames between two cartoon images using diffusion-based priors, transferring color and style from a reference image onto black-and-white ske

    Generates smooth intermediate cartoon frames by denoising latent representations conditioned on start and end frames.

    Python
    Vezi pe GitHub↗5,972
  • aigc-apps/sd-webui-easyphotoAvatar aigc-apps

    aigc-apps/sd-webui-EasyPhoto

    5,150Vezi pe GitHub↗

    Acest proiect este o extensie Stable Diffusion WebUI care oferă o interfață grafică pentru generarea de portrete personalizate și editarea foto cu AI. Permite utilizatorilor să antreneze modele de identitate personalizate dintr-un set mic de imagini încărcate pentru a crea versiuni digitale consistente ale unor persoane specifice. Extensia include un sistem de probă virtuală (virtual try-on) care înlocuiește îmbrăcămintea din imagini prin alinierea articolelor de referință cu corpurile din template-uri. De asemenea, dispune de instrumente pentru schimbarea feței (face swapping) atât în imagini statice, cât și în videoclipuri, precum și un animator de portrete care transformă imaginile statice în videoclipuri dinamice folosind mișcare ghidată de referință și descrieri text. Capabilitățile suplimentare acoperă manipularea atributelor faciale pentru ajustarea vârstei și a expresiei, sinteza de imagini cu mai multe persoane și generarea de tranziții line între imagini prin interpolare în spațiul latent.

    Produces motion sequences by applying stable video diffusion models to a starting frame and textual description.

    Python
    Vezi pe GitHub↗5,150
  • ailab-cvc/videocrafterAvatar ailab-cvc

    ailab-cvc/videocrafter

    5,063Vezi pe GitHub↗

    Videocrafter este un model de difuzie latentă conceput pentru sinteza video AI. Acesta funcționează atât ca un sistem de generare text-to-video, cât și image-to-video, sintetizând secvențe video de înaltă calitate din prompt-uri text descriptive sau input-uri de imagini statice. Modelul utilizează o rețea neuronală bazată pe difuzie pentru a transforma input-urile în conținut animat, asigurând consistența vizuală și coerența temporală pe parcursul secvențelor generate. Acest lucru permite crearea de clipuri video personalizate și animarea imaginilor statice în mișcare fluidă.

    Implements a video diffusion model that synthesizes high-quality sequences from text or image inputs.

    Python
    Vezi pe GitHub↗5,063
  • antgroup/echomimic_v2Avatar antgroup

    antgroup/echomimic_v2

    4,597Vezi pe GitHub↗

    EchoMimic V2 este un pipeline de generare video AI și un model de animație computer vision conceput pentru a produce animații umane sintetice. Funcționează ca un framework generativ care creează videoclipuri semi-corp prin alinierea unei imagini de referință statice cu mișcările de postură extrase dintr-un videoclip de conducere (driving video). Sistemul utilizează un proces de generare bazat pe difuzie combinat cu compresia spațiului latent și un mecanism de atenție temporală pentru a asigura tranziții line între cadre. Menține identitatea consistentă a persoanei prin codificare bazată pe referință și ghidează plasarea spațială prin condiționarea mișcării bazată pe postură. Proiectul include capabilități pentru rafinarea imaginilor în mai multe etape pentru a îmbunătăți detaliile faciale și claritatea. Oferă, de asemenea, instrumente pentru pregătirea seturilor de date de animație, inclusiv descărcarea și preprocesarea datelor video în formatele necesare pentru antrenarea modelului și inferență.

    Implements a video diffusion model that generates temporal sequences by denoising latent representations.

    Pythonaudio-driven-body-animationaudio-driven-portrait-animationsaudio-driven-talking-face
    Vezi pe GitHub↗4,597
  • meituan-longcat/longcat-videoAvatar meituan-longcat

    meituan-longcat/LongCat-Video

    4,460Vezi pe GitHub↗

    LongCat-Video este o colecție de modele specializate pentru sinteza video, având o arhitectură bazată pe modele de limbaj mari (LLM) pentru crearea de videoclipuri de înaltă rezoluție din text, imagini sau secvențe existente. Include sisteme dedicate pentru generarea text-to-video, animația image-to-video și crearea de avatare vorbitoare. Proiectul oferă capabilități specifice pentru extinderea duratei clipurilor existente printr-un model de continuare video care prezice cadrele ulterioare. De asemenea, permite sincronizarea mișcărilor buzelor personajelor cu prompturi audio și text pentru a produce videoclipuri vorbite. Sistemul încorporează diverse tehnici de optimizare pentru a gestiona eficiența generării, inclusiv eșantionarea bazată pe distilare și cuantizarea pentru a reduce utilizarea memoriei și latența de inferență. Componentele structurale suplimentare acoperă compresia în spațiul latent și modelarea spațio-temporală pentru a menține consistența în timp și spațiu.

    Uses video diffusion models to transform random noise into high-resolution video sequences.

    Python
    Vezi pe GitHub↗4,460
  • tencent-hunyuan/hunyuanvideo-1.5Avatar Tencent-Hunyuan

    Tencent-Hunyuan/HunyuanVideo-1.5

    4,440Vezi pe GitHub↗

    HunyuanVideo-1.5 is a video generation foundation model and text-to-video diffusion framework. It utilizes a latent video diffusion model and a spatio-temporal transformer architecture to generate high-definition video sequences from text descriptions and images. The project enables cinematic camera control for directing pans and tilts and provides image-to-video animation capabilities. It supports visual style adaptation through low-rank adaptation tuning and uses a language model for prompt refinement to improve visual alignment. The model covers high-resolution video upscaling via a super

    Provides the core latent video diffusion model that generates high-definition video sequences from text descriptions.

    Pythonimage-to-videotext-to-videovideo-generation
    Vezi pe GitHub↗4,440
  • showlab/tune-a-videoAvatar showlab

    showlab/Tune-A-Video

    4,364Vezi pe GitHub↗

    Tune-A-Video este un framework de difuzie text-to-video conceput pentru a converti modelele de difuzie text-to-image pre-antrenate în generatoare video. Utilizează un mecanism de atenție spatio-temporală și antrenament pe o singură pereche text-video pentru a permite sinteza secvențelor în mișcare din prompt-uri text. Proiectul oferă instrumente pentru personalizarea video one-shot, permițând unui model să fie reglat pe un singur videoclip de referință pentru a păstra personaje specifice sau stiluri artistice în noile generații. De asemenea, funcționează ca un editor video care modifică subiecții, fundalurile și stilurile prin ghidarea prompt-ului de eșantionare a zgomotului și inversiune. Framework-ul acoperă mai multe zone de capabilitate de bază, inclusiv extracția ghidării structurale pentru a păstra layout-ul și mișcarea videoclipurilor sursă și consistența conținutului spatio-temporal pentru a menține elementele vizuale stabile între cadre. Aceste procese permit sinteza video personalizată și modificarea conținutului vizual prin eșantionare ghidată.

    Converts text-to-image diffusion models into video generators through training on specific sequences.

    Python
    Vezi pe GitHub↗4,364
  • antgroup/echomimicAvatar antgroup

    antgroup/echomimic

    4,255Vezi pe GitHub↗

    EchoMimic este un framework multimodal de animație umană și un generator video bazat pe difuzie. Acesta produce animații faciale și semi-corporale realiste ale unei imagini de referință prin sintetizarea mișcării și aspectului din diverse date sursă. Sistemul permite animația portretelor condusă de audio, secvențe de postură sau videoclipuri driver. Dispune de un instrument de condiționare a punctelor de reper care permite controlul precis al mișcărilor faciale prin modificarea unor puncte de reper specifice. Framework-ul acoperă sinteza mișcării multimodale și sincronizarea imaginilor de referință pentru a se potrivi cu mișcările fizice ale unui driver țintă. Aceasta include capacitatea de a transforma semnalele audio în parametri de postură facială pentru a conduce cadrele video generate.

    Uses a diffusion-based generative model to produce high-quality video sequences from multimodal source data.

    Pythonaaai2025audio-driven-portrait-animationsaudio-driven-talking-face
    Vezi pe GitHub↗4,255
  • fudan-generative-vision/champAvatar fudan-generative-vision

    fudan-generative-vision/champ

    4,253Vezi pe GitHub↗

    Champ este un sistem de viziune generativă și un generator imagine-la-video controlabil conceput pentru animația imaginilor umane. Acesta utilizează un sintetizator video bazat pe difuzie și ghidare parametrică 3D pentru a transforma o singură imagine de referință într-o secvență consistentă de mișcare bazată pe date de conducere externe. Framework-ul se distinge printr-un sistem de transfer al posturii umane care utilizează extracția parametrică a corpului 3D și alinierea în spațiul de coordonate. Acest lucru permite modelului să mapeze mișcarea de la un videoclip de conducere la o persoană de referință prin ajustarea pentru scările corpului și perspectivele camerei folosind hărți de adâncime și condiții semantice. Sistemul acoperă o gamă largă de capabilități, inclusiv rafinarea datelor de mișcare, transferul parametric de mișcare și o conductă de antrenare a modelului de viziune în două etape. Aceste procese asigură consistența structurală și stabilitatea temporală în animațiile umane generate.

    Uses a video diffusion model to generate temporally consistent human animations.

    Pythonhuman-animationimage-animatiolnvideo-generation
    Vezi pe GitHub↗4,253
  • picsart-ai-research/text2video-zeroAvatar Picsart-AI-Research

    Picsart-AI-Research/Text2Video-Zero

    4,244Vezi pe GitHub↗

    Text2Video-Zero este un model de difuzie text-to-video și un framework conceput pentru a sintetiza secvențe video temporal consistente din prompt-uri textuale. Funcționează ca un generator video zero-shot, reutilizând modelele de difuzie de imagine pre-antrenate pentru a crea conținut video fără a necesita antrenament suplimentar pe seturi de date video. Sistemul include un sintetizator video condițional care permite generarea ghidată folosind hărți de adâncime, margini sau postură pentru a controla layout-ul structural și mișcarea. De asemenea, oferă capabilități de editare video bazate pe text pentru a modifica stilul sau conținutul clipurilor video existente prin instrucțiuni în limbaj natural. Pentru a gestiona cerințele computaționale, proiectul implementează inferența optimizată pentru memoria GPU. Acest lucru este realizat prin tehnici precum token merging și frame chunking pentru a reduce utilizarea VRAM în timpul procesului de generare.

    Repurposes pre-trained image diffusion models to generate temporally consistent video frames without needing video-specific training data.

    Pythonvideo-editingvideo-generation
    Vezi pe GitHub↗4,244
  • badtobest/echomimicAvatar BadToBest

    BadToBest/EchoMimic

    4,258Vezi pe GitHub↗

    EchoMimic este un framework de animație a portretelor bazat pe audio și un generator video de difuzie latentă. Acesta transformă imaginile de referință statice în videoclipuri dinamice cu capete vorbitoare prin sincronizarea mișcărilor faciale cu piesele audio și driverele de mișcare. Sistemul funcționează ca un motor hibrid de sinteză a mișcării care combină input-urile audio și datele de postură. Utilizează un controler de mișcare a punctelor de reper faciale pentru a edita markerii de poziționare, permițând sincronizarea precisă și transferul de postură video-la-video. Conducta acoperă animația imagine-la-video prin difuzie latentă și condiționarea punctelor de reper faciale. Acest lucru permite animația portretelor condusă de audio, postură sau o combinație a ambelor surse de ghidare.

    Implements a video generation system that iteratively denoises latent representations to produce high-fidelity human animations.

    Python
    Vezi pe GitHub↗4,258
  • hao-ai-lab/fastvideoAvatar hao-ai-lab

    hao-ai-lab/FastVideo

    3,743Vezi pe GitHub↗

    FastVideo is a comprehensive system for accelerated video generation, serving as a video generation inference engine, a video diffusion training framework, and a modular pipeline orchestrator. It provides a distributed transformer optimizer and a distillation toolkit designed to reduce denoising steps and model complexity to increase frame rates. The project distinguishes itself through specialized acceleration techniques, including joint distillation and sparse attention training. It implements low-step video generation and weight quantization to FP8 or FP4 precision to increase throughput a

    Provides full and LoRA training methods to adapt video diffusion models to specific styles or tasks.

    Pythondiffusersdiffusion-modelsdistillation
    Vezi pe GitHub↗3,743
  • thu-ml/turbodiffusionAvatar thu-ml

    thu-ml/TurboDiffusion

    3,339Vezi pe GitHub↗

    TurboDiffusion is a video diffusion inference engine and generator designed to create high-resolution videos from text prompts and images. It provides a runtime environment for executing optimized diffusion model checkpoints with a focus on reducing latency and GPU memory usage. The project features a specialized training framework for aligning sparse-linear attention models with pretrained full-attention models. This system includes capabilities for sparse attention parameter merging and sparse-linear model alignment to reduce computational costs during inference while maintaining output qua

    A high-resolution video generator that uses optimized diffusion model checkpoints for text-to-video and image-to-video synthesis.

    Pythonai-infraconsistency-modeldiffusion-models
    Vezi pe GitHub↗3,339
  • robbyant/lingbot-worldAvatar Robbyant

    Robbyant/lingbot-world

    2,915Vezi pe GitHub↗

    Lingbot-world is an interactive world simulator and framework for generating high-fidelity video environments from text and image prompts. It functions as a video generation system designed to create controllable simulations for applications such as robotics learning and gaming. The project includes a video motion controller that directs camera and object movement using transformation matrices and action strings. It utilizes a quantized inference engine to reduce memory usage and accelerate the generation of video sequences. The system covers a range of optimization techniques, including fou

    Utilizes video diffusion models to generate high-fidelity environments by iteratively denoising latent representations.

    Pythonaigcimage-to-videolingbot-world
    Vezi pe GitHub↗2,915
Înapoi12Înainte
  1. Home
  2. Artificial Intelligence & ML
  3. Generative AI Resources
  4. Diffusion & Visual Synthesis Models
  5. Generative Models
  6. Latent Diffusion Models
  7. Video Diffusion Models

Explorează sub-etichetele

  • Cartoon Frame GeneratorsApplies diffusion priors specifically to produce coherent intermediate frames in cartoon animation workflows. **Distinct from Video Diffusion Models:** Distinct from Video Diffusion Models: specialized for cartoon-style interpolation rather than general video generation.
  • Conditioned Frame InterpolatorsGenerates intermediate frames by denoising a latent representation conditioned on start and end frames using a pretrained diffusion model. **Distinct from Video Diffusion Models:** Distinct from Video Diffusion Models: specifically conditions on start and end frames for interpolation rather than generating from noise.
  • Finetuning FrameworksTools and methodologies for adapting pretrained video diffusion models to specific styles or tasks. **Distinct from Video Diffusion Models:** Focuses on the act of adapting weights via LoRA or full training, not the model architecture itself
  • Image-to-Video Model AdaptationProcesses for converting static image diffusion models into temporal video generators. **Distinct from Video Diffusion Models:** Focuses on the adaptation process of the model weights rather than the resulting video diffusion model identity.
  • Latent Diffusion Frame InterpolatorsGenerates intermediate video frames by denoising latent representations conditioned on start and end frames. **Distinct from Video Diffusion Models:** Distinct from Video Diffusion Models: focuses on interpolation between given frames rather than unconditional video generation.
  • Video TokenizersComponents that convert raw video frames into discrete latent tokens for efficient processing and generation. **Distinct from Video Diffusion Models:** Distinct from Video Diffusion Models: focuses on the tokenization step that precedes diffusion-based generation.
  • Zero-Shot AdaptationTechniques for repurposing pre-trained image models for video generation without additional video-dataset training. **Distinct from Video Diffusion Models:** Focuses on the zero-shot repurposing of image models for video, whereas Video Diffusion Models is the general architecture.