awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

9 repositorios

Awesome GitHub RepositoriesMulti-Stage Refinement

Improving visual fidelity and resolution using a two-stage structural-to-texture inference paradigm.

Distinct from Video Generation: Specific to the multi-stage structural and texture refinement process of generative models

Explore 9 awesome GitHub repositories matching artificial intelligence & ml · Multi-Stage Refinement. Refine with filters or upvote what's useful.

Awesome Multi-Stage Refinement GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • nvlabs/sanaAvatar de NVlabs

    NVlabs/Sana

    8,310Ver en GitHub↗

    Sana is a framework for high-resolution image and video synthesis based on a linear diffusion transformer. It provides a toolkit for the training, fine-tuning, and execution of text-to-image and text-to-video models, as well as a video generative world model capable of simulating physical environments with precise spatial control. The project is distinguished by its use of linear complexity layers to handle high resolutions and its support for long-form, minute-length video generation in real time. It implements a two-stage inference paradigm that separates structural generation from visual t

    Implements a two-stage inference paradigm to improve visual quality and resolution of generated videos.

    Python
    Ver en GitHub↗8,310
  • mochidiffusion/mochidiffusionAvatar de MochiDiffusion

    MochiDiffusion/MochiDiffusion

    7,895Ver en GitHub↗

    MochiDiffusion is a local client for Stable Diffusion that functions as an AI image generation studio. It provides a workspace for performing text-to-image, image-to-image, and inpainting tasks, enabling the production of high-resolution images offline using local hardware and neural engine acceleration. The project includes a local model manager for importing, organizing, and converting machine learning models into compatible formats for offline execution. It features a ControlNet integration tool to guide structural composition and spatial layout, alongside a dedicated image upscaler that u

    Improves image quality by applying a second diffusion pass using a specialized refiner model.

    Swiftaneappleapple-silicon
    Ver en GitHub↗7,895
  • tldraw/draw-a-uiAvatar de tldraw

    tldraw/draw-a-ui

    5,445Ver en GitHub↗

    Este proyecto es un lienzo visual impulsado por IA y un framework de pizarra colaborativa. Funciona como un motor de dibujo vectorial personalizable y una herramienta para convertir bocetos de interfaz dibujados a mano y wireframes en código funcional utilizando inteligencia artificial. El sistema se distingue por la integración de agentes de IA que pueden leer, modificar y generar diagramas visuales directamente en el lienzo. También proporciona un editor de flujo de trabajo basado en nodos para construir pipelines de automatización y flujos de procesamiento de datos conectando componentes multimodales. La plataforma cubre una amplia gama de capacidades, incluyendo colaboración multijugador en tiempo real con seguimiento de presencia de usuarios, un lienzo infinito con renderizado acelerado por GPU y una suite integral de herramientas de manipulación y alineación de objetos. También implementa estándares de accesibilidad web y proporciona una interfaz programable para definir formas personalizadas y controles de lienzo programáticos.

    Transforms sketches into code through a conversational loop that iteratively refines the generated layout.

    TypeScript
    Ver en GitHub↗5,445
  • cloudflare/vibesdkAvatar de cloudflare

    cloudflare/vibesdk

    5,094Ver en GitHub↗

    vibesdk es una plataforma y framework de desarrollo de software agentico diseñado para coordinar agentes autónomos que escriben, depuran y refinan aplicaciones full-stack a partir de lenguaje natural. Sirve como un orquestador de aplicaciones cloud-native y un framework de generación de código potenciado por LLM que convierte prompts en código funcional a través de conversaciones iterativas y comportamientos de agentes multifase. El proyecto se distingue por proporcionar una cadena de herramientas completa para construir plataformas de desarrollo de IA. Esto incluye la capacidad de integrar varios proveedores de modelos, construir kits de herramientas LLM personalizados y gestionar todo el ciclo de vida de las aplicaciones generadas por IA a través de una cadena de herramientas de despliegue serverless y un SDK de TypeScript programático. La plataforma cubre una amplia gama de capacidades, incluyendo orquestación de sandbox de IA para ejecución aislada y vistas previas en vivo, sistemas de archivos virtuales respaldados por Git para el seguimiento de versiones y despliegue automático en la nube a plataformas de workers serverless. También incorpora sistemas para la gestión de esquemas de bases de datos, cifrado jerárquico de secretos y sincronización de estado en tiempo real mediante WebSockets. Los usuarios pueden gestionar los flujos de trabajo del proyecto a través de una interfaz de línea de comandos o programáticamente utilizando el SDK proporcionado.

    Enables iterative modification of generated UI code through conversational feedback loops using text and image messages.

    TypeScript
    Ver en GitHub↗5,094
  • antgroup/echomimic_v2Avatar de antgroup

    antgroup/echomimic_v2

    4,597Ver en GitHub↗

    EchoMimic V2 es un pipeline de generación de video por IA y modelo de animación de visión por computadora diseñado para producir animaciones humanas sintéticas. Funciona como un framework generativo que crea videos de medio cuerpo alineando una imagen de referencia estática con movimientos de pose extraídos de un video de conducción. El sistema utiliza un proceso de generación basado en difusión combinado con compresión de espacio latente y un mecanismo de atención temporal para garantizar transiciones suaves entre fotogramas. Mantiene una identidad de persona consistente a través de codificación basada en referencia y guía la colocación espacial mediante condicionamiento de movimiento impulsado por pose. El proyecto incluye capacidades para el refinamiento de imágenes en múltiples etapas para mejorar el detalle y la nitidez facial. También proporciona herramientas para la preparación de datasets de animación, incluyendo la descarga y preprocesamiento de datos de video en formatos requeridos para el entrenamiento e inferencia del modelo.

    Employs a multi-stage refinement process to enhance facial details and overall sharpness of generated frames.

    Pythonaudio-driven-body-animationaudio-driven-portrait-animationsaudio-driven-talking-face
    Ver en GitHub↗4,597
  • xpixelgroup/diffbirAvatar de XPixelGroup

    XPixelGroup/DiffBIR

    4,087Ver en GitHub↗

    DiffBIR es un framework de restauración de imágenes basado en difusión, diseñado para la reconstrucción de imágenes ciegas. Utiliza priors de difusión generativa para recuperar imágenes de alta calidad a partir de fuentes con degradaciones complejas o desconocidas, sin necesidad de modelos de degradación explícitos. El sistema incluye modelos especializados para la restauración de rostros, permitiendo recuperar rasgos faciales, texturas y fondos en retratos degradados. Para soportar salidas de alta resolución en hardware con memoria limitada, emplea un escalador de imágenes por mosaicos que divide las imágenes en parches más pequeños durante el muestreo. El framework abarca un pipeline de restauración multietapa y escalado de imágenes generativo. Incorpora capacidades para el entrenamiento de modelos de restauración y la aplicación de pesos especializados para optimizar la mejora en escenas específicas.

    Employs a multi-stage pipeline of specialized models to iteratively remove image artifacts and refine details.

    Python
    Ver en GitHub↗4,087
  • presenton/presentonAvatar de presenton

    presenton/presenton

    4,042Ver en GitHub↗

    Presenton is an AI-powered presentation engine and API designed to transform natural language prompts, uploaded documents, and structured data into professional slide decks. It functions as a generation service that leverages large language models to automate the creation of outlines, slide content, and visual assets. The system is distinguished by its support for both cloud-based and self-hosted infrastructure, allowing for the integration of local language models and image generators to ensure data privacy. It implements a Model Context Protocol server, enabling external AI agents to trigge

    Enables the refinement of slide structural and aesthetic layouts through natural language instructions.

    TypeScriptai-agentai-presentationapi
    Ver en GitHub↗4,042
  • lightricks/comfyui-ltxvideoAvatar de Lightricks

    Lightricks/ComfyUI-LTXVideo

    3,840Ver en GitHub↗

    ComfyUI-LTXVideo is a generative framework and ComfyUI custom node extension for synthesizing high-fidelity video. It utilizes a latent diffusion and transformer-based system to create cinematic clips from text, image, and audio inputs, providing a modular interface for precise control over subject behavior and temporal consistency. The tool distinguishes itself with production-grade capabilities, including the generation of High Dynamic Range video in linear formats such as ARRI LogC3. It supports multimodal synchronization for audio-driven animation and lip-syncing, and allows for the creat

    Employs a multi-stage refinement process to recover fine visual details and increase resolution.

    Pythoncomfyuidiffusion-modelsdit
    Ver en GitHub↗3,840
  • datawhalechina/vibe-vibeAvatar de datawhalechina

    datawhalechina/vibe-vibe

    3,126Ver en GitHub↗

    vibe-vibe is an LLM agent engineering framework and toolchain optimizer designed for orchestrating multi-agent systems. It serves as a comprehensive guide and methodology for transforming conceptual ideas into deployed applications through agentic software engineering. The project focuses on the orchestration of specialized AI agent roles with defined collaboration boundaries and iterative feedback loops. It provides frameworks for toolchain optimization, including the selection and evaluation of protocols that extend model capabilities and the design of standardized tool interfaces. The sys

    Translates aesthetic preferences into concrete instructions for AI to refine layout and typography.

    agentagentic-aiai
    Ver en GitHub↗3,126
  1. Home
  2. Artificial Intelligence & ML
  3. Video Generation
  4. Multi-Stage Refinement

Explorar subetiquetas

  • AI Layout Refinement2 sub-etiquetasProcesses for manually refining and adjusting AI-generated structural layouts in a visual editor. **Distinct from Multi-Stage Refinement:** Focuses on the human-in-the-loop refinement of AI-generated infographics rather than multi-stage model inference.
  • Image Restoration PipelinesSequential processing stages designed to iteratively remove artifacts and refine visual details in images. **Distinct from Multi-Stage Refinement:** Focuses on image restoration sequences rather than video structural-to-texture refinement