9 repositorios
Improving visual fidelity and resolution using a two-stage structural-to-texture inference paradigm.
Distinct from Video Generation: Specific to the multi-stage structural and texture refinement process of generative models
Explore 9 awesome GitHub repositories matching artificial intelligence & ml · Multi-Stage Refinement. Refine with filters or upvote what's useful.
Sana is a framework for high-resolution image and video synthesis based on a linear diffusion transformer. It provides a toolkit for the training, fine-tuning, and execution of text-to-image and text-to-video models, as well as a video generative world model capable of simulating physical environments with precise spatial control. The project is distinguished by its use of linear complexity layers to handle high resolutions and its support for long-form, minute-length video generation in real time. It implements a two-stage inference paradigm that separates structural generation from visual t
Implements a two-stage inference paradigm to improve visual quality and resolution of generated videos.
MochiDiffusion is a local client for Stable Diffusion that functions as an AI image generation studio. It provides a workspace for performing text-to-image, image-to-image, and inpainting tasks, enabling the production of high-resolution images offline using local hardware and neural engine acceleration. The project includes a local model manager for importing, organizing, and converting machine learning models into compatible formats for offline execution. It features a ControlNet integration tool to guide structural composition and spatial layout, alongside a dedicated image upscaler that u
Improves image quality by applying a second diffusion pass using a specialized refiner model.
Este proyecto es un lienzo visual impulsado por IA y un framework de pizarra colaborativa. Funciona como un motor de dibujo vectorial personalizable y una herramienta para convertir bocetos de interfaz dibujados a mano y wireframes en código funcional utilizando inteligencia artificial. El sistema se distingue por la integración de agentes de IA que pueden leer, modificar y generar diagramas visuales directamente en el lienzo. También proporciona un editor de flujo de trabajo basado en nodos para construir pipelines de automatización y flujos de procesamiento de datos conectando componentes multimodales. La plataforma cubre una amplia gama de capacidades, incluyendo colaboración multijugador en tiempo real con seguimiento de presencia de usuarios, un lienzo infinito con renderizado acelerado por GPU y una suite integral de herramientas de manipulación y alineación de objetos. También implementa estándares de accesibilidad web y proporciona una interfaz programable para definir formas personalizadas y controles de lienzo programáticos.
Transforms sketches into code through a conversational loop that iteratively refines the generated layout.
vibesdk es una plataforma y framework de desarrollo de software agentico diseñado para coordinar agentes autónomos que escriben, depuran y refinan aplicaciones full-stack a partir de lenguaje natural. Sirve como un orquestador de aplicaciones cloud-native y un framework de generación de código potenciado por LLM que convierte prompts en código funcional a través de conversaciones iterativas y comportamientos de agentes multifase. El proyecto se distingue por proporcionar una cadena de herramientas completa para construir plataformas de desarrollo de IA. Esto incluye la capacidad de integrar varios proveedores de modelos, construir kits de herramientas LLM personalizados y gestionar todo el ciclo de vida de las aplicaciones generadas por IA a través de una cadena de herramientas de despliegue serverless y un SDK de TypeScript programático. La plataforma cubre una amplia gama de capacidades, incluyendo orquestación de sandbox de IA para ejecución aislada y vistas previas en vivo, sistemas de archivos virtuales respaldados por Git para el seguimiento de versiones y despliegue automático en la nube a plataformas de workers serverless. También incorpora sistemas para la gestión de esquemas de bases de datos, cifrado jerárquico de secretos y sincronización de estado en tiempo real mediante WebSockets. Los usuarios pueden gestionar los flujos de trabajo del proyecto a través de una interfaz de línea de comandos o programáticamente utilizando el SDK proporcionado.
Enables iterative modification of generated UI code through conversational feedback loops using text and image messages.
EchoMimic V2 es un pipeline de generación de video por IA y modelo de animación de visión por computadora diseñado para producir animaciones humanas sintéticas. Funciona como un framework generativo que crea videos de medio cuerpo alineando una imagen de referencia estática con movimientos de pose extraídos de un video de conducción. El sistema utiliza un proceso de generación basado en difusión combinado con compresión de espacio latente y un mecanismo de atención temporal para garantizar transiciones suaves entre fotogramas. Mantiene una identidad de persona consistente a través de codificación basada en referencia y guía la colocación espacial mediante condicionamiento de movimiento impulsado por pose. El proyecto incluye capacidades para el refinamiento de imágenes en múltiples etapas para mejorar el detalle y la nitidez facial. También proporciona herramientas para la preparación de datasets de animación, incluyendo la descarga y preprocesamiento de datos de video en formatos requeridos para el entrenamiento e inferencia del modelo.
Employs a multi-stage refinement process to enhance facial details and overall sharpness of generated frames.
DiffBIR es un framework de restauración de imágenes basado en difusión, diseñado para la reconstrucción de imágenes ciegas. Utiliza priors de difusión generativa para recuperar imágenes de alta calidad a partir de fuentes con degradaciones complejas o desconocidas, sin necesidad de modelos de degradación explícitos. El sistema incluye modelos especializados para la restauración de rostros, permitiendo recuperar rasgos faciales, texturas y fondos en retratos degradados. Para soportar salidas de alta resolución en hardware con memoria limitada, emplea un escalador de imágenes por mosaicos que divide las imágenes en parches más pequeños durante el muestreo. El framework abarca un pipeline de restauración multietapa y escalado de imágenes generativo. Incorpora capacidades para el entrenamiento de modelos de restauración y la aplicación de pesos especializados para optimizar la mejora en escenas específicas.
Employs a multi-stage pipeline of specialized models to iteratively remove image artifacts and refine details.
Presenton is an AI-powered presentation engine and API designed to transform natural language prompts, uploaded documents, and structured data into professional slide decks. It functions as a generation service that leverages large language models to automate the creation of outlines, slide content, and visual assets. The system is distinguished by its support for both cloud-based and self-hosted infrastructure, allowing for the integration of local language models and image generators to ensure data privacy. It implements a Model Context Protocol server, enabling external AI agents to trigge
Enables the refinement of slide structural and aesthetic layouts through natural language instructions.
ComfyUI-LTXVideo is a generative framework and ComfyUI custom node extension for synthesizing high-fidelity video. It utilizes a latent diffusion and transformer-based system to create cinematic clips from text, image, and audio inputs, providing a modular interface for precise control over subject behavior and temporal consistency. The tool distinguishes itself with production-grade capabilities, including the generation of High Dynamic Range video in linear formats such as ARRI LogC3. It supports multimodal synchronization for audio-driven animation and lip-syncing, and allows for the creat
Employs a multi-stage refinement process to recover fine visual details and increase resolution.
vibe-vibe is an LLM agent engineering framework and toolchain optimizer designed for orchestrating multi-agent systems. It serves as a comprehensive guide and methodology for transforming conceptual ideas into deployed applications through agentic software engineering. The project focuses on the orchestration of specialized AI agent roles with defined collaboration boundaries and iterative feedback loops. It provides frameworks for toolchain optimization, including the selection and evaluation of protocols that extend model capabilities and the design of standardized tool interfaces. The sys
Translates aesthetic preferences into concrete instructions for AI to refine layout and typography.