图生图/编辑90 / 393 个项目
图生图/编辑模型排行榜,收录 GitHub 上最热门的图像编辑和生成 AI 项目,包括图像修复、风格迁移、超分辨率等工具。
GFPGAN 旨在开发用于真实世界人脸恢复的实用算法。
Real-ESRGAN 旨在开发用于通用图像/视频恢复的实用算法。
Invoke是Stable Diffusion模型的领先创意引擎,赋能专业人士、艺术家和爱好者,利用最新AI驱动技术生成和创建视觉媒体。该解决方案提供业界领先的WebUI,并作为多个商业产品的基础。
[NeurIPS 2022] 基于码本查找 Transformer 的鲁棒盲脸恢复方法
Grounded SAM:将 Grounding DINO 与 Segment Anything、Stable Diffusion 和 Recognize Anything 结合——自动检测、分割和生成任何内容。
🦙 LaMa图像修复,具有傅里叶卷积的鲁棒大掩码修复,WACV 2022
PaddlePaddle GAN库,包含许多有趣的应用,如一阶运动迁移、Wav2Lip、图像修复、图像编辑、照片转卡通、图像风格迁移、GPEN等。
OpenMMLab多模态高级、生成式与智能创作工具箱。解锁魔法🪄:生成式AI(AIGC)、易用API、精彩模型库、扩散模型,用于文本到图像生成、图像/视频修复/增强等。
一个跨平台的图像超分辨率工具
SUPIR 旨在开发用于野外逼真图像恢复的实用算法。我们的新在线演示也在 suppixel.ai 发布。
DragGAN 的非官方实现 - "Drag Your GAN: Interactive Point-based Manipulation on the Generative Image Manifold"(DragGAN 全功能实现,在线Demo,本地部署试用,代码、模型已全部开源,支持Windows, macOS, Linux)
🔎 使用残差密集网络和对抗网络超大规模放大图像并运行实验。
论文《Anydoor: zero-shot object-level image customization》的官方实现
基于Pytorch的图像超分辨率迭代细化方法的非官方实现
在无限画布上使用稳定扩散进行外补绘
使用生成对抗网络实现照片级真实感的单图像超分辨率
论文《SinGAN:从单张自然图像学习生成模型》的官方PyTorch实现
Kandinsky 2 — 多语言文本到图像潜在扩散模型
🔥 [ICCV 2025 Highlight] InfiniteYou:在保留身份的同时灵活重绘照片。
[IJCV2024] 利用扩散先验进行真实世界图像超分辨率。
[NeurIPS 2025] 图像编辑只需一个LoRA!0.1%的训练数据即可实现出色的图像编辑!在ID保持方面超越GPT-4o~ MoE检查点已发布!仅需4GB显存即可运行!
本项目是 'DreamOmni2: 多模态指令式编辑与生成 (CVPR2026 Highlight)' 的官方实现
一个拥有30亿活跃参数的原生统一多模态模型,用于图像和视频的理解、生成与编辑。
Inpaint Anything扩展使用Segment Anything的掩码在浏览器UI上执行稳定扩散修复。
Paint by Example:基于示例的图像编辑与扩散模型。
基于 CVPR 2017 论文《使用生成对抗网络进行照片级真实感单图像超分辨率》的 SRGAN PyTorch 实现。
Bernini是一个统一的视频生成和编辑框架,结合了基于MLLM的语义规划器和基于DiT的渲染器
用于 ComfyUI 的更好修复节点:SDXL 的 Fooocus 修复模型、LaMA、MAT 以及各种用于预填充修复和扩展区域的工具。
SDEdit 的 PyTorch 实现:基于随机微分方程的图像合成与编辑
[ICCV 2023 Oral] "FateZero: 融合注意力实现零样本文本驱动视频编辑"
[ECCV 2024] PowerPaint,一个多功能图像修补模型,支持文本引导的物体修补、物体移除、图像外扩和形状引导的物体修补,仅需单个模型。
快速准确的单阶段时空视频超分辨率 (被 CVPR 2020 接收)
《Image Inpainting for Irregular Holes Using Partial Convolutions》的非官方实现。尝试访问:www.fixmyphoto.ai
UniWorld:用于统一视觉理解与生成的高分辨率语义编码器
开源SOTA多图像编辑模型
用于单图像超分辨率的 SRGAN 算法的 TensorFlow 实现。
[NeurIPS 2025] 4KAgent: 智能任意图像到4K超分辨率。一个智能计算机视觉代理,能够神奇地将任何图像恢复到完美的4K!
[CVPR 2021] Anycost GANs 用于交互式图像合成与编辑
[ICML 2024] MagicPose(也称为MagicDance):基于身份感知扩散的真实人体姿态和面部表情重定向
[ECCV 2024] InstructIR:遵循人类指令的高质量图像恢复 https://huggingface.co/spaces/marcosv/InstructIR
[ICLR 2026] ChronoEdit:面向图像编辑和世界模拟的时间推理
[ECCV 2026] SparkVSR: 基于稀疏关键帧传播的交互式视频超分辨率
[CVPR 2019]:多元图像补全
[NeurIPS 2022] 去噪扩散恢复模型 -- 官方代码仓库
Flash Diffusion — 加速条件扩散模型 (AAAI 2025 Oral)
'AnyV2V:面向任意视频到视频编辑任务的无调优框架' [TMLR 2024] 的代码和数据
论文《无域标签的高分辨率日间翻译》(CVPR2020, 口头报告) 的官方仓库
[CVPR2024] SeeSR:面向语义感知的真实世界图像超分辨率
该项目是 'Diffir: Efficient diffusion model for image restoration'(ICCV2023)的官方实现。
IDM-VTON 的 ComfyUI 适配版,用于虚拟试穿。
DiffMorpher官方代码:释放扩散模型在图像变形中的能力(CVPR 2024)
一个统一模型,在单个强大框架内无缝集成多模态理解、文本到图像生成和图像编辑。
PyTorch 实现《改进单图像 GAN 训练技术》(WACV-21)
[CVPR 2023] 协同扩散
[CVPR 2024] FreeDrag的官方实现:基于特征拖拽的可靠点编辑图像
[ICLR 2026] 论文 "Reconstruction Alignment Improves Unified Multimodal Models" 的官方仓库。通过自监督学习解锁统一多模态模型中的大规模零样本潜力。
"Stable Flow: 用于免训练图像编辑的关键层" [CVPR 2025] 的官方实现
[ICLR2024] 论文 "PnP Inversion: Boosting Diffusion-based Editing with 3 Lines of Code" 的官方仓库
[CVPR 2025] '像素级和语义级可调超分辨率:一种双 LoRA 方法' 官方代码仓库
[ICLR 2025] Meissonic 官方实现:复兴掩码生成式Transformer以实现高效高分辨率文本到图像合成
Video-Inpaint-Anything:这是我们论文CoCoCo的推理代码:改进文本引导视频修复以实现更好的一致性、可控性和兼容性。
MinImagen:Imagen文本到图像模型的最小实现
Calligrapher:自由风格文本图像定制
[ICML2025] 一个8步反转和8步编辑过程可有效与FLUX-dev模型配合使用。(3倍加速,结果与基线方法相当甚至更优)
论文HistoGAN的参考代码:通过颜色直方图控制GAN生成图像和真实图像的颜色(CVPR 2021)。
近期用于文本图像生成任务的扩散模型论文合集,例如视觉文本生成、字体生成、文本去除、文本图像超分辨率、文本编辑、手写生成、场景文本识别和场景文本检测。
《ReNoise:通过迭代加噪实现真实图像反演》的官方实现
[CVPR 2025] FaithDiff用于经典电影修复、老照片复原、社交媒体恢复、图像增强和AIGC增强
用于IHC图像量化的深度学习推断多重免疫荧光(https://deepliif.org)[Nature Machine Intelligence'22, CVPR'22, MICCAI'23, Histopathology'23, MICCAI'24]
论文“CFG++: manifold-constrained classifier free guidance for diffusion models”(ICLR2025)的官方仓库
最先进的内容保留风格迁移
用于在 Stable Diffusion 上进行各种实验的代码库,由 diffusers 库支持。
CoMoGAN:连续模型引导的图像到图像翻译。CVPR 2021口头报告。
[CVPR 2023] Ref-NPR:基于参考的非真实感辐射场
本项目是论文《用于二值化图像恢复网络的基本二进制卷积单元》(ICLR 2023)的官方实现
论文《You Only Cut Once: Boosting Data Augmentation with a Single Cut, ICML 2022》的代码。
论文《使用残差注意力深度神经网络的多图像遥感图像超分辨率》的官方 TensorFlow 代码。
BFSR的官方仓库:"通过学习先验提升基于流的生成式超分辨率模型" [CVPR 2024]
DiffRoll的PyTorch实现,一种基于扩散的生成式自动音乐转录(AMT)模型
HiDream O1图像节点 + 用于ComfyUI的LoRA训练
使用 Stability AI 生成图像的 Compose Multiplatform 应用
"Guide-and-Rescale: 用于有效免调优真实图像编辑的自引导机制"的官方实现
Stable Diffusion Web UI的易用图像编辑器扩展
自托管GPT图像/兼容OpenAI的WebUI,用于文生图、图像编辑、基于参考的生成和多语言创意工作流。
面向团队的自托管GPT Image 2 / Image-2工作台:文生图、图生图、模板、配额、历史记录和管理仪表盘。
通过muapi.ai进行GPT-Image-2图像生成的ComfyUI自定义节点——文本到图像和图像到图像
字节跳动Seedream 5.0 Pro API的Python封装——4K文生图、自然语言图像编辑、精确排版和一致角色生成。
本地 AI 工具集/工作站:本地 AI 图像编辑器、Ollama 图像生成路由、SDXL 修复 UI、CivitAI 模型导入、8GB VRAM Stable Diffusion
[WACV 2025] I Dream My Painting: 通过提示生成连接多模态大语言模型和扩散模型,实现文本引导的多掩码图像修复
数据来源:GitHub API · 人工精选 · 实时同步