文生图421 / 395 个项目
文生图模型排行榜,收录 GitHub 上最热门的文字生成图片 AI 项目,如 Stable Diffusion、DALL·E 等开源实现,按 Stars 排名。
强大的节点式 Stable Diffusion 工作流编辑器,模块化管道实现高级图像生成。
Stability AI 的基础文生图模型,开源权重、高质量输出、庞大的工具生态。
Invoke是Stable Diffusion模型的领先创意引擎,赋能专业人士、艺术家和爱好者,利用最新AI驱动技术生成和创建视觉媒体。该解决方案提供业界领先的WebUI,并作为多个商业产品的基础。
PyTorch中的图像到图像翻译
能够从绘画生成照片、将马变成斑马、执行风格迁移等功能的软件。
基于 Stable Diffusion 的自定义照片生成,从几张照片生成个性化图像。
使用条件对抗网络的图像到图像翻译
一种简单的一键式方法,无需技术知识即可在电脑上使用AI创建精美艺术品。提供浏览器UI,用于从文本提示和图像生成图像。只需输入文本提示,即可看到生成的图像。
使用 NeRF + Diffusion 的文本到 3D、图像到 3D 和网格导出。
[NeurIPS 2024 最佳论文奖][GPT 击败扩散🔥][视觉生成中的缩放定律📈] “视觉自回归建模:通过下一尺度预测实现可扩展图像生成”的官方实现。一个*极其简单、用户友好且最先进*的自回归图像生成代码库!
SANA:基于线性扩散Transformer的高效高分辨率图像合成
PaddlePaddle GAN库,包含许多有趣的应用,如一阶运动迁移、Wav2Lip、图像修复、图像编辑、照片转卡通、图像风格迁移、GPEN等。
在Mac上原生运行Stable Diffusion
fast-stable-diffusion + DreamBooth
使用Stable Diffusion实现Dreambooth (https://arxiv.org/abs/2208.12242)
OpenMMLab多模态高级、生成式与智能创作工具箱。解锁魔法🪄:生成式AI(AIGC)、易用API、精彩模型库、扩散模型,用于文本到图像生成、图像/视频修复/增强等。
SD.Next:用于AI生成图像和视频创建、字幕和处理的一体化WebUI
SUPIR 旨在开发用于野外逼真图像恢复的实用算法。我们的新在线演示也在 suppixel.ai 发布。
DALL-E(OpenAI 的文本到图像转换器)在 Pytorch 中的实现/复现。
Tiled Diffusion 和 VAE 优化,基于 CC BY-NC-SA 4.0 许可
DragGAN 的非官方实现 - "Drag Your GAN: Interactive Point-based Manipulation on the Generative Image Manifold"(DragGAN 全功能实现,在线Demo,本地部署试用,代码、模型已全部开源,支持Windows, macOS, Linux)
StableSwarmUI,一个模块化 Stable Diffusion Web 用户界面,重点在于使强大工具易于访问、高性能和可扩展性。
通过探索潜在空间并在文本提示之间变形,使用Stable Diffusion创建🔥视频。
OmniGen:统一图像生成。https://arxiv.org/pdf/2409.11340
使用 OpenAI 的 CLIP 和 Siren(隐式神经表示网络)进行文本到图像生成的简单命令行工具。该技术最初由 https://twitter.com/advadnoun 创建。
论文《Anydoor: zero-shot object-level image customization》的官方实现
基于Pytorch的图像超分辨率迭代细化方法的非官方实现
用于实时音乐生成的稳定扩散
在无限画布上使用稳定扩散进行外补绘
🪩 一行代码创建Disco Diffusion艺术作品
用于 Stable Diffusion WebUI 的 Segment Anything
min(DALL·E) 是 DALL·E Mini 到 PyTorch 的一个快速、极简移植版本
HunyuanImage-3.0:一個強大的原生多模態影像生成模型。
透過 Textual Inversion 方式實現 Dreambooth,用於 Stable Diffusion。調整重點在於訓練人臉、物體和風格。
[CVPR 2024 - 口頭報告,最佳論文獎候選] Marigold:重新利用基於擴散的影像生成器進行單目深度估計。
Zero-1-to-3:零样本单图到 3D 物体(ICCV 2023)
[SIGGRAPH Asia 2023] Rerender A Video:零样本文本引导的视频到视频翻译
歌声转换与歌声克隆的核心引擎
AUTOMATIC1111 的 Stable Diffusion WebUI 的 Deforum 扩展
MuseV:基于视觉条件并行去噪的无限长度高保真虚拟人视频生成
Kandinsky 2 — 多语言文本到图像潜在扩散模型
FLUX, Stable Diffusion, SDXL, SD3, LoRA, 微调, DreamBooth, 训练, Automatic1111, Forge WebUI, SwarmUI, DeepFake, TTS, 动画, 文本转视频, 教程, 指南, 讲座, 课程, ComfyUI, Google Colab, RunPod, Kaggle, 笔记本, ControlNet, TTS, 语音克隆, AI, AI新闻, ML, ML新闻, 新闻, 科技, 科技新闻, Kohya, Midjourney, RunPod
一个使用Stable Diffusion(过去使用DALL-E Mini)从任何文本提示生成图像的游乐场
🔥 [ICCV 2025 Highlight] InfiniteYou:在保留身份的同时灵活重绘照片。
[IJCV2024] 利用扩散先验进行真实世界图像超分辨率。
只是尝试在本地运行 VQGAN+CLIP,而不是使用 colab。
一个简单的命令行文本到图像生成工具,使用OpenAI的CLIP和BigGAN。该技术最初由https://twitter.com/advadnoun创建
对比无配对图像到图像翻译,训练比 cyclegan 更快更轻量(ECCV 2020,PyTorch 实现)
超越传统方法的Lora,以及Stable Diffusion的其他秩适应实现。
使用Stable Diffusion turbo的一步图像到图像转换:草图转图像、白天转黑夜等。
Lumina-T2X是一个用于文本到任意模态生成的统一框架。
Project Lyra:开放生成式 3D 世界模型
用于动漫/插画的素描提取器。
[NeurIPS 2025] 图像编辑只需一个LoRA!0.1%的训练数据即可实现出色的图像编辑!在ID保持方面超越GPT-4o~ MoE检查点已发布!仅需4GB显存即可运行!
让我们普及高分辨率生成!(CVPR 2024)
Helios: 真正的实时长视频生成模型
本项目是 'DreamOmni2: 多模态指令式编辑与生成 (CVPR2026 Highlight)' 的官方实现
自回归模型击败扩散:🦙 Llama用于可扩展图像生成
"DPM-Solver:约10步内扩散概率模型采样的快速ODE求解器"(Neurips 2022 Oral)的官方代码
[ICML 2024] 掌握文本到图像扩散:使用多模态LLM进行重述、规划和生成(RPG)
文本到图像生成。NeurIPS 2021论文“CogView: Mastering Text-to-Image Generation via Transformers”的仓库
发现可解释的GAN控制 [NeurIPS 2020]
[ECCV 2024] 论文"BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion"的官方实现
一套图像和视频神经分词器
[CVPR2024 亮点] VBench - 我们评估视频生成
论文"TokenFlow: Consistent Diffusion Features for Consistent Video Editing"的官方Pytorch实现,介绍"TokenFlow"(ICLR 2024)
[ICLR'25 Oral] 面向生成的表示对齐:训练扩散变换器比你想象的更容易
从文本生成图像。俄语版本
[ACM MM 2025] FantasyTalking:通过连贯运动合成实现逼真的说话人肖像生成
[CVPR 2025 Oral]Infinity ∞:扩展逐比特自回归建模以实现高分辨率图像合成
[ICCV 2025] 🔥🔥 UNO:一种适用于单主体和多主体条件的通用定制方法。
生成对抗变换器。
FireRed-Image-Edit是一个强大的图像编辑基础模型,实现了开源最先进的性能,具有精确的指令跟随、高保真生成、卓越的身份一致性和无缝的多元素融合。
基于 Stable Diffusion 的《Prompt-to-Prompt 图像编辑与交叉注意力控制》的非官方实现。
Auto1111扩展,仅使用Auto1111 webui依赖实现文本到视频扩散模型(如ModelScope或VideoCrafter)
一个简洁易读的PyTorch实现的CycleGAN
一个拥有30亿活跃参数的原生统一多模态模型,用于图像和视频的理解、生成与编辑。
[NeurIPS 2020] 用于数据高效GAN训练的可微分增强
Inpaint Anything扩展使用Segment Anything的掩码在浏览器UI上执行稳定扩散修复。
[ICCV 2025] "MV-Adapter:轻松实现多视图一致图像生成"的官方实现
Paint by Example:基于示例的图像编辑与扩散模型。
用于文本到音频生成的扩散模型系列。
Bernini是一个统一的视频生成和编辑框架,结合了基于MLLM的语义规划器和基于DiT的渲染器
用于 ComfyUI 的更好修复节点:SDXL 的 Fooocus 修复模型、LaMA、MAT 以及各种用于预填充修复和扩展区域的工具。
使用 Pytorch 的自包含、极简扩散模型实现。
SDEdit 的 PyTorch 实现:基于随机微分方程的图像合成与编辑
[ICLR24] 论文《MagicDrive:具有多样化3D几何控制的街景生成》的官方实现
[ICCV 2023 Oral] "FateZero: 融合注意力实现零样本文本驱动视频编辑"
[ECCV 2026] MixGRPO:解锁基于流的 GRPO 效率,混合 ODE-SDE
"VITON-HD: 基于错位感知归一化的高分辨率虚拟试穿" (CVPR 2021) 的官方 PyTorch 实现
CogView4、CogView3-Plus 和 CogView3(ECCV 2024)
[ECCV 2024] PowerPaint,一个多功能图像修补模型,支持文本引导的物体修补、物体移除、图像外扩和形状引导的物体修补,仅需单个模型。
Text2Room使用2D文本到图像模型从给定文本提示生成带纹理的3D网格(ICCV2023)。
从零开始在PyTorch中实现的稳定扩散
基于C++的NCNN中的Stable Diffusion,支持txt2img和img2img
MultiDiffusion: Fusing Diffusion Paths for Controlled Image Generation的官方PyTorch实现,提出MultiDiffusion(ICML 2023)
[CVPR 2024] PIA,你的个性化图像动画生成器。通过文本提示结合Dreambooth将图像动画化,生成惊艳视频。
[ICLR 2024] SEINE: 用于生成式过渡和预测的短到长视频扩散模型
MixNMatch的Pytorch实现
基于diffusers的Stable diffusion webui。
[ICLR 2026] 一种无需训练的长故事可视化迭代框架
Get Deinked!!
论文“CogView2:通过层次化Transformer实现更快更好的文本到图像生成”的官方代码仓库
该项目是 FernRP 包的实现,包含 NPR/PBR。
Muse:基于掩码生成变换器的文本到图像生成,在Pytorch中的实现
论文《高分辨率虚拟试穿:处理错位和遮挡条件》(ECCV 2022)的官方PyTorch实现。
[ICML 2026] 论文“Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation”及Causal Forcing++的官方代码库。
一个由 LLM 驱动的开源基础 TTS 系统
沉着的生成模型学习器
基于Qwen-3和Stable Diffusion系列的DeepSeek Engram架构研究。
UniWorld:用于统一视觉理解与生成的高分辨率语义编码器
开源SOTA多图像编辑模型
利用生成式AI的力量,直接在Blender中改变你的3D纹理工作流程!
无监督跨域图像生成的TensorFlow实现。
[CVPR 2025 Highlight🔥] 通过频率分解实现身份保持的文本到视频生成
用于3D形状生成的潜在点扩散模型
YOLO-World + EfficientSAM在ComfyUI中的非官方实现
“RIFLEx:视频扩散 Transformer 中长度外推的免费午餐”(ICML 2025)、UltraViCo(ICLR 2026)和 UltraImage 的官方实现
[ICCV 2023] “TF-ICON:基于扩散的无训练跨域图像合成”(官方实现)
APDrawingGAN的代码:使用分层GAN从人脸照片生成艺术肖像画(CVPR 2019 Oral)
Kandinsky 5.0:用于视频和图像生成的扩散模型系列
[CVPR 2024] Paint3D: 使用无光照纹理扩散模型绘制任意 3D 物体,一种无光照烘焙的纹理生成模型。
[ECCV 2024 Oral 🔥] Arc2Face: 用于身份一致人脸的基座模型 ------------------------ [ICCVW 2025] 使用 Blendshape 引导扩散的身份一致、精确表情生成。
CLIP + FFT/DWT/RGB = 文本到图像/视频
[CVPR 2024] FRESCO:用于零样本视频翻译的时空对应
[CVPR 2021] Anycost GANs 用于交互式图像合成与编辑
用于训练和采样扩散模型的简单可读代码
rCM 和 Causal-rCM:领先且统一的算法/基础设施,用于大规模双向/自回归视频扩散蒸馏
AI驱动的文本到艺术生成器 - Text2Art.com
"Attend-and-Excite: 基于注意力的文本到图像扩散模型语义引导"(SIGGRAPH 2023)的官方实现
🤖🖌️ 基于源图像或(即将推出)PBR 材质生成逼真的纹理。混搭、重制、融合!如果你想在主题上创建变体或对现有纹理进行精细加工,这将非常有用。
一个易于理解的 TTS / SVS / SVC 框架
通过美学梯度实现Stable Diffusion的个性化 🎨
HY-SOAR:扩散模型中用于最优对齐和精炼的自我校正方法。
Paddle多模态集成与探索,支持主流多模态任务,包括端到端大规模多模态预训练模型和扩散模型工具箱。兼具高性能和灵活性。
创建给定角色在不同姿势下的图像
[ICCV 2021] 用于图像重建与合成的焦点频率损失
使用 Diffusers 🧨 微调 ModelScope 的文本到视频模型
[ICLR 2026] ChronoEdit:面向图像编辑和世界模拟的时间推理
[ECCV 2024] OMG:扩散模型中遮挡友好的个性化多概念生成。
[ICML2025, NeurIPS2025 Spotlight] Sparse VideoGen 1 & 2:使用稀疏注意力加速视频扩散Transformer
用于非配对图像到图像翻译和多域图像到图像翻译的AttentionGAN
DiffuEraser是一种用于视频修复的扩散模型,在保持可接受效率的同时,实现了出色的内容完整性和时间一致性
HunyuanImage-2.1:一种用于高分辨率(2K)文本到图像生成的高效扩散模型
[NeurIPS 2022] 去噪扩散恢复模型 -- 官方代码仓库
Flash Diffusion — 加速条件扩散模型 (AAAI 2025 Oral)
OneDiffusion论文的官方实现 (CVPR 2025)
[ICCV 2023] 随机扩散模型的潜在空间
[ICLR 2025] 无需向量量化的自回归视频生成
SEAN:基于语义区域自适应归一化的图像合成(CVPR 2020,口头报告)
论文《无域标签的高分辨率日间翻译》(CVPR2020, 口头报告) 的官方仓库
[CVPR2024] SeeSR:面向语义感知的真实世界图像超分辨率
用于 Flow-Matching 模型中简化强化学习的统一框架
基于Stable Diffusion优化的AI绘画模型。支持输入中英文文本,可生成多种现代艺术风格的高质量图像
使用Stable Diffusion实现Paint-with-words:来自eDiff-I的方法,允许从文本标记的分割图生成图像
(被IJCV接收) Liquid:语言模型是可扩展且统一的多模态生成器
"混合潜在扩散"的官方实现 [SIGGRAPH 2023]
[ECCV 2026] 基于扩散的文档OCR框架,用块级并行扩散解码替代自回归解码。
我们SIGGRAPH 2020论文《基于少样本补丁训练的交互式视频风格化》的官方实现
Segmind蒸馏扩散
[CVPR 2024 Highlight] MIGC 和 [TPAMI 2024] MIGC++(官方实现)
[CVPR 2025] RollingDepth:无需视频模型的视频深度估计
[TIP2026] CCSRv2 和 CCSRv1 的官方代码:提高扩散模型在内容一致超分辨率中的稳定性和效率。
生成对抗文本到图像合成 / 请加星标 -->
又一个 Stable Diffusion 的 PyTorch 实现(可能易于阅读)。
CVPR 2025 论文《SemanticDraw: Towards Real-Time Interactive Content Creation from Image Diffusion Models》的官方代码。
《Blended Diffusion for Text-driven Editing of Natural Images》[CVPR 2022] 的官方实现。
IDM-VTON 的 ComfyUI 适配版,用于虚拟试穿。
蛋白质结构的扩散模型;三角学和注意力机制就是一切!
ECCV 2024 论文的官方代码——用于手写文本生成的单次扩散模仿器
一个多功能且稳健的 SDXL-ControlNet 模型,用于可适应的线条艺术条件控制
Würstchen 的官方实现:文本到图像模型的高效预训练
T2F:使用深度学习进行文本到人脸生成。
[CVPR 2022] StyleSwin:基于Transformer的GAN用于高分辨率图像生成
[AAAI2024] FontDiffuser:通过去噪扩散与多尺度内容聚合和风格对比学习实现单样本字体生成
在 ComfyUI 中直接训练、块编辑和保存 LoRA,适用于 Z-image、Flux Klein、SDXL、Flux、WAN 2.2、SD 1.5
Tiled Diffusion、MultiDiffusion、Mixture of Diffusers 以及优化的 VAE
支持多种图像模型。目前支持:DiT、PixArt、HunYuanDiT、MiaoBi 以及一些 VAE。
[NeurIPS 2025 Spotlight] 用于视觉生成与理解的统一分词器
“Break-A-Scene:从单张图像中提取多个概念”的官方实现 [SIGGRAPH Asia 2023]
本地生成图像
[WACV'25 Oral] 微调图像条件扩散模型比你想象的更容易
[SIGGRAPH Asia 2024] ReVersion: 基于扩散的图像关系反演
通过去噪扩散模型进行人物图像合成(CVPR 2023)
PITI:预训练是图像到图像翻译的全部所需
《BlendGAN:用于任意风格化人脸生成的隐式GAN混合》(NeurIPS 2021)的官方PyTorch实现
Z-Image工作流,带有预定义样式,用于高质量图像生成和用户友好体验。包含针对GGUF和SAFETENSORS检查点格式的预配置版本。
SVG可微分渲染:使用神经网络生成矢量图形。支持:文本转SVG、图像转SVG、SVG编辑。
🧬 使用扩散概率模型对调控DNA序列进行生成建模 💨
扩散分类器利用预训练扩散模型进行零样本分类,无需额外训练
LLM引导扩散:使用大型语言模型增强文本到图像扩散模型的提示理解(LLM-grounded Diffusion: LMD, TMLR 2024)
"StyleKeeper:使用负视觉查询引导防止内容泄露"的官方PyTorch实现
用于伪图像翻译的冻结生成器
StyleShot: 任意风格的快照。一款可以迁移任意风格到任意内容的模型,无需针对图片微调,即能生成高质量的个性风格化图片!
ILVR: 去噪扩散概率模型的条件方法 (ICCV 2021 Oral)
[CVPR 2019 Oral] 基于级联语义引导的多通道注意力选择GAN用于跨视图图像翻译
[ICLR 2024] 《InstructCV:指令调优的文本到图像扩散模型作为视觉通才》的官方代码库
一个 CLI 工具/Python 模块,使用 OpenAI 的引导扩散和 CLIP 从文本生成图像。
AsymFlow、pi-Flow、GMFlow 的官方实现
[CVPRW 2026] AutoStudio:在多轮交互式图像生成中打造一致主题
数据来源:GitHub API · 人工精选 · 实时同步