文生视频151 / 192 个项目
文生视频模型排行榜,收录 GitHub 上最热门的文字生成视频 AI 项目,包括视频生成、帧插值和视频编辑等开源工具。
让肖像活起来!
Wan:开放且先进的大规模视频生成模型
🚀 真正开源的AI头像(数字人)工具包,用于离线视频生成和数字人克隆。
首家工业级全流程 AI 影视生产平台。行业首个专业 AI Agent 平台,用于可控电影和视频制作。从短片到真人实拍,采用好莱坞标准工作流程。
文本和图像到视频生成:CogVideoX (2024) 和 CogVideo (ICLR 2023)
HunyuanVideo: 大型视频生成模型的系统框架
"ViMax:智能体视频生成(导演、编剧、制片人和视频生成器一体化)"
SANA:基于线性扩散Transformer的高效高分辨率图像合成
VideoCrafter2:克服数据限制以实现高质量视频扩散模型
[CVPR 2025] EchoMimicV2:迈向引人注目、简化且半身的人体动画
HunyuanVideo-1.5:领先的轻量级视频生成模型
推进开源世界模型
[ECCV 2024] Champ:基于 3D 参数化引导的可控且一致的人体图像动画。
[ICCV 2023 Oral] 文本到图像扩散模型是零样本视频生成器
一个用于加速视频生成的统一推理和后训练框架。
[ICCV 2025] 论文的官方实现:VACE:一体化视频创建与编辑
AI Agent 驅動的開源影片生成工作台 — 小說→角色/場景/道具設計→劇本→分鏡圖→影片,跨鏡頭角色與場景一致 | Open-source AI video workspace powered by AI Agents, Nano Banana 2 & Veo 3.1 / Grok / Seedance / OpenAI
MAGI-1:大规模自回归视频生成。
TurboDiffusion:视频扩散模型100–200倍加速
[CVPR 2026] PersonaLive!:用于直播的表现力肖像图像动画
通用 AIGC 视频引擎 —— 从剧本到成片一条流水线,漫剧、广告、电商、乙游皆可
InternGPT (iGPT) 是一個開源示範平台,你可以輕鬆展示你的 AI 模型。現在支援 DragGAN、ChatGPT、ImageBind、類似 GPT-4 的多模態聊天、SAM、互動式影像編輯等。試試 igpt.opengvlab.com (支援 DragGAN、ChatGPT、ImageBind、SAM 的線上 Demo 系統)
[ICLR 2025] 用於高效影片生成建模的金字塔流匹配。
VGen 的官方仓库:一个基于扩散模型的视频生成整体生态系统
[ECCV 2024, 口头报告] DynamiCrafter:利用视频扩散先验动画化开放域图像
短剧平台 AI 短剧 动态漫画生成平台 工业级AI动态漫画与视频工作台
MuseV:基于视觉条件并行去噪的无限长度高保真虚拟人视频生成
FLUX, Stable Diffusion, SDXL, SD3, LoRA, 微调, DreamBooth, 训练, Automatic1111, Forge WebUI, SwarmUI, DeepFake, TTS, 动画, 文本转视频, 教程, 指南, 讲座, 课程, ComfyUI, Google Colab, RunPod, Kaggle, 笔记本, ControlNet, TTS, 语音克隆, AI, AI新闻, ML, ML新闻, 新闻, 科技, 科技新闻, Kohya, Midjourney, RunPod
基于置信度感知姿态引导的高质量人体运动视频生成
轻量级图像视频动作生成推理框架。
LongLive 2.0:基础设施 - 长视频生成
Matrix-Game 3.0:具有长时记忆的实时流式交互世界模型。
Helios: 真正的实时长视频生成模型
[ICML 2026] 通过代码生成视频
[ICCV'25最佳论文决赛] ReCamMaster:从单个视频进行相机控制的生成式渲染
论文DreamTalk: When Expressive Talking Head Generation Meets Diffusion Probabilistic Models的官方实现
[CVPR2024 亮点] VBench - 我们评估视频生成
论文"TokenFlow: Consistent Diffusion Features for Consistent Video Editing"的官方Pytorch实现,介绍"TokenFlow"(ICLR 2024)
“MIMO:基于空间分解建模的可控角色视频合成”的官方实现
Phantom:通过跨模态对齐实现主体一致的视频生成
视频扩散模型的实现,Jonathan Ho 将 DDPM 扩展到视频生成的新论文——基于 Pytorch
[AAAI 2024] Follow-Your-Pose:本仓库是《Follow-Your-Pose:使用无姿态视频进行姿态引导的文本到视频生成》的官方实现。
Cosmos-Predict2.5,Cosmos世界基础模型(WFMs)系列的最新版本,专门用于以视频形式模拟和预测世界的未来状态。
[TPAMI 2025🔥] MagicTime:作为变形模拟器的延时视频生成模型。
一个拥有30亿活跃参数的原生统一多模态模型,用于图像和视频的理解、生成与编辑。
《Articulated Animation》论文中运动表示的代码
我们提出 StableAvatar,首个端到端视频扩散 Transformer,它能够基于参考图像和音频合成无限长度的高质量音频驱动虚拟人视频,无需任何后处理。
Bernini是一个统一的视频生成和编辑框架,结合了基于MLLM的语义规划器和基于DiT的渲染器
HunyuanCustom:一种用于定制化视频生成的多模态驱动架构。
Motus 的官方代码:一个统一的潜在动作世界模型
SCIS-2025 论文 "UniAnimate:驯服统一视频扩散模型以实现一致的人体图像动画" 的代码。
🎬 seedance2接入 开源本地AI短剧 & 漫剧生成工具 —— 从故事到成片一站式完成,数据不出本机,短剧工作流管理平台,高灵活度,AI真人剧,AI漫剧本地搞定。Open-source local AI short drama maker: story → storyboard → video, fully offline, your data stays yours. 纳米流水线
[ICLR24] 论文《MagicDrive:具有多样化3D几何控制的街景生成》的官方实现
✨ Hotshot-XL: 最先进的AI文本到GIF模型,训练用于与Stable Diffusion XL协同工作
[ECCV 2024 Oral] MotionDirector:文本到视频扩散模型的运动定制
SCAIL:通过 3D 一致姿态表示的上下文学习实现工作室级角色动画(CVPR 2026 Findings)
[AAAI 2026] EchoMimicV3: 1.3B参数足以实现统一多模态多任务人体动画
MAGVIT 的官方 JAX 实现:掩码生成式视频变换器
基于运动引导的细粒度开放域图像动画
[ICLR 2024] SEINE: 用于生成式过渡和预测的短到长视频扩散模型
VideoComposer的官方仓库:具有运动可控性的组合式视频合成
从文本和图像生成视频,第一代
[ICML 2026] 论文“Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation”及Causal Forcing++的官方代码库。
[AAAI 2025] Follow-Your-Click: 该仓库是“Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts”的官方实现
面向具身智能的混合专家视频预训练扩展。
[NeurIPS 2024] 面向自动驾驶的通用世界模型
[ICLR 2024] "ControlVideo: 无需训练的可控文本到视频生成"的官方PyTorch实现。
[ACM MM 2025] Ditto:用于可控实时说话头合成的运动空间扩散
UniAnimate-DiT:使用大规模视频扩散变换器进行人体图像动画。
[CVPR 2025 Highlight🔥] 通过频率分解实现身份保持的文本到视频生成
[ICLR2026] SeedVR2: 通过扩散对抗后训练实现一步视频修复
[SIGGRAPH 2025] 扩散作为着色器:用于多功能视频生成控制的3D感知视频扩散
“RIFLEx:视频扩散 Transformer 中长度外推的免费午餐”(ICML 2025)、UltraViCo(ICLR 2026)和 UltraImage 的官方实现
一个简单、统一的多模态模型训练引擎。精简、灵活,专为大规模黑客攻击而构建。
Kandinsky 5.0:用于视频和图像生成的扩散模型系列
[CVPR 2024 Highlight] GenAD: 自动驾驶的通用预测模型。
使用AI从文本生成视频
CLIP + FFT/DWT/RGB = 文本到图像/视频
Phenaki Video的PyTorch实现,使用Mask GIT生成长达2分钟的文本引导视频
rCM 和 Causal-rCM:领先且统一的算法/基础设施,用于大规模双向/自回归视频扩散蒸馏
[ICML 2024] MagicPose(也称为MagicDance):基于身份感知扩散的真实人体姿态和面部表情重定向
从单张图像或文本提示生成大规模可探索的 3D 场景,并附带高质量全景视频。
[NeurIPS 2025 Oral] Infinity⭐️: 用于视觉生成的统一时空自回归建模
Paddle多模态集成与探索,支持主流多模态任务,包括端到端大规模多模态预训练模型和扩散模型工具箱。兼具高性能和灵活性。
[ICCV 2025] 论文“MagicDrive-V2: 自适应控制的高分辨率长视频生成用于自动驾驶”的官方实现
Cosmos-Transfer2.5,构建于 Cosmos-Predict2.5 之上,根据多个空间控制输入生成高质量的世界模拟。
生成式世界渲染器:一个用于游戏和虚拟世界的 AI 原生渲染器。
[ICML 2025] “历史引导视频扩散”的官方 PyTorch 实现
使用 Diffusers 🧨 微调 ModelScope 的文本到视频模型
[ICLR 2026] ChronoEdit:面向图像编辑和世界模拟的时间推理
一个极简、开箱即用的仓库,用于推进世界模型科学
[ICLR'25] SynCamMaster:从不同视角同步多摄像头视频生成
[ECCV 2026] SparkVSR: 基于稀疏关键帧传播的交互式视频超分辨率
Pytorch中MagViT2分词器的实现
[SIGGRAPH ASIA 2024 TCS] AnimateLCM: 无需个性化视频数据的计算高效个性化风格视频生成
[ICLR 2025] 无需向量量化的自回归视频生成
'AnyV2V:面向任意视频到视频编辑任务的无调优框架' [TMLR 2024] 的代码和数据
用于 Flow-Matching 模型中简化强化学习的统一框架
[ICCV 2025 & ICCV 2025 RIWM杰出论文] Aether:几何感知统一世界建模
VEnhancer 官方代码:视频生成的生成式时空增强
Vista4D的官方代码、模型和数据:基于4D点云的视频重拍(CVPR 2026 Highlight)
让我们一起微调视频生成模型!
在 PyTorch 中实现 NÜWA,一种用于文本到视频合成的先进注意力网络。
[ECCV 2024] FreeInit:弥合视频扩散模型中的初始化差距
Cosmos-Drive-Dreams:使用世界基础模型的可扩展合成驾驶数据生成
[ICCV 2025] Light-A-Video:通过渐进式光融合实现无需训练的视频重光照
FantasyPortrait: 通过表情增强扩散变换器提升多角色肖像动画。
DiffMorpher官方代码:释放扩散模型在图像变形中的能力(CVPR 2024)
OmniVCus:基于多模态控制条件的前馈主体驱动视频定制(NeurIPS 2025)
[ICCV 2025] FLOAT的官方PyTorch实现:用于音频驱动说话人肖像的生成式运动潜在流匹配。
[AAAI-2026] FlashVideo:从保真度到细节的高效高分辨率视频生成
我们CVPR 2023论文"基于潜在流扩散模型的条件图像到视频生成"的PyTorch实现
[ECCV 2024 Oral] EDTalk - 官方PyTorch实现
[ICML 2026] 字节跳动面向人-物交互视频生成的全能视频生成模型
ID 特定视频定制扩散的代码
[CVPR'23] MM-Diffusion:学习用于联合音频和视频生成的多模态扩散模型
AI 短剧与微短剧视频生成器——通过多智能体 AI 流水线(编剧→故事板→帧→视频)将任何想法转化为完整的短剧。支持 Seedance 2 VIP、Kling 3.0 Pro、Veo 3.1、Sora 2。
字节跳动Seedance 2.5 API的Python封装——文本转视频、图像转视频、逼真人脸、原生4K、一致角色生成
[ICLR 2026] 论文“Video-As-Prompt: Unified Semantic Control for Video Generation”的官方仓库
[ICCV 2025 ⭐亮点⭐] VMem 实现:基于 Surfel 索引视图内存的一致交互式视频场景生成
[ECCV 2026] RefAlign: Representation Alignment for Reference-to-Video Generation的官方PyTorch实现
[ICML 2026] World-R1:为文本到视频生成强化 3D 约束
驾驶世界模型的开源代码仓库,包含训练、推理、评估工具和预训练检查点。
ICCV 2025 | TesserAct:学习 4D 具身世界模型
统一视频动作模型的官方PyTorch实现(RSS 2025)
[CVPR 2022] StyleGAN-V:一种具有StyleGAN2价格、图像质量和优势的连续视频生成器
[ICLR 2026] JavisDiT和JavisDiT++系列的官方实现。
Epona的官方代码:用于自动驾驶的自回归扩散世界模型(ICCV 2025)
[TPAMI 2025, NeurIPS 2024] Video4DGen: 通过相互优化增强视频和4D生成
LPM 1.0: 基于视频的角色表演模型
[CVPR 2025 Highlight] VideoScene: 蒸馏视频扩散模型以一步生成3D场景
PhysGen:基于刚体物理的图像到视频生成 (ECCV 2024)
[NeurIPS D&B Track 2024] HumanVid的官方实现
[CVPR-2025] HunyuanPortrait 官方代码:增强肖像动画的隐式条件控制
一个实时流式对话视频系统,使用自回归扩散将文本交互转换为连续、高保真的视频响应。
字节跳动 Seedance 2.0、Seedance 2.5 和 Seedance 2 Mini API 的 Python 封装——文本到视频、图像到视频、逼真的人脸、1080p、一致的角色生成。
“改进多功能应用的视频生成”的GitHub仓库
[ICCV 2025] LangScene-X:使用TriMap视频扩散重建可泛化的3D语言嵌入场景。
[CVPR 2024] | LAMP: 学习运动模式用于基于少样本的视频生成
OmniTransfer:时空视频传输的全能框架
LongLive-RAG的官方实现:一种用于长视频生成的通用检索增强框架
官方仓库:极线几何提升视频生成模型
Black Forest Labs 的 FLUX 3 视频 API 的 Python 封装——文本到视频和图像到视频,支持原生同步音频。
[ECCV 2026] 论文LiveWorld的官方实现:生成式视频世界模型中模拟视野外动态
从头逐步实现 Google Veo 3 架构
ICML 2025 - 不可能的视频
EvoWorld:基于显式 3D 记忆的进化全景世界生成
运动脉搏:从视觉动态中测量物理帧率
用于 Veo 3.1 视频生成的 ComfyUI 自定义节点——通过 MuAPI 实现文本到视频、图像到视频、参考到视频、扩展和 4K 放大
"GeminiGen AI" API文档——将您的创意转化为惊艳的AI生成图像、视频和语音。
AI 视频和图像创作平台,支持文生视频、视频转视频、修复和实时编辑。
数据来源:GitHub API · 人工精选 · 实时同步