Wan 2.2

开源多模态 & 视觉16k

开源大规模视频生成模型,16K+ stars。支持高质量文本到视频和图像到视频生成,是开源视频生成领域的最新标杆

🎯适用场景:开源视频生成,适用于内容创作、广告制作、教育视频

#视频生成#文生视频#开源#AIGC

📊 仓库数据

Stars15,855

优点

  • 开源可自部署,无需付费 API,数据隐私有保障
  • 支持文生视频和图生视频两种模式

⚠️ 限制

  • 对 GPU 显存要求高,消费级显卡推理困难
  • 生成质量和 Sora/可灵等闭源方案仍有差距

🔗 相关工具

Open Generative AI

开源17k↑+30

github.com/Anil-matcha/Open-Generative-AI

Open Generative AI 是 Higgsfield AI、Freepik AI、Krea AI、Openart AI 的开源替代方案。提供免费的、无限制的 AI 图像和视频生成工作室,集成 200+ 模型(Flux、Midjourney、Kling、Sora、Veo 等)。无内容过滤器,完全自部署,MIT 许可证。GitHub 7,993 stars,本周增长 2,417 星。与商业图像生成平台不同,Open Generative AI 完全开源且无内容限制——用户可以在本地运行所有模型,不受任何平台的审查或限制。适合需要完整 AI 生成能力且对内容无限制的用户。

🎯 多模态内容理解与生成

#开源#图像生成#视频生成#200+ 模型+3
语言JavaScript
🍴 Forks2,794
📅 上线2025/8/15
🔄 更新2026/5/23

CogVideo

开源13k

github.com/zai-org/CogVideo

智谱开源的文本/图像到视频生成模型,13K+ stars。包括 CogVideoX (2024) 和 CogVideo (ICLR 2023),是开源视频生成的重要方案

🎯 开源视频生成研究,视频内容创作,AI 视频模型微调

#视频生成#文生视频#智谱#ICLR

Sora 2

付费

openai.com/sora

OpenAI 的旗舰级视频生成模型,基于 Diffusion Transformer 架构。支持最长 60 秒视频生成,在物理模拟(流体、光影、碰撞)方面表现卓越。通过 ChatGPT Plus/Pro 订阅可用,是 2026 年质量最高的文生视频模型。

🎯 多模态内容理解与生成

#视频生成#文生视频#商用#Diffusion Transformer+1
🔄 更新2026/4/30

Stable Diffusion WebUI

开源163k↑+5

github.com/AUTOMATIC1111/stable-diffusion-webui

最流行的 Stable Diffusion Web UI,162,491+ stars。提供直观的图形界面,支持文生图、图生图、ControlNet、LoRA 微调、Inpainting 等核心功能,是 AI 图像生成领域的事实标准工具

🎯 大模型微调与训练、多模态内容理解与生成

#图像生成#Stable Diffusion#Web UI#开源
语言Python
🍴 Forks30,356
🔄 更新2026/5/23

ComfyUI

开源114k↑+19

github.com/comfyanonymous/ComfyUI

节点式 Diffusion 模型 GUI,109,363+ stars。基于节点的工作流编排,可视化连接各处理模块,是最强大的图像生成工作流工具,支持 SDXL、Flux、Stable Cascade 等最新模型

🎯 AI 工作流编排与自动化、多模态内容理解与生成

#节点式#工作流#图像生成#开源
语言Python
🍴 Forks13,355
🔄 更新2026/5/23

OpenCV

开源88k

github.com/opencv/opencv

开源计算机视觉库,87,181+ stars。全球最广泛使用的计算机视觉库,提供 2500+ 优化算法,涵盖图像处理、目标检测、人脸识别、相机标定等领域。支持 C++、Python、Java,是 AI 视觉应用的基石。

🎯 多模态内容理解与生成

#计算机视觉#图像处理#目标检测#开源
语言C++
🍴 Forks56,575
📅 上线2012/5/1
🔄 更新2026/5/22