Wan 2.2

开源多模态 & 视觉⭐ 16k

开源大规模视频生成模型，16K+ stars。支持高质量文本到视频和图像到视频生成，是开源视频生成领域的最新标杆

🎯适用场景：开源视频生成，适用于内容创作、广告制作、教育视频

#视频生成#文生视频#开源#AIGC

访问工具

📊 仓库数据

Stars15,855

✅ 优点

•开源可自部署，无需付费 API，数据隐私有保障
•支持文生视频和图生视频两种模式

⚠️ 限制

•对 GPU 显存要求高，消费级显卡推理困难
•生成质量和 Sora/可灵等闭源方案仍有差距

🔗 相关工具

Open Generative AI

开源⭐ 17k↑+30

github.com/Anil-matcha/Open-Generative-AI

Open Generative AI 是 Higgsfield AI、Freepik AI、Krea AI、Openart AI 的开源替代方案。提供免费的、无限制的 AI 图像和视频生成工作室，集成 200+ 模型（Flux、Midjourney、Kling、Sora、Veo 等）。无内容过滤器，完全自部署，MIT 许可证。GitHub 7,993 stars，本周增长 2,417 星。与商业图像生成平台不同，Open Generative AI 完全开源且无内容限制——用户可以在本地运行所有模型，不受任何平台的审查或限制。适合需要完整 AI 生成能力且对内容无限制的用户。

🎯 多模态内容理解与生成

#开源#图像生成#视频生成#200+ 模型+3

语言JavaScript

🍴 Forks2,794

📅 上线2025/8/15

🔄 更新2026/5/23

CogVideo

开源⭐ 13k

github.com/zai-org/CogVideo

智谱开源的文本/图像到视频生成模型，13K+ stars。包括 CogVideoX (2024) 和 CogVideo (ICLR 2023)，是开源视频生成的重要方案

🎯 开源视频生成研究，视频内容创作，AI 视频模型微调

#视频生成#文生视频#智谱#ICLR

Sora 2

付费

openai.com/sora

OpenAI 的旗舰级视频生成模型，基于 Diffusion Transformer 架构。支持最长 60 秒视频生成，在物理模拟（流体、光影、碰撞）方面表现卓越。通过 ChatGPT Plus/Pro 订阅可用，是 2026 年质量最高的文生视频模型。

🎯 多模态内容理解与生成

#视频生成#文生视频#商用#Diffusion Transformer+1

🔄 更新2026/4/30

Stable Diffusion WebUI

开源⭐ 163k↑+5

github.com/AUTOMATIC1111/stable-diffusion-webui

最流行的 Stable Diffusion Web UI，162,491+ stars。提供直观的图形界面，支持文生图、图生图、ControlNet、LoRA 微调、Inpainting 等核心功能，是 AI 图像生成领域的事实标准工具

🎯 大模型微调与训练、多模态内容理解与生成

#图像生成#Stable Diffusion#Web UI#开源

语言Python

🍴 Forks30,356

🔄 更新2026/5/23

ComfyUI

开源⭐ 114k↑+19

github.com/comfyanonymous/ComfyUI

节点式 Diffusion 模型 GUI，109,363+ stars。基于节点的工作流编排，可视化连接各处理模块，是最强大的图像生成工作流工具，支持 SDXL、Flux、Stable Cascade 等最新模型

🎯 AI 工作流编排与自动化、多模态内容理解与生成

#节点式#工作流#图像生成#开源

语言Python

🍴 Forks13,355

🔄 更新2026/5/23

OpenCV

开源⭐ 88k

github.com/opencv/opencv

开源计算机视觉库，87,181+ stars。全球最广泛使用的计算机视觉库，提供 2500+ 优化算法，涵盖图像处理、目标检测、人脸识别、相机标定等领域。支持 C++、Python、Java，是 AI 视觉应用的基石。

🎯 多模态内容理解与生成

#计算机视觉#图像处理#目标检测#开源

语言C++

🍴 Forks56,575

📅 上线2012/5/1

🔄 更新2026/5/22

← 浏览全部 464 个工具