> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-chore-sync-comfy-api-v2-spec-463e218.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Kandinsky 5.0

> 本指南介绍如何在 ComfyUI 中使用 Kandinsky 5.0 视频生成工作流

[Kandinsky 5.0](https://huggingface.co/kandinskylab/Kandinsky-5.0-I2V-Lite-5s) 是由 [Kandinsky Lab](https://huggingface.co/kandinskylab) 开发的视频和图像生成扩散模型系列。Kandinsky 5.0 T2V Lite 是一个轻量级的 2B 参数模型，位居开源视频生成模型的前列，能够生成最长 10 秒的视频。

<Tip>
  <Tabs>
    <Tab title="本地用户">
      请确保你的 ComfyUI 已经更新。

      * [ComfyUI 下载](https://www.comfy.org/download)
      * [ComfyUI 更新教程](/zh/installation/update_comfyui)

      本指南里的工作流可以在[工作流模板](/zh/interface/features/template)中找到。如果找不到，可能是 ComfyUI 没有更新。

      如果加载工作流时有节点缺失，可能原因有：

      1. 你用的不是最新版（每夜版）。
      2. 启动时有些节点导入失败。
    </Tab>

    <Tab title="云端用户">
      * [Cloud](https://cloud.comfy.org) 会在 ComfyUI 稳定版本发布后更新。

      所以，如果你发现本文档中有任何核心节点缺失，可能是因为新核心节点尚未在最新稳定版中发布。请等待下一个稳定版发布。
    </Tab>
  </Tabs>
</Tip>

## 概述

Kandinsky 5.0 使用带有 Flow Matching 的潜在扩散管线，具有以下特点：

* **Diffusion Transformer (DiT):** 主要的生成骨干网络，带有对文本嵌入的交叉注意力
* **Qwen2.5-VL 和 CLIP:** 提供高质量的文本嵌入
* **HunyuanVideo 3D VAE:** 将视频编码和解码到潜在空间

该模型系列包含针对不同用例优化的多个变体：

* **SFT 模型：** 最高的生成质量
* **CFG-distilled:** 推理速度提升 2 倍
* **Diffusion-distilled:** 速度提升 6 倍且质量损失最小（16 步）
* **Pretrain 模型：** 为微调而设计

所有模型均提供 5 秒和 10 秒视频生成版本。

## 模型变体

| 模型                             | 视频时长     | NFE | 延迟 (H100)   |
| ------------------------------ | -------- | --- | ----------- |
| Kandinsky 5.0 T2V Lite SFT     | 5s / 10s | 100 | 139s / 224s |
| Kandinsky 5.0 T2V Lite no-CFG  | 5s / 10s | 50  | 77s / 124s  |
| Kandinsky 5.0 T2V Lite distill | 5s / 10s | 16  | 35s / 61s   |
| Kandinsky 5.0 I2V Lite         | 5s       | 100 | 673s        |

## 文生视频工作流

<h3 id="video_kandinsky5_t2v">
  Kandinsky 5.0 Video Lite 文生视频
</h3>

一个轻量级 2B 模型，可从英文和俄文提示词生成高视觉质量的视频。

<img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/video_kandinsky5_t2v-1.webp" alt="Kandinsky 5.0 Video Lite Text to Video workflow preview" />

<CardGroup cols={2}>
  <Card title="在 Comfy Cloud 上运行" icon="cloud" href="https://cloud.comfy.org/?template=video_kandinsky5_t2v&utm_source=docs&utm_medium=referral&utm_campaign=kandinsky-5">
    在 Comfy Cloud 中打开
  </Card>

  <Card title="下载工作流" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_kandinsky5_t2v.json">
    下载 JSON 或在模板库中搜索"Kandinsky 5.0 Video Lite Text to Video"
  </Card>
</CardGroup>

### 2. 手动下载模型

**文本编码器**

<CardGroup cols={2}>
  <Card title="Text Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors" icon="download" href="https://huggingface.co/Comfy-Org/HunyuanVideo_1.5_repackaged/blob/main/split_files/text_encoders/qwen_2.5_vl_7b_fp8_scaled.safetensors">
    Qwen2.5-VL 7B 文本编码器（FP8）。放入 <code>ComfyUI/models/text\_encoders/</code>
  </Card>

  <Card title="Text Encoder: clip_l.safetensors" icon="download" href="https://huggingface.co/comfyanonymous/flux_text_encoders/blob/main/clip_l.safetensors">
    CLIP-L 文本编码器。放入 <code>ComfyUI/models/text\_encoders/</code>
  </Card>
</CardGroup>

**Diffusion Model**

<Card title="Diffusion Model: kandinsky5lite_t2v_sft_5s.safetensors" icon="download" href="https://huggingface.co/kandinskylab/Kandinsky-5.0-T2V-Lite-sft-5s/blob/main/model/kandinsky5lite_t2v_sft_5s.safetensors">
  Kandinsky 5.0 T2V Lite SFT diffusion 模型（5s）。放入 <code>ComfyUI/models/diffusion\_models/</code>
</Card>

**VAE**

<Card title="VAE: hunyuan_video_vae_bf16.safetensors" icon="download" href="https://huggingface.co/Kijai/HunyuanVideo_comfy/blob/main/hunyuan_video_vae_bf16.safetensors">
  HunyuanVideo 3D VAE。放入 <code>ComfyUI/models/vae/</code>
</Card>

```
ComfyUI/
├── 📂 models/
│   ├── 📂 text_encoders/
│   │      ├── qwen_2.5_vl_7b_fp8_scaled.safetensors
│   │      └── clip_l.safetensors
│   ├── 📂 diffusion_models/
│   │      └── kandinsky5lite_t2v_sft_5s.safetensors
│   └── 📂 vae/
│          └── hunyuan_video_vae_bf16.safetensors
```

## 图生视频工作流

<h3 id="video_kandinsky5_i2v">
  Kandinsky 5.0 Video Lite 图生视频
</h3>

一个轻量级 2B 模型，可从英文和俄文提示词生成高视觉质量的视频。

<img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/video_kandinsky5_i2v-1.webp" alt="Kandinsky 5.0 Video Lite Image to Video workflow preview" />

<CardGroup cols={2}>
  <Card title="在 Comfy Cloud 上运行" icon="cloud" href="https://cloud.comfy.org/?template=video_kandinsky5_i2v&utm_source=docs&utm_medium=referral&utm_campaign=kandinsky-5">
    在 Comfy Cloud 中打开
  </Card>

  <Card title="下载工作流" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_kandinsky5_i2v.json">
    下载 JSON 或在模板库中搜索"Kandinsky 5.0 Video Lite Image to Video"
  </Card>
</CardGroup>

**输入素材**

将此文件上传到对应的 `LoadImage` 节点：

<CardGroup cols={2}>
  <Card title="crystal_flower.png" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/crystal_flower.png">
    `LoadImage` 节点 11 · `crystal_flower.png`
  </Card>
</CardGroup>

<div style={{display: 'grid', gridTemplateColumns: 'repeat(2, minmax(0, 1fr))', gap: '1rem', alignItems: 'start'}}>
  <img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/crystal_flower.png" alt="crystal_flower.png" style={{width: '100%', height: 'auto', objectFit: 'contain'}} />
</div>

### 2. 手动下载模型

**文本编码器**

<CardGroup cols={2}>
  <Card title="Text Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors" icon="download" href="https://huggingface.co/Comfy-Org/HunyuanVideo_1.5_repackaged/blob/main/split_files/text_encoders/qwen_2.5_vl_7b_fp8_scaled.safetensors">
    Qwen2.5-VL 7B 文本编码器（FP8）。放入 <code>ComfyUI/models/text\_encoders/</code>
  </Card>

  <Card title="Text Encoder: clip_l.safetensors" icon="download" href="https://huggingface.co/comfyanonymous/flux_text_encoders/blob/main/clip_l.safetensors">
    CLIP-L 文本编码器。放入 <code>ComfyUI/models/text\_encoders/</code>
  </Card>
</CardGroup>

**Diffusion Model**

<Card title="Diffusion Model: kandinsky5lite_i2v_5s.safetensors" icon="download" href="https://huggingface.co/kandinskylab/Kandinsky-5.0-I2V-Lite-5s/blob/main/model/kandinsky5lite_i2v_5s.safetensors">
  Kandinsky 5.0 I2V Lite diffusion 模型（5s）。放入 <code>ComfyUI/models/diffusion\_models/</code>
</Card>

**VAE**

<Card title="VAE: hunyuan_video_vae_bf16.safetensors" icon="download" href="https://huggingface.co/Kijai/HunyuanVideo_comfy/blob/main/hunyuan_video_vae_bf16.safetensors">
  HunyuanVideo 3D VAE。放入 <code>ComfyUI/models/vae/</code>
</Card>

```
ComfyUI/
├── 📂 models/
│   ├── 📂 text_encoders/
│   │      ├── qwen_2.5_vl_7b_fp8_scaled.safetensors
│   │      └── clip_l.safetensors
│   ├── 📂 diffusion_models/
│   │      └── kandinsky5lite_i2v_5s.safetensors
│   └── 📂 vae/
│          └── hunyuan_video_vae_bf16.safetensors
```

## 资源

* [HuggingFace 模型合集](https://huggingface.co/collections/kandinskylab/kandinsky-50-video-lite)
* [GitHub 仓库](https://github.com/ai-forever/Kandinsky-5)
* [ComfyUI 集成](https://github.com/ai-forever/Kandinsky-5/blob/main/comfyui/README.md)
* [项目主页](https://ai-forever.github.io/Kandinsky-5/)
