一、主力线路 · H100 + SageAttention(int8)· 最高 12 秒
步速对基线砍半、比官方 API 便宜 3 倍以上;安全域实测 ≤12 秒(294 帧),超过塌方。
8 秒 主力 $0.16
| 配置 | H100 · sage int8 (sm90) · Turbo LoRA 8 步 · 11.4s/步 |
| 时长/帧 | 8.0s · 192 帧 · 采样 91s |
下载 MP4
10 秒 主力 $0.21
| 配置 | H100 · sage int8 (sm90) · Turbo LoRA 8 步 · 16.2s/步 |
| 时长/帧 | 10.12s · 243 帧 · 采样 130s |
下载 MP4
12 秒 主力 · 时长上限 $0.28
| 配置 | H100 · sage int8 (sm90) · Turbo LoRA 8 步 · 21.7s/步 |
| 时长/帧 | 12.25s · 294 帧 · 采样 173s · 安全域边界 |
下载 MP4
二、RTX 5090 实验线 · fp8 权重(国内云 ¥3/时)
32G 显存逼出的 fp8 DiT 档,同种子可与主力线直接对钊画质;速度 ~3× 慢但单条成本再砍 4 倍。基线配置(SDPA attention),加速三牌未叠。
8 秒 · 5090 fp8 质量过检 $0.037
| 配置 | RTX 5090 · fp8_scaled DiT · pytorch attention · Turbo LoRA 8 步 · 33.0s/步 |
| 时长/帧 | 8.0s · 192 帧 · 全程 313s · 与主力线 8 秒版同种子,可逐帧对比 fp8 损失 |
下载 MP4
12 秒 · 5090 fp8 质量过检 $0.069
| 配置 | RTX 5090 · fp8_scaled DiT · pytorch attention · Turbo LoRA 8 步 · 68.2s/步 |
| 时长/帧 | 12.25s · 294 帧 · 全程 591s · 与主力线 12 秒版同种子 |
下载 MP4
三、15 秒档 · 保留不推荐(溢价档)
15.08s = 362 帧,平方律 + sage 塌方双重惩罚;真需要 15 秒不间断才用。
H100 + flash 15s 档最优 $0.72
| 配置 | H100 · FlashAttention(FA2 系, bf16) · Turbo LoRA 8 步 · 56.9s/步 |
| 时长/帧 | 15.08s · 362 帧 · 墙钟 533s |
下载 MP4
B200 + flash 赶时间档 $1.01
| 配置 | B200 · FlashAttention(FA2 系, bf16) · Turbo LoRA 8 步 · 46.9s/步 |
| 时长/帧 | 15.08s · 362 帧 · 墙钟 509s · 最快墙钟但 +40% 价 |
下载 MP4
B200 + sage 无优势 $0.85
| 配置 | B200 · sage int8 (sm89 代内核) · Turbo LoRA 8 步 · 48.3s/步 |
| 时长/帧 | 15.08s · 362 帧 · 质量干净但比 flash 还慢 3% |
下载 MP4
H100 + sage 15 秒 塌方警示样本 · 禁用 $0.48
| 配置 | H100 · sage int8 (sm90) · Turbo LoRA 8 步 · 30.2s/步(速度最快但质量报废) |
| 病理 | int8 长序列数值劣化:7.5s 起白背景现条纹 → 14.5s 全帧噪声。主力线路限 12s 的原因。 |
下载 MP4
四、步数对比 · 旧产线存档(15s / H100 / 未优化镜像)
满血 50 步 质量上限参照 $4.30
| 配置 | H100 · pytorch attention · 50 步无 LoRA · 62s/步 · 墙钟 52 分钟 |
下载 MP4
Turbo 4 步 草稿档 $0.45
| 配置 | H100 · pytorch attention · Turbo LoRA 4 步 · 有可感质量损失 |
下载 MP4
对照基准:官方 API 768p 按 0.5 元/秒线性计价(8s≈$0.55 · 12s≈$0.83 · 15s≈$1.04)。
主力线路在 ≤12s 域内约为 API 价格的 30%。音轨均为模型联合生成。
所有 15s 条目与主力条目同种子同提示词,可直接互相对比。