VAR 图像生成速查:310M 到 2.3B 的六档模型选型与推理调参
【免费下载链接】VAR[NeurIPS 2024 Best Paper Award][GPT beats diffusion🔥] [scaling laws in visual generation📈] Official impl. of "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". An *ultra-simple, user-friendly yet state-of-the-art* codebase for autoregressive image generation!项目地址: https://gitcode.com/GitHub_Trending/va/VAR
想做 VAR 图像生成?这份速查面向新手和普通开发者:VAR 是 NeurIPS 2024 最佳论文《Visual Autoregressive Modeling》的官方开源实现,用 next-scale prediction(下一尺度预测)做自回归图像生成,覆盖安装、6 个模型选型与推理调参。
🚀 先跑起来:VAR 安装与首次采样
- 获取代码:clone 仓库(地址见文末资源清单)。
- 装依赖:先装
torch>=2.0.0,再执行pip3 install -r requirements.txt补齐其余包。 - 备数据(仅训练需要):纯采样可跳过;若训练,按 utils/data.py 描述的方式把 ImageNet 整理成 train/val 两级目录,并通过
--data_path传入路径。 - 下权重:模型权重托管在 Hugging Face 的
FoundationVision/var;生成图像前必须先下载 VAE 权重vae_ch160v4096z32.pth。 - 可选加速:
flash-attn与xformers可加快注意力计算,环境里装好后代码会自动启用。
以上步骤完成后,即可加载任意档位模型开始生成,推理入口与参数含义见后文。
📊 VAR 模型选型对比:按算力预算挑哪档
VAR 家族共 6 个官方模型,覆盖 256×256 与 512×512 两档分辨率。FID 是衡量生成图与真实图像分布差异的常用指标,数值越低越好:
| 模型名 | 参数规模 | 输出分辨率 | FID | 算力开销(相对值) |
|---|---|---|---|---|
| VAR-d16 | 310M | 256×256 | 3.55 | 0.4 |
| VAR-d20 | 600M | 256×256 | 2.95 | 0.5 |
| VAR-d24 | 1.0B | 256×256 | 2.33 | 0.6 |
| VAR-d30 | 2.0B | 256×256 | 1.97 | 1.0 |
| VAR-d30-re | 2.0B | 256×256 | 1.80 | 1.0 |
| VAR-d36 | 2.3B | 512×512 | 2.63 | - |
小档位里 VAR-d16 是唯一不足 5 亿参数的成员,算力开销仅 0.4,FID 为 3.55,适合先打通流程、熟悉代码结构。中档有两个:VAR-d20(600M)把 FID 压到 2.95;VAR-d24(1.0B)进一步降到 2.33,开销仅 0.6,是 256 分辨率下三者里最均衡的一档。大档中 VAR-d30 用 2.0B 参数对应 FID 1.97;其改进版 VAR-d30-re 参数同为 2.0B,质量推进到 1.80,是 256×256 上目前最好的成绩,算力开销不变。高分辨率档只有 VAR-d36,2.3B 参数,输出尺寸翻倍到 512×512,FID 为 2.63,面向看重细节的场景。
三条建议:
- 预算紧张 / 单卡:选 VAR-d16,算力开销 0.4,最快拿到正反馈;
- 质量与开销平衡:选 VAR-d24,0.6 的开销换来 FID 2.33,单位算力回报最高;
- 追求最优质量:256×256 用 VAR-d30-re(FID 1.80),512×512 用 VAR-d36。
🧠 next-scale prediction 三分钟看懂
传统自回归图像生成沿光栅扫描顺序(next-token prediction)逐个 token 预测,一张图要串联几千个 token。VAR 把问题改写为"下一尺度预测":模型先预测图像最粗糙的低分辨率表示,再以粗尺度为条件预测下一层更细的尺度,如此由粗到细推进,直到达到目标分辨率。每步只需决定整个尺度,而非几千个零散 token,自回归步数明显更少。
与扩散模型相比,二者路线不同:扩散从纯噪声出发反复去噪才得到图像;VAR 逐级直接预测离散 token 表示,没有迭代去噪环节。这种结构与 GPT 式语言模型对齐,训练和推理可以复用成熟的自回归技术栈——在 ImageNet 图像生成这一基准上,GPT 风格模型也是由此首次超过扩散模型。
第三个关键特性是缩放规律:FID 随参数增长呈稳定的幂律下降,"加多少参数换多少质量"可以大致外推。这是上方选型表的量化依据,也让社区能持续把这套架构迁移到其他视觉任务。
⚙️ VAR 推理调参建议:cfg、top_p、top_k 怎么配
采样入口是 models/var.py 中的autoregressive_infer_cfg:
from models.var import VAR model = VAR.from_pretrained("FoundationVision/var", model_name="var_d30.pth") model.eval() samples = model.autoregressive_infer_cfg( cfg=1.5, top_p=0.96, top_k=900, more_smooth=False )cfg:引导强度,决定图像锐利度与样本多样性的取舍;FID 评测用 1.5,想要更锐利的细节可试 5.0。top_p:核采样阈值,0.96 表示只在累计概率达到 96% 的 token 内采样,过滤低概率噪声。top_k:每步只保留概率最高的 900 个候选,与 top_p 共同约束随机性。more_smooth:默认 False 面向 FID 评测;改为 True 图像更平滑、观感更好,适合日常演示。- 想自评 FID:生成 50,000 张图(每类 50 张),以 PNG(而非 JPEG)保存,再用 utils/misc.py 的
create_npz_from_sample_folder打包成 npz 后评估。
📈 缩放趋势判断与资源清单
往后看,VAR 的参数—FID 下降曲线尚未见平台,更大模型仍有空间;同一套"下一尺度"框架已被作者扩展到文本生成图像(Infinity)与文本生成视频(InfinityStar)。建议:先复现 d16 小模型验证环境,再依据选型表决定加多大。
资源清单:
- 克隆仓库:
git clone https://gitcode.com/GitHub_Trending/va/VAR - 模型定义与推理入口:models/var.py
- 基础架构实现:models/basic_var.py
- 训练入口:train.py
【免费下载链接】VAR[NeurIPS 2024 Best Paper Award][GPT beats diffusion🔥] [scaling laws in visual generation📈] Official impl. of "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". An *ultra-simple, user-friendly yet state-of-the-art* codebase for autoregressive image generation!项目地址: https://gitcode.com/GitHub_Trending/va/VAR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考