多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

如何用VideoFlexTok为生成式模型提供离散视频Token?应用场景与集成指南

如何用VideoFlexTok为生成式模型提供离散视频Token?应用场景与集成指南 如何用VideoFlexTok为生成式模型提供离散视频Token应用场景与集成指南【免费下载链接】videoflextok_d18_d28项目地址: https://ai.gitcode.com/hf_mirrors/EPFL-VILAB/videoflextok_d18_d28VideoFlexTok 是由 EPFL VILAB 与 Apple 团队联合推出的视频分词器Video Tokenizer能把视频压缩成可变长度的离散视频 Token序列再还原成视频。它采用由粗到细coarse-to-fine的 Token 结构前面的 Token 承载语义与运动等抽象信息后面的 Token 补充细节。本文带你快速了解它的原理、3 步集成方法和典型应用场景帮你把它接入自己的生成式视频模型。VideoFlexTok 解决了什么问题传统视频分词器输出固定长度的 Token 序列想要高质量就必须处理海量 Token想要低算力就损失画质二选一。VideoFlexTok 的核心创新是嵌套可变长度由粗到细每个时刻的 256 个 Token 按重要性排序前 64 个就能表达视频的大致内容256 个才是完整细节自由截断你可以只保留前k个 Token例如 256 → 64获得更轻量的表示无需重新训练对生成模型友好离散 Token 像视频词汇表一样可直接喂给自回归 Transformer做类似 LLM 的逐 Token 预测。一句话总结Token 越少越抽象Token 越多越精细长度随你的算力预算自由伸缩。这个模型仓库里有什么本仓库是 VideoFlexTokd18_d28 版本的官方预训练权重结构非常简洁文件作用README.md模型说明与用法文档模型卡含安装、加载、编解码示例config.json模型结构与超参数配置VAE、编码器、量化器、解码器的完整定义model.safetensors预训练模型权重文件模型规格速览来自config.json项目数值说明输入规格256×256 约 8 FPS帧数需满足 T 1 K×16时间压缩16 帧 → 4 个 Token 时刻每个 Token 时刻对应 4 帧画面每时刻 Token 数最多 256 个可嵌套截断为任意更小的前缀词表大小64,000FSQ 有限标量量化级别 8×8×8×5×5×5编码器18 层 Transformerd18维度 1152输入 VAE 潜变量解码器28 层 Transformerd28维度 1792rectified flow 去噪重建视频 名字里的d18_d28即指编码器 18 层、解码器 28 层。快速集成3 步把视频变成 Token第 1 步加载模型from videoflextok.wrappers import VideoFlexTokFromHub model VideoFlexTokFromHub.from_pretrained(EPFL-VILAB/videoflextok_d18_d28).eval()若需离线使用可下载本仓库的model.safetensors权重文件仓库地址https://gitcode.com/hf_mirrors/EPFL-VILAB/videoflextok_d18_d28再按README.md中的load_safetensors方式加载。第 2 步编码视频为离散 Tokenfrom videoflextok.utils.demo import read_mp4 # 读取视频并自动采样至约 8 FPS得到 (3, T, 256, 256) 张量T 1 K*16 video_tensor read_mp4(./data/video.mp4, fps8) # 输出 Token 序列形状 [1, t, 256]t 1 K*416 帧压成 4 个时刻 tokens_list model.tokenize(video_tensor[None])第 3 步截断 Token 并解码回视频# 每时刻只保留前 64/256 个 Token表示更粗、更省算力 k_keep 64 tokens_list [t[..., :k_keep] for t in tokens_list] reconst model.detokenize( tokens_list, timesteps30, # 去噪步数 guidance_scale20., # 引导强度15~30 通常效果最佳 perform_norm_guidanceTrue, )三步完成视频 → 离散 Token → 视频的闭环。生成式模型接入时你只需要第 2 步产出的tokens_list即可作为训练/推理的离散输入。四大典型应用场景 自回归视频生成把 64,000 词表的视频 Token 当作词汇用 LLM 式自回归模型逐 Token 生成视频再经解码器渲染 视频理解与多模态 LLM将视频压缩为紧凑的 Token 序列直接输入语言模型实现视频问答、检索与摘要 变码率/自适应视频传输嵌套截断天然形成码率阶梯——带宽充足时传 256 个 Token紧张时只传 64 个无需多套编码器✂️ 视频编辑与可控生成保留粗粒度 Token语义、运动只重生成细粒度部分实现低成本的风格迁移与内容编辑。新手常见疑问 FAQ为什么帧数必须是 1 K×16视频按 17 帧滑动窗口分块重叠 1 帧16 帧正好压缩为 4 个 Token 时刻read_mp4工具已自动处理帧采样截断多少合适k_keep越小表示越抽象64 左右适合理解任务与低算力生成256 为完整细节解码参数怎么选去噪步数 30、引导强度 15~30常用 20是官方推荐起点支持多大分辨率当前模型固定 256×256、约 8 FPS输入前请用read_mp4等工具做好采样。许可与引用模型权重以Apache License 2.0发布可用于研究与商业场景。若在论文中引用本工作推荐 BibTeXarticle{videoflextok, title{{VideoFlexTok}: Flexible-Length Coarse-to-Fine Video Tokenization}, author{Andrei Atanov and Jesse Allardice and Roman Bachmann and Oğuzhan Fatih Kar and Peter Fu and David Griffiths and Devon Hjelm and Afshin Dehghan and Amir Zamir}, journal{arXiv 2026}, year{2026} }总结VideoFlexTok 用由粗到细 嵌套可变长度的设计为生成式视频模型提供了一个算力可伸缩的离散视频 Token 接口——3 步即可集成4 类场景即插即用。【免费下载链接】videoflextok_d18_d28项目地址: https://ai.gitcode.com/hf_mirrors/EPFL-VILAB/videoflextok_d18_d28创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表