Video2LoRA: Parametric Video Internalization for Vision-Language Models
arxiv.org原文 ↗
Video2LoRA 用 perceiver hypernetwork 读取冻结 VLM 编码视频时的中间表示,一次前向直接生成 LoRA adapter,不做迭代微调。查询阶段同一个 frozen VLM 只看 adapter,不再把视频 visual tokens 塞进上下文。它在 SmolVLM2 500M 和 2.2B 上训练,五个 captioning benchmarks 全 scale 达到与 video-in-context inference 统计 non-inferior/equivalent;虽然只用 12 frames、384px 训练,仍可稳定到 1,024 frames 和 1024px,并把 answer-time visual-token load 最多降 1,500x。
–浏览
评论 · Comments