每日 Harness 开源 · Source
返回本期 · Back to 2026-06-06

论文 · Papers2026-06-06 · Saturday, June 6, 2026

Video2LoRA: Parametric Video Internalization for Vision-Language Models

arxiv.org原文 ↗

Video2LoRA: Parametric Video Internalization for Vision-Language Models
Video2LoRA 用 perceiver hypernetwork 读取冻结 VLM 编码视频时的中间表示,一次前向直接生成 LoRA adapter,不做迭代微调。查询阶段同一个 frozen VLM 只看 adapter,不再把视频 visual tokens 塞进上下文。它在 SmolVLM2 500M 和 2.2B 上训练,五个 captioning benchmarks 全 scale 达到与 video-in-context inference 统计 non-inferior/equivalent;虽然只用 12 frames、384px 训练,仍可稳定到 1,024 frames 和 1024px,并把 answer-time visual-token load 最多降 1,500x。
浏览

评论 · Comments