主题 · Topic
2.2 蒸馏与压缩Distillation & Compression
本主题共 13 条 · 最早 2026-06-04 · 最新 2026-08-17
2026 年 8 月4
-
DeepSeek V4 Flash 56.8GB MoEspressoV2
这份权重将 DeepSeek V4 Flash Coder 压缩到约 56.8GB,目标是在降低本地存储和显存门槛后保留推理、工具调用与代码能力。MoEspressoV2 面向 MoE 模型的紧凑部署,并非重新训练一套独立架构。是否真正划算要看目标硬件上的吞吐、激活内存和任务回归,因为文件体积本身不能说明压缩损失。
原文 ↗– -
Shoehorn
Shoehorn 读取 BF16 GGUF 与 importance matrix,先从显存预算扣除 KV cache、计算区和预留,再用加权误差为每个 tensor 选择量化档位,以拉格朗日加贪心求多选背包。示例在 519.2MiB 预算内使用 99.981%,只剩 103,424 字节,平均 7.306 bpw;Qwen3-0.6B 方案求解约 0.7 秒。精确预算和逐 tensor 误差权衡…
原文 ↗– -
Needle2
Needle2 把 14MB 模型定位在手机、可穿戴设备和嵌入式设备,内建工具调用与按 schema 抽取,而非追求长篇通用对话。如此小的包体有利于离线、隐私和启动延迟,不过发布条目没有给参数量、量化方式、端侧吞吐或基准集;目前最值得关注的是“专用 agentic 能力压进极小本地模型”的产品方向,而不是尚未展示的性能领先。
原文 ↗– -
MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents
MemOPD 记录每次调用的输入/采样输出,恢复原始位置和因果可见性后再让 teacher 打分,修补 memory rewriting 让 teacher 看到 student 从未经历状态的问题。匹配控制中 F1 提高 7.0%;MemOPD-3B 相对 PPO 的最高提升为 416.2%,序列打包使 actor 计算最高加速 1.63 倍。它把 on-policy 的定义从“动作来自该策略”…
原文 ↗–
2026 年 7 月3
-
A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents
论文系统比较代码代理 LoRA 微调中的轨迹数量、成功与失败样本、步骤过滤和难度分层。实验发现,约 2,000 条经过筛选的高质量轨迹即可接近更大数据集的收益,而盲目加入失败轨迹可能拉低表现。结论把注意力从“多收集交互”转向“保留哪些决策过程”,对低成本定制代码代理具有直接工程意义。
原文 ↗– -
cactus-compute/needle
needle 是一个 26M 参数 function-call 模型,仓库提供权重和数据生成流程。它把小模型放在工具调用这一窄任务上,而不是追求通用聊天覆盖。开源数据生成流程让它更适合被改造成私有工具调用模型,也方便复现 function-call 数据如何合成。
原文 ↗– -
The Illusion of Equivalency
论文分析 LLM 量化后的行为差异,指出总体准确率接近并不代表逐题行为等价。作者提出 decision-level correctness agreement,衡量原模型和量化模型在同一决策上是否同时答对或答错。它提醒部署侧不要只看压缩后平均分,因为用户遇到的是单个决策的稳定性。
原文 ↗–
2026 年 6 月6
-
OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
OPID 从 on-policy completed trajectories 中抽取 hindsight skills,episode-level skills 表示全局 workflow,step-level skills 覆盖关键局部决策。方法让旧策略在原始 context 与 skill-augmented context 下重算同一 response 的 log-probability…
原文 ↗– -
Skill-Guided Continuation Distillation for GUI Agents
SGCD 针对 GUI agent 在闭环执行中偏离专家轨迹后的状态没有监督这一问题。方法先让原策略运行几步到真实 off-trajectory states,再用技能引导策略完成任务,把 continuation plans、critical targets、failure traps 和 success criteria 生成的成功后续混入训练。它在 OSWorld-Verified 上把三个…
原文 ↗– -
Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents
S2L 把 SKILL.md 从运行时长文本变成 skill-specific LoRA adapter。离线阶段用完整 skill 文档合成 demonstrations,在线阶段省去文档注入,动态加载 adapter 来激活对应行为。Qwen3.6-27B 在 21 个 SWE-Skills-Bench skill 子集上,相对 no-skill 和 Full Skill Text pass…
原文 ↗– -
Prompt-Level Distillation: A Non-Parametric Alternative to Model Fine-Tuning for Efficient Reasoning
PLD 把 teacher 的推理模式抽取成结构化 system prompt 指令,让小模型不经参数更新就获得更强决策逻辑。作者用 Gemma-3 4B 在 StereoSet 和 Contract-NLI 上测试,Macro F1 分别从 57% 到 90.0%、从 67% 到 83%。这不是“让 prompt 更长”的简单技巧,而是把 fine-tuning 的一部分功能移到可审阅、可修改的…
原文 ↗– -
Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents
Open-SWE-Traces 发布 207,489 条软件工程 agent 轨迹,覆盖九种语言和 20,000 个真实 PR。数据通过 OpenHands 与 SWE-agent harness 生成,结合 Minimax-M2.5 的 thinking traces 与 Qwen3.5-122B 的 non-thinking traces,并过滤到 MIT、Apache、BSD 等宽松许可证来…
原文 ↗– -
What Makes Interaction Trajectories Effective for Training Terminal Agents?
研究 terminal-agent post-training 中,强教师是否必然给出更好的训练轨迹。作者用 Terminal-Lego 把真实 multi-domain issue 转成可环境验证任务,发现 Claude Opus 4.6 虽在 Terminal-Bench 2.0 分数更高,但 DeepSeek-V3.2 轨迹微调出的学生泛化更强。关键解释是 Environment-Groun…
原文 ↗–