每日 Harness 开源 · Source
主题 · All topics

2.2 蒸馏与压缩Distillation & Compression

本主题共 9 条 · 最早 2026-06-04 · 最新 2026-07-23

视图 · View

2026 年 7 月3

  • A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents

    论文系统比较代码代理 LoRA 微调中的轨迹数量、成功与失败样本、步骤过滤和难度分层。实验发现,约 2,000 条经过筛选的高质量轨迹即可接近更大数据集的收益,而盲目加入失败轨迹可能拉低表现。结论把注意力从“多收集交互”转向“保留哪些决策过程”,对低成本定制代码代理具有直接工程意义。

    Paper2026-07-23arxiv.org原文 ↗
  • cactus-compute/needle

    needle 是一个 26M 参数 function-call 模型,仓库提供权重和数据生成流程。它把小模型放在工具调用这一窄任务上,而不是追求通用聊天覆盖。开源数据生成流程让它更适合被改造成私有工具调用模型,也方便复现 function-call 数据如何合成。

    Trending2026-07-16github.com原文 ↗
  • The Illusion of Equivalency

    论文分析 LLM 量化后的行为差异,指出总体准确率接近并不代表逐题行为等价。作者提出 decision-level correctness agreement,衡量原模型和量化模型在同一决策上是否同时答对或答错。它提醒部署侧不要只看压缩后平均分,因为用户遇到的是单个决策的稳定性。

    Paper2026-07-11arxiv.org原文 ↗

2026 年 6 月6

  • OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

    OPID 从 on-policy completed trajectories 中抽取 hindsight skills,episode-level skills 表示全局 workflow,step-level skills 覆盖关键局部决策。方法让旧策略在原始 context 与 skill-augmented context 下重算同一 response 的 log-probability…

    Paper2026-06-27arxiv.org原文 ↗
  • Skill-Guided Continuation Distillation for GUI Agents

    SGCD 针对 GUI agent 在闭环执行中偏离专家轨迹后的状态没有监督这一问题。方法先让原策略运行几步到真实 off-trajectory states,再用技能引导策略完成任务,把 continuation plans、critical targets、failure traps 和 success criteria 生成的成功后续混入训练。它在 OSWorld-Verified 上把三个…

    Paper2026-06-19arxiv.org原文 ↗
  • Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents

    S2L 把 SKILL.md 从运行时长文本变成 skill-specific LoRA adapter。离线阶段用完整 skill 文档合成 demonstrations,在线阶段省去文档注入,动态加载 adapter 来激活对应行为。Qwen3.6-27B 在 21 个 SWE-Skills-Bench skill 子集上,相对 no-skill 和 Full Skill Text pass…

    Paper2026-06-17arxiv.org原文 ↗
  • Prompt-Level Distillation: A Non-Parametric Alternative to Model Fine-Tuning for Efficient Reasoning

    PLD 把 teacher 的推理模式抽取成结构化 system prompt 指令,让小模型不经参数更新就获得更强决策逻辑。作者用 Gemma-3 4B 在 StereoSet 和 Contract-NLI 上测试,Macro F1 分别从 57% 到 90.0%、从 67% 到 83%。这不是“让 prompt 更长”的简单技巧,而是把 fine-tuning 的一部分功能移到可审阅、可修改的…

    Paper2026-06-17arxiv.org原文 ↗
  • Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents

    Open-SWE-Traces 发布 207,489 条软件工程 agent 轨迹,覆盖九种语言和 20,000 个真实 PR。数据通过 OpenHands 与 SWE-agent harness 生成,结合 Minimax-M2.5 的 thinking traces 与 Qwen3.5-122B 的 non-thinking traces,并过滤到 MIT、Apache、BSD 等宽松许可证来…

    Paper2026-06-17arxiv.org原文 ↗
  • What Makes Interaction Trajectories Effective for Training Terminal Agents?

    研究 terminal-agent post-training 中,强教师是否必然给出更好的训练轨迹。作者用 Terminal-Lego 把真实 multi-domain issue 转成可环境验证任务,发现 Claude Opus 4.6 虽在 Terminal-Bench 2.0 分数更高,但 DeepSeek-V3.2 轨迹微调出的学生泛化更强。关键解释是 Environment-Groun…

    Paper2026-06-04arxiv.org原文 ↗