Beyond Truncation: Rethinking LLM Decoding as Ensemble Pruning
arxiv.org原文 ↗
ME-Decoding 用自适应核从 token embedding 建相似度矩阵,再以 Mahalanobis 目标做子集优化和贪心剪枝。作者声称早停下近线性复杂度并给出理论近似保证,因而能作为低侵入的 plug-in;真正的收益来自减少语义重复,而不是简单提高温度。
–浏览
arxiv.org原文 ↗
评论 · Comments