LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs
arxiv.org原文 ↗
PropMe 明确区分“被 prefix attack 逼出训练数据”的最坏情况能力和“普通使用中是否倾向泄露”的 propensity。它用 SimpleTrace 基于 infini-gram 将生成内容确定性归因到大规模语料,并同时计算 verbatim、near-verbatim、propensity-transformed memorization metrics。实验覆盖 Comma 与 DFM Decoder、Common Pile 与 Dynaword、两种语言,发现 prefix attacks 的泄露信号明显强于 generic 或 dataset-specific prompts,memorization audit 因此不应只报 extractability。
–浏览
评论 · Comments