每日 Harness 开源 · Source
返回本期 · Back to 2026-06-06

论文 · Papers2026-06-06 · Saturday, June 6, 2026

LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs

arxiv.org原文 ↗

LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs
PropMe 明确区分“被 prefix attack 逼出训练数据”的最坏情况能力和“普通使用中是否倾向泄露”的 propensity。它用 SimpleTrace 基于 infini-gram 将生成内容确定性归因到大规模语料,并同时计算 verbatim、near-verbatim、propensity-transformed memorization metrics。实验覆盖 Comma 与 DFM Decoder、Common Pile 与 Dynaword、两种语言,发现 prefix attacks 的泄露信号明显强于 generic 或 dataset-specific prompts,memorization audit 因此不应只报 extractability。
浏览

评论 · Comments