SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication
arxiv.org原文 ↗
SemHash-LLM 面向大规模文档去重,组合 MinHash 候选召回、对比学习语义表示和 LLM 判别,覆盖完全重复、局部重复和语义改写。多粒度设计是关键事实:它不是只在整篇文档上做相似度,而是同时处理片段和文档级别的重复。这个方向适合训练语料清洗,因为近重复数据会污染评测、放大记忆,并降低语料多样性。
–浏览
评论 · Comments