Characterizing Narrative Content in Web-scale LLM Pretraining Data
arxiv.org原文 ↗
论文从叙事理论出发,分析 Dolma 这个 3 万亿 token 开放预训练语料里的 agency、setting 和 events 等叙事结构。作者先人工标注 400 段文本,训练 RoBERTa-based NarraBERT,再扩展标注 300 万段形成 NarraDolma;框架覆盖 11 个可解释维度。它把“预训练数据有什么叙事偏向”变成可测数据集问题,也指出现有 curation 流程没有显式衡量这些分布差异。
–浏览
评论 · Comments