每日 Harness 开源 · Source
返回本期 · Back to 2026-06-23

论文 · Papers2026-06-23 · Tuesday, June 23, 2026

Characterizing Narrative Content in Web-scale LLM Pretraining Data

arxiv.org原文 ↗

Characterizing Narrative Content in Web-scale LLM Pretraining Data
论文从叙事理论出发,分析 Dolma 这个 3 万亿 token 开放预训练语料里的 agency、setting 和 events 等叙事结构。作者先人工标注 400 段文本,训练 RoBERTa-based NarraBERT,再扩展标注 300 万段形成 NarraDolma;框架覆盖 11 个可解释维度。它把“预训练数据有什么叙事偏向”变成可测数据集问题,也指出现有 curation 流程没有显式衡量这些分布差异。
浏览

评论 · Comments