Can gzip be a language model?
nathan.rs原文 ↗
作者用 tiny Shakespeare 语料填充 gzip 的 32KiB 窗口,再按压缩长度给候选续写打分;逐字节贪心信号太粗,于是用 beam search 选择可压缩字节串。生成结果不连贯却能复现语料片段,展示“压缩即隐含预测”如何在没有参数训练的情况下成立,也清楚暴露了局部匹配而非语义泛化的边界。
–浏览
nathan.rs原文 ↗
评论 · Comments