Compression is prediction
ngrok.com原文 ↗
文章从码长 `-log₂ p` 出发说明:预测器给真实下一符号的概率越高,熵编码所需位数越少,因此预测质量与无损压缩存在严格对应,而非泛泛类比。传统压缩器和语言模型都在寻找可利用结构,区别主要在概率模型与计算预算;next-token loss 也可读成平均编码成本。这个视角值得保留,因为它能用可测压缩率讨论模型是否真正学到分布,却不能把“压得好”直接等同于所有下游智能能力。
–浏览
评论 · Comments