EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs
arxiv.org原文 ↗
EntropyMoE 用动态 byte patch 作为路由基本单元,把 patch 熵和长度同时交给 Top-K expert router,并按覆盖的 byte 数计算稀疏工作量。它在匹配的 dense/sparse 基线上得到最低 held-out bits-per-byte,同时下游准确率相近。亮点是将 tokenizer-free 模型已有的语义复杂度信号直接转成条件计算坐标,而不是另造一个路由特征。
–浏览
评论 · Comments