Cactus Hybrid
github.com原文 ↗
Cactus Hybrid 对端侧 Gemma 3 270M 做后训练,让模型在生成答案之外输出置信分数,并把低置信请求转交云端大模型。README 报告该路由可在保持任务质量的同时把 60% - 90% 请求留在设备侧,降低延迟和云调用成本。它把 hybrid inference 的关键从固定规则改为模型自评,但置信度校准会直接决定错误放行率。
–浏览
github.com原文 ↗
评论 · Comments