Cactus 把工具调用、设备控制和结构化抽取做成 14MB 单体模型,45M 参数用 2-bit 压缩,完整会话约 28MB RAM。它在 Raspberry Pi 5 约 500 tok/s,在 Vision Pro/Quest 3S 约 400 - 1,500 tok/s,目标是低价手机和微控制器而非通用对话。与 230M - 350M 级小模型交替胜出,说明端侧 agent 的瓶颈可以从“推理能力”收缩到可靠的检索、参数组装和 JSON 输出。
–浏览
评论 · Comments