jundot/omlx
github.com原文 ↗
oMLX 在 Apple Silicon 上实现连续批处理、共享前缀与写时复制缓存,并把 KV 状态分成内存热层和可跨重启保留的 SSD 冷层,同时暴露 OpenAI 与 Anthropic 兼容 API。README 报告 GLM 5.2 专用内核在 M3 Ultra 上为 845 tok/s,对照路径为 29 tok/s;默认最大并发为 8,内存保护线约为物理 RAM 减 8 GB。数字来自项目自测,多 Mac 扩展仍标为实验性,但单机服务的机制覆盖相当完整。
–浏览
评论 · Comments