Apple Silicon and macOS VMs: Faster LLM Inference with llama.cpp
github.com原文 ↗
Cua 发现 `Virtualization.framework` 的 guest GPU 保守报告 Apple family 5、32KB threadgroup memory,令 llama.cpp 退回慢 Metal kernel,于是做了仅注入单一 guest 进程的 capability shim,把两个回答改为 family 9 和 64KB。M1 Ultra 上 TinyLlama prompt 从 431.86 升至 4,786.70 tok/s,generation 从 12.63 升至 206.60 tok/s;Gemma 4 12B 的解码也从 3.41 到 49.67 tok/s。该方法没有做 PCI/GPU 直通,且依赖私有、版本敏感行为,只在一台主机和三种 llama.cpp 模型验证;MLX-LM 基本不变,说明收益来自特定 kernel 选择瓶颈。
–浏览
评论 · Comments