kvcache-ai/ktransformers
github.com原文 ↗
KTransformers 是面向异构 LLM 推理与微调实验的框架,通过可替换算子把模型的不同部分分配到 CPU、GPU 等设备。它特别关注显存不足场景下的权重放置、KV cache 和高性能 CPU kernel,使超大模型能在消费级硬件组合上运行。灵活调度带来更复杂的性能调优,最佳配置会随模型结构和内存带宽显著变化。
–浏览
github.com原文 ↗
评论 · Comments