ggml-org/llama.cpp
github.com原文 ↗
llama.cpp 是 C/C++ LLM inference 项目,目标是在本地和云端用最少依赖获得高性能推理。README 列出 Apple Silicon NEON/Accelerate/Metal、x86 AVX/AVX2/AVX512/AMX、RISC-V、CUDA/HIP/MUSA、Vulkan/SYCL、1.5-8 bit quantization、CPU+GPU hybrid inference 等支持;近期热点包括 HF cache migration、gpt-oss native MXFP4 和 multimodal llama-server。
–浏览
评论 · Comments