GeeeekExplorer/nano-vllm
github.com原文 ↗
nano-vllm 用约 1,200 行 Python 从头实现轻量 vLLM,保留离线推理、prefix caching、tensor parallelism、torch compilation、CUDA graph 等关键优化。README 的 Qwen3-0.6B / RTX 4070 Laptop 基准中,两边输出 133,966 tokens,nano-vLLM 用 93.41 秒、1434 tokens/s,vLLM 用 98.37 秒、1362 tokens/s。它适合作为推理系统学习材料,因为读者能在小代码量里看到 vLLM 风格的核心机制。
–浏览
评论 · Comments