每日 Harness 开源 · Source
返回本期 · Back to 2026-07-07

GitHub 热门 · GitHub Trending2026-07-07 · Tuesday, July 7, 2026

GeeeekExplorer/nano-vllm

github.com原文 ↗

nano-vllm 用约 1,200 行 Python 从头实现轻量 vLLM,保留离线推理、prefix caching、tensor parallelism、torch compilation、CUDA graph 等关键优化。README 的 Qwen3-0.6B / RTX 4070 Laptop 基准中,两边输出 133,966 tokens,nano-vLLM 用 93.41 秒、1434 tokens/s,vLLM 用 98.37 秒、1362 tokens/s。它适合作为推理系统学习材料,因为读者能在小代码量里看到 vLLM 风格的核心机制。
浏览

评论 · Comments