章节 01
nano-vllm-qos:面向LLM推理的服务质量感知调度系统(导读)
nano-vllm-qos:面向LLM推理的服务质量感知调度系统
核心观点:本项目是基于nano-vLLM的服务质量(SLO)感知调度系统,集成Radix前缀缓存和Mooncake远程KV缓存技术,旨在优化大语言模型推理的延迟和吞吐量。
原作者与来源
- 原作者/维护者:Xuhang0607
- 来源平台:GitHub
- 原始链接:https://github.com/Xuhang0607/nano-vllm-qos
- 发布/更新时间:2026-08-11
关键词:LLM推理, 服务质量, SLO调度, 前缀缓存, KV缓存, vLLM, Mooncake, 推理优化