安橙的博客
  • 博文
  • 标签
  • 搜索

SGLang

  • Day 33 · Continuous Batching

    2026-06-20AILLMInference

    学习 LLM 推理服务中的 Continuous Batching:理解静态 batching 与 in-flight batching 的差异,prefill/decode 如何混排,以及 TGI、vLLM、SGLang 调度器在吞吐、TTFT、TPOT 与公平性上的取舍。

  • Day 34 · SGLang & RadixAttention

    2026-06-20AILLMSGLang

    学习 SGLang 推理框架与 RadixAttention:理解前缀缓存、共享 prefix 的请求调度、Radix Tree 如何复用 KV Cache,并动手用同一个 system prompt 发多请求观察缓存命中。

© 2026 安橙的博客