摘要

SGLang 在 GitHub Releases 发布了稳定补丁版本 v0.5.15.post1。发布说明称,此版本以 GLM 5.2 的修复为主,包含非 CUDA/HIP 设备上的 DSA 模型启动修复、CUDA 12 镜像中的 FlashInfer 依赖修复,以及长输入时 FlashInfer TensorRT-LLM FP4 MoE 内核可能导致 NaN 输出的问题修复。

此外,版本还修复了 GLM 5.2 在 PD 解耦和上下文并行配置下的 IndexShare 问题。对使用上述模型、内核或部署配置的团队而言,升级可能改善推理服务的兼容性与稳定性。

原始来源:GitHub Releases