发布日期:2026-09-05 03:33 点击次数:177

开源框架终了 100% 可复现的走漏 RL 教练!开云体育
下图是基于 Qwen3-8B 进行的重叠实际。两次启动,一条弧线,终显豁落幕的齐备重合,为需要高精度复现的实际场景提供了可靠保险。
这等于SGLang 团队妥洽 slime 团队的最新开源落幕。

近期,Thinking Machines Lab ( 由 OpenAI 前 CTO Mira Murati 创立 ) 发布了一篇著作——《克服 LLM 推理中的不细则性》,指出问题的中枢在于缺少批次不变性 ( batch invariance ) 。

自从这篇博客发布后,业界反响横蛮,一直期待开源推理引擎能终了走漏可用的细则性推理,约略更进一步,终了十足可复现的 RL 教练。而当今,SGLang 和 slime 一齐给出了谜底。
SGLang 团队在 Thinking Machines Lab 发布的批次不变算子基础之上,通过定制一系列提防力算子和采样逻辑,终显豁十足细则性推理。该终了同期保抓与分块预填充 ( chunked prefill ) 、CUDA Graph、Radix Cache 和非贪心采样 ( non-greedy sampling ) 等要津功能的兼容性。
行使 CUDA Graph,SGLang 不错终了2.8 倍的加快。与 Thinking Machines Lab 博客中敷陈的 61.5% 性能下落比拟,SGLang 在 FlashInfer 和 FlashAttention 3 后端平均仅有 34.35% 的性能下落。

在此基础上,SGLang 团队妥洽 slime 团队一齐,以少许代码终显豁十足可复现的走漏 RL 教练,具体细节当今全面公开。
问题的本体:为什么 LLM 推理不细则?
从妄言语模子 ( LLM ) 推理中获取一致输出的智商越来越遑急。举例,推理落幕的不细则性可能会隐式地将在线计谋强化学习 ( RL ) 调度为离线计谋 RL。然而,即使将温度降到 0,由于使用了动态批处理 ( Dynamic Batching ) 和基数缓存 ( Radix Cache ) ,采样仍然不是细则性的。
Thinking Machines Lab 的盘问发现,不细则性的最大开始是变化的批次大小:即使用户重叠提交相同的教导,输出也可能在不同的启动中有所变化,因为申请可能与其他用户的申请一齐批处理,批次大小的各异导致不细则的推理落幕。
更具体地说,不同的批次大小会影响内核的归约(reduction)分割经过。这导致每个归约块的律例和大小变化,由于浮点运算的非结合性,可能导致不细则的输出。为了贬责这个问题,他们终显豁批次不变 ( batch invariant ) 的归约算子(RMSNorm、Matmul)。这些算子也动作配套库发布供外部集成。
在 Thinking Machines Lab 责任的基础上,SGLang 提供了刚劲、高婉曲量的细则性 LLM 推理解决决策,将批次不变 ( batch invariant ) 算子、CUDA 图、基数缓存和分块预填充与高效性能相结合。通过全面的测试和强化学习教练实际,其细则性得到了充分考据。
主要增强功能包括:
集成 Thinking Machines Lab 的批次不变 ( batch invariant ) 算子。
终了固定 KV 分割大小的批次不变提防力算子。援助多种后端,包括 FlashInfer、FlashAttention 3 和 Triton。
与要津推感性能关系功能十足兼容,举例分块预填充、CUDA 图、基数缓存等,当启用细则性推理时,所有这些功能王人仍受援助。
援助按申请建造采样种子 ( per-request sampling seed ) ,即使在 temperature>0 的非贪心采样面目下也能终了细则性推理。
实际落幕细则性评估
引入了一个细则性测试,以考据推理落幕在不同批处理条目下是否保抓一致。该测试包含三个子测试,难度依次渐进:
单一(Single):在不同批次大小下启动相同的教导,查抄输出是否保抓一致。
夹杂(Mixed):在归拢批次中夹杂不同类型的教导(短教导和长教导),并考据一致性。
前缀(Prefix):使用来自归拢长文本但前缀长度不同的教导,飞速进行批处理,并测试落幕在不同启动中是否可复现。
以下是 50 次采样观察的落幕。数字暗示每个子测试不雅察到的专有输出数目(数值越低,细则性越高)。

离线推感性能评估 :
使用三种常见的 RL 推理责任负载(256个输入 / 输出长度不同的申请)来臆测非细则性面目和细则性面目的端到端延伸。
测试落幕披露,细则性推理具有精熟的可用性,大部分性能下落适度在 25% 到 45% 之间,其中 FlashInfer 和 FlashAttention 3 后端的平均性能下落为34.35%。大部分支出来自未经优化的基于 Triton 编写的批次不变算子,这标明性能仍有很大的栽植空间。

团队照实不雅察到细则性推理比平素面目要慢。因此提倡主要将其用于调试和复现性。SGLang 团队昔日的责任之一将专注于加快细则性推理,主见是将性能差距消弱到 20% 以内,或理思情况下达到与平素面目抓平。
使用步伐 SGLang 环境建造:
# 使用最新的主分支 git clone https://github.com/sgl-project/sglang.gitcd sglang# 装配 Python 依赖 pip install --upgrade pippip install -e "python [ all ] "
启动 SGLang Server:
SGLang 援助多种模子的细则性推理。举例,关于 Qwen3-8B,您只需在启动就业器时添加— enable-deterministic-inference 参数:
python3 -m sglang.launch_server --model-path Qwen/Qwen3-8B --attention-backend --enable-deterministic-inference
昔日责任
团队昔日的悉力将结合在以下领域,以增强细则性推理的性能和可用性:
更快的批次不变算子:批次不变算子是性能瓶颈,因此将悉力优化其建立并可能重写它们以栽植性能。这关于提高 RL 推理的速率也至关遑急。
援助 MoE 模子:现时只援助像 QWen3-8B 或 LLaMa-3.1-8B 这么的 Dense 模子的细则性推理。昔日计较将援助膨大到像 Qwen3-30B-A3B 或 DeepSeek-V3 这么的夹杂巨匠模子。
增强基数缓存功能:将编削基数树,使其与更泛泛的提防力算子兼容,超过现时对 FlashAttention 3 后端的落幕。
张量并行(Tensor Parallelism):不雅察到 TP1 和 TP2 是细则性的,可能因为不波及浮点加法的结合率。将尝试膨大到更大的 TP size, 可能包括修改归约算子以终了细则性。
FlexAttention 集成:除了现时援助的提防力后端,计较昔日将细则性推理的援助膨大到 FlexAttention。
SGLang 的细则性推理和 slime 的可复现教练功能现时正在积极完善中,团队忠实接待雄伟用户和拓荒者积极试用,并提供难得的响应宗旨。您的使用体验和提倡将鼓动这一遑急功能的进一步优化,鼓动细则性推理技艺的发展。
参考结合:
[ 1 ] https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/
[ 2 ] https://lmsys.org/blog/2025-09-22-sglang-deterministic/
[ 3 ] https://github.com/sgl-project/sglang/issues/10278
[ 4 ] https://thudm.github.io/slime/_examples_synced/reproducibility/README.html
[ 5 ] https://github.com/THUDM/slime/pull/370
一键三连「点赞」「转发」「留心心」
接待在驳斥区留住你的思法!
— 完 —
� � 点亮星标 � �
科技前沿发扬逐日见开云体育
Powered by 开云vip2026手机网页版(官方)网站/网页版登录入口 @2013-2022 RSS地图 HTML地图