RL每步到底慢在哪里:实测rollout占了81.5%

前言

强化学习训练链路遇到一个很实际的问题:每个 step 更新完 LoRA 后,需要先把权重保存到磁盘,再让 vLLM 加载,才能开始下一轮 rollout。

这个文件链路看起来很绕,但它真的是 RL step 的主要瓶颈吗?

阅读更多

记一次Triton-Ascend融合算子把variance算成0的排查

前言

事情的起点很简单,Qwen3.5-4B 在 Ascend 950PR 上可以正常启动,接口也能返回内容,但是输出完全是胡言乱语。

最麻烦的地方是服务看起来没有坏: 模型加载成功,显存正常,HTTP 也是 200,没有任何一个日志能看出来是某个融合算子算错了。只能从最终输出向前一层层比较中间值。

阅读更多