前言
强化学习训练链路遇到一个很实际的问题:每个 step 更新完 LoRA 后,需要先把权重保存到磁盘,再让 vLLM 加载,才能开始下一轮 rollout。
这个文件链路看起来很绕,但它真的是 RL step 的主要瓶颈吗?
强化学习训练链路遇到一个很实际的问题:每个 step 更新完 LoRA 后,需要先把权重保存到磁盘,再让 vLLM 加载,才能开始下一轮 rollout。
这个文件链路看起来很绕,但它真的是 RL step 的主要瓶颈吗?
给推理和训练链路加入图片输入时,最先遇到的不是 Vision Encoder,而是图片到底怎么穿过 SDK、Router、Actor 和 vLLM。
常见选择有:
记一次Triton-Ascend融合算子把variance算成0的排查
事情的起点很简单,Qwen3.5-4B 在 Ascend 950PR 上可以正常启动,接口也能返回内容,但是输出完全是胡言乱语。
最麻烦的地方是服务看起来没有坏: 模型加载成功,显存正常,HTTP 也是 200,没有任何一个日志能看出来是某个融合算子算错了。只能从最终输出向前一层层比较中间值。
最近在 Ascend 950PR 上部署 Qwen3.5-4B,最开始直连 vLLM 压测只有:
1 | Total TPS: 2167.47 tok/s |