前言
一次 BatchLoRA 任务把两个各 32 样本的事件合并后,四张 80G 训练卡同时 OOM:
1 | 64 samples |
一次 BatchLoRA 任务把两个各 32 样本的事件合并后,四张 80G 训练卡同时 OOM:
1 | 64 samples |
训练服务曾经在一段处理 position_ids 的代码附近报:
1 | CUDA error: device-side assert triggered |
Triton地址索引跨过int32边界导致CUDA error
一次 Qwen3.5-4B 训练在约 23.4 万 packed tokens 时触发:
1 | CUDA error: an illegal memory access was encountered |