RL Experiments

clearwave2026-09-20165
实验3:2×A100 多卡 GRPO 实验报告本实验旨在验证基于 verl 的多卡 LLM 强化学习训练流程,并初步观察 FSDP 场景下 GRPO 的训练行为与系统性能。实验使用 2×A100 GP...

计组实验6-Ver2

clearwave2025-06-132921
; //*****************************************// ; //      &...

计组实验6

clearwave2025-06-131345
; //*****************************************// ; //      &...

计组实验5

clearwave2025-05-301412
; //*************************************// ; //      &nb...

Hello, World!

clearwave2025-01-171935
Hello, World!
Hello, World!...