Wenboz/SACD-Qwen2.5-3B-ALFWorld-k1-tau0.75-beta1.0-plain-pipeline Reinforcement Learning • 3B • Updated Jun 10 • 5 • 1
Wenboz/SACD-Qwen2.5-3B-ALFWorld-k1-tau0.5-beta1.0-plain-pipeline Reinforcement Learning • 3B • Updated Jun 10 • 5
RockToken/qwen3_30b_a3b_to_4b_onpolicy_5k_src30k-35k_cont Text Generation • 4B • Updated Jul 17 • 115