mradermacher/Qwen3-8B-MiMo-Music-GRPO-GGUF Reinforcement Learning • 8B • Updated 10 days ago • 743 • 2
Chaew00n/test-policy-optimization-query-expansion-0529 Text Generation • 0.6B • Updated May 29, 2025 • 13 • 1
YuvrajSingh9886/Qwen2.5-0.5B-grpo-summarization-quality-rouge Summarization • 0.5B • Updated about 9 hours ago • 67 • 1
mradermacher/qwen2.5-coder-3b-instruct-spider-sft-grpo-GGUF Reinforcement Learning • 3B • Updated Aug 25 • 269 • 1