用双卡 5090 训练 Qwen3-0.6B:从数学推理到 Agentic RL 的完整踩坑大集锦
这篇文章是我最近一个月做的一组实验的记录。起因很简单:想看看 0.6B 这种“小参数”模型, 在两张 RTX 5090 上,到底能不能用强化学习训出像样的数学推理和 Agent 能力。 起点是 Datawhale 第 11 章的 hello-agents 案例,之后延伸出了一堆东西。 从 GSM8K 数学推理,到多轮工具调用,再到自己搭一个跨应用的工具基准, 最后还顺手用 QLoRA 挑战了一下 72B 的微调。 想试着讲讲看整个过程踩到的无数的坑。 完整的论文、报告和代码:…