十派的玩具箱有哪些内容?
顾名思义,玩具箱就应该是玩具箱。 知识笔记、工具笔记、写出的小玩意儿,都是玩具。 有时候玩玩具是为了写blog,有时候写blog是为了玩玩具。 任何批评和建议均会受到最热烈的欢迎: Issues / pipipi2328@gmail.com 主要集中于深度学习常用的工具。 结合 pi 的架构与真实会话数据(sessions.jsonl),把消息模型、主循环、Provider…
@earendil-works/pi-coding-agent)的源码和它留在本机的真实会话数据(~/.pi/agent/sessions/ 下的 sessions.jsonl)翻了一遍。这篇把两样东西合在一起:用源码结构讲架构,用会话数据讲这架机器实际转起来是什么样子。文中的会话片段都取自真实运行记录,路径、ID、仓库名做了泛化,结构原样保留。 <!-- more…GRPOTrainer 有一个“静默”的bug,如果先SFT再RL就可能碰到。使得模型可能并没有真的从已有的 LoRA adapter 继续训练,但是看起来仍然一切正常。 怎么个“静默”法呢?训练能完整跑完,日志看起来一切正常:loss 在降、reward 在涨、grad_norm 非零,wandb 曲线漂漂亮亮。可你把训练前后的权重拿去一对比,发现保存下来的 adapter 和你喂进去的初始 adapter…blogs/ 目录下的 Markdown,生成卡片 / 清单 / 图谱三种视图,Chrome小恐龙风格。