筛选

卡片视图

置顶 /

十派的玩具箱有哪些内容?

顾名思义,玩具箱就应该是玩具箱。 知识笔记、工具笔记、写出的小玩意儿,都是玩具。 有时候玩玩具是为了写blog,有时候写blog是为了玩玩具。 任何批评和建议均会受到最热烈的欢迎: Issues / pipipi2328@gmail.com 主要集中于深度学习常用的工具。 结合 pi 的架构与真实会话数据(sessions.jsonl),把消息模型、主循环、Provider…
//

一个最简 Coding Agent 的完整解剖——结合 pi 的架构与真实会话数据

之前想自己写一个 mini coding agent,于是把 pi(@earendil-works/pi-coding-agent)的源码和它留在本机的真实会话数据(~/.pi/agent/sessions/ 下的 sessions.jsonl)翻了一遍。这篇把两样东西合在一起:用源码结构讲架构,用会话数据讲这架机器实际转起来是什么样子。文中的会话片段都取自真实运行记录,路径、ID、仓库名做了泛化,结构原样保留。 <!-- more…
//

深度学习必将拥有一套科学理论 · 翻译

这篇论文提出一个核心主张:深度学习正在形成一套真正的科学理论,而它的形态将是一种“学习力学”——从第一性原理出发、高度数学化地研究训练过程的动力学。作者将机制可解释性比作“深度学习的生物学”(定性解剖模型),而学习力学则是“深度学习的物理学”(定量研究学习如何展开)。全文围绕一个关键观察展开:学习就是参数空间中的运动,而物理学提供了思考运动的成熟工具;加之深度学习系统完全可测量,这为理论研究创造了前所未有的条件。 论文从五个“口袋”论证理论正在涌现:**存在可解析求解的设定、有洞察力的极限揭示基本行为、简单方程捕…
//

抓到一个会“假装训练”的 bug:TRL 1.9.2 续训 LoRA 时优化器是空的

TRL 1.9.2 的 GRPOTrainer 有一个“静默”的bug,如果先SFT再RL就可能碰到。使得模型可能并没有真的从已有的 LoRA adapter 继续训练,但是看起来仍然一切正常。 怎么个“静默”法呢?训练能完整跑完,日志看起来一切正常:loss 在降、reward 在涨、grad_norm 非零,wandb 曲线漂漂亮亮。可你把训练前后的权重拿去一对比,发现保存下来的 adapter 和你喂进去的初始 adapter…
//

结合nanovllm的FlashAttention和PagedAttention主要原理概述

总结:FlashAttention用于降低Attention计算阶段预存的显存消耗(内部计算范畴), PagedAttention用于高效管理推理的KV Cache(外部推理范畴)。 FlashAttention: 问题:标准 Attention 需要存储 N×N 的中间矩阵,显存 O(N²) ; 解决:分块 + 在线 softmax,显存降到 O(N) ; 关键:外循环 Q 块,内循环 K、V 块,在线更新 m、l、O ; PagedAttention: -…