筛选

卡片视图

//

深度学习必将拥有一套科学理论 · 翻译

这篇论文提出一个核心主张:深度学习正在形成一套真正的科学理论,而它的形态将是一种“学习力学”——从第一性原理出发、高度数学化地研究训练过程的动力学。作者将机制可解释性比作“深度学习的生物学”(定性解剖模型),而学习力学则是“深度学习的物理学”(定量研究学习如何展开)。全文围绕一个关键观察展开:学习就是参数空间中的运动,而物理学提供了思考运动的成熟工具;加之深度学习系统完全可测量,这为理论研究创造了前所未有的条件。 论文从五个“口袋”论证理论正在涌现:**存在可解析求解的设定、有洞察力的极限揭示基本行为、简单方程捕…
//

抓到一个会“假装训练”的 bug:TRL 1.9.2 续训 LoRA 时优化器是空的

TRL 1.9.2 的 GRPOTrainer 有一个“静默”的bug,如果先SFT再RL就可能碰到。使得模型可能并没有真的从已有的 LoRA adapter 继续训练,但是看起来仍然一切正常。 怎么个“静默”法呢?训练能完整跑完,日志看起来一切正常:loss 在降、reward 在涨、grad_norm 非零,wandb 曲线漂漂亮亮。可你把训练前后的权重拿去一对比,发现保存下来的 adapter 和你喂进去的初始 adapter…
//

结合nanovllm的FlashAttention和PagedAttention主要原理概述

总结:FlashAttention用于降低Attention计算阶段预存的显存消耗(内部计算范畴), PagedAttention用于高效管理推理的KV Cache(外部推理范畴)。 FlashAttention: 问题:标准 Attention 需要存储 N×N 的中间矩阵,显存 O(N²) ; 解决:分块 + 在线 softmax,显存降到 O(N) ; 关键:外循环 Q 块,内循环 K、V 块,在线更新 m、l、O ; PagedAttention: -…