筛选

卡片视图

//

深度学习必将拥有一套科学理论 · 翻译

这篇论文提出一个核心主张:深度学习正在形成一套真正的科学理论,而它的形态将是一种“学习力学”——从第一性原理出发、高度数学化地研究训练过程的动力学。作者将机制可解释性比作“深度学习的生物学”(定性解剖模型),而学习力学则是“深度学习的物理学”(定量研究学习如何展开)。全文围绕一个关键观察展开:学习就是参数空间中的运动,而物理学提供了思考运动的成熟工具;加之深度学习系统完全可测量,这为理论研究创造了前所未有的条件。 论文从五个“口袋”论证理论正在涌现:**存在可解析求解的设定、有洞察力的极限揭示基本行为、简单方程捕…
//

抓到一个会“假装训练”的 bug:TRL 1.9.2 续训 LoRA 时优化器是空的

TRL 1.9.2 的 GRPOTrainer 有一个“静默”的bug,如果先SFT再RL就可能碰到。使得模型可能并没有真的从已有的 LoRA adapter 继续训练,但是看起来仍然一切正常。 怎么个“静默”法呢?训练能完整跑完,日志看起来一切正常:loss 在降、reward 在涨、grad_norm 非零,wandb 曲线漂漂亮亮。可你把训练前后的权重拿去一对比,发现保存下来的 adapter 和你喂进去的初始 adapter…
//

结合nanovllm的FlashAttention和PagedAttention主要原理概述

总结:FlashAttention用于降低Attention计算阶段预存的显存消耗(内部计算范畴), PagedAttention用于高效管理推理的KV Cache(外部推理范畴)。 FlashAttention: 问题:标准 Attention 需要存储 N×N 的中间矩阵,显存 O(N²) ; 解决:分块 + 在线 softmax,显存降到 O(N) ; 关键:外循环 Q 块,内循环 K、V 块,在线更新 m、l、O ; PagedAttention: -…
//

给 tensorzero 提的第一个 PR:object_storage.endpoint 支持环境变量

tensorzero 是一个做 LLM 推理和优化的框架,配置里的 [object_storage] 用来管多模态推理时图片之类文件的存储。原来这个段的 endpoint 只能写死一个地址,我提的 PR 让它也能写成 env::SOME_ENV_VAR,启动的时候从环境变量里读。这样内网地址、测试和生产的存储端点就不用都摊在配置文件里了。 当时提的 PR 是…