壹
从这里开始读
182026·09 DeepNorm 改残差缩放与初始化,千层实验仍来自机器翻译DeepNorm 在 Post-LN Transformer 中放大残差支路并缩小部分初始权重,用来稳定超深模型;原论文的千层结果主要是翻译实验。 白话入门 182026·09 FP8 用两种格式训练模型,省位宽还要逐张量缩放FP8 常用 E4M3 保存权重和激活,用 E5M2 保存梯度;乘法累加、归一化和更新仍会使用更高精度,逐张量缩放是稳定性的关键。 白话入门 182026·09 MLA 把 KV 压进低维向量,省显存还靠专用实现多头潜在注意力用低秩联合压缩缩小 KV 缓存,并把 RoPE 的位置部分拆开;论文收益需要合适推理内核才能兑现。 白话入门 182026·09 μP 让小模型超参数迁到大模型,能迁什么要先分清最大更新参数化调整不同宽度下的初始化和学习率缩放,让小模型上调出的部分超参数可以迁到大模型;正则化与训练规模仍有限制。 白话入门 182026·09 多查询注意力共用一套 KV 缓存,解码更快会少一点质量多查询注意力保留多个查询头,却让所有头共用一套 Key 和 Value,以减少逐词解码的显存读取;速度收益与质量损失要在当前模型上重测。 白话入门 172026·09 ALiBi 把距离惩罚加进注意力,训练短也能测试长ALiBi 用与距离成比例的线性偏置表达位置,让模型在较短序列上训练后处理更长输入;外推范围与任务质量仍有边界。 白话入门 172026·09 RMSNorm 只按均方根缩放激活,少算均值仍要看实现RMSNorm 去掉 LayerNorm 的均值中心化,只用均方根控制激活尺度;原论文显示它能维持训练质量,但实际速度仍取决于内核与模型结构。 白话入门 172026·09 SwiGLU 给前馈层加一道门,参数对齐后再比效果SwiGLU 用两路投影和逐元素乘法改造 Transformer 前馈层;原论文按相同参数量比较,显示预训练困惑度改善,但收益仍需在任务上复测。 白话入门 172026·09 YaRN 调整 RoPE 频率拉长上下文,窗口数字还要靠长文验证YaRN 通过分段调整 RoPE 频率并缩放注意力,少量继续训练即可扩展上下文;标称 128K 仍要用真实长文任务检查。 白话入门 172026·09 滑动窗口注意力只看附近 Token,多层传播也有距离上限滑动窗口注意力限制每层直接查看的历史范围,用线性计算和固定缓存支持长序列;远处信息要经过多层传递,不能当成完整注意力。 白话入门
叁
老白正在做
项目 01 · 白话AI
这个网站,就是我的第一个公开 AI 实战项目。
从定位、视觉到栏目和内容,一步一步把想法做成真正能用的博客。这里记录过程,不包装成绩。
已完成品牌定位与首页视觉
进行中栏目结构与内容整理
下一步发布第一批真实文章

长期主义。
关于老白
大家好,我是白先生。
一个喜欢文字,也喜欢把复杂问题讲明白的内容创作者。
我相信,知识只有用大白话讲出来,才能真正被更多人理解和应用。
在「白话AI」,你能看到:
- 通俗易懂的 AI 知识解释
- 真实落地的实践经验
- 踩坑后的复盘与思考
如果你也想把 AI 用起来、用得好,欢迎一起交流、一起进步。