全部文章
从最新的观察到最早的记录,这里不截断。
贰
最新文章
112026·09 AWQ按激活保护关键权重,4比特能跑快还得靠算子AWQ用少量校准样本观察激活,找出重要权重通道并缩放保护;模型压到低比特后,真实速度仍取决于权重打包和推理内核。 白话入门 112026·09 GQA让多组查询共享KV头,省显存时也要看质量分组查询注意力让多组查询头共用较少的键和值,减少逐词生成时搬运的KV缓存,并在多头注意力与单组共享之间取舍。 白话入门 112026·09 RoPE用旋转记录词元位置,拉长上下文还要重新评测RoPE把位置信息写进查询和键的旋转角度,让注意力感知相对距离;调整缩放参数能扩展长度,却不能替代长文检索评测。 白话入门 112026·09 激活检查点用重算换显存,训练变慢多少要实测激活检查点少保存前向计算的中间张量,反向传播时再算一次,用更多计算时间换较低训练显存,并要求随机状态保持一致。 白话入门 112026·09 语义熵比较多次回答的意思,稳定一致也不等于正确语义熵把同一问题的多次回答按含义归组,再测模型在不同含义之间有多犹豫,可发现一部分随采样变化的编造。 踩坑记录 102026·09 GRPO让同一道题的多份答案互相比较,省掉价值模型还要多次生成GRPO用同一道题多份回答的组内分数估计相对好坏,少训练一个价值模型,却会增加在线采样与奖励设计压力。 白话入门 102026·09 QLoRA让4比特模型也能微调,省下显存后还要重测QLoRA把冻结的基础模型压到4比特,只训练LoRA适配器,显存大幅下降,数据质量和任务验收仍然决定结果。 白话入门 102026·09 文本水印把统计信号写进选词,检测结果只能当证据之一文本水印在模型生成时调整词元选择并留下可检测信号,短文本、翻译和重写会降低把握,检测不能单独定责。 白话入门 102026·09 模型剪枝删掉一部分权重,能不能加速要看硬件模型剪枝把一部分连接置零或整组删除,参数更稀疏以后仍要检查文件格式、算子支持、真实延迟与任务精度。 白话入门 102026·09 模型提取攻击靠查询仿出功能,少返回概率仍挡不住模型提取攻击反复查询线上接口,用输入和输出训练替代模型,防守要同时管理访问、输出、异常查询与后续风险。 踩坑记录