文章归档

全部文章

从最新的观察到最早的记录,这里不截断。

贰

最新文章

312026·08 AI 红队要主动找失败,测完还得修和复测AI 红队通过有范围的对抗测试主动寻找模型和应用失效方式,发现样例之后仍需修复、量化评测和持续复测。 实战手记 312026·08 FlashAttention 省显存提速度,先核硬件和实现FlashAttention 通过减少 GPU 不同层级内存之间的数据搬运加速精确注意力,实际收益仍受序列长度、硬件和实现版本影响。 白话入门 312026·08 合成数据能补样本,隐私和偏差仍要另验合成数据可以扩充训练与测试样本,也可能继承原始偏差、增加统计误差,并且不会自动获得可靠的隐私保护。 白话入门 312026·08 小语言模型更容易本地跑,能力要按任务验小语言模型用较少参数换取更低的部署门槛和推理成本,选型仍需按具体任务、硬件、上下文和安全要求实测。 工具测评 312026·08 连续批处理让 GPU 少等空位,也要盯住请求延迟连续批处理会在生成过程中动态加入和移出请求,提高 GPU 利用率,同时带来排队、插队与显存预算之间的取舍。 白话入门 302026·08 DPO 少训一个奖励模型,偏好数据仍要认真做DPO 直接使用优选与淘汰答案训练语言模型,流程比传统 RLHF 简化,结果仍受偏好数据和参考模型影响。 白话入门 302026·08 一段中文有多少 Token,先按实际模型分词分词器会把文字、标点和其他输入变成模型处理的 Token,同一段中文换模型后数量可能变化。 白话入门 302026·08 批量推理能省费用,先接受它不会立刻返回批量推理适合评测、分类和离线加工,费用通常更低,任务会异步排队并可能出现局部失败。 实战手记 302026·08 模型路由会替请求选模型,账单和质量都要留记录模型路由按请求难度和策略选择候选模型,企业仍要用真实样本核对质量、成本与实际去向。 实战手记 302026·08 混合专家模型参数很多,每个 Token 只走一小部分混合专家模型用路由器为每个 Token 选择少数专家,总参数与激活参数要分开看,部署还受内存和通信影响。 白话入门