文章归档

全部文章

从最新的观察到最早的记录,这里不截断。

贰

最新文章

022026·09 AI 应用也要留调用轨迹,正文默认别进日志生成式 AI 可观测性把模型、检索和工具调用串成可查询的轨迹,同时要控制提示词与回答中的敏感信息。 实战手记 022026·09 GraphRAG 先建实体关系图,索引成本要提前试算GraphRAG 从文档中抽取实体与关系,生成分层社区摘要,适合回答跨段落和全局问题,但索引过程会消耗更多模型资源。 实战手记 022026·09 Grounding 让回答贴着来源,来源本身也要验Grounding 把公开搜索或企业资料交给模型作为回答依据,并用来源与检测结果帮助核验,仍需保证资料新鲜且可信。 实战手记 022026·09 混合检索同时找关键词和语义,还要用真实问题调排名混合检索并行执行全文搜索与向量搜索,再融合两边的排序,适合既有产品编号又有自然语言问法的企业知识库。 实战手记 022026·09 语义缓存能复用相近问题,命中错误比未命中更麻烦语义缓存用向量相似度寻找过去的相近问题并复用回答,能减少模型调用,前提是权限、时效和相似度门槛都经过验证。 踩坑记录 012026·09 KV 缓存让生成少算旧 Token,显存会随上下文增长KV 缓存复用模型已经算过的注意力状态,能加快逐 token 生成,同时会占用随上下文增加的显存。 实战手记 012026·09 PagedAttention 把 KV 缓存分块,吞吐提升要看负载PagedAttention 用固定大小的非连续块管理请求的 KV 缓存,减少显存碎片并提高大模型服务并发。 实战手记 012026·09 差分隐私给泄露风险定上限,精度和预算要一起算差分隐私用可计算的参数限制单个样本对结果的影响,落到模型训练还需裁剪、加噪和持续记账。 实战手记 012026·09 思维链能帮模型做多步题,过程仍要核验思维链提示让模型生成中间步骤,在部分多步任务上能提高表现,连贯过程仍可能带着错误。 实战手记 012026·09 联邦学习让数据留在设备,更新仍需保护联邦学习把训练任务送到设备或机构本地,再汇总模型更新,减少集中收集原始数据的需要。 实战手记