全部文章
从最新的观察到最早的记录,这里不截断。
贰
最新文章
042026·09 HyDE先写假设文档再检索,生成内容不能当证据HyDE用生成的假设文档寻找真实资料,适合试验领域检索问题,但要分别检查召回、耗时和最终引用。 白话入门 042026·09 后期交互保留词级匹配,检索精细也要算索引ColBERT把查询与文档分别编码,保留词级向量参与匹配。理解后期交互,需要同时看检索质量与索引开销。 白话入门 042026·09 套娃嵌入可以截短向量,维度要按任务试套娃嵌入在训练时照顾不同长度的向量前缀,让检索能选择维度;节省存储以后仍需验证召回与归一化处理。 实战手记 042026·09 微调新任务也要复测旧能力,留意灾难性遗忘持续微调可能改善新任务,也可能损失旧能力。灾难性遗忘需要用训练前后可比较的任务记录来识别和处理。 实战手记 042026·09 测试集污染会影响跑分解释,高分低分都要有证据评测题进入训练资料会干扰能力判断。测试集污染需要方法和证据,采购方还应保留独立、未用于调试的验收题。 踩坑记录 032026·09 LLM 评审能批量打分,先用人工样本校准裁判LLM 评审可以比较两份回答或按标准给单份答案评分,但位置偏差、啰嗦偏好和自我偏好需要人工样本校准。 实战手记 032026·09 上下文工程管每轮给模型什么,资料越多未必越准上下文工程持续挑选系统指令、工具说明、历史消息和外部资料,让模型每一步看到足够且相关的信息。 实战手记 032026·09 智能体记忆会保存过去,写入和删除都要有规则智能体记忆把会话历史与跨会话资料分开保存,系统需要控制写入、检索、纠错、保留期限和敏感信息。 实战手记 032026·09 模型卡把用途和限制写清,跑分才有上下文模型卡记录模型的用途、训练资料、评测方法和已知限制,帮助使用者判断一项跑分能否代表自己的任务。 实战手记 032026·09 测试时计算让难题多算一会,预算应按题目分配测试时计算在模型回答阶段增加候选生成、验证或推理步骤,能改善部分难题,也会增加等待和推理成本。 实战手记