全部文章
从最新的观察到最早的记录,这里不截断。
贰
最新文章
082026·09 成员推断能猜一条数据是否参加训练,接口没吐原文也可能泄密成员推断利用模型对训练内外样本的反应差别判断数据身份,隐私验收不能只检查有没有输出原文。 白话入门 082026·09 数据投毒在训练前动手脚,总准确率正常也可能留后门数据投毒通过修改训练资料或训练过程控制模型行为,来源记录与定向测试比单看平均准确率更有用。 白话入门 082026·09 机器遗忘想删掉训练影响,少答几道题还不能算忘干净机器遗忘试图移除指定数据对模型的影响,验收还要同时检查逐字记忆、隐私泄露与保留能力。 白话入门 082026·09 涌现失调让窄任务微调影响别的问题,回归测试要跨出训练领域涌现失调描述窄任务微调后出现跨领域不当行为的实验现象,微调验收需要加入训练领域之外的问题。 白话入门 082026·09 训练数据提取会让模型复述训练原文,记住和说出来要分开测训练数据提取通过查询模型恢复具体训练文本,聊天限制能压低暴露机会,却不能证明模型已经没有记忆。 白话入门 072026·09 奖励黑客会钻评分漏洞,验收要看真实结果奖励黑客让智能体靠钻评分规则的空子拿高分,任务是否完成要用独立结果和行动记录复核。 踩坑记录 072026·09 宪法式AI用原则生成训练反馈,原则本身还得有人负责宪法式 AI 用明确原则让模型批评、修订并比较回答,可以减少部分人工标签,原则选择仍需人负责。 白话入门 072026·09 激活引导直接改模型中间状态,控制强度也会伤质量激活引导在推理时向模型中间状态加入方向向量,可以改变输出倾向,也可能牵动无关能力。 白话入门 072026·09 稀疏自动编码器把内部激活拆成特征,能解释还不等于全看懂稀疏自动编码器把模型激活重构成较少同时出现的特征,解释结果仍受重构误差和命名方法限制。 白话入门 072026·09 置信度校准让八成把握接近八成正确,先别拿语气当概率置信度校准检查模型给出的概率是否符合实际正确率,准确率、语气和校准质量需要分开验。 白话入门