提示词从输入端影响模型,微调会改模型参数。激活引导走了第三条路。模型生成答案时会在每一层形成中间状态,研究者直接在这些数值上加一个方向向量,让后续输出更偏向某种主题、情感或行为。

Activation Addition 的做法很容易用一个例子理解。把 Love 和 Hate 两个提示分别送进模型,取某一层激活的差,得到一条方向。模型回答新问题时,把这条方向按一定强度加回同一层。原论文用这种办法改变情感与毒性等输出属性,并在 OPT、LLaMA-3 等模型上做了实验。

它改的是一次推理过程

ActAdd 不需要重新训练,也不要求数值优化。论文报告单个对照提示就能构造向量,这让试验成本很低。模型参数文件没有因此变小,下一次请求也不会自动继承效果。服务系统要在每次前向传播时找到指定层并修改激活。

这也划出了使用边界。只有一个黑箱 API 时,调用方通常拿不到中间层,无法自己做激活引导。开放权重也只是起点,还需要能插入推理过程的框架,并记录模型版本、层号、向量来源和缩放强度。少一个参数,结果就很难复现。

后续研究把对照做得更细。微软研究团队用“带某条指令”和“不带这条指令”的激活差构造向量,测试输出格式、长度和指定词等要求,还尝试同时加入多个指令向量。这说明向量可以表达一些高层行为,组合后会不会互相干扰仍要逐项测。

强度越大,副作用越该查

向量太弱,输出变化看不出来。向量太强,模型可能反复提同一主题,语言变得不连贯,原本会做的无关任务也会掉分。后续多种引导研究都把控制效果与通用能力的取舍列为核心指标。只展示最显眼的成功样例,很容易漏掉代价。

评测可以准备三组问题。一组专门测目标行为,一组测应保持不变的普通能力,再放一组与目标接近但不该被误伤的边界题。每个强度都跑同一批样本,同时记录任务得分、输出多样性和异常重复。选出来的参数应当是最小有效强度。

对照实验还要固定采样参数和随机种子,并保留完全不加向量的基线。若同一个向量换一层就失效,或只在一组提示上有效,结论只能写到这组模型和设置。引导方向也可能随着模型升级而改变,不能把旧向量直接搬到新版本。

激活引导也不等于安全规则。它可能让某类回答减少,无法保证每个输入都服从约束。付款、删除和外部发送仍要靠权限与程序门禁。向量适合做模型行为研究和有限控制,确定性的业务动作继续交给确定性的检查。

参考资料