AI 安全的问题不在模型,在输入
Emeritus 课程的最后一个单元讲 Guardrails——用多层模型来加固智能体的安全性。教授的框架很清晰:输入过滤 → 输出审核 → 行为约束。
但我脑子里有一个问题挥之不去。
用智能体审计智能体?
主流安全框架的做法是:让一个大模型生成输出,再用另一个大模型(或同一模型的另一个实例)去审查这个输出。
审计者发现了问题,要求重新生成。重新生成的输出再次被审计……这不是安全。这是审计递归——一个没有坚实基点的无限循环。
问题在哪?
不在输出。在输入。
为什么没人问这个问题
同一个模型、同一个任务——为什么有的提示词产生精准的答案,有的产生幻觉?
如果所有幻觉都是"模型的问题",那为什么不是所有提示词都产生幻觉?
答案是:提示词的质量千差万别。 有些提示词本身就是一团迷雾——别说 AI,换成人来读,也未必能看清用户想表达什么。
大雾天开车,你需要的是能见度。AI 也一样。
Visibility(能见度)
我把这个概念命名为 Visibility——LLM 输入的结构清晰度和来源可追溯性。
论文的核心命题很简单:
输入质量应该是 AI 安全的第一道防线。输出审计——今天的主流方案——应该降级为兜底机制。
这不是哲学。是可以量化的。
我提出了四个维度的 Visibility 评分框架:
| 维度 | 测量什么 |
|---|---|
| 来源数量(Source Count) | 输入引用了多少个独立信息源? |
| 溯源比例(Provenance Ratio) | 多少断言可以追溯到具体出处? |
| 约束密度(Constraint Density) | 每单位 token 包含多少具体约束? |
| 时序新鲜度(Temporal Freshness) | 输入中的信息有多新? |
然后用一个公式来表达核心关系:
$$V = \frac{F}{m}$$其中 $F$ 是约束力(constraint force),$m$ 是上下文质量(context mass)。这个公式的含义:输入越长(m 越大),你就需要更强的约束(F 越大)来维持同样的 Visibility。 这解释了为什么在长对话中,模糊的追问往往得到跑偏的回答。
这不止是关于 AI
在写这篇论文的过程中,我意识到同样三条规律可以描述所有人际沟通:
第一定律(注意力惯性):没有外力时,对方的回应自动坍缩到最平庸的社交套话。你问大模型"写个方案"→ 它给你放之四海而皆准的空话。不是模型笨,是它沿着训练数据里概率最高的路径在滑行。
第二定律(注意力偏转):要偏转对方的注意力所需的"特异性外力",与对话历史的长度成正比。群聊刷了 100 条之后你轻飘飘说一句"吃了吗"——没人理你。但你突然说"老板刚才在电梯里哭了"——全场注意瞬间聚焦。
第三定律(注意力互惠):你投入多精细的引导,对方就回馈多精细的回应。“聊聊电影”→“好看”。“聊聊诺兰在《奥本海默》中刻意省略广岛镜头的叙事伦理”→ 对方被迫用同等深度回应你。
治理 AI,从治理输入开始。而治理输入,从理解注意力开始。
