AI 安全的问题不在模型,在输入

2026-06-28 · 3 分钟阅读时长
notes

Emeritus 课程的最后一个单元讲 Guardrails——用多层模型来加固智能体的安全性。教授的框架很清晰:输入过滤 → 输出审核 → 行为约束。

但我脑子里有一个问题挥之不去。

用智能体审计智能体?

主流安全框架的做法是:让一个大模型生成输出,再用另一个大模型(或同一模型的另一个实例)去审查这个输出。

审计者发现了问题,要求重新生成。重新生成的输出再次被审计……这不是安全。这是审计递归——一个没有坚实基点的无限循环。

问题在哪?

不在输出。在输入。

为什么没人问这个问题

同一个模型、同一个任务——为什么有的提示词产生精准的答案,有的产生幻觉?

如果所有幻觉都是"模型的问题",那为什么不是所有提示词都产生幻觉?

答案是:提示词的质量千差万别。 有些提示词本身就是一团迷雾——别说 AI,换成人来读,也未必能看清用户想表达什么。

大雾天开车,你需要的是能见度。AI 也一样。

Visibility(能见度)

我把这个概念命名为 Visibility——LLM 输入的结构清晰度来源可追溯性

论文的核心命题很简单:

输入质量应该是 AI 安全的第一道防线。输出审计——今天的主流方案——应该降级为兜底机制。

这不是哲学。是可以量化的。

我提出了四个维度的 Visibility 评分框架:

维度测量什么
来源数量(Source Count)输入引用了多少个独立信息源?
溯源比例(Provenance Ratio)多少断言可以追溯到具体出处?
约束密度(Constraint Density)每单位 token 包含多少具体约束?
时序新鲜度(Temporal Freshness)输入中的信息有多新?

然后用一个公式来表达核心关系:

$$V = \frac{F}{m}$$

其中 $F$ 是约束力(constraint force),$m$ 是上下文质量(context mass)。这个公式的含义:输入越长(m 越大),你就需要更强的约束(F 越大)来维持同样的 Visibility。 这解释了为什么在长对话中,模糊的追问往往得到跑偏的回答。

这不止是关于 AI

在写这篇论文的过程中,我意识到同样三条规律可以描述所有人际沟通:

第一定律(注意力惯性):没有外力时,对方的回应自动坍缩到最平庸的社交套话。你问大模型"写个方案"→ 它给你放之四海而皆准的空话。不是模型笨,是它沿着训练数据里概率最高的路径在滑行。

第二定律(注意力偏转):要偏转对方的注意力所需的"特异性外力",与对话历史的长度成正比。群聊刷了 100 条之后你轻飘飘说一句"吃了吗"——没人理你。但你突然说"老板刚才在电梯里哭了"——全场注意瞬间聚焦。

第三定律(注意力互惠):你投入多精细的引导,对方就回馈多精细的回应。“聊聊电影”→“好看”。“聊聊诺兰在《奥本海默》中刻意省略广岛镜头的叙事伦理”→ 对方被迫用同等深度回应你。


治理 AI,从治理输入开始。而治理输入,从理解注意力开始。

📄 阅读完整论文(PDF) · arXiv 路线图

董昊
Authors
DevOps Engineer · AI Infrastructure · Open Source Builder
阿联酋主权 AI 基础设施工程师,开源工具 mcp-dbutils 作者——让大模型安全连接工业数据库的 MCP 协议工具。 技术博客 jiejue.ai 主理人,周活跃读者 1,960 人。 专注于将 AI Agent 落地到工业场景——数据库安全、企业级部署、生产环境运维。