关键观点
能执行命令的智能体天然是高风险系统
Wizard 不只是生成建议,而是能够读取项目、安装依赖、修改埋点并创建仪表盘。相同能力若被恶意指令控制,就足以读取敏感信息、篡改代码或执行危险操作。因此,工具能力本身会直接生成威胁模型,不能…展开观点收起观点
Wizard 不只是生成建议,而是能够读取项目、安装依赖、修改埋点并创建仪表盘。相同能力若被恶意指令控制,就足以读取敏感信息、篡改代码或执行危险操作。因此,工具能力本身会直接生成威胁模型,不能把智能体视为普通聊天界面。
为什么重要: 一旦智能体拥有“手”,安全设计就必须围绕真实执行权限展开,而不是只检查回答文本。
支撑证据
if you take the anatomy of any agent that can run commands, it's basically what I like to call the malware starter pack
提示词只能引导,不能构成安全边界
团队早期的所谓“零层安全”只是用提示词告诉智能体应该做什么。提示词会受上下文、提示注入和模型行为波动影响,无法可靠阻止越权行为。真正的限制必须由模型之外的确定性机制执行。展开观点收起观点
团队早期的所谓“零层安全”只是用提示词告诉智能体应该做什么。提示词会受上下文、提示注入和模型行为波动影响,无法可靠阻止越权行为。真正的限制必须由模型之外的确定性机制执行。
为什么重要: 把提示词误当作访问控制,会制造一种并不存在的安全感。
支撑证据
prompts are not security
默认拒绝显著缩小命令攻击面