🧊 前沿科技知识库
全部 / 网络安全

AI 与 LLM 安全

2026-09-26 · 网络安全
最后更新:2026-09-26 | 领域:安全 · AI/LLM 攻防 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

LLM 应用的安全问题源于一个结构性事实:模型无法在上下文窗口内对"数据"与"指令"做硬性隔离(OWASP Top 10 for LLM Applications 2025 解读)。因此,攻击者只要能把自然语言指令送入模型可见的通道——用户输入、检索到的文档、工具返回、网页、附件——就可能覆盖开发者写入的系统提示。OWASP 将这类风险列为 LLM01: Prompt Injection,并明确指出这些输入"不需要对人可见或可读",只要被模型解析即可(OWASP-Top-10-for-LLMs-v2025.pdf)。

最新进展(2025–2026)

OWASP 榜单两代并存。 2025 版为 LLM01 Prompt Injection、LLM02 Sensitive Information Disclosure、LLM03 Supply Chain、LLM04 Data and Model Poisoning、LLM05 Improper Output Handling 等(OWASP LLM Top 10: A Builder's Map)。2026 版(v1.0,日期为 2026 年 8 月 3 日)排序为:LLM01 Prompt Injection、LLM02 Sensitive Information Disclosure、LLM03 Excessive Agency、LLM04 Supply Chain、LLM05 Data and Model Poisoning、LLM06 Unbounded Consumption、LLM07 Misinformation、LLM08 Hidden Context Exposure、LLM09 Vector and Embedding Weaknesses、LLM10 Improper Output Handling(CSA:OWASP's 2026 LLM Top 10、OWASP GenAI LLM Top 10 2026 概览)。相比 2025 版,最显著的变化是 Excessive Agency 从 LLM06 升至 LLM03(OWASP LLM Top 10 2026 对照)。一个第三方整理指出 2026 版为 v1.0(OWASP LLM Top 10 (2026): Official List and What Changed)。

间接提示注入进入实战。 2026 年 4 月下旬,Google Security 与 Forcepoint X-Labs 相继发布分析,确认攻击者已在开放网络中埋入隐藏指令以劫持浏览型 AI 代理、编码助手与企业 copilot;Palo Alto Networks Unit 42 亦有相关观测(CSA:Indirect Prompt Injection Goes Operational)。2026 年 7 月,Noma Security 披露 GitLost:利用公开 GitHub issue 中嵌入的隐蔽指令,诱使 GitHub 的 Agentic Workflow(按 issues.assigned 事件触发)在公开评论中泄露私有仓库数据(Indirect Prompt Injection Exploits GitHub's AI Agent)。Zenity 则公开了针对 Claude 与 ChatGPT/Atlas 代理式浏览器能力的零点击注入手法,攻击面涵盖邮件与 X 帖子,无需受害者主动交互(Claude and ChatGPT Hijacked via Zero-Click Prompt Injection)。

防御范式转向"抗社工"。 OpenAI 在其官方文章中表示,现实中效果最好的注入攻击越来越像社会工程而非简单的提示覆盖,因此防御重心应从"识别恶意字符串"转向抵抗误导与操纵性内容(Designing AI agents to resist prompt injection)。研究者进一步提出 Agent Data Injection(ADI):不把不可信数据当作指令,而是伪造模型依赖的、被当作可信锚点的元数据(如评论作者/角色、邮件 sender、Web UI 元素标识、工具调用历史),使代理在执行用户原始任务的同时作用于伪造元数据(Agent Data Injection (ADI))。

Agent 与工具链成为主战场。 MCP(Model Context Protocol)相关的工具投毒(Tool Poisoning Attack,由 Invariant Labs 首次识别)利用模型对工具描述文本的天然信任触发未授权行为;多工具阈值投毒等新手法(如 ShareLock)被陆续提出(ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP)。协议层亦被质疑:对 MCP STDIO 设计缺陷的分析指出,攻击者若能写或影响 MCP 配置文件,可在无需模型参与的情况下获得主机上的任意代码执行路径,影响范围被估计覆盖 20 万以上 AI 部署(CSA:MCP STDIO Design Flaw Enables Systemic AI Supply Chain RCE)。由于基础协议规范未强制认证与授权,大量部署在未验证调用方身份的情况下接受连接或工具调用,OWASP MCP Top 10 将认证/授权不足列为 MCP07:2025(CSA:Poisoned Foundations: The AI Developer Toolchain Attack Surface)。OWASP 的 Agent Memory Guard 项目则聚焦记忆投毒——持久化代理记忆可被运行时篡改并跨会话延续,不同于模型权重(OWASP Agent Memory Guard)。

模型与数据供应链。 2026 年 5 月 10 日,攻击者注册 Hugging Face 组织 Open-OSS 并发布仿冒的 privacy-filter 仓库,模仿合法模型 OpenCSS/privacy-filter(Defending Against Fake HuggingFace Repository Attacks)。评论普遍指出,最直接的防御是放弃 Pickle、强制使用 safetensors——该格式只能存储张量数据,结构上无法在执行加载时运行任意代码;但仍需注意恶意元数据字段、导致解析器崩溃的损坏张量,以及"良性 safetensors + 恶意 pickle 或加载代码并存"的仓库(The Open-OSS Malware Attack and the ML Supply Chain Crisis、AI Red Teaming Guide: Supply Chain)。

规模与数据。 Zscaler ThreatLabz 的 2026 AI 威胁报告(2026 年 6 月 17 日)称,员工全年向 AI 工具上传企业数据 18,033 TB,同比增长 93%;仅 ChatGPT 就产生 4.1 亿次 DLP 策略违规,同比增 99%(Reading the Zscaler ThreatLabz Numbers)。Orca Security 的《2026 State of AI Security》称 51.5% 组织已用 AI 构建自定义应用,但 80% 的 SageMaker 部署仍启用全部五项核心不安全默认配置,81% 拥有 AI 包的组织至少存在一个已知高危漏洞,公开利用代码覆盖 50.1% 的告警(高于此前的 0.2%)(2026 STATE OF AI SECURITY REPORT)。转引的行业数据还包括:生产环境中成功攻击平均 42 秒完成、90% 泄露敏感数据(Pillar Security),提示注入攻击同比上升 340%(OWASP, Q1 2026),13% 的组织已因 AI 模型或应用被入侵,其中 97% 缺乏基础 AI 访问控制(IBM)(OrcaRouter Releases AI Threat Report 2026)。

平台侧防护与监管要求。 微软观察到针对 Azure AI 模型部署的越狱尝试,并以 Prompt Shields(统一 API,检测用户提示攻击与间接攻击 XPIA)进行检测与阻断(AI as tradecraft: How threat actors operationalize AI)。2026 年 8 月,欧盟《AI 法案》(EU AI Act)进入全面适用,其第 50 条要求对面向公众传播的深度伪造与 AI 生成文本进行强制标注(Défense contre les Attaques IA Générées)。此外,2026 年新增的 OWASP Top 10 for Agentic Applications 列出 Agent 目标劫持(ASI01)、工具滥用(ASI02)、身份与权限滥用(ASI03)、Agentic 供应链漏洞(ASI04)、意外代码执行(ASI05)等风险(Apps, APIs, and DDoS 2026 — Akamai)。

防御建议与治理框架。 业界建议将提示、检索文档、工具响应等外部内容一律视为不可信输入,对直接/间接提示注入、投毒、对抗输入、模型窃取与不安全集成进行测试,并校验模型输入输出(Cloud Security 2026: When AI is the Weapon and the Target)。OWASP 提供 LLM Top 10 控制项,NIST AI RMF 则用于持续跟踪风险(2026 and the Rise of AI-Based Cyberattacks)。针对深度伪造与 AI 生成钓鱼,仅靠安全意识培训已不足,需结合高风险请求的带外验证(out-of-band verification)、抗钓鱼 MFA 与深度伪造检测(AI Cybersecurity: Defending Against AI-Powered Attacks)。

核心技术与关键概念

代表性项目 / 公司 / 产品(附官方链接)

关键数据与评测结果(附来源)

指标数值来源
企业向 AI 工具上传数据18,033 TB/年(+93%)Zscaler 2026 AI Threat Report 解读
ChatGPT DLP 违规4.1 亿次(+99% YoY)同上
SageMaker 不安全默认全开比例80%Orca 2026 State of AI Security
含高危漏洞的 AI 包组织占比81%同上
提示注入攻击同比增幅340%(OWASP, Q1 2026)OrcaRouter AI Threat Report 2026
因 AI 被入侵的组织占比13%(其中 97% 缺基础访问控制,IBM)同上
AgentDojo 任务数97LlamaFirewall(arXiv)

趋势与争议

参考来源

← 向量数据库与嵌入检索应用安全 →