AI 黑客攻击
概述
AI 黑客攻击大致可从两个方向定义。其一,是以人工智能模型本身为目标,诱导其出现误动作、信息泄露、绕过安全防护(越狱)的攻击;其二,是滥用生成式 AI 作为攻击工具,提升既有网络攻击的规模与精细程度的行为。2022 年 ChatGPT 问世后,随着大规模语言模型(LLM)渗透到各行各业,安全业界开始同时将 AI 视为“需要保护的资产”和“新型攻击武器”。
主要内容
1. 以 AI 为目标的攻击
提示注入(Prompt Injection)
最具代表性的 LLM 漏洞。在用户输入或外部文档、网页中隐藏恶意指令,使模型忽略原本的系统指令。直接注入是用户直接注入命令的方式;间接注入则是在模型所读取的网页、电子邮件、PDF 中埋入命令的方式。2023 年以后,它在 OWASP 的 LLM 应用 Top 10 中位居第一,而在智能体型 AI 调用工具的结构中,它可能演变为实际系统权限的夺取,因此危险程度急剧上升。
越狱(Jailbreak)
通过角色扮演、虚构情景、多语言绕过、编码转换等手法,使模型的安全对齐(Safety Alignment)失效,从而输出被禁止的信息。“DAN”提示词是早期的典型案例,此后又出现了自动化的攻击提示词搜索研究。
对抗样本(Adversarial Examples)
在图像、语音、文本中添加人类难以察觉的微小扰动,误导模型的判断。可被用于自动驾驶识别错误、人脸识别绕过、恶意代码检测规避等。
数据投毒与后门
在训练数据或微调数据中混入恶意样本,使模型对特定触发输入给出有意为之的错误答案。随着开源模型分发生态的壮大,它已成为供应链攻击路径。
模型窃取·逆向工程(Model Stealing)与成员推断
通过大量执行 API 查询来复制模型的行为,或判定训练数据中是否包含特定个人信息,从而侵犯隐私。
2. 利用 AI 的攻击
- 深度伪造·语音克隆诈骗:伪造高管语音或视频通话以诱导转账的手法。2024 年在香港,有人利用伪造的视频会议实施了约 2500 万美元规模的诈骗。
- 自动化钓鱼:用生成式 AI 批量生产没有语法错误的定制化鱼叉式钓鱼邮件。
- 加速漏洞探测:代码生成模型可快速生成模糊测试器(Fuzzer)与漏洞利用(Exploit)草案,缩短漏洞发现周期。
- 恶意代码变种:通过混淆与多态代码生成来规避杀毒软件检测。
- 滥用 AI 智能体:夺取赋予自主智能体的文件、支付、邮件权限,使其自动执行攻击。
3. 防御手法
代表性的有输入·输出过滤与护栏、系统提示词隔离、最小权限原则、工具调用审批流程、RLHF·宪法式 AI 等对齐手法、差分隐私与联邦学习、水印与来源标注(C2PA),以及持续性红队评估。近来,同时部署基于 AI 的检测模型的“AI 对 AI”格局正日趋普遍。
最新动向
2024~2025 年的核心变化在于,攻击目标已从“聊天机器人”转移到“智能体”。随着 LLM 直接调用文件系统、浏览器、支付 API、MCP(Model Context Protocol)服务器等外部工具,已有报告显示一次提示注入就会导致实际的数据泄露或资金转账事故。2025 年,主要 AI 企业接连发布指南,限制自主智能体的工具权限并强制要求人类在环(Human-in-the-Loop)审批。
在监管层面,欧盟《AI 法案》于 2024 年生效,并于 2025~2026 年进入分阶段实施;美国则以 NIST AI 风险管理框架为中心,并行推进自律监管与联邦采购要求。韩国方面,2025 年《AI 基本法》(关于人工智能发展与信任基础营造等的框架法)在国会通过,即将于 2026 年施行,其核心争点在于生成式 AI 结果标注义务与高影响 AI 安全保障措施。此外,各国 CERT 与安全企业正在扩大 LLM 漏洞报告体系与 AI 专用漏洞赏金计划。
在技术层面,多模态攻击(隐藏在图像中的指令、音频注入)与长期记忆(Memory)污染攻击已成为新的研究课题;在防御侧,结合形式验证与沙箱化的智能体隔离架构正受到关注。
相关主题
- [[提示注入]]
- [[对抗攻击]]
- [[生成式 AI]]
- [[网络安全]]
- [[深度伪造]]
- [[AI 监管]]