Prompt Injection as an Emerging Threat: Evaluating the Resilience of Large Language Models

发布时间:2026/7/26 9:32:11
Prompt Injection as an Emerging Threat: Evaluating the Resilience of Large Language Models 文章总结与翻译一、主要内容该研究聚焦大型语言模型(LLMs)面临的提示注入(Prompt Injection)威胁,提出了一个统一的评估框架,用于量化模型对这类攻击的抵御能力。核心背景提示注入是一种新型对抗性攻击,攻击者将恶意指令隐藏在用户输入或外部内容中,导致模型忽略原定任务、违反安全约束或产生非预期输出。随着LLMs日益整合外部工具、API和检索系统,这类攻击的风险愈发突出,而现有研究缺乏统一的量化评估标准。研究设计评估框架:包含三个核心指标与一个综合得分,从多维度衡量模型韧性:韧性退化指数(RDI):衡量注入攻击导致的任务性能下降程度;安全合规系数(SCC):量化模型产生安全响应的比例与置信度;指令完整性指标(IIM):通过输出嵌入的余弦相似度,评估模型对原定指令的坚守程度;统一韧性得分(URS):加权整合上述三指标,提供整体韧性评估。实验设置:选取4个代表性指令微调模型(GPT-4、GPT-4o、LLaMA-3 8B Instruct、Flan-T5-Large),在问答、摘要、翻译、推理、代码生成5类常见任务上进行测试。构建500个清洁提示,并转化为4类对抗性变体(直接指令覆盖、上下文污染、间接注入、目标劫持/语义漂移),共2500个测试样本。