跳到正文

#多模态

今日 4 条
今天10月2日周五
  1. arXiv cs.CR78

    黑盒多模态 RAG 数据提取攻击在 2500 次查询中最多重建 611 张放射科图像

    针对图像返回型多模态 RAG 的黑盒自适应数据提取攻击把恶意指令嵌入用户输入图像,而不是把恶意查询放在文本 prompt 中。实验覆盖医疗助手、文档助手和通用工具三个场景,在多个 CLIP-family retrievers 与不同 generators 下,单次 2500-query run 在 local-feature correspondence 下最多重建 611 张放射科图像、566 份文档扫描和 416 张通用图像,并达到非自适应 baseline 最多 5.6 倍。事实是攻击可沿 embedding space 中仍能产生新检索的区域自适应推进;推断是 MRAG 的图像检索与返回通道本身构成数据源泄露入口,防护需要覆盖多模态输入、检索和图像输出,而不只是文本 prompt。

    推荐理由:它把多模态 RAG 的数据提取风险从文本提示扩展到图像输入,并给出黑盒自适应攻击的量化结果,能直接校正对 MRAG 安全边界的判断。

  2. arXiv cs.CR68

    ReCast 用合同保持的改写框架保护固定接口多模态推理中的源内容

    ReCast 是一个 agentic plug-in 框架,用于在调用远程多模态模型时保护私有输入。它不是简单做文本脱敏或身份匿名化,而是保留任务相关关系和所需输入模态,替换源特定内容,从而在图表、语音等固定媒体接口下降低敏感内容暴露。 具体机制上,ReCast 先在本地把输入转换成共享的文本 evidence-query record,再用一个蒸馏出的 4B 模型联合改写实体和主题,并通过本地可逆、角色感知的数值映射替换数值。随后由重建 agent 从受保护记录生成并验证所需媒体。远程 solver 返回程序后,受保护操作数会在本地执行前恢复。论文在 4,000 个 ChartQA 和 NMSQA 留出样本上报告了结果:ReCast 达到 75.10% 准确率,保留了未保护远程准确率的 92.43%;基于模型的审计标记出 7.95% 的 solver-bound 请求存在源内容泄漏。 这篇工作的关键增量在于,它把隐私保护问题从“隐藏身份”重新定义为“保持任务合同但替换源内容”。事实是论文给出了准确率、保留率和泄漏率三项指标;推断是这种方法更适合必须向远程多模态服务提交图表或语音、但又不能直接暴露原始内容的场景;猜测是其实际部署价值取决于审计模型对泄漏的识别能力是否足够可靠。

    推荐理由:它把隐私保护从“匿名化”推进到“合同保持的可重写接口”,可改变多模态外包推理的安全设计判断。

  3. arXiv cs.CR72

    UnifiedAttack 评测大尺寸多模态模型在协同有害图文生成中的安全漏洞

    UnifiedAttack 是一个针对原生统一多模态模型的安全评测基准,重点不是单模态有害内容,而是文本与图像协同后产生的额外危害增益。论文同时提出一个协同劫持框架,用 In-Context Reskinning 和 Cognitive Planning Injection 验证漏洞:前者通过 few-shot 方式把对抗意图包装进看似良性的虚拟外壳,降低安全过滤敏感度;后者强制模型先进入中性逻辑规划,再利用其保持一致性的倾向诱导后续生成有害多模态内容。 论文称在多种先进架构上,UnifiedAttack 能持续绕过现代对齐机制。这个结果的关键含义是,统一模型的结构性有用性和逻辑连贯性可能被系统性武器化,因此仅靠单模态内容过滤或通用拒答策略不够,安全防御需要进入协同生成任务的逻辑规划层。 事实是论文提出了基准、攻击方法和实验结论;推断是这类攻击对统一多模态产品尤其相关,因为图文同模型生成会减少跨模块审查点;猜测是未来安全评测会增加 logic-aware defenses 和跨模态协同风险指标。

  4. arXiv cs.AI68

    MemFit 提出无 LLM 写入与检索的长期智能体记忆系统

    MemFit 提出一种无 LLM 写入与检索的长期智能体记忆系统,并在三个基准上报告 SOTA 与数倍构建时间与成本下降。 现有长期记忆系统常依赖 LLM 智能体组织和整合记忆,导致写操作昂贵且低效;MemFit 改为把每轮对话原文近即时追加到 append-only store,用 segment summaries 索引,而不是通过压缩丢弃表面细节或替换原始轮次。 检索侧使用无 LLM 的多路径检索策略,结合词汇与语义信号和 cross-encoder reranking,对 caption-augmented episodes 做重排,覆盖文本与多模态设置。 事实是论文报告了上述机制和 LoCoMo、MemGallery、LongMemEval-S 上的 SOTA 与数倍构建时间、成本下降,并称其提供可扩展、高效的 persistent agentic memory;推断是它可能降低高频对话中的调用成本;猜测是真实长周期 Agent 场景效果仍需完整论文验证。

    推荐理由:它把长期记忆写入从大模型调用改为无大模型调用的追加索引,能校正对智能体记忆成本、延迟、可扩展性与可用性的判断。