跳到正文

安全与对抗

覆盖越狱、提示注入、数据泄露、对抗评测与安全机制,优先保留有攻击路径、实验结果或可复现材料的研究。

最新精选

第 121–122 条 · 共 122 条
8月25日周二
  1. Anthropic News68

    Anthropic 启动 500 万美元资助计划以建立独立的 AI 用户福祉评估体系

    Anthropic 宣布推出 500 万美元的赠款项目,旨在资助独立研究团队开发开源工具,用于评估 AI 模型对用户福祉的具体影响。该项目不仅提供资金,还开放模型访问权限与技术支援,要求受助者完全独立地构建评估框架,并将成果开源供全行业复用。此举针对的是当前行业在缺乏统一标准的情况下,难以界定模型在陪伴、情感支持及心理健康危机等复杂场景下的行为边界。 该计划明确了评估必须满足的五项核心标准:清晰定义测量指标及其意义;引入临床专家参与设计与验证;同时测试过度合规(overcompliance)与拒绝过度(overrefusal)的风险;构建反映多轮对话中风险动态变化的真实场景;以及验证评分者与领域专家的校准度。材料特别指出,福祉评估不同于单一答案的准确性判断,需要结合长上下文中的语境变化,例如区分普通减肥建议与针对饮食失调历史用户的潜在有害回应。 申请截止日期为 9 月 21 日,入选提案通知将于 10 月 5 日发布。这一动作标志着 Anthropic 试图通过外部独立视角来校正自身的安全策略,将原本依赖内部 Safeguards 团队的模糊经验转化为可量化的行业标准。事实层面是资金规模与验收标准的公开,推断层面是该举措意在降低全行业在情感交互领域的试错成本,猜测层面则是这种独立评估机制能否真正覆盖所有复杂的心理危机情境,目前尚需观察首批项目的实际产出。

    推荐理由:通过资助独立评估与明确验收标准,将行业对 AI 情感影响的衡量从内部黑盒转向可复用的开源基准。

8月14日周五
  1. Anthropic News70

    Anthropic 宣布 Claude 将采用基于 SynthID-Text 的水印以符合欧盟 AI 法案

    Anthropic 宣布未来 Claude 模型生成的文本将包含不可见的水印,旨在配合欧盟 AI 法案及全球约 190 家签署方的《透明度实践准则》。该机制利用 Google DeepMind 2024 年发表的 SynthID-Text 方法,通过微调生成过程中的随机性选择来嵌入模式,确保人类读者无法区分水印与非水印内容,且不增加额外 Token 成本或降低输出质量。 核心事实在于水印不修改词汇语义,也不添加隐藏字符,而是改变决定下一个词来源的随机数种子(如从骰子改为圆周率序列)。这意味着检测器只能判断“文本是否由 Claude 参与生成”的概率,无法确认具体作者、组织或对话记录,也无法在短文本、高事实准确性段落(如代码逻辑)或经过重度人工编辑的内容中有效工作。此外,文件类输出将采用 C2PA 标准在元数据中附带数字凭证,与文本水印机制分离。 推断显示,由于 EU 法规过渡期允许旧模型延后实施,且 Anthropic 目前缺乏按区域精确控制的技术手段,因此采取全球统一上线策略。猜测认为,随着检测 API 向监管机构、执法部门及企业开放,行业将出现针对水印鲁棒性的对抗性测试,但彻底重写文本仍可能绕过检测,这要求后续工具需结合多种信号而非单一依赖水印。

    推荐理由:澄清水印仅改变随机性种子而非内容,且无法追溯用户,直接校正对隐私泄露和检测能力的误判。