跳到正文

能力边界与评测

只收能改写模型上限或下限判断的评测与真实系统证据,关注失败条件、可复现性和外推限制。

最新精选

第 21–23 条 · 共 23 条
10月2日周五
  1. Hacker News · AI78

    Quail 如何用 roofline 模型估算 AI-SQL 过滤器的延迟成本

    Quail 团队提出用 roofline 模型估算 AI-SQL 过滤器延迟,而不是为每个模型、GPU 或工作负载重新 profiling。在 H100 和 Qwen3-4B-fp8 上,5,000 条 IMDB 评论的单过滤器 SoL 下界为 6.64 秒,三过滤器最优顺序 F2→F1→F3 的 SoL 下界为 6.86 秒。这个模型把 LLM 查询计划从经验 profiling 变成可计算的硬件下界,核心不是 token 数,而是 FLOPs、HBM 流量、KV 复用和 filter 选择率。 成本模型把每个 filter 拆成 projection、attention 和 MLP,分别计算 FLOPs 与 HBM 流量,再取 max(FLOPs/峰值算力, bytes/HBM 带宽)。单过滤器 5,000 条评论需要 16 次 forward pass,projection 1.6778 秒、attention 0.1850 秒、MLP 4.7818 秒,全部 compute-bound。多过滤器时,共享 prefix 的 KV cache 可复用,HBM 容量把 batch 限制到约 1,200 条文档;排序规则用 ask cost/(1-selectivity) 给后续 filter 排名,并尝试每个 filter 作为第一个,例子中 F2 先执行比 F1 先执行低约 4.7%。 事实是 SoL 是硬件峰值下的下界,实际运行可能更长,因为峰值算力和跨 filter overlap 不一定达到。推断是 LLM 查询引擎的查询计划器必须把模型结构、量化格式、KV 复用和 filter selectivity 纳入成本,而不是只看 prompt token 数;GQA、FP8 权重和较小 KV footprint 会直接影响可批处理文档数。猜测是如果后续扩展到 AI JOIN、AI CLASSIFY 和 Blackwell FP4,硬件感知成本模型会成为 AI-SQL 产品差异化的关键。

    推荐理由:它把 AI-SQL 过滤器的延迟估计从逐模型 profiling 转为 roofline 下界,并给出 filter ordering 与 KV 复用成本模型,能校正 LLM 查询引擎优化方向。

10月1日周四
  1. The Decoder92

    OpenAI 称已阻断窃取模型推理的攻击,但微软 Azure 上的漏洞仍被利用

    OpenAI 在 7 月成功关闭了针对其模型推理链的提取活动,涉及超过 15,000 个账户,并将核心行为归因于与 Moonshot AI 有关联的人员,但研究人员随后证实该攻击在 Microsoft Azure 上依然有效。尽管 OpenAI 自身 API 已修复加密推理重放漏洞并引入流输出筛查,Azure 平台直到 9 月 27 日才为 GPT-6 Astra 等模型补上防护,期间攻击者仍能通过单一请求完整获取包括 GPT-6 Astra 和 Anthropic Sonnet 5 在内的模型隐藏思维过程。 除加密重放外,另一更简单的“虚拟便签”工具调用方法也被证实能绕过所有 OpenAI 模型及 Opus 4.8、Sonnet 5 的防御,仅 Fable 5 系列未受影响。研究人员指出,现有修复措施依赖脆弱的模式匹配且覆盖不全,GPT-6 Astra 在第三方平台上线时甚至缺乏任何保护。这种同一模型在不同云平台面临不同安全等级的现象,暴露了供应链中防护标准不统一的系统性风险。 事实层面,OpenAI 确认了攻击路径并修补了自有服务,但 Azure 端点存在明显的时间滞后;推断层面,若云厂商不执行同等强度的推理隔离,API 层面的出口管制将被轻易绕过;猜测层面,随着模型能力提升,针对云侧弱点的自动化攻击可能会进一步复杂化。这要求产品决策者在选择托管方案时,必须将云厂商的安全承诺视为与模型能力同等重要的变量,而非默认信任。

    推荐理由:材料把收入增长拆到客户和成本结构,能直接校正对商业化质量的判断。

9月23日周三
  1. Anthropic News80

    Anthropic 发布 Claude 自主发现新型酶系统 ART 的预印本与实验室验证结果

    Anthropic 正式宣布其生命科学团队利用 Claude 模型自主发现了一种名为 array-associated reverse transcriptases (ART) 的新型酶系统,该发现基于对噬菌体 DNA 序列的深度挖掘,并伴随 CRISPR 样重复序列特征。这一成果并非简单的模式匹配,而是 AI 智能体在缺乏具体功能假设的情况下,通过扫描海量数据识别出未被表征的蛋白家族,并主动提出假设、生成报告供人类科学家验证的完整科研流程。 关键事实细节显示,此次发现过程由约 950 个 Agent 并行运行,消耗 2.1 亿 tokens,耗时 21 小时完成初步搜索。Claude 在分析超过 20 万种逆转录酶(RT)时,注意到一个异常 RT 基因旁存在独特的串联重复阵列,这种布局此前仅在少数可编程系统中出现过。虽然该系统的生物学功能尚待进一步实验确认,但其包含逆转录酶、伴侣基因和长重复序列阵列的三要素结构已引发 MIT 教授 Feng Zhang 等专家的重视,认为其值得深入调查。Anthropic 强调,人类科学家仅负责初始提示词设定和后续湿实验验证,中间的数据筛选、逻辑推理及假设生成均由 AI 独立完成。 推断表明,这标志着 AI 在基础科学研究中的角色正从“加速现有流程”向“定义新科研范式”迁移,即建立人机协作的新工作流,其中 AI 负责大规模假设生成与初筛,人类负责高价值候选物的实验验证。猜测层面,若 ART 系统被证实具有类似 CRISPR 的可编程性,它可能成为下一代基因编辑或合成生物学的核心工具。目前 Anthropic 已公开相关预印本,并邀请外部科学家合作扩展该方法论,但需区分的是,文中明确说明所有湿实验操作仍由人类在 BSL-1/2 级实验室完成,AI 并未直接操控物理设备。

    推荐理由:材料展示AI自主发现新酶系统的完整闭环,将改变对AI在基础科学中从辅助工具转向独立发现者的判断。