跳到正文

能力边界与评测

只收能改写模型上限或下限判断的评测与真实系统证据,关注失败条件、可复现性和外推限制。

最新精选

第 41–43 条 · 共 43 条
9月30日周三
  1. arXiv cs.CR80

    CipherGenome 协议利用同态推理保护基因组混合专家模型中的序列隐私

    CipherGenome 提出一种针对基因组基础模型的稀疏混合专家(MoE)网络的同态推理协议,解决将私有基因组发送至租赁加速器时面临的数据泄露风险。该协议将 151 亿参数模型中的嵌入、注意力机制和路由层保留在可信的轻量级客户端,而将占参数总量 95.8% 的专家投影层外包给不可信且可能串通的 GPU 服务器,全程基于模块-LWE 加密进行。 实验显示,单个服务器若仅托管一个专家层,能以 99.8% 的 top-1 准确率恢复输入核苷酸,构成严重的安全漏洞;而 CipherGenome 通过利用专家层线性结构、公开权重及 GPU 整数张量核心在模 $2^{48}$ 下精确评估密文 - 权重乘积的特性,在不需多项式近似或自举的情况下实现了安全推理。在 12 个细菌基因组的 72 个窗口测试中,加密带来的 KL 散度增加低于预注册的非劣效性边界,与 bf16 推理结果无法区分,同时使上述逆向攻击降至随机水平。此外,通过可复用公共提示、线压缩和每层填充技术,端到端延迟降低 3.54 倍,流量减少 6.8 倍,路由泄露准确率从 54.9% 降至 8.9%,且兼容同态的 int4 专家层性能未劣于明文版本,单专家单 token 的服务器端成本比 CKKS 基线低六个数量级以上。 事实层面,该研究验证了特定架构下同态推理的工程可行性与安全性提升;推断层面,这暗示未来基因组大模型可能转向“端侧处理敏感逻辑 + 云侧执行密集计算”的混合部署模式;猜测层面,此类方案若推广至通用 LLM,可能改变当前依赖全量加密或差分隐私的行业路径,但具体落地仍受限于硬件对整数运算的支持程度。

    推荐理由:材料证明在 MoE 架构下通过同态加密实现基因数据推理的可行性,直接校正对隐私计算工程成本的认知。

  2. arXiv cs.CR78

    GenomeOcean 15B MoE 模型在 WebGPU 上实现隐私保护的分布式推理

    该论文提出 GenomeOcean Anywhere 系统,使一个 150 亿参数的基因组混合专家(MoE)模型能在志愿者浏览器中运行,无需将原始 DNA 序列发送至数据中心。系统通过可信协调器处理注意力与路由,利用手写 WebGPU 内核在浏览器中执行专家前馈网络,并采用实值拉格朗日编码计算保护专家输入,确保单个设备无法获取完整序列。 实证数据显示,在 GenomeOcean-MoE(8 个专家、top-2 路由、24 层)上,浏览器路径在各量化级别下与原生性能一致,分布式路径的数值噪声保持在 BF16 底噪水平(KL 散度 0.0036 nat/token)。未拟合的延迟模型在模拟广域网链路下的解码时间预测中位数误差仅为 0.74%。实验表明,明文专家输入存在严重隐私泄露风险,攻击者可通过单向量恢复 token,且仅凭 300 个无序 token 即可以 92% 准确率识别来源基因组;而引入编码专家后,自适应攻击者表现回落至最频繁 token 基线,单 worker 对每个 token 的信息量被限制在每次前向传播低于 1 bit,且 Chrome 环境下的解码耗时为 220 至 376 ms/token。 事实层面,该系统已验证在浏览器端运行大参数基因组模型的可行性与安全性;推断层面,这意味着未来敏感生物数据推理可能不再依赖中心化算力集群,而是转向边缘协同架构;猜测层面,若此类技术扩展至其他垂直领域,可能重塑医疗 AI 的数据合规边界。文中未提及具体商业化时间表或企业落地案例,所有结论均基于 arXiv 预印本中的实验数据。

    推荐理由:材料证明分布式浏览器推理可兼顾隐私与精度,直接修正对基因组模型必须依赖数据中心的判断。

9月23日周三
  1. Anthropic News80

    Anthropic 发布 Claude 自主发现新型酶系统 ART 的预印本与实验室验证结果

    Anthropic 正式宣布其生命科学团队利用 Claude 模型自主发现了一种名为 array-associated reverse transcriptases (ART) 的新型酶系统,该发现基于对噬菌体 DNA 序列的深度挖掘,并伴随 CRISPR 样重复序列特征。这一成果并非简单的模式匹配,而是 AI 智能体在缺乏具体功能假设的情况下,通过扫描海量数据识别出未被表征的蛋白家族,并主动提出假设、生成报告供人类科学家验证的完整科研流程。 关键事实细节显示,此次发现过程由约 950 个 Agent 并行运行,消耗 2.1 亿 tokens,耗时 21 小时完成初步搜索。Claude 在分析超过 20 万种逆转录酶(RT)时,注意到一个异常 RT 基因旁存在独特的串联重复阵列,这种布局此前仅在少数可编程系统中出现过。虽然该系统的生物学功能尚待进一步实验确认,但其包含逆转录酶、伴侣基因和长重复序列阵列的三要素结构已引发 MIT 教授 Feng Zhang 等专家的重视,认为其值得深入调查。Anthropic 强调,人类科学家仅负责初始提示词设定和后续湿实验验证,中间的数据筛选、逻辑推理及假设生成均由 AI 独立完成。 推断表明,这标志着 AI 在基础科学研究中的角色正从“加速现有流程”向“定义新科研范式”迁移,即建立人机协作的新工作流,其中 AI 负责大规模假设生成与初筛,人类负责高价值候选物的实验验证。猜测层面,若 ART 系统被证实具有类似 CRISPR 的可编程性,它可能成为下一代基因编辑或合成生物学的核心工具。目前 Anthropic 已公开相关预印本,并邀请外部科学家合作扩展该方法论,但需区分的是,文中明确说明所有湿实验操作仍由人类在 BSL-1/2 级实验室完成,AI 并未直接操控物理设备。

    推荐理由:材料展示AI自主发现新酶系统的完整闭环,将改变对AI在基础科学中从辅助工具转向独立发现者的判断。