跳到正文

#MCP/工具调用

今日 16 条
今天10月2日周五
  1. Hacker News · AI78

    deepsense.ai 提出面向生产的 AI 系统评估模式,用 harness、重复运行和失败诊断替代公开 benchmark 做部署判断

    deepsense.ai 提出,生产 AI 系统评估不应以公开 benchmark 分数作为部署依据,而应评估模型、harness、工具、记忆、执行路径、可靠性、成本和业务结果。文章认为,2026 年公开评估已更接近端到端专业工作流,但 benchmark 分数只说明特定测试协议下的表现,不能证明系统会泛化到真实用户、数据、工具和约束;公开 benchmark 更适合建立候选短名单,而不是直接决定上线。 两个细节最能说明问题。事实是,OpenAI 在 ARC-AGI-3 中展示,启用 retained reasoning 和 compaction 后,GPT-5.6 Sol 的分数从 13.3% 提升到 38.3%,同时输出 token 约少 6 倍;模型没有变,变的是系统如何保存推理和管理上下文。作者自己的 EDA benchmark 也显示,Claude Fable 5 的平均分 0.50 高于 GPT-5.6 Sol 的 0.48,但按重复运行方差调整后,GPT-5.6 Sol 的可靠性调整分 0.46 高于 Claude Fable 5 的 0.42,说明平均分可能隐藏不稳定。文章还指出,工具响应可能事实正确但不可用,例如缺少单位、结构不适合下游 agent、没有回答用户目标。 从事实看,文章把部署前评估、生产监控和失败回归串成三个循环,并提到 Harbor 保存完整轨迹、轻量模型聚类问题、人工审查关键 trace。推断上,这会改变模型切换决策:团队更可能依据自有回归集、首跑成功率、单位成功成本和失败诊断,而不是公告分数;对交易、客服或合规类 agent,重复成功比单次高分更重要。猜测上,评估平台可能成为企业 AI 工程的核心资产,但原文没有给出市场、收入或采用率证据。

    推荐理由:它把部署判断从公开基准分数转向生产运行环境、重复运行方差、单位成功成本和失败诊断,能校正高分模型即可上线的误判。

  2. Hacker News · AI87

    Pi Coding Agent 与 Jev 的集成用例展示用概率门控、路由和压缩控制编码智能体工具调用

    Pi Coding Agent 与 Jev 的集成用例展示如何在工具调用前后用概率门控、路由和压缩控制编码智能体。材料给出的事实是 Jev 不生成文本,调用 193 到 642 ms,并把执行前安全门、输出判断、工具发现、上下文压缩和模型选择拆成多个扩展。关键细节是 no_secret_egress 阈值从 0.97 提到 0.99 时,0.02 的凭据外泄命令会从拒绝区进入模糊区并默认放行;据此推断该机制能减少审批疲劳,但批准命令仍在主机直接运行,不能替代沙箱。

    推荐理由:它把编码智能体的工具调用安全门拆成概率阈值与本地脱敏,并指出提高阈值可能让凭据外泄落入模糊区,能校正对自动执行安全性的判断。

  3. InfoQ 中文78

    谷歌开源面向自主 AI 代理的 Kubernetes 风格编排器 AX

    谷歌开源了名为 AX 的 Kubernetes 风格编排器及声明式运行时,旨在执行和扩展自主 AI 代理的工作负载。 AX 基于 Agent Substrate 运行,将代理视为有状态的 Actor 沙箱。当代理处于等待模型响应或外部 API 反馈的空闲期时,平台会保存执行状态检查点并挂起,以亚秒级时间恢复且无冷启动延迟,从而将数十个任务复用到共享主机工作进程上,解决传统容器在代理空闲期算力利用率不足的问题。 事实是 AX 提供了 Task、Workspace、Gateway 和 Model 四个声明式原语,并支持通过 Go 语言编写的 ax 命令行工具进行部署和调试。推断是,对于需要管理大规模、长期运行代理集群的企业而言,AX 提供了一种比传统微服务或批处理任务更契合代理状态性、突发性和长期运行特征的基础计算原语,但社区也指出其依赖 Kubernetes 集群和自定义 CRD 会带来较重的运维开销。

    推荐理由:AX 将 AI 代理视为有状态 Actor 而非无状态微服务,通过亚秒级暂停与恢复解决空闲期算力浪费,为构建大规模长期运行的 Agent 集群提供了直接的基础设施参考。

  4. Hacker News · AI78

    Free Coding Agent 开源发布,为前沿模型提供本地 MCP 编码执行层

    Free Coding Agent 是一个开源、provider-neutral 的 MCP 执行层,目标是让任何支持 MCP 或等效远程工具的模型在开发者本地工作站上获得真实编码能力。它提供文件读写、多文件补丁与回滚检查点、shell 命令、PTY、Git 操作、LSP 诊断、Playwright 浏览器自动化、Windows UI 自动化等资源,并通过本地 stdio、认证 HTTP 或用户自建的 HTTPS 端点接入。 材料中最值得注意的是它的“无共享项目基础设施”设计和 Durable Agent Mode。项目不要求统一中继、账号、API key 或官方隧道,远程访问由用户自己的 Tailscale Funnel 或 Cloudflare Tunnel 承担,本地生成 MCP bearer token 并绑定 127.0.0.1。任务内核用 append-only journal、幂等键、任务 DAG、leaseKey 独占、跨进程锁、验证命令和可配置修复轮数来协调多 Agent 编码,强调失败会显式标记为 interrupted 而非伪装成功。 事实是该项目给出了较完整的本地执行、权限沙箱和任务审计机制,并明确不抓取或自动化 LM Arena 私有 UI。推断是它试图解决编码 Agent 从聊天接口到工程环境的执行层标准化问题,适合与 OpenCode、IDE 或自托管模型组合。猜测是其实际价值取决于用户是否愿意自建隧道、维护 workspace allowlist,以及外部模型能否稳定利用这些工具。

    推荐理由:它把编码 Agent 的关键缺口从模型能力转向本地执行与任务核验,适合作为评估 MCP 工作流落地成本的样本。

  5. Hacker News · AI78

    Show HN:kamchatka 展示了一个上下文、权限和日志透明的 Linux 终端 agent

    kamchatka 是一个只面向 Linux 的终端 agent,把上下文、权限、日志和 shell 沙箱做成可审计的本地工具,核心结果是用 Landlock 与 seccomp 限制模型 shell,而不是依赖命令黑名单。它基于 nachalnik runtime,自研 tools、permission policy、compactor、confinement、served sessions、drawing 和 providers,目标是让模型每次调用都能被查看、授权和追溯。 材料给出的关键机制是权限按 subject 而不是工具名授权:fs:read 是 subject,fs 覆盖其下操作,MCP server 通过 nachalnik-mcp 声明 mcp:call,来源本身成为独立 subject,可用 --allow-server files 授权单个 server。它提供 fs、shell、context、fork、log、setup 六个工具,默认所有操作都要询问,包括读文件;/step 只执行一次状态机 transition,使“命令已决定、已允许、未运行”成为可暂停的 ready 状态。构建只支持 Linux x86_64 和 aarch64,需要 Rust 1.88 或更新,release 为 static musl,TLS 使用 rustls over ring。 对做 agent 产品的人,事实是它把控制面拆成上下文 tab、权限 prompt、输出截断、本地 transcript 和内核沙箱;推断是它适合需要本地审计、细粒度权限和最小供应链的开发者,不适合需要 macOS/Windows 或通用 npm 工具链的用户,因为 0.15.1 之后依赖 Landlock 和 seccomp。猜测是这类设计可能推动 agent 工具从功能堆叠转向可验证控制面,但材料没有提供采用数据或性能基准。

    推荐理由:它把上下文、权限、日志和 Linux 内核沙箱做成可审计的本地终端智能体,能校正对通用 agent 工具是否可控、可追溯的判断。

  6. Hacker News · AI78

    agent-chrome 让 Claude Code 在后台使用已登录 Chrome 而不抢占焦点

    agent-chrome 是一个开源 macOS 工具,让 Claude Code 通过复制的已登录 Chrome 配置文件浏览网页,同时把浏览器窗口放在其他应用后面,避免用户输入被自动化窗口打断。项目以 Claude Code 插件和本地代理形式发布,依赖 Node 18.3 或更高版本,代码约 500 行,仅监听 localhost,采用 MIT 许可。 关键细节是它不直接使用 Chrome 默认数据目录,而是用 APFS clone 复制一份用户配置文件,并关闭主题、标签、扩展等同步项,但密码、书签、自动填充和设置仍会同步回 Google 账户。代理以 --remote-debugging-pipe 启动 Chrome,再向 chrome-devtools-mcp 暴露兼容 /json/version、/json/list 和浏览器级 WebSocket 的本地接口,通过请求 ID 重写、目标状态缓存和共享会话让多个 Claude Code 会话共用同一个已登录窗口。 事实层面,它解决的是 macOS 上 Chrome 调试端口每次调用都会激活窗口、以及 pipe 只能由启动进程持有导致多会话冲突的问题。推断是这种代理模式比 headless Playwright 更适合需要人工处理登录、2FA 或 CAPTCHA 的场景,因为它保留可视化窗口和真实登录态。猜测是网站仍可能通过调试器痕迹、点击轨迹和输入节奏识别自动化,因此它更适合受信任工作流,而不是高对抗抓取。

    推荐理由:它把 macOS 上 Chrome 调试端口抢焦点的问题改成本地代理复用 pipe,能直接改善 Claude Code 多会话浏览自动化的人机协作体验。

  7. Hacker News · AI78

    Mixdog 开源 Windows 桌面编码 Agent,通过压缩上下文降低同模型运行成本

    Mixdog 是一个开源的 Windows 桌面与 CLI 编码 Agent,主打通过 cache-aware context、focused tools 和 compaction 降低同一模型的上下文开销与调用成本。项目给出的 Terminal-Bench 2.1 同模型对比显示,在相同 89 个任务和官方 verifier 下,Mixdog 与 Codex CLI、Claude Code 的结果接近或略高,但中位最终上下文更小、按 API 列表价计算的成本更低。 具体数据是:GPT-5.6 Sol xhigh 对比 Codex CLI 时,每次试验成本为 $0.476 对 $0.782,中位最终上下文为 18.5k 对 34.3k tokens,pass@5 为 96.6% 对 95.5%,耗时接近;Claude Opus 5 对比 Claude Code 时,每次运行成本为 $104.29 对 $129.21,中位最终上下文为 27.6k 对 38.2k tokens,任务通过 79/89 对 77/89,速度为 610 秒对 708 秒。这些数字基于固定源码版本、官方 Harbor verifier、fast mode off,且成本按当前 API 列表价计算,不是实际订阅账单。 产品层面,Mixdog 支持多会话、多 Agent 角色、MCP servers、skills、hooks、plugins、Browser Use、Windows Computer Use、Office 文档、图像视频 Studio,以及 Desktop、TUI 和配对浏览器之间继续同一会话。其效率机制包括轻量系统指令、限定范围的工具调用、ast-grep 和 code graph、provider-aware caching、结构化 compaction、空闲时压缩、按需加载提示词、数据库长期记忆和工具结果裁剪。事实是项目开源且提供了基准产物;推断是它竞争的不是模型能力,而是 agent harness 对上下文和成本的控制;猜测是实际节省仍会随 provider、工作负载和配置变化。

    推荐理由:它把 coding agent 的成本差异拆到上下文压缩、缓存和工具裁剪,可用来评估 harness 而非模型本身对预算的影响。

  8. arXiv cs.CR78

    LLMLeak 利用 LLM 的合法网页抓取能力把本地机密外泄给攻击者

    这篇 arXiv 论文提出名为 LLMLeak 的攻击:本地恶意软件自身不能直接联网,但可以把机密编码进 URL,并诱导 LLM 为完成看似正常的任务去访问该网页。当 LLM 使用其网页抓取工具请求这个地址时,攻击者控制的 DNS 或 Web 服务器就能收到机密,从而绕开对直接网络通信和生成代码外发的常规检测。 论文的关键细节是攻击不依赖网络库,也不要求 LLM 生成明显的发送代码,只利用 Agent 常见的 fetch website 能力。作者在 11 个开放参数模型上评估,报告攻击成功率为 79.7%,并在真实聊天机器人上做了案例研究。这说明风险不仅存在于理论构造,也可能出现在允许工具调用、网页浏览或插件式信息获取的产品里。 事实是论文展示了攻击路径、评估范围和成功率;推断是这种风险会提高对 Agent 出站请求的审计需求,尤其要识别 URL 中携带异常编码参数的抓取行为;猜测是未来防护可能把网页抓取工具纳入数据外泄面,而不是只把它当作普通联网功能。

    推荐理由:论文把网页抓取这类常见 Agent 工具变成隐蔽外泄通道,可提醒开发者在工具白名单和出站审计中区分“合法请求”与数据外带。

  9. arXiv cs.CR78

    OverAct 论文测量 LLM 工具调用智能体的主动过度授权,并用 SelfAudit 降低 43% 隐私过度访问

    OverAct 论文提出基准与 SelfAudit,测量并缓解 LLM 工具调用智能体对私有数据的主动过度授权访问。OverAct 在八个隐私敏感领域使用确定性、无裁判评分,覆盖七个模型四个模型族;所有模型都显著超出授权范围,请求具体性是最强预测因素,工具池规模扩大使过度授权亚线性增长,解码温度影响很小。SelfAudit 是零样本推理时方法,无需 oracle 知识,通过生成基于请求的理由并在执行前过滤不合理调用,将隐私导向的过度访问降低 43%;作者据此推断过度授权更多来自结构性决策倾向,而非解码随机性。

    推荐理由:它把工具调用智能体的越权访问拆成可复现基准与推理阶段过滤机制,能校正对数据访问风险的具体工程判断。

  10. arXiv cs.CR78

    论文提出 A2A-TIBA 攻击与三层同构攻防模型,指出信封层是多智能体安全防御新维度

    这篇 arXiv cs.CR 论文针对 ACP、A2A 等 Agent 交互协议带来的间接提示词注入风险,提出名为 A2A-TIBA 的攻击原理,并设计 GDA Measurement 红队测试方法。作者认为现有评测只看攻击成功率,无法区分失败究竟来自 LLM 识别恶意内容,还是 Agent 层机制拦截执行,因此把攻击结果扩展为 Class A/B/C/D,对应语义拒绝率、语义突破率、拦截率和穿透率。 攻击路径采用植入命令、回传数据和建立回调交互程序的步骤,让目标 Agent 部署一个可被攻击者后续直接调用的交互通道,从而绕过 Agent 前端继续发号施令。为评估防御,作者通过 LLM gateway 捕获原始上下文、双路数据保存和基于 Agent 的自动判定构建测试台,并在 15 种 Agent 前端与 LLM 后端组合上测试,建立 1,000 个案例数据集。实验结论是,恶意内容进入 Agent 的信封层,即 A2A、工具、记忆等通道,应被视为独立防御层。 作者据此提出 ELA-ITL 三层同构攻防模型:防御分为信封包装、LLM 识别和 Agent 拦截,攻击分为植入通道、提示优化和执行机制。论文称,在 A2A、工具和记忆等信封包装中加入恶意提示标签,能显著提升 LLM 对恶意内容的识别。这一结果若可复现,意味着多智能体产品不能只依赖模型安全对齐或终端执行沙箱,还需要在协议封装、消息元数据和通道标记层增加安全设计。

    推荐理由:把 Agent 安全评测从单一 ASR 拆成四层结果,并提出信封层标注防御,能改变多智能体系统安全设计优先级。

  11. Hacker News · AI84

    Best-of-Agent-Harnesses 每周重排 167 个 AI agent harness,并提供 MCP 选型服务

    Best-of-Agent-Harnesses 是一个持续更新的开源清单,收录 167 个 AI agent harness、编排框架和相关技术,按与 harness 相关性和 GitHub stars/活跃度每周重排。它把 harness 定义为模型之外决定工具、审批、上下文、崩溃恢复和运行生命周期的运行时层,并提供可搜索站点、模板、playbook、harnesses.json、llms.txt 和一个可供 agent 调用的 MCP server。 材料给出的关键证据是同一模型换不同 harness 会显著改变成绩:在 SWE-bench Pro 相关分析中,GLM-5.2 的 pass@1 从 23% 到 52%,Gemma 4 26B 从 15% 到 36%;不同模型间的 harness 排名相关性约为 -0.05。材料还称一个裸前沿模型在 ARC-AGI-3 上约 30%,而 Prime Agent 的 harness 将 Opus 5 提升到 95.5%。这些数字被用来支持“harness 选择必须随模型和任务重新评估”的判断。 清单将项目分为编码代理产品、个人代理运行时、框架、多代理编排、MCP/插件、记忆层、评测和可观测性等类别,并标注 headless、durable、开源许可、复杂度等工程属性。事实是该项目提供了机器可读接口和推荐工具;推断是它试图把 agent 选型从静态榜单转向“模型—任务—harness”配对;猜测是若这些基准可复现,harness 工程可能比单纯升级模型更能影响长任务交付质量。

    推荐理由:它把 agent harness 从框架选型变成可按模型配对、可复测的工程决策,能改变选型和试用流程。

  12. Hacker News · AI78

    Zero Slop 开源 agent skill 发布,可检测并改写 AI 写作痕迹

    Zero Slop 是一个开源 agent skill,用本地评分和八阶段编辑流程检测并改写 AI 写作痕迹,同时保留原文核心信息。它提供浏览器编辑器、MCP connector、Claude Code、Codex、Gemini CLI 等接入路径,并可用本地 Python scorer 在不调用模型的情况下评分。REST API 的共享免费容量接受最多 20,000 Unicode code points,项目采用 MIT 许可。 材料称本地评分器使用 294 个加权模式和 96 词表,检查固定开头、模糊归因、夸大意义、宣传词、重复句式和过度格式化。八阶段包括 scorer、interpreter、rewriter、fact gate、copy desk、read-aloud editor、verifier 和 fresh-eyes finalizer,材料强调这是工程约定,不是八个独立模型。在 GPT-5.4 high reasoning 的测试中,原始草稿平均写作分为 76.3,Zero Slop 后为 12.8,18/18 通过本地门和来源检查,平均长度变化 -8.9%;同场对比的 avoid-ai-writing、no-ai-slop 和 humanizer 分别为 23.3、28.4 和 35.4。 RAID+ 审计用 7,627 条匿名用户生成文本测试不同模型默认写作被 Zero Slop 标记为 AI slop 的比例:DeepSeek V3 10.1%、Gemini 3.1 Pro 18.2%、Gemma 3 27B 30.4%、Llama 3.3 70B 41.7%。事实是这些数字只表示被该工具标记,不表示文本质量或作者身份;推断是本地评分、事实门和可复现对比比单纯提示词更适合做发布前编辑;猜测是它更可能用于降低 AI 味,而不是替代人工判断或识别作者。

    推荐理由:它把去AI味工具拆成本地评分、事实门、八阶段编辑和可复现对比,能校正对提示词方案是否可靠的判断。

  13. Hacker News · AI78

    Breadcrumb 为 Mac 上的 AI 工作提供本地记录与 MCP 上下文管理

    Breadcrumb 是一个 Mac 本地工具,记录屏幕、会议、AI 转录以及用户与 AI 做出的决定,并把这些内容变成 AI 可搜索的记忆。作者称数据保存在本地并加密,系统还以 30+ MCP tools 的形式暴露给 Claude Code、Codex、Cursor 和 opencode 等开发工具。 作者从 6 月开始开发,最初只是录制屏幕以便回看自己与 AI 的工作过程,随后加入 MCP 搜索、时间追踪、会议转录和带时间戳的截图,再进一步把 AI 转录、子代理和工具调用记录也喂回系统。文中给出的例子是:一次 Zoom 会议后,作者让 Claude 审阅会议记录、找出讨论过的 bug 并创建 JIRA tickets;系统读取转录、定位相关屏幕截图、启动本地服务器、诊断问题、创建 14 个带诊断和可能修复建议的 tickets,并附上 12 张截图和 Slack 消息。作者表示这个流程并非预先编排,而是 Claude 结合会议记录、Breadcrumb 工具和既有规则自行串联完成。 事实是该项目以本地记录和 MCP 工具接口为核心,强调可观察性与上下文供给;推断是这类工具的价值取决于记录质量、规则组织方式以及 Agent 能否可靠调用这些记忆;猜测是若长期积累会议、屏幕和代码调试数据,可能减少开发者重复交代上下文的成本,但材料未提供稳定性、隐私边界或失败率数据。

    推荐理由:它把本地屏幕、会议和 AI 记录封装成可搜索记忆与规则,可启发开发者设计 Agent 上下文供给方式。