跳到正文

#工程/实践

今日 17 条
今天10月2日周五
  1. Hacker News · AI68

    olddogs.ai 团队用四个 agent 工作流建成零 slop 官网并把渲染提速到 117 fps

    olddogs.ai 团队用四个 agent 工作流建成自家官网首页,页面全部内容出自对 agent 的 prompt,作者称成品独特且零 slop,其中一次要求提速的 prompt 让 agent 把 Canvas 渲染改写为 GPU shader,快速鼠标拖拽时帧率从 14 fps 升到 117 fps。四个工作流分别是先用生成图像模型探索设计再落代码、嵌入应用的 in-app design jig、独立小应用 jig、以及直接向 agent 提最夸张的要求。 容易被忽略的是探索与实现的分离尺度,首页八个 section 各自生成 8 到 38 个设计选项并经历 1 到 7 轮设计与构建循环,全项目累计 2,460 张生成图像,作者还公开了按顺序排列的全部图像。in-app design jig 是只给开发者用的参数面板,改动可以同步回提交代码,standalone jig 则服务于 50 多对狗图像的逐张审查,反馈一键复制回 Codex。shader 内做的分部件动画只给页面增加约 77 KB,说明夸张要求在体积代价上并非失控,而 117 fps 的口径是 1440×900 分辨率与 120 Hz 显示器下的测试值。 事实部分仅为作者自述的工作流与数字,未经第三方复核。推断是图像先行的做法之所以能避开同质化,是因为把设计探索放在图像空间而非代码空间,绕开了 agent 第一个设计方案的路径依赖,jig 则把人的审美判断变成可反复操作的界面而不是一次性 prompt。猜测是这套模式可迁移到其他 agent 前端项目,但作者未披露 2,460 张图像的生成成本与人工筛选耗时,单位经济不明,照搬前需要自行补测。

  2. Hacker News · AI87

    Pi Coding Agent 与 Jev 的集成用例展示用概率门控、路由和压缩控制编码智能体工具调用

    Pi Coding Agent 与 Jev 的集成用例展示如何在工具调用前后用概率门控、路由和压缩控制编码智能体。材料给出的事实是 Jev 不生成文本,调用 193 到 642 ms,并把执行前安全门、输出判断、工具发现、上下文压缩和模型选择拆成多个扩展。关键细节是 no_secret_egress 阈值从 0.97 提到 0.99 时,0.02 的凭据外泄命令会从拒绝区进入模糊区并默认放行;据此推断该机制能减少审批疲劳,但批准命令仍在主机直接运行,不能替代沙箱。

    推荐理由:它把编码智能体的工具调用安全门拆成概率阈值与本地脱敏,并指出提高阈值可能让凭据外泄落入模糊区,能校正对自动执行安全性的判断。

  3. InfoQ 中文42

    范式智能获 IDC 2026 中国 AI 算力管理平台评估第一,HAMi 开源调度器晋升 CNCF 孵化级

    范式智能在 IDC《中国 AI 算力管理平台技术能力评估,2026》中综合评分位列第一,资源管理等四项维度获满分。其主导的开源调度器 HAMi 于 7 月晋升为 CNCF 孵化级项目,通过动态弹性切分将 GPU 利用率从不足 30% 提升至 70%-90%。该公司上半年 API 业务收入达 4.64 亿元,同比暴增 860.8%,验证了“Token 工厂”模式成效。

  4. InfoQ 中文78

    作者团队在 Cloudflare Worker 上实现多租户 SaaS 规模的模块化边缘计算

    作者团队在 Cloudflare Worker 上用网关 Worker 加单一用途功能 Worker,把数十万租户账号的 SaaS 边缘入口拆成可独立测试、独立部署的模块,以降低部署耦合和故障半径。可行性来自服务绑定:Cloudflare 在同一隔离沙箱内调度 Worker 调用,开销近似普通函数调用,因此网关可以内联执行 shouldApply 判断,只在需要时把图片优化、故障转移等重任务分发到功能 Worker,并在功能异常、超时或返回无效响应时回退源站原始响应。文章进一步比较 Akamai 的 property、EdgeWorker 和 Image Manager,指出 Cloudflare KV 全局可读而 Akamai EdgeKV 曾按区域配置、托管服务与代码原语抽象不同,因此多 CDN 不是复制粘贴,而是围绕内存上限、本地缓存、数据驻留、不可变版本标签、金丝雀滚动发布和纯函数判断测试等不变量持续适配。

    推荐理由:它把边缘 Worker 拆分、服务绑定、多 CDN 原语差异和滚动发布边界讲清楚,能校正把边缘模块化等同于微服务化的判断。

  5. Hacker News · AI78

    agent-chrome 让 Claude Code 在后台使用已登录 Chrome 而不抢占焦点

    agent-chrome 是一个开源 macOS 工具,让 Claude Code 通过复制的已登录 Chrome 配置文件浏览网页,同时把浏览器窗口放在其他应用后面,避免用户输入被自动化窗口打断。项目以 Claude Code 插件和本地代理形式发布,依赖 Node 18.3 或更高版本,代码约 500 行,仅监听 localhost,采用 MIT 许可。 关键细节是它不直接使用 Chrome 默认数据目录,而是用 APFS clone 复制一份用户配置文件,并关闭主题、标签、扩展等同步项,但密码、书签、自动填充和设置仍会同步回 Google 账户。代理以 --remote-debugging-pipe 启动 Chrome,再向 chrome-devtools-mcp 暴露兼容 /json/version、/json/list 和浏览器级 WebSocket 的本地接口,通过请求 ID 重写、目标状态缓存和共享会话让多个 Claude Code 会话共用同一个已登录窗口。 事实层面,它解决的是 macOS 上 Chrome 调试端口每次调用都会激活窗口、以及 pipe 只能由启动进程持有导致多会话冲突的问题。推断是这种代理模式比 headless Playwright 更适合需要人工处理登录、2FA 或 CAPTCHA 的场景,因为它保留可视化窗口和真实登录态。猜测是网站仍可能通过调试器痕迹、点击轨迹和输入节奏识别自动化,因此它更适合受信任工作流,而不是高对抗抓取。

    推荐理由:它把 macOS 上 Chrome 调试端口抢焦点的问题改成本地代理复用 pipe,能直接改善 Claude Code 多会话浏览自动化的人机协作体验。

  6. Hacker News · AI73

    Cloudflare 用 AI 多 Agent 工具 CryptoLabe 盘点代码库密码学使用并公开 prompts,支撑 2029 年后量子迁移目标

    Cloudflare 为在 2029 年前达成全平台后量子就绪,开发了内部 AI 工具 CryptoLabe,用模型代替 grep 在集中式代码库中发现、分类并解释密码学使用,同时公开部分 prompts 供其他组织借鉴;该工具深度绑定其内部仓库、工单与文档系统,不向客户开放。

  7. Hacker News · AI38

    The Philadelphia Inquirer 构建 Scrape AI 工具挖掘本地新闻

    The Philadelphia Inquirer 推出 Scrape 工具,将编辑每周搜寻本地新闻线索的时间从约 12 小时大幅缩减。该工具通过嵌入具体简报描述与人工反馈循环,成功将输出从噪音转化为高价值社区新闻。目前 Scrape 已成为六份(即将扩展至八份)通讯的“承重基础设施”,支撑近 20 名记者高效工作。

  8. Hacker News · AI78

    作者用四道发布门控降低 AI Agent 直接改线上站点的事故成本

    作者在实践中发现,给 AI Agent 设置最小权限并不能避免线上事故,反而会因审批阻塞导致任务停滞;于是他把安全重心从“允许什么动作”转向“变更如何进入生产”,用一个脚本搭出包含 hash guard、隔离测试环境、备份或拒绝、自动回滚的四道发布门控。 文中给出三次具体拦截案例:一次 Agent 基于旧版首页生成文章,若直接安装会覆盖已上线修复,门控发现文件已变化后改为在 live 版本上合并;一次安装后检查通过了一个代码不接受的值,系统自动回滚,随后作者补充了常量校验;一次重启后健康检查过早执行导致回滚,但日志未说明原因,作者又加入重试和输出。作者还指出回滚备份会保留旧版本中的秘密,因此可逆性和隐私可能冲突,必要时需删除备份并放弃回滚。 事实是这套方法来自单人、单服务器的小型站点,作者明确表示无法证明可扩展。推断是它把 Agent 运维的重点从权限边界转到事故成本控制,适合有明确发布流程的小团队。猜测是邮件发送、删除无备份数据、花钱、改共享服务、凭证处理等不可恢复动作仍需人工把关,不能靠备份解决。

    推荐理由:它把 Agent 安全从权限收窄转向发布管线,提示单站部署可用低成本回滚机制降低事故成本。

  9. arXiv cs.AI68

    ActiveSaddler 将自动化课程学习引入 LLM Agent harness 优化

    ActiveSaddler 提出一种自动化课程学习方法,用于优化 LLM agent 的 harness,即提示词、工具接口与控制逻辑的组合。该方法不再固定使用预设训练场景,而是把课程建模为非平稳多臂老虎机问题,动态调整哪些失败模式应被优先优化。 系统将反复出现的执行失败抽象为可复用的 failure-pattern arms,估计针对每个模式继续优化可能带来的学习进展,并在修复已知弱点与探索未见场景之间做平衡。在 GAIA2 和 Terminal-Bench 2.0 上,相比使用固定场景顺序的同一 harness 优化器,ActiveSaddler 分别提升测试 Pass@1 4.4 和 7.5 个百分点。 事实是论文给出了两个基准上的量化增益与消融结果;推断是这种收益来自对优化目标集合和优先级的持续更新;猜测是这类课程共演机制可能更适合长周期、多轮迭代的 agent 工程流程。

    推荐理由:它把 agent harness 优化从固定场景迭代推进到自适应课程学习,可改变对训练场景选择策略的工程判断。

  10. arXiv cs.AI42

    Praxa:一种证据约束的 AI 智能体执行框架

    Praxa 提出一种通过确定性准入、代理执行和外部回读显式化智能体状态转换的证据约束架构。在 Terminal-Bench Core 0.1.1 测试中,其可靠性层比基线多消耗 37.49% 输入 token 和 50.73% 输出 token;另一对比实验显示候选方案虽减少 37.11% token 和 33.84% 成本,但未证明质量或延迟提升。当前证据未确立对抗安全、生产安全性或通用优势。

  11. Hacker News · AI58

    Pair.nvim 以 v0.1.0 alpha 版本发布,让 AI Agent 在 Neovim 内以可审查提案方式协助编码

    Pair.nvim 是一个面向 Neovim 的 AI Agent 辅助插件,v0.1.0 alpha 版本让开发者在不离开代码库的情况下与 Agent 对话、询问选中代码,并在指定位置请求修改。其核心机制不是直接写入文件,而是把建议代码放入未保存缓冲区,由用户检查、接受或拒绝;聊天与编辑器操作共享同一个 Agent 会话。 材料给出的细节显示,Pair 默认使用 Codex,也列出 Antigravity CLI、GitHub Copilot CLI、OpenCode 等已通过实际工作流验证的后端,Claude Code ACP、Legacy Gemini CLI ACP 以及 OpenAI、Anthropic、Gemini API 仍属实验状态。上下文默认发送当前缓冲区,包括未保存编辑;Antigravity 可在文件系统沙箱中运行测试和构建,并通过预先存在的可写目录允许构建输出或生成代码,而 Codex 使用自己的只读沙箱。 从产品形态看,这不是一个独立 IDE,而是把 Agent 能力嵌入现有 Neovim 工作流的插件。事实是它通过提案、diff、接受/拒绝和本地历史来保留开发者对代码的控制;推断是这种设计针对的是长期使用 Agent 后对代码库理解下降的问题,适合希望保留手动编辑权的工程师;猜测是其多后端适配能否稳定,取决于后续对实验性后端和不同账户模型组合的验证。

  12. Hacker News · AI82

    Soothsay 用确定性静态分析在运行前检查 curl | sh 安装脚本并可拦截 Claude Code

    Soothsay 是一个开源的 shell 安装脚本静态分析工具,用于在运行 curl | sh 之前解释脚本会对机器做什么。它以单个 Rust 二进制发布,可作为命令行工具、CI 检查,或 Claude Code 的 PreToolUse hook,在 AI 编码 Agent 尝试运行网络下载脚本时先阻断、审查并要求人工批准。 材料给出的关键机制是“审查后运行已审查字节”:soothsay 下载脚本、生成报告并保存对应 sha256 的副本,随后用 --run --expect-sha256 运行同一份字节,避免服务器在审查后向管道返回不同内容。它还提供 --diff 比较两个版本的行为变化,以及 --cloak-check 检查服务器是否对 curl 和浏览器提供不同脚本。作为 Claude Code hook 时,普通 curl | sh 会被改写为固定哈希的运行命令并附带审查结果;在 bypassPermissions、auto、dontAsk 等不提示模式下则直接阻断。 作者强调它不是沙箱,而是建议性静态分析,不能审查脚本后续下载的二进制文件,也可能被运行时拼接命令绕过。事实是它用 tokenizer 和解析器识别 remote-exec、obfuscation、secrets、persistence、rc-edit 等类别,并把无法看穿的调用标为 blind spots。推断是这类工具的价值在于给 Agent 加确定性执行边界:模型可以解释脚本,但是否允许运行由外部策略和哈希固定决定。

    推荐理由:它把 AI Agent 执行 curl | sh 的安全审查从模型判断改成确定性静态分析,可作为 Claude Code hook 或 CI 策略直接落地。

  13. Hacker News · AI78

    Breadcrumb 为 Mac 上的 AI 工作提供本地记录与 MCP 上下文管理

    Breadcrumb 是一个 Mac 本地工具,记录屏幕、会议、AI 转录以及用户与 AI 做出的决定,并把这些内容变成 AI 可搜索的记忆。作者称数据保存在本地并加密,系统还以 30+ MCP tools 的形式暴露给 Claude Code、Codex、Cursor 和 opencode 等开发工具。 作者从 6 月开始开发,最初只是录制屏幕以便回看自己与 AI 的工作过程,随后加入 MCP 搜索、时间追踪、会议转录和带时间戳的截图,再进一步把 AI 转录、子代理和工具调用记录也喂回系统。文中给出的例子是:一次 Zoom 会议后,作者让 Claude 审阅会议记录、找出讨论过的 bug 并创建 JIRA tickets;系统读取转录、定位相关屏幕截图、启动本地服务器、诊断问题、创建 14 个带诊断和可能修复建议的 tickets,并附上 12 张截图和 Slack 消息。作者表示这个流程并非预先编排,而是 Claude 结合会议记录、Breadcrumb 工具和既有规则自行串联完成。 事实是该项目以本地记录和 MCP 工具接口为核心,强调可观察性与上下文供给;推断是这类工具的价值取决于记录质量、规则组织方式以及 Agent 能否可靠调用这些记忆;猜测是若长期积累会议、屏幕和代码调试数据,可能减少开发者重复交代上下文的成本,但材料未提供稳定性、隐私边界或失败率数据。

    推荐理由:它把本地屏幕、会议和 AI 记录封装成可搜索记忆与规则,可启发开发者设计 Agent 上下文供给方式。

  14. AWS Machine Learning Blog68

    AWS 教程展示如何用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆

    AWS 教程展示如何用 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit 的持久记忆层,并在 Amazon EKS 上部署多智能体投资研究示例。事实是 NAT 通过 MemoryEditor 插件接口扩展,S3 Vectors 用 1024 维向量、cosine 距离和 agent_id、team_id、user_id 等元数据过滤,auto_memory_agent 可自动保存与检索对话,无需 LLM 显式调用记忆工具。推断上,这给多智能体共享记忆提供了一条把对象存储向量能力作为后端的实现路径:强写一致性让不同 agent pod 立即可见新记忆,按存储、写入和查询计费也减少了空闲计算成本。猜测是,若后续有真实延迟、召回和成本数据,S3 Vectors 可能成为 AWS 上 agent 持久记忆的默认选项之一,但本文只给定性预期,没有基准测量。

    推荐理由:它把 S3 Vectors 接入 NeMo Agent Toolkit 的插件、元数据过滤和 EKS 部署路径写清楚,能校正多智能体记忆必须依赖专用向量数据库的工程判断。