跳到正文

#编码

今日 13 条
今天10月2日周五
  1. Hacker News · AI68

    olddogs.ai 团队用四个 agent 工作流建成零 slop 官网并把渲染提速到 117 fps

    olddogs.ai 团队用四个 agent 工作流建成自家官网首页,页面全部内容出自对 agent 的 prompt,作者称成品独特且零 slop,其中一次要求提速的 prompt 让 agent 把 Canvas 渲染改写为 GPU shader,快速鼠标拖拽时帧率从 14 fps 升到 117 fps。四个工作流分别是先用生成图像模型探索设计再落代码、嵌入应用的 in-app design jig、独立小应用 jig、以及直接向 agent 提最夸张的要求。 容易被忽略的是探索与实现的分离尺度,首页八个 section 各自生成 8 到 38 个设计选项并经历 1 到 7 轮设计与构建循环,全项目累计 2,460 张生成图像,作者还公开了按顺序排列的全部图像。in-app design jig 是只给开发者用的参数面板,改动可以同步回提交代码,standalone jig 则服务于 50 多对狗图像的逐张审查,反馈一键复制回 Codex。shader 内做的分部件动画只给页面增加约 77 KB,说明夸张要求在体积代价上并非失控,而 117 fps 的口径是 1440×900 分辨率与 120 Hz 显示器下的测试值。 事实部分仅为作者自述的工作流与数字,未经第三方复核。推断是图像先行的做法之所以能避开同质化,是因为把设计探索放在图像空间而非代码空间,绕开了 agent 第一个设计方案的路径依赖,jig 则把人的审美判断变成可反复操作的界面而不是一次性 prompt。猜测是这套模式可迁移到其他 agent 前端项目,但作者未披露 2,460 张图像的生成成本与人工筛选耗时,单位经济不明,照搬前需要自行补测。

  2. Hacker News · AI87

    Pi Coding Agent 与 Jev 的集成用例展示用概率门控、路由和压缩控制编码智能体工具调用

    Pi Coding Agent 与 Jev 的集成用例展示如何在工具调用前后用概率门控、路由和压缩控制编码智能体。材料给出的事实是 Jev 不生成文本,调用 193 到 642 ms,并把执行前安全门、输出判断、工具发现、上下文压缩和模型选择拆成多个扩展。关键细节是 no_secret_egress 阈值从 0.97 提到 0.99 时,0.02 的凭据外泄命令会从拒绝区进入模糊区并默认放行;据此推断该机制能减少审批疲劳,但批准命令仍在主机直接运行,不能替代沙箱。

    推荐理由:它把编码智能体的工具调用安全门拆成概率阈值与本地脱敏,并指出提高阈值可能让凭据外泄落入模糊区,能校正对自动执行安全性的判断。

  3. InfoQ 中文82

    谷歌发布 Gemini 4 Argon,输出上限升至百万 Token 且初期仅向受信任安全团队开放

    谷歌发布新一代模型 Gemini 4 Argon,主打长流程软件工程、企业知识工作与网络安全防御,输出 Token 上限从 64K 提升至 100 万,并采用分阶段开放:初期仅通过 Fairwind 计划向受信任的网络安全防御团队提供,后续才从付费 API 客户和 Google AI Ultra 订阅用户开始,具体时间未公布;定价为每百万输入 Token 2 美元、每百万输出 Token 10 美元,缓存输入价格较普通输入低 95%。 容易被标题带偏的是两个口径。其一,谷歌披露 Argon 智能体参与 C/C++ 向 Rust 的迁移,规模从 re2、libgav1 等核心库扩展至 Fuchsia 操作系统 Zircon 内核的 80 多万行代码,但原文明确这不代表迁移已完成或投入生产;libgav1 案例中替换约 3.2 万行 SIMD 代码后运行速度达到原 Rust 移植版本的 2.7 倍,比较对象是 Rust 移植版而非优化后的 C++ 实现。其二,DeepSWE v1.1 的 77.9%、AutomationBench 的 51.3%、LVBench 的 91.7%、CWE-bench v1 的 68% 并列第一均为谷歌公布或引用的结果,且配套表格中 GPT-6 Astra 在 FrontierSWE v2、Terminal-bench 4.0 等项目上仍高于 Argon,全面碾压的说法并不成立。 事实层面,谷歌把网络安全防御作为优先开放领域,向受信任防御者提供不带网络安全防护措施的版本,并计划用对齐偏差监测跟踪模型思维链与行动,必要时停止执行;推断层面,受信任测试者先行的节奏意味着公开跑分与开发者实际可用性之间的差距在拉大,正如评论中基准领先但普通开发者还拿不到 API 的质疑;猜测层面,后续开放时间未公布,付费 API 与订阅用户何时能用仍无依据。对准备把智能体接入工程流程的团队而言,眼下可依赖的是价格、输出上限这类硬参数,而非内部案例的性能倍数。

    推荐理由:材料拆出了Argon迁移案例与跑分的真实口径:2.7倍速度是对比Rust移植版而非C++,80万行内核迁移尚未投产,可校正把基准成绩当工程落地能力的判断。

  4. Hacker News · AI78

    Free Coding Agent 开源发布,为前沿模型提供本地 MCP 编码执行层

    Free Coding Agent 是一个开源、provider-neutral 的 MCP 执行层,目标是让任何支持 MCP 或等效远程工具的模型在开发者本地工作站上获得真实编码能力。它提供文件读写、多文件补丁与回滚检查点、shell 命令、PTY、Git 操作、LSP 诊断、Playwright 浏览器自动化、Windows UI 自动化等资源,并通过本地 stdio、认证 HTTP 或用户自建的 HTTPS 端点接入。 材料中最值得注意的是它的“无共享项目基础设施”设计和 Durable Agent Mode。项目不要求统一中继、账号、API key 或官方隧道,远程访问由用户自己的 Tailscale Funnel 或 Cloudflare Tunnel 承担,本地生成 MCP bearer token 并绑定 127.0.0.1。任务内核用 append-only journal、幂等键、任务 DAG、leaseKey 独占、跨进程锁、验证命令和可配置修复轮数来协调多 Agent 编码,强调失败会显式标记为 interrupted 而非伪装成功。 事实是该项目给出了较完整的本地执行、权限沙箱和任务审计机制,并明确不抓取或自动化 LM Arena 私有 UI。推断是它试图解决编码 Agent 从聊天接口到工程环境的执行层标准化问题,适合与 OpenCode、IDE 或自托管模型组合。猜测是其实际价值取决于用户是否愿意自建隧道、维护 workspace allowlist,以及外部模型能否稳定利用这些工具。

    推荐理由:它把编码 Agent 的关键缺口从模型能力转向本地执行与任务核验,适合作为评估 MCP 工作流落地成本的样本。

  5. Hacker News · AI55

    Kodama 为 Kiro CLI 提供 9 个分工 Agent 的开源多智能体包

    Kodama 是一个面向 Kiro CLI 的社区开源多 Agent 包,提供一个主 orchestrator 和 8 个专职 agent,用于规划、代码侦察、外部研究、架构分析、UI 实现、测试重构、diff 审查、基础设施部署和技术写作。项目强调 provider-neutral 和可移植安装,不绑定云厂商、模型或全局 MCP 配置,所有 agent 默认使用 model: "auto",可按本地 Kiro 环境改成其他模型 ID。 材料中最值得注意的是权限分层:kodama-scout、kodama-sage、kodama-critic 默认只读或仅限研究,kodama-artist、kodama-smith、kodama-forge、kodama-scribe 的写入和 shell 操作需要审批,主 agent 拥有委派权但实现工具受审批门控。项目还内置 project memory,把技术栈、决策、失败路径和团队约定写入 .kiro/kodama/memory/,并提供 kodama memory audit 检查意外存储的敏感信息;说明文档明确只保存自然语言描述,不保存代码、文件内容或凭证。 事实是该项目提供安装、更新、卸载、dry-run 和冲突保护等生命周期命令,并附带 3 个 skill playbook。推断是这种结构适合把 Agent 工作流从单一大权限助手转向按角色限制权限的工程团队模式;猜测是其实际效果取决于 Kiro CLI 的审批机制和用户是否配置合适模型。

  6. Hacker News · AI78

    Mixdog 开源 Windows 桌面编码 Agent,通过压缩上下文降低同模型运行成本

    Mixdog 是一个开源的 Windows 桌面与 CLI 编码 Agent,主打通过 cache-aware context、focused tools 和 compaction 降低同一模型的上下文开销与调用成本。项目给出的 Terminal-Bench 2.1 同模型对比显示,在相同 89 个任务和官方 verifier 下,Mixdog 与 Codex CLI、Claude Code 的结果接近或略高,但中位最终上下文更小、按 API 列表价计算的成本更低。 具体数据是:GPT-5.6 Sol xhigh 对比 Codex CLI 时,每次试验成本为 $0.476 对 $0.782,中位最终上下文为 18.5k 对 34.3k tokens,pass@5 为 96.6% 对 95.5%,耗时接近;Claude Opus 5 对比 Claude Code 时,每次运行成本为 $104.29 对 $129.21,中位最终上下文为 27.6k 对 38.2k tokens,任务通过 79/89 对 77/89,速度为 610 秒对 708 秒。这些数字基于固定源码版本、官方 Harbor verifier、fast mode off,且成本按当前 API 列表价计算,不是实际订阅账单。 产品层面,Mixdog 支持多会话、多 Agent 角色、MCP servers、skills、hooks、plugins、Browser Use、Windows Computer Use、Office 文档、图像视频 Studio,以及 Desktop、TUI 和配对浏览器之间继续同一会话。其效率机制包括轻量系统指令、限定范围的工具调用、ast-grep 和 code graph、provider-aware caching、结构化 compaction、空闲时压缩、按需加载提示词、数据库长期记忆和工具结果裁剪。事实是项目开源且提供了基准产物;推断是它竞争的不是模型能力,而是 agent harness 对上下文和成本的控制;猜测是实际节省仍会随 provider、工作负载和配置变化。

    推荐理由:它把 coding agent 的成本差异拆到上下文压缩、缓存和工具裁剪,可用来评估 harness 而非模型本身对预算的影响。

  7. arXiv cs.CR72

    AuraForge 通过合成可执行安全测试训练更安全的编码 Agent

    AuraForge 提出一种合成并验证可执行安全测试的方法,用于训练编码 Agent 在实现功能时避免安全漏洞。作者用该方法构建了 AuraGym,一个覆盖 Python、JavaScript 和 TypeScript 的多语言训练环境,包含来自 344 个真实仓库的 679 个可执行功能实现任务,并覆盖 177 个 CWE 类别。 在有人工撰写安全测试的子集上,AuraForge 平均生成约 3 倍数量的测试用例,并将误报率降低 83.23%,使替代性的安全实现也能获得正确监督。用合成安全测试训练 Qwen3.5-4B 后,其在三种语言上的提升高于用人工安全测试训练的结果,平均 FuncPass 和 SecPass 分别为 19.7 和 6.2,而人工测试组为 14.9 和 4.4。 事实是论文提供了合成安全测试的数据集、训练环境和对比结果。推断是这种方法可能降低编码 Agent 安全训练对人工安全审计的依赖。猜测是若该方法能扩展到更多语言和更复杂任务,安全测试合成可能成为编码 Agent 训练流水线的一部分。

  8. arXiv cs.AI68

    R2T 用可执行检查提升科学计算 LLM Agent 的代码修复表现

    R2T(Rules to Tools)把公开科学计算要求预先做成可执行检查,供科学编码 Agent 在修复 SciCode 任务时使用。与只拿到文本规则、起始程序、模型和预算的对照组相比,拿到可调用检查的工具组在两个任务 ID 队列中完成修复数从 26/30 提升到 29/30。 细看任务层面,工具组在三个任务 ID 上占优,一个任务上文本占优,十一个任务打平;八 ID 队列中工具组 15/16、文本组 13/16,但任务聚类 bootstrap 95% 区间为 [-12.5, 43.75] 个百分点,说明差异并不稳健。更大的共享定义 SciCode 队列两组均 13/24;在更换起始程序的五个开发暴露任务上,工具组 7/10 对文本组 3/10。匹配 PDE 对比中,详细文本 23/24、检查 24/24,且检查组报告的模型输出低 31.2%,但公共 CPU 使用在两个任务 ID 队列中都上升。 事实是可执行检查能减少部分科学计算代码修复失败,并可能降低 Agent 侧输出成本;推断是其收益取决于任务是否已有可靠初始检查,且可能把成本转移到公共算力;猜测是这类方法更适合有明确方程、边界条件和输出要求的科学计算场景,而不是泛化到所有编码 Agent。

    推荐理由:论文用 SciCode 修复任务对比文本规则与可执行检查,显示检查可提升部分任务修复率但结果高度任务依赖,可用于判断 Agent 代码验证应优先做可执行校验而非纯提示约束。

  9. Hacker News · AI58

    Pair.nvim 以 v0.1.0 alpha 版本发布,让 AI Agent 在 Neovim 内以可审查提案方式协助编码

    Pair.nvim 是一个面向 Neovim 的 AI Agent 辅助插件,v0.1.0 alpha 版本让开发者在不离开代码库的情况下与 Agent 对话、询问选中代码,并在指定位置请求修改。其核心机制不是直接写入文件,而是把建议代码放入未保存缓冲区,由用户检查、接受或拒绝;聊天与编辑器操作共享同一个 Agent 会话。 材料给出的细节显示,Pair 默认使用 Codex,也列出 Antigravity CLI、GitHub Copilot CLI、OpenCode 等已通过实际工作流验证的后端,Claude Code ACP、Legacy Gemini CLI ACP 以及 OpenAI、Anthropic、Gemini API 仍属实验状态。上下文默认发送当前缓冲区,包括未保存编辑;Antigravity 可在文件系统沙箱中运行测试和构建,并通过预先存在的可写目录允许构建输出或生成代码,而 Codex 使用自己的只读沙箱。 从产品形态看,这不是一个独立 IDE,而是把 Agent 能力嵌入现有 Neovim 工作流的插件。事实是它通过提案、diff、接受/拒绝和本地历史来保留开发者对代码的控制;推断是这种设计针对的是长期使用 Agent 后对代码库理解下降的问题,适合希望保留手动编辑权的工程师;猜测是其多后端适配能否稳定,取决于后续对实验性后端和不同账户模型组合的验证。

  10. Hacker News · AI78

    Oh My Subagents 开源面向 Codex 与 Claude 的本地智能体团队运行时

    Oh My Subagents 是一个面向 Codex 与 Claude 的本地子智能体编排运行时,把临时委托改为持久任务状态、可复用责任树和中断恢复。它的核心判断不是让模型更强,而是把多智能体协作中最容易失控的部分——等待、所有权、完成证据和恢复——从聊天 transcript 移入本地 controller 状态。 材料给出的机制细节是:Manager 委托一个 Wave 时,子 Assignments 与父等待状态一起提交,子智能体独立返回 terminal Checkpoints,controller 收集完整 Wave 后继续父任务;只有 Task lead 接受的 completed 或 blocked Checkpoint 成为最终 Result。它把 Waves、waits、retries、replans、Checkpoints 和 continuations 放在 controller-owned state,并强调普通文件仍留在 workspace,只记录导航引用;capabilities 默认拒绝且不从父级继承。 事实是项目以 MIT 开源,默认 SQLite,提供 8 个 starter workflows,支持 Python 3.12+、Linux、macOS 13+ 和 Windows 11 x64,并支持从 Banksia 迁移;推断是它适合需要独立验证、长周期工程任务或可审计责任链的团队,能减少“盯着子智能体”的运维成本;猜测是它可能成为 subagent 编排层,但材料没有第三方基准、生产数据或性能对比,不能证明质量或效率提升。

    推荐理由:它把 Codex 与 Claude 的临时子智能体协作改为本地持久运行时,能校正对多智能体可运维性和中断恢复的判断。