跳到正文
原文
Hacker News · AI· davikr·· 3 小时前精选AI 评分80

用 700B Tokens 重制 FPS 游戏:Agent 编排与字节级验证的工程复盘

500B Tokens Later: Letting AI Agents Decompile a First-Person Shooter

AI 导读

作者耗时三个月利用 AI 智能体将一款热门第一人称射击游戏反编译为 C++,最终实现 99% 函数覆盖率且 83% 达到字节级精确匹配。项目初期采用 Claude Max、Codex Pro 及 Sonnet 5 等模型组合,通过 GitHub CLI 和 Discord 进行多 Agent 协作与进度追踪,但在引入自动化验证前,尽管代码可读性高,却存在大量语义错误和不必要的架构变更。

核心转折点在于发现单纯依赖 Reviewer Agent 无法有效识别逻辑偏差,因为缺乏客观的验收标准(Acceptance Criteria)。作者构建了基于编译器输出的字节匹配脚本(Byte Matching Decompilation),强制要求重构后的 OBJ 文件与原游戏 EXE/PDB 进行二进制比对,以此作为唯一的 PASS/FAIL 信号。这一机制不仅消除了人工审查的主观性,还迫使 Agent 放弃使用内联汇编等作弊手段,并允许使用成本更低、能力较弱的 Luna 模型替代昂贵模型,从而大幅降低了单位经济成本。

该项目揭示了当前 Agent 工程化的关键瓶颈:指令衰减与意图漂移。随着上下文窗口扩大,Agent 会忽略早期规则或产生幻觉,作者通过每小时 Cron Job 注入指令文档来维持注意力。最终项目消耗约 600-700B Tokens,剩余未达字节匹配的函数因非确定性特征被判定为不可优化。事实层面确认了字节级验证对 Agent 代码生成的必要性;推断层面表明未来复杂开发任务需从“人审”转向“机验”;猜测层面认为该模式可能成为企业级 Agent 开发的通用基础设施标准。

推荐理由

材料证明仅靠人类审查无法保证 Agent 代码正确性,必须建立机器可执行的字节级验证闭环。

来源:Hacker News · AI · momo5502.com