跳到正文
原文
Hacker News · AI· nvmdbljstm·· 4 小时前精选AI 评分78

deepsense.ai 提出面向生产的 AI 系统评估模式,用 harness、重复运行和失败诊断替代公开 benchmark 做部署判断

Show HN: A practical AI Evaluation pattern

AI 导读

deepsense.ai 提出,生产 AI 系统评估不应以公开 benchmark 分数作为部署依据,而应评估模型、harness、工具、记忆、执行路径、可靠性、成本和业务结果。文章认为,2026 年公开评估已更接近端到端专业工作流,但 benchmark 分数只说明特定测试协议下的表现,不能证明系统会泛化到真实用户、数据、工具和约束;公开 benchmark 更适合建立候选短名单,而不是直接决定上线。

两个细节最能说明问题。事实是,OpenAI 在 ARC-AGI-3 中展示,启用 retained reasoning 和 compaction 后,GPT-5.6 Sol 的分数从 13.3% 提升到 38.3%,同时输出 token 约少 6 倍;模型没有变,变的是系统如何保存推理和管理上下文。作者自己的 EDA benchmark 也显示,Claude Fable 5 的平均分 0.50 高于 GPT-5.6 Sol 的 0.48,但按重复运行方差调整后,GPT-5.6 Sol 的可靠性调整分 0.46 高于 Claude Fable 5 的 0.42,说明平均分可能隐藏不稳定。文章还指出,工具响应可能事实正确但不可用,例如缺少单位、结构不适合下游 agent、没有回答用户目标。

从事实看,文章把部署前评估、生产监控和失败回归串成三个循环,并提到 Harbor 保存完整轨迹、轻量模型聚类问题、人工审查关键 trace。推断上,这会改变模型切换决策:团队更可能依据自有回归集、首跑成功率、单位成功成本和失败诊断,而不是公告分数;对交易、客服或合规类 agent,重复成功比单次高分更重要。猜测上,评估平台可能成为企业 AI 工程的核心资产,但原文没有给出市场、收入或采用率证据。

推荐理由

它把部署判断从公开基准分数转向生产运行环境、重复运行方差、单位成功成本和失败诊断,能校正高分模型即可上线的误判。

来源:Hacker News · AI · deepsense.ai