研究显示专业系统提示词未提升科学任务准确率且成本更高
先了解这件事
2026年10月2日,arXiv发布论文评估503个职业特定系统提示词在科学任务中的表现。研究发现,使用匹配的职业简介并未带来一致的准确率提升,平均准确率差异为-0.6个百分点,且在9个基准测试中无任何改进具有统计显著性。相反,输出token数增加1.5至2.3倍,单次成功调用成本增加2.2至4.5倍。在BioMysteryBench生物信息学问题上,职业简介组的解决率为46.7%。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.AIScientific Agents 论文显示专业系统提示词未提升准确率但显著增加成本与失败率
该研究评估了503个职业特定系统提示词(Scientific Agents)在科学任务中的表现,发现使用匹配的职业简介并未带来一致的准确率提升,反而使输出token数增加1.5至2.3倍,单次成功调用的成本增加2.2至4.5倍。在9个文本科学基准测试的4,531个问题中,平均准确率差异为-0.6个百分点,且无任何基准显示出统计显著的改进。 在涉及工具使用的BioMysteryBench生物信息学问题上,职业简介组的解决率为46.7%,而最小化基线组为56.7%,差异达-10.0个百分点,主要原因是职业简介触发了更频繁的token和时间限制停止。值得注意的是,在SuperGPQA基准上,长提示词因API中断时的容错性表现出优势,正确首答率从基线的54.0%提升至71.6%,但这被归因于提示词长度或格式而非领域专业知识,因为通用和不匹配的提示词表现相当。 事实层面,针对Gemini 3.8 Flash模型和测试任务,默认加载完整职业简介无法提高准确性且成本更高;推断层面,当前行业流行的“越专业越好”的提示词工程策略可能缺乏实证支持;猜测层面,是否通过选择性检索简介片段或在开放式科学任务中应用能改变这一结论仍需进一步验证。
本事件热度走势
当前热度 7·可比范围峰值 7(10月2日 23:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。