arXiv cs.AI· Timothy Kassis·· 13 小时前AI 评分68
Scientific Agents 论文显示专业系统提示词未提升准确率但显著增加成本与失败率
Scientific Agents: Evaluating Profession-Specific System Prompts on Scientific Tasks
AI 摘要
该研究评估了503个职业特定系统提示词(Scientific Agents)在科学任务中的表现,发现使用匹配的职业简介并未带来一致的准确率提升,反而使输出token数增加1.5至2.3倍,单次成功调用的成本增加2.2至4.5倍。在9个文本科学基准测试的4,531个问题中,平均准确率差异为-0.6个百分点,且无任何基准显示出统计显著的改进。
在涉及工具使用的BioMysteryBench生物信息学问题上,职业简介组的解决率为46.7%,而最小化基线组为56.7%,差异达-10.0个百分点,主要原因是职业简介触发了更频繁的token和时间限制停止。值得注意的是,在SuperGPQA基准上,长提示词因API中断时的容错性表现出优势,正确首答率从基线的54.0%提升至71.6%,但这被归因于提示词长度或格式而非领域专业知识,因为通用和不匹配的提示词表现相当。
事实层面,针对Gemini 3.8 Flash模型和测试任务,默认加载完整职业简介无法提高准确性且成本更高;推断层面,当前行业流行的“越专业越好”的提示词工程策略可能缺乏实证支持;猜测层面,是否通过选择性检索简介片段或在开放式科学任务中应用能改变这一结论仍需进一步验证。
来源:arXiv cs.AI · arxiv.org