Claude Code 插件 Terse 通过强制精简文风降低输出长度但未能显著减少总成本
Show HN: Terse, a Claude Code plugin that halves reply length by cutting filler
开源插件 Terse 为 Claude Code 引入一套包含 22 条规则的写作风格约束,强制模型采用“一句话答案加列表”的结构并禁止第一人称、隐喻和口号式表达。实测数据显示该插件在 Opus 5.5 和 Fable 5.1 模型上将回复字数减少了 46% 至 70%,同时将风格违规率降低了 90% 以上。
然而成本分析揭示了关键细节:虽然输出 Token 数下降了 42% 至 55%,但插件通过 UserPromptSubmit Hook 向每个请求注入约 576 字符的规则文本,导致每轮对话的输入 Token 增加约 100 个且无法被缓存。由于 Opus 系列模型的输入 Token 价格约为输出的五分之一,增加的上下文开销抵消了部分输出节省,最终导致总成本仅下降 2% 至 12%,而非字面意义上的减半。此外,规则注入还使模型推理(Thinking)Token 从 2,150 激增至 4,155,进一步推高了计算消耗。
这一结果修正了对“短即省钱”的简单推断,表明在端侧或高并发场景下,过度压缩输出长度若伴随显著的上下文膨胀,可能无法带来预期的单位经济效益。对于追求极致成本的工程实践者,建议优先评估模型本身的效率优化或仅在特定长文档生成场景启用此类插件,而非将其作为通用的降本方案。事实部分基于原文提供的基准测试数据,推断部分基于输入输出 Token 定价机制与上下文窗口成本的逻辑推导。
实测显示插件虽将字数减半,但因增加系统提示词导致推理成本上升,总成本降幅远低于预期。
来源:Hacker News · AI · github.com