跳到正文
原文
Hacker News · AI· bakigul·· 1 天前AI 评分52

Jev-llm-guard 开源工具发布并引入基于引号的语义风险修正逻辑

Show HN: An open-source LLM guardrail powered by Jev

AI 摘要

GitHub 用户 bakigul 发布了名为 jev-llm-guard 的开源 LLM 护栏工具,该工具基于 Jev System One 提供上下文感知的本地允许、审查或拦截决策,并输出符合 OWASP LLM Top 10 2026 标准的十项风险评估。系统接受用户输入、检索内容、工具输出或模型输出作为文本源,通过 Node.js 环境运行,支持 Vercel 部署,并在未配置 Redis 时保持无限制的本地演示模式。

核心机制包含一项针对引用内容的特殊处理逻辑:当文本中包含平衡双引号时,系统会并行发起两次额外的 Jev 请求,分别检查全量文本是否仅要求解释且不含真实隐私值,以及引号外指令是否仅为解释而非执行命令。只有当两个解释信号均达到 0.85 且隐私值/活跃请求信号低于 0.4 时,原始评分才会被修正为两者中的最大值;否则保留原始分数。此外,系统在 Vercel 部署中利用共享 Redis 进行配额预留,实现了每分钟每 IP 5 次分析、每日每 IP 20 次的原子性计数,且拒绝的请求不消耗配额,但已接受的尝试即使后端调用失败也会计入限额。

事实层面,该工具目前处于 npm 包发布前的本地 tarball 安装阶段,基准测试包含 120 个预置回归场景(含 15 种攻击和 15 个良性案例)及 48 个引号专项测试,但这些数据明确声明为开发套件而非独立准确率基准。推断上,这种基于语境的动态修正和严格的配额原子性设计表明其试图解决传统静态规则无法处理的“解释性指令”误杀问题,同时防止公共 API 滥用。猜测成分在于其实际生产环境中的误报率表现,因为文档明确指出阈值是临时的且模型分数未经实证校准,最终决策仍依赖应用层提供的可信任务定义。

来源:Hacker News · AI · github.com