causeval 在 DeepEval 之上为 LLM 应用评估补上不确定性、因果干预与 judge 审计三层证据
causeval 是 @routsom 创建并维护、构建于 DeepEval 之上的 LLM 应用评估层,它保留 DeepEval 的指标作为测量仪器,另加不确定性。
causeval 是 @routsom 创建并维护、构建于 DeepEval 之上的 LLM 应用评估层,它保留 DeepEval 的指标作为测量仪器,另加不确定性。
作者发现当前招聘市场普遍在职位描述中堆砌 MCP、RAG、LangChain 等术语,甚至出现要求候选人具备技术发布前三年经验的荒谬条款。这种盲目跟风导致企业忽视实际用例,试图寻找能替代自身员工的“专家”,而非真正评估技能匹配度。
针对图像返回型多模态 RAG 的黑盒自适应数据提取攻击把恶意指令嵌入用户输入图像,而不是把恶意查询放在文本 prompt 中。实验覆盖医疗助手、文档助手和通用工具三个场景,在多个 CLIP-family retrievers 与不同 generators 下,单次 2500-query run 在 local-feature correspondence 下最多重建 611 张放射科图像、566 份文档扫描和 416 张通用图像,并达到非自适应 baseline 最多 5.6 倍。事实是攻击可沿 embedding space 中仍能产生新检索的区域自适应推进;推断是 MRAG 的图像检索与返回通道本身构成数据源泄露入口,防护需要覆盖多模态输入、检索和图像输出,而不只是文本 prompt。
推荐理由:它把多模态 RAG 的数据提取风险从文本提示扩展到图像输入,并给出黑盒自适应攻击的量化结果,能直接校正对 MRAG 安全边界的判断。
MOMAT 是一个面向端侧量化大语言模型的安全框架,通过结构化知识检索和低功耗硬件加速来抵御越狱攻击。论文指出,量化会削弱大语言模型的对齐保护,使 qLLM 更容易被越狱;MOMAT 的应对方式不是单纯扩大安全数据库,而是把有害与良性样本、策略模板组织成多个语义图集,再对每条 prompt 做跨图集 top-k 检索和轻量 MoE 检测。 细节上,MOMAT 将检索任务放进 CiM 存内计算加速引擎执行,论文给出的对比数据显示,100 条查询批处理从 15,052.44 ms 降到 3,207.21 ns,能耗从 8.1×10^7 μJ 降到 3.32 μJ,相对 DRAM 基线分别获得约 4.69×10^6 倍加速和约 2.5×10^5 倍能耗下降。作者同时称红队评测中其防御效果与现有方法相当,并减少误伤良性请求,还计划开放 223.2k 样本数据集。 事实是论文提出了图集化 RAG 防护、MoE 检测与 CiM 检索的组合,并报告了显著效率指标;推断是这种模块化硬件路径可能更适合端侧 qLLM 的实时安全过滤;猜测是若 CiM 硬件可得且数据集有效,该方案可能影响边缘设备上的安全部署架构。
推荐理由:它把量化模型越狱防御从软件检索转向 CiM 硬件加速,可能改变端侧安全方案对延迟与能耗的取舍判断。
一项提交给 Journal of Service Research 的预印本研究提出,生成式 AI 个性化的关键不是给模型更多上下文,而是找到当前交互所需的最小相关上下文集合。作者把用户历史行为和偏好称为 customer evidence,把服务方在生成时补充的情境信息称为 provider-side context,并认为后者一旦变得容易供给,数量增加不一定带来收益。 研究构建了 context sufficiency 理论,将上下文状态分为 insufficiency、sufficiency、saturation 和 interference,并提出 Context-Sufficiency Frontier 用于定位最小相关集合。作者在一大家居零售商的生成式推荐系统上做了 full-factorial experiment,结果显示相关上下文提升了推荐适配度,无关上下文则降低适配度并扰乱检索。 该工作把个性化问题从“补充更多上下文”转向“判断当前交互真正需要什么上下文,并在服务流程中施加约束”。对做推荐、客服或导购类 Agent 的团队而言,它提示上下文工程需要引入相关性筛选和约束机制,而不是简单扩大 prompt 或 RAG 输入。
推荐理由:它提出上下文充分性边界,提醒个性化系统优先筛掉无关上下文,而不是继续堆料。
Build2SPARQL 发布了包含 6,136 个可执行 SPARQL 查询和 30,680 个自然语言问题的建筑领域大规模基准数据集。该数据通过图遍历代码生成查询并由大语言模型生成问题,经人工验证语义保真度达 98.8%。在三个开源权重语言模型上的评估显示,检索增强后精确匹配准确率从零样本的 0.2-20% 提升至三样本的 56-65%。
Xinyuan Song 和 Zekun Cai 在 arXiv 论文中指出,长程语言 Agent 的外部记忆使用会向少数核心状态集中,罕见状态则落入长尾并累积预测误差;他们据此提出 Core--Tail World Model(CTWM),用单一指数 τ 分配提示词预算并保留摘要化长尾。 在 Synthetic Graph World 上,论文称 CTWM 相对 graph-memory baseline 保持完整状态与转移覆盖,减少 5.9% prompt tokens,并把下半部分长尾预测误差降低 13.6%。同一配对比较还显示其在 ALFWorld 上有一致的 token 节省,在 LongMemEval 上减少 24.48% tokens 且总体准确率持平。审计部分还发现集中现象可复现但依赖策略:random-walk agent 产生与 log-normal 兼容的检索痕迹,语义 LLM 策略产生更强的截断幂律核心—长尾痕迹。 事实是论文给出了审计方法和三组基准上的配对结果;推断是重尾记忆轨迹可作为 token 高效世界模型的控制信号;猜测是其是否适用于更复杂真实任务仍取决于外部验证。
推荐理由:把长程 Agent 记忆从成功率和 token 成本转向长尾预测误差,可作为记忆系统评测与预算控制的新变量。
GGUF Libra 通过对话树版本控制与谱图理论构建拓扑记忆,解决传统线性架构的上下文污染与推理深度缺失问题。该工具利用 llama.cpp 在本地运行,支持 Gemma 4 E4B 等模型,提供 Git 式分支、物理 KV 缓存清除及语法感知代码分块功能。