跳到正文
原文
arXiv cs.CL· Rui Liu, Tong Zheng, Jindong Gu, Zhipeng Wang·· 6 小时前AI 评分68

CARE论文提出视觉语言动作模型加速的失效风险认证框架

CARE: Certifying Acceleration for Vision-Language-Action Inference

AI 摘要

该论文针对视觉语言动作(VLA)模型在控制步骤中运行成本高昂的问题,提出了一种名为CARE的认证加速器选择方法,旨在解决传统加速技术因丢弃信息而导致任务失败的风险无法被平均延迟和成功率指标有效捕捉的问题。CARE通过从相同初始条件进行的配对回放在校准集上运行,提供有限样本保证,确保加速导致的失败风险低于用户指定的预算,并在没有合格候选者时回退到参考策略。

实验数据显示,在四个LIBERO套件上使用OpenVLA-OFT时,CARE实现了9.0至10.8倍的加速,同时在95%置信度下保证至少85.8%的参考策略解决的回合得以保留。相比之下,缺乏保证的加速器在高达75%的试验中超出预算,而CARE的顺序形式比穷举评估减少了78.9%的回放次数。该方法还泛化到了π_0.5的流步减少以及Qwen3.5-9B和Llama-3.1-8B智能体在Crafter中的场景。

事实层面,CARE利用终端结果和计算测量,不依赖特定加速机制,通过顺序测试和触发失败的参考回放保持认证成本可控。推断层面,这种基于配对回放的认证机制为工业界部署VLA模型提供了可量化的安全边界,避免了仅凭平均指标优化带来的潜在失控风险。猜测层面,若该框架能进一步标准化并集成到主流推理引擎中,可能成为未来高可靠性机器人系统部署的标准前置条件,但这取决于后续开源生态的采纳程度。

来源:arXiv cs.CL · arxiv.org