LiquidAI 发布 d1-3B 与 d1-omni-600M 两款面向边缘的多模态决策模型
Multimodal open d1 decision models for the edge
LiquidAI 正式开源 d1-3B 和实验性的 d1-omni-600M 两款决策模型,它们不生成 token 而是通过单次前向传播直接输出结构化决策结果。d1-3B 在 Decision Index 0.2.1 中以 48.57 分超越所有 4B 和 9B 模型及 Decider 35B-A3B,且支持文本与图像输入;d1-omni-600M 仅 6 亿参数即可处理文本、图像或音频组合,在多项基准测试中表现优于参数量四倍的竞品。
性能实测显示,d1-3B 在 NVIDIA Jetson AGX Thor 上单问响应仅需 16 毫秒,在 Orin Nano 上为 50 毫秒,GPU 环境下甚至低于 10 毫秒。该模型基于 LFM2.5-VL-3B 解码器架构构建,而 d1-omni-600M 则源自双向编码器 LFM2.5-Encoder-350M,额外集成视觉与音频编码器以支持三模态输入。两者均已在 Hugging Face 开放权重并附带可执行代码,支持通过 transformers>=5.14 加载。
事实层面,这两款模型明确属于非自回归决策架构,适用于需要快速、结构化输出的场景如客服路由、医疗问答或内容审核。推断其商业价值在于显著降低边缘设备上的推理延迟与算力消耗,尤其适合资源受限的 IoT 终端。猜测未来可能扩展至更多模态组合,但音频基准目前仍属开放问题,官方未报告具体数值。
LiquidAI 发布无需生成 token 的决策模型,在 Jetson 上实现毫秒级响应,为边缘端实时分类与意图识别提供新架构选择。
来源:Hugging Face Blog · huggingface.co