跳到正文
原文
Hacker News · AI· fibo·· 1 天前精选AI 评分78

Redis 作者发布 ds4 引擎,支持在本地运行 DeepSeek V4 和 Qwen3.8 Flash

From the creator of Redis; run LLM locally with ds4

AI 导读

ds4 是由 Redis 创始人 Antirez 开发的专用 C 语言推理引擎,旨在让高内存 Mac、CUDA 及 ROCm 机器能够本地运行前沿开源权重模型。该工具原生支持 DeepSeek V4/V4.1 Flash、GLM 5.x 及 Qwen3.8 Flash Next 等文本与视觉模型,通过 CLI、HTTP API 和本地 Agent 接口实现统一栈操作。

其核心机制采用非对称 2-bit 量化压缩路由专家层同时保留关键共享路径精度,使 2840 亿参数的 MoE 模型能在 128GB 内存设备上运行。系统利用 SSD 存储 KV cache 以实现长上下文持久化,重启时仅需根据提示词哈希恢复状态而非全量预填充。基准测试显示,在配备 M5 Max 芯片且拥有 128GB 内存的机器上,运行 Q2 量化的 V4 Flash 模型时,生成速度可达 39.4 tokens/s(2k 上下文)至 27.6 tokens/s(64k 上下文),预填充速度分别为 790.2 t/s 和 398.5 t/s。

该工具并非通用 GGUF 运行器,而是针对特定模型架构进行端到端验证的窄型引擎。用户需自行下载项目特定的 GGUF 文件并编译后端,随后通过 ./ds4-server 启动服务以兼容 OpenAI 或 Anthropic 风格 API,从而连接 Codex、Claude Code 等本地编码智能体。事实层面确认了硬件需求与性能数据;推断层面表明该方案降低了本地部署超大模型的门槛,但依赖特定硬件配置与手动构建流程;猜测层面在于其长期维护能力是否受限于单一开发者驱动。

推荐理由

提供将 DeepSeek V4 等前沿模型在本地 128GB 内存机器上以 Q2 量化运行的具体方案与性能基线。

来源:Hacker News · AI · dwarfstar.sh