跳到正文

#算力

今日 6 条
今天10月2日周五
  1. NVIDIA Blog75

    NVIDIA 推出 DGX Spark 64GB 配置,起价 $4,999 并以双机集群扩展本地 AI

    NVIDIA 宣布 DGX Spark 新增 64GB 统一内存配置,10 月 23 日起经 Acer、ASUS、Dell、Gigabyte、HP、MSI 发售,起价 $4,999,保留 GB10 Grace Blackwell Superchip、DGX OS 与完整 NVIDIA AI 软件栈,可完全在设备端运行最多 100B 参数模型。两台 64GB 单元经内置 ConnectX-7 网口与 QSFP 线缆集群后,内存 pooling 到 128GB、模型支持扩到 200B 参数,NVIDIA 在 Qwen3.8 27B 测试中测得最高 1.7x 性能。 两个容易被标题略过的细节。其一,集群收益不只是容量翻倍:正文明确双机带来两倍内存带宽与最高 1.7x 性能,Sync Cluster Assistant 的作用是自动检测、校验并配置 ConnectX-7 网络,使单机工作流无需重构软件环境即可扩展到两机,这把集群的工程成本压到接近插线级别。其二,64GB SKU 仅通过制造商伙伴渠道销售,芯片与软件栈与 128GB 型号完全一致,NVIDIA 把低价入口交给 OEM,自己守住 DGX OS、CUDA-X 与 Sync 软件层;月底将上线的 NVIDIA Sync Model Launcher 可一键下载并启动 Qwen3.8 27B,并配置 OpenCode 供浏览器内编码使用。以上均为材料给出的事实。 从商业结构看,这一配置把常驻 coding 或研究 Agent 的成本从按 token 付费的云推理改为一次性硬件投入,对每天运行多步任务的团队是单位经济口径的变化,属于推断;OEM 独占渠道意味着 NVIDIA 想借伙伴的库存与渠道扩大装机量而非自营降价,也属推断;至于 64GB 是否蚕食 128GB 型号销量、1.7x 的集群效率在更大模型或更长上下文下能否保持,材料未给数据,只能算猜测。

    推荐理由:把本地 AI 入门价压到 $4,999 并给出双机集群 1.7x 的实测口径,能校正“本地跑不动 Agent、集群配置复杂”的判断,帮助决定先买单机还是继续依赖云推理。

  2. The Verge · AI68

    Amazon 发文警告社区不要阻止数据中心,称会拖累美国 AI 竞争

    Amazon 发布长文警告社区不要阻止数据中心,核心是把地方反对包装成美国 AI 竞争和国家安全风险。事实是 AWS CEO Matt Garman 称超过 100 个数据中心暂停令正在考虑,若实施会让美国在 AI 主导权竞争中自写败局;同时 Amazon 提出 Data Center Commitment,承诺创造就业、防止当地能源费率上涨,并投资超过 10 亿美元支持邻近社区。 值得下钻的是 NDA 与外部虚假信息两个细节。材料称 Amazon 不再与政府机构使用保密协议,回应此前议员对科技公司与当地官员秘密交易的调查;这比一般公关承诺更接近可核查的治理变化,但原文没有说明适用范围、历史协议是否追溯或替代披露机制。另一细节是 Garman 称有广泛报道显示各国故意在美国散布数据中心虚假信息,但正文没有给出具体国家、证据或来源,只能视为 Amazon 对反对意见的归因。 对产业链的推论是,AI 数据中心已从云厂商内部资本开支问题变成地方政治问题。事实是民调支持率下降、社区反弹和暂停令增加;推断是如果地方限制扩大,云厂商的算力扩张节奏将更多取决于电力、就业、环境和社区补偿谈判,而不是单纯 AI 算力需求。猜测是 Amazon 用国家安全叙事可能短期压制反对,但长期会提高公众对 AI 基建外部性的审查强度。

  3. InfoQ 中文82

    DeepSeek 开源昇腾平台基础设施组件,覆盖 TileLang、计算库与分布式通信库

    DeepSeek 宣布开源一组面向华为昇腾算力平台的基础设施组件,包括 TileLang 高级语言编译工具,以及 DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect 的昇腾平台实现。官方称这些组件与此前英伟达平台开源组件一一对应,覆盖矩阵运算、跨设备通信、常规向量计算与访存、稀疏注意力和数据筛选,并披露团队与华为共同推进基于昇腾 950 的 128 卡超节点方案,对计算和通信进行联合优化。 迁移价值不在“全部可用”,而在接口对齐程度与限制条件。DeepGEMM-Ascend 的 API 与 DeepGEMM 兼容,但昇腾版量化缩放因子存储格式与英伟达版不同;DeepEP Ascend 的公开 buffer API 对齐英伟达版并支持 FP8 数据分发,但流水线并行、上下文并行和数据并行的部分通信能力仍在开发中。FlashMLA 覆盖稀疏注意力的预填充和解码,但仓库中部分融合内核及稠密注意力内核仍仅支持 CUDA;DeepSelect 昇腾实现目前仅支持 BF16 输入。TileKernels 昇腾后端要求 CANN 9.2.0 及以上,DeepEP Ascend 也未验证其他昇腾代际或 CANN 版本。 事实是这批开源代码为昇腾环境提供了算子编写、计算和通信执行层可复用组件,且多数组件围绕昇腾 950 验证。推断是 API 对齐会降低已有 CUDA 调用代码的迁移成本,但数据布局、精度格式、算子覆盖和软件栈版本仍会决定实际可用性。猜测是这代表 DeepSeek 与华为合作从云端推理服务适配进一步下沉到编译工具与基础库联合优化,但完整模型部署效果仍取决于上层框架、模型实现和集群环境集成。

    推荐理由:若团队评估昇腾迁移,这篇把 API 兼容边界、精度格式差异和 CANN/硬件验证范围讲清了,能减少盲目复用。

  4. Hacker News · AI78

    Quail 如何用 roofline 模型估算 AI-SQL 过滤器的延迟成本

    Quail 团队提出用 roofline 模型估算 AI-SQL 过滤器延迟,而不是为每个模型、GPU 或工作负载重新 profiling。在 H100 和 Qwen3-4B-fp8 上,5,000 条 IMDB 评论的单过滤器 SoL 下界为 6.64 秒,三过滤器最优顺序 F2→F1→F3 的 SoL 下界为 6.86 秒。这个模型把 LLM 查询计划从经验 profiling 变成可计算的硬件下界,核心不是 token 数,而是 FLOPs、HBM 流量、KV 复用和 filter 选择率。 成本模型把每个 filter 拆成 projection、attention 和 MLP,分别计算 FLOPs 与 HBM 流量,再取 max(FLOPs/峰值算力, bytes/HBM 带宽)。单过滤器 5,000 条评论需要 16 次 forward pass,projection 1.6778 秒、attention 0.1850 秒、MLP 4.7818 秒,全部 compute-bound。多过滤器时,共享 prefix 的 KV cache 可复用,HBM 容量把 batch 限制到约 1,200 条文档;排序规则用 ask cost/(1-selectivity) 给后续 filter 排名,并尝试每个 filter 作为第一个,例子中 F2 先执行比 F1 先执行低约 4.7%。 事实是 SoL 是硬件峰值下的下界,实际运行可能更长,因为峰值算力和跨 filter overlap 不一定达到。推断是 LLM 查询引擎的查询计划器必须把模型结构、量化格式、KV 复用和 filter selectivity 纳入成本,而不是只看 prompt token 数;GQA、FP8 权重和较小 KV footprint 会直接影响可批处理文档数。猜测是如果后续扩展到 AI JOIN、AI CLASSIFY 和 Blackwell FP4,硬件感知成本模型会成为 AI-SQL 产品差异化的关键。

    推荐理由:它把 AI-SQL 过滤器的延迟估计从逐模型 profiling 转为 roofline 下界,并给出 filter ordering 与 KV 复用成本模型,能校正 LLM 查询引擎优化方向。

10月1日周四