范式智能获 IDC 2026 中国 AI 算力管理平台评估第一,HAMi 开源调度器晋升 CNCF 孵化级
范式智能在 IDC《中国 AI 算力管理平台技术能力评估,2026》中综合评分位列第一,资源管理等四项维度获满分。其主导的开源调度器 HAMi 于 7 月晋升为 CNCF 孵化级项目,通过动态弹性切分将 GPU 利用率从不足 30% 提升至 70%-90%。该公司上半年 API 业务收入达 4.64 亿元,同比暴增 860.8%,验证了“Token 工厂”模式成效。
范式智能在 IDC《中国 AI 算力管理平台技术能力评估,2026》中综合评分位列第一,资源管理等四项维度获满分。其主导的开源调度器 HAMi 于 7 月晋升为 CNCF 孵化级项目,通过动态弹性切分将 GPU 利用率从不足 30% 提升至 70%-90%。该公司上半年 API 业务收入达 4.64 亿元,同比暴增 860.8%,验证了“Token 工厂”模式成效。
亚马逊云科技为 Elastic Beanstalk 新增集群模式,将应用运行在自动创建的 Amazon EKS 集群上。该模式默认共享节点且无法自行选择集群版本或配置,需重新创建环境才能修正设置。部分开发者认为其与 ECS 功能重叠,建议应集中资源优化现有服务而非推出新方案。
Microsoft AI 发布 MAI-Transcribe-2-Streaming 和两个语音合成模型,面向语音智能体,核心是低延迟、多语言和更低价格。Microsoft 称转录模型在 Artificial Analysis 的准确率排名第一,支持 60 种语言,首个部分结果在 100 多毫秒内返回;到年底,每小时音频介绍价为 $0.54。
Ramp AI Index 显示美国企业 AI 用量上升但支出下降,关键变化是单位 token 成本下降,而不是用量收缩。Ramp 经济学家 Ara Kharazian 将支出回落归因于顶级模型降价,以及更便宜、更高效的标准和 lite 模型;他称下降几乎完全来自 OpenAI 与 Anthropic 之间的竞争。
Apple 就 AI 相关诉讼达成 2.5 亿美元和解协议,iPhone 15 和 iPhone 16 用户每台设备可申领 25 至 95 美元赔偿。该和解方案针对特定机型用户开放索赔申请,具体金额依据设备型号确定。目前尚未披露详细的申领流程与截止日期。
非营利组织 Basel Action Network 发布新报告,预测到 2050 年 AI 相关电子垃圾将增至 39500 万至 6.17 亿吨。该估算首次纳入冷却系统、电源及网络设备等基础设施,远超以往仅关注服务器和 GPU 的保守数据。若缺乏规划,当前 AI 建设可能演变为比现有更严重的有毒废物危机。
dowbench 是一个开源离线工具,读取 LLM Agent 的工具定义,扫描可能导致 denial-of-wallet 成本放大的结构,例如无结果上限、无分页上限、把先前输出回传为输入字段,以及缺少调用预算。扫描不调用模型 API、不需要 key,也不产生费用;它给出的结论是模式匹配,而不是对实际账单的预测。 项目背后还有一个可复现基准:攻击、防御和模型组成矩阵,用 provider 计费的 token 和美元成本评分。材料给出的早期试点显示,在 gemini-3.5-flash-lite 上,bloat-verify-001 攻击把单次任务成本放大到基线的约 8.8 倍;在测试的五种防御中,只有 result_cap 能阻止该攻击,并把攻击成功率降到 0%,对正常任务的额外成本约 +1.1%。材料同时说明这些样本量只有 1 到 5,属于方向性结果,不是稳定费率。 对做 Agent 产品的团队,事实层面的启示是:成本攻击不一定需要复杂提示词注入,一个返回外部数据但没有 size/limit 参数的工具,就可能通过一次大结果撑爆上下文并推高计费输入 token。推断是,把结果上限、分页上限和调用预算写进工具层,比只依赖 turn_limit 或 token_budget 更贴近这类攻击路径。猜测是,这类扫描可能成为 Agent CI 安全检查的一部分,但材料中的基准仍处于 alpha 和早期试点阶段。
推荐理由:它把 Agent 成本攻击从红队叙事落到可复现实验:无界工具结果可放大账单,result_cap 是当前低成本防御。
NVIDIA AI Factories 通过高生产力、长寿命和通用性三大特性最大化投资回报。SemiAnalysis 数据显示,Vera Rubin NVL72 系统每兆瓦吞吐量比 GB300 NVL72 高出 30 倍以上,DeepSeek V4 Pro 模型每百万 token 成本降低 45 倍。