AI 自主设计开源加速器 openTPU 发布并实测
先了解这件事
openTPU 是由 AI 自主设计的开源 AI 加速器项目,其硬件设计、指令集、编译器及宿主软件均包含在一个单体仓库中。2026 年 10 月 7 日,该项目在搭载 Xilinx Kintex-7 xc7k480t 的 Inspur YPCB-00338 卡上成功运行了 LFM2.5、Qwen3.5、Gemma 4 等多个现代模型。实测数据显示,该卡在解码阶段能产生与模拟器逐位一致的 token,且在不同量化配置下(如 int8 或 4-bit)展现了 DRAM 带宽利用情况。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- Hacker News · AI精选AI 设计的 openTPU 在 Xilinx Kintex-7 FPGA 上实测运行 Qwen3.5 等模型
openTPU 是一个由 AI 自主设计的开源 AI 加速器项目,其硬件设计、指令集、编译器及宿主软件均包含在一个单体仓库中,并在 Inspur YPCB-00338 卡(搭载 Xilinx Kintex-7 xc7k480t)上成功运行了 LFM2.5、Qwen3.5、Gemma 4 等多个现代模型。实测数据显示,该卡在解码阶段能产生与模拟器逐位一致的 token,且在不同量化配置下(如 int8 或 4-bit),DRAM 带宽利用率稳定在 82% 至 94% 之间,部分场景下解码速度比前代镜像提升 8-10%。 该项目采用无缓存、无隐藏调度的极简架构,通过一条指令完成一次数据移动,利用 LiteDRAM 控制器和四列脉动矩阵单元处理计算。针对超过 4 GiB 的混合专家(MoE)模型,系统支持从主机存储流式传输专家参数到卡上 DRAM,实测显示 LFM2.5-8B 模型的专家命中率高达 98.5%,而 Qwen3.5-35B 模型因 PCIe 带宽限制导致每 token 需传输 153 MB 数据。此外,4-bit 权重方案通过 FP4 值加两级块缩放,将每 token 字节数减少约三分之一,使解码速度提升 40%-45%,但伴随可测量的困惑度上升。 事实层面,该项目证明了 AI 代理能够生成可编译、可运行的 FPGA 比特流并驱动真实 PCIe 设备;推断层面,当前性能瓶颈已明确转移至 DRAM 效率而非计算单元,未来优化方向在于提升 DDR3 读取效率或升级时钟频率以加速预填充;猜测层面,若后续引入更高速的内存接口或片上缓存,此类 AI 自研加速器可能在特定边缘推理场景中具备成本优势,但目前仍受限于 FPGA 资源与 PCIe 带宽。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。