三星宣称 LPDDR5X-PIM 推理吞吐达 3.01 倍,但输出差异仍待解决
Llama 3.1 8B 初步测试显示数据搬运减少、吞吐提高;但输出并不一致,准确率和整机功耗仍缺少可比验证。
三星公布了什么
三星在 Hot Chips 2026 介绍了 LPDDR5X-PIM,把简单运算逻辑放进低功耗内存。Tom’s Hardware 与 ServeTheHome 根据现场材料报道,三星用一款未公开型号的边缘 AI 加速器运行 Llama 3.1 8B:执行时间从 12.3 秒降至 5.4 秒,为 2.28 倍;每秒令牌数从 27.0 升至 81.3,为 3.01 倍;内部带宽由 76.8GB/s 提高到 614GB/s,约为 8 倍。这些都是三星的初步测试主张,尚无独立复现。
PIM 减少的是数据搬运
PIM 要解决的不是内存容量,而是数据搬运。传统推理中,处理器需要反复从内存读取权重和中间结果;带宽受限时,运算单元会等待数据,传输本身也消耗电力。把适合并行的基础运算放到内存附近,可以缩短这条路径。它并不等于“在内存里运行完整模型”,而是让部分工作不再往返处理器。
从 HBM 走向 LPDDR 的意义
这次披露的重要性,在于 PIM 正从高带宽内存和服务器实验走向 LPDDR。LPDDR 服务于功耗和空间更受约束的系统;如果收益能在真实模型中保留,个人 AI 设备、边缘服务器和其他本地推理系统可能受益。Hot Chips 官方议程将其列为面向 AI 推理的 LPDDR-PIM 方案,证明这是正式技术披露,但不证明性能数字。
输出差异是关键反证
最重要的反证来自测试输出本身。Tom’s Hardware 报道,PIM 与普通 LPDDR5X 的输出存在差异;现场有人就此提问,三星表示仍在优化准确率,并预期性能收益可以保留。在输出质量可比之前,3.01 倍只能说明这一次测试的吞吐变化,不能等同于可用推理性能。公开信息也没有确认加速器型号和批量大小;三星称整体功耗不会更高,同时承认瞬时峰值功耗会“高得多”,但尚未公开可比的整机测量。
接下来应看哪些证据
因此,现阶段更准确的结论是:三星展示了减少数据搬运的可行路径,但还没有证明 3.01 倍吞吐可以在相同准确率、可控功耗和真实软件栈中保持。接下来首先应看一致输出或标准精度指标下的复测,其次是完整系统功耗、开发工具和支持算子、客户送样,以及明确的成本和量产时间。只有这些证据同时出现,演示速度才会变成可采购的产品价值。