关键观点
乘加是 AI 芯片的基础算术单元
矩阵乘法的内层循环不断执行“乘法后累加”,因此 multiply-accumulate 比单独的乘法或加法更贴近 AI 工作负载。乘法通常使用较低精度,以降低面积、带宽和能耗;累加则需要更高精…展开观点收起观点
矩阵乘法的内层循环不断执行“乘法后累加”,因此 multiply-accumulate 比单独的乘法或加法更贴近 AI 工作负载。乘法通常使用较低精度,以降低面积、带宽和能耗;累加则需要更高精度,因为大量项连续求和会放大舍入误差。示例因此采用四位乘法和八位加法。这个选择同时反映了数值稳定性与硬件成本。
为什么重要: 理解乘加单元,就能理解 AI 芯片的性能指标、精度格式以及矩阵引擎为何如此设计。
支撑证据
A multiply-accumulate happens at every single step of a matrix multiply.
乘法器面积随位宽近似二次增长
一个 p 位数与一个 q 位数相乘,需要形成 p×q 个部分积,因而需要 p×q 个 AND 门。使用 Dadda multiplier 压缩这些部分积时,访谈推导出所需 full adder…展开观点收起观点
一个 p 位数与一个 q 位数相乘,需要形成 p×q 个部分积,因而需要 p×q 个 AND 门。使用 Dadda multiplier 压缩这些部分积时,访谈推导出所需 full adder 数量同样为 p×q。位宽减半不仅减少存储和传输量,也会显著缩小乘法电路。浮点格式还需处理指数,因此实际比例不会完全等于整数乘法的理想缩放。
为什么重要: 这解释了低精度计算为何能给神经网络带来远超线性的硬件收益,也是 FP4 性能快速提升的根本原因。
支撑证据
There will be p times q many full adders in this circuit.