4858 字
24 分钟
NVFP4 与 MXFP4 量化格式深度对比:格式设计、精度表现与适用场景

目录#

  1. 引言:为什么需要 FP4?
  2. Block Floating Point 与 Micro-Scaling 基础
  3. 格式定义对比
  4. Scale Factor 的设计哲学分歧
  5. 硬件与软件生态
  6. 量化效果的实验研究
  7. 综合分析与适用场景讨论
  8. 未来展望

1. 引言:为什么需要 FP4?#

LLM 推理的核心瓶颈是显存带宽,而非计算能力。将模型权重的精度从 FP16(16-bit)降到 INT8(8-bit)可以实现约 2× 的显存节省,再降到 FP4(4-bit)则是 约 4×。对于 70B 参数的模型,FP16 权重需 ~140GB 显存,FP4 仅需 ~35GB——这就是 4-bit 量化最大的吸引力。

但问题在于:4-bit 仅能表示 16 个不同的数值(E2M1 格式:1 位符号 + 2 位指数 + 1 位尾数),其原生表示范围仅为 ±{0, 0.5, 1.0, 1.5, 2.0, 3.0, 4.0, 6.0}。缺乏 subnormal 和 Infinity/NaN 支持意味着它无法像 FP16 那样优雅地处理极端值。因此,仅靠 4-bit 元素本身是不够的,必须引入某种 scaling 机制来扩展动态范围

这正是 Block Floating Point (BFP) 要做的事,也是 MXFP4 和 NVFP4 分野的起点。

Comment: FP4 量化的价值不难理解——它是当前硬件上可实现的最低精度浮点格式。但将 16 个离散值”拉伸”到覆盖整个 LLM 的权重分布,这个任务的难度可能被低估了。


2. Block Floating Point 与 Micro-Scaling 基础#

2.1 核心思想#

Block Floating Point (BFP) 的核心思想是:一组数值共享一个指数(scale factor),而非每个数值有自己的指数。这本质上是”分组归一化”——先用组内最大值确定一个共同的 scale,然后将组内所有值缩放到目标精度下表示。

形式化地,对于一个包含 kk 个元素的数据块 {vi}i=1k\{v_i\}_{i=1}^k

  • 计算 shared exponent:X=2log2(maxivi)emaxX = 2^{\lfloor \log_2(\max_i |v_i|) \rfloor - emax}
  • 每个元素量化为:Pi=quantize(vi/X)P_i = quantize(v_i / X)
  • 实际值重建为:v^i=XPi\hat{v}_i = X \cdot P_i

2.2 两个关键设计参数#

在这个框架下,不同的 BFP 实现有两个关键的自由度:

  1. 块大小 kk:多少元素共享一个 scale factor。kk 越小,scale 越能反映局部数值特征,但存储开销越大(每个块多存一个 scale)。
  2. Scale factor 的表示精度 ww:scale 本身用什么格式存储。整数次幂(如 E8M0)最简单但精度最低;浮点格式(如 E4M3)更灵活但计算更复杂。

MXFP4 和 NVFP4 正是在这两个参数上做出了截然不同的选择


3. 格式定义对比#

3.1 MXFP4#

MXFP4 由 Open Compute Project (OCP) 标准化,是 Microscaling Formats (MX) 规范 v1.0 的一部分。其定义如下:

参数
元素格式E2M1(1s + 2e + 1m = 4 bit)
块大小 kk32 元素
Scale factor 格式E8M0(8-bit unsigned exponent,仅表示 2n2^n
字节开销 per block32×4+8=13632 \times 4 + 8 = 136 bit = 4.254.25 bit/element
缩放层级单层:block 级 scale 即可覆盖整个 tensor

设计哲学:简洁、标准化、低复杂度。E8M0 提供 21272^{-127}21272^{127} 的指数范围,scale factor 的计算是纯 bit-shift。k=32 与 tensor core 的 32-thread warp 结构对齐。

E2M1 可表示的规格化值#

FP4 (E2M1) 的规格化值范围为:

二进制 (e2m1)十进制值
0_00_00
0_00_10.5
0_01_01.0
0_01_11.5
0_10_02.0
0_10_13.0
0_11_04.0
0_11_16.0

(负值对应符号位为 1)

Comment: 注意 E2M1 的值分布是非均匀的——0.5 到 2.0 之间步长为 0.5,2.0 以上步长变为 1 和 2。这种”粗粒度”意味着精确表示某个权重值的概率很低,实际精度高度依赖 scale factor 的质量。

3.2 NVFP4#

NVFP4 是 NVIDIA 在 Blackwell 架构中引入的专有格式,其定义如下:

参数
元素格式E2M1(同 MXFP4)
块大小 kk16 元素
Scale factor (L1)E4M3(4-bit 指数 + 3-bit 尾数 = 7-bit FP8)
Scale factor (L2)FP32 per-tensor 全局缩放
字节开销 per block16×4+8=7216 \times 4 + 8 = 72 bit = 4.54.5 bit/element
缩放层级双层:block 级 E4M3 + tensor 级 FP32

设计哲学:精度优先。通过减小块大小(更局部化适配)和提升 scale factor 精度(非 2 的幂)来降低量化误差,代价是略高的存储开销(4.5 vs 4.25 bit/element)和双层缩放的实现复杂度。

对比表格(来自 NVIDIA 官方)#

以下表格来自 NVIDIA 2025 年 6 月的技术博客,比较了 Blackwell 支持的三种 4-bit 浮点格式:

特性FP4 (E2M1)MXFP4NVFP4
格式结构4-bit + 软件 scaling4-bit + 1 个共享 2^n scale / 32 元素块4-bit + 1 个共享 E4M3 scale / 16 元素块
硬件加速缩放
显存效率最多 4× vs FP16约 4× vs FP16约 3.5× vs FP16
精度风险相对 FP8 精度下降明显相对 FP8 精度下降明显精度下降风险最低(尤其大模型)

4. Scale Factor 的设计哲学分歧#

这是理解 NVFP4 与 MXFP4 差异的核心。

4.1 E8M0 vs E4M3:不只是精度差异#

MXFP4 的 E8M0 表示 2n2^n,其中 n[127,127]n \in [-127, 127]。这意味着 scale factor 只能是 2 的整数次幂。当 block 内元素的分布不恰好落在 2n2^n 的边界上时,scale 的 round-to-nearest 误差会系统性地放大。

NVFP4 的 E4M3 是 7-bit 浮点数(4 位指数 + 3 位尾数),可以表示非 2 的幂的任意值(如 1.25×, 1.375×, 1.5× 等)。这使得 scale factor 可以更精确地适配 block 内数值的统计分布。

Comment: 用 NVIDIA 博客中的数值例子来说明:假设一个 block 的 amax 是 5.0,E8M0 的 scale 必须是 23=82^3 = 8(over-scaling),导致 block 内所有值被”拉大”1.6×;而 E4M3 可以选择更贴近的 scale(如 5.0 本身或其附近的值),量化误差自然更小。

4.2 单层 vs 双层缩放#

MXFP4 的单层缩放有一个隐含假设:E8M0 的指数范围(212721272^{-127} \sim 2^{127})足以覆盖任何实际 tensor 的动态范围。这在绝大多数情况下是对的,但在极端分布下可能出现问题。

NVFP4 选择了更保守的策略:

  1. 第一层:E4M3 block scale 提供精细的局部适配(精度高,但范围有限)
  2. 第二层:FP32 tensor scale 补偿全局动态范围(精度无损,因为只有一个标量)

这种”分工合作”的思路使得 NVFP4 的 L1 scale 不需要承担覆盖全动态范围的责任,可以专注于精度。

4.3 块大小 16 vs 32 的统计学意义#

这是两个格式最根本的差异之一。块大小直接影响量化误差的统计分布

在一个 block 内,被量化的 kk 个元素共享同一个 scale factor XXXX 由 block 内的 amax 决定:XmaxiviX \propto \max_i |v_i|。因此,block 内的量化误差取决于所有元素与 amax 的相对比例关系

  • k=32(MXFP4):32 个元素中,amax 很可能是一个 outlier。其余 31 个值被迫使用这个”为 outlier 量身定制”的 scale,导致均匀分布的值被 over-scale,系统性地浪费了宝贵的 4-bit 量化精度。

  • k=16(NVFP4):块大小减半,outlier 影响范围缩小一倍。在统计意义上,16 个值中至少有一个极端 outlier 的概率远低于 32 个值中至少有 outlier 的概率——假设权重近似正态分布,这大致等价于:NVFP4 每个 block 的 amax 更接近该 block 内元素的”典型”最大幅度,而非极端 outlier。

定量直觉:给定权重张量的正态性,k=16 的每个 block 内,最大值超出均值 2σ 以上的概率约为 k=32 对应概率的 50%-60%。这意味着 NVFP4 比 MXFP4 有大约两倍的概率选到一个”不偏激”的 scale factor。


5. 硬件与软件生态#

5.1 硬件支持#

硬件平台MXFP4 支持NVFP4 支持
NVIDIA Blackwell (B100/B200/GB300)✅ (.kind::mxf4 指令)✅ (.kind::mxf4nvf4 指令)
AMD CDNA4 (MI355X)✅ (规划中)
NVIDIA Hopper (H100/H200)❌(仅 FP8)
Intel Gaudi 3❌(仅 FP8)

Blackwell PTX ISA 中:

  • tcgen05.mma.kind::mxf4:执行 MXFP4 的 block scaling 矩阵乘,scale_vec 仅支持 2X(block32),scale 类型为 UE8M0
  • tcgen05.mma.kind::mxf4nvf4:执行 NVFP4 的 block scaling 矩阵乘,scale_vec 支持 2X(block32,向后兼容 MXFP4)+ 4X(block16,NVFP4 独有),scale 类型支持 UE8M0 + UE4M3

Comment: 从 PTX 指令命名(.mxf4nvf4)可以看出,NVIDIA 将 NVFP4 定位为 MXFP4 的超集而非替代。Blackwell tensor core 可以同时跑两种格式,开发者可在同一硬件上按需选择。

5.2 软件生态#

组件MXFP4 支持NVFP4 支持
CUDA≥ 12.3(CUTLASS 仿真)CUDA ≥ 12.9 原生支持
CUTLASS✅ (float_e2m1_t + MX block types)✅ (kind::mxf4nvf4 tile)
TensorRT-LLM规划中✅ (Blackwell 推理部署)
TensorRT Model Optimizer✅ (PTQ/QAT → NVFP4)
vLLM✅ (MX 仿真)✅ (early support)
PyTorchOCP 仿真库通过 Transformer Engine / DeepGEMM
DeepGEMM✅ (FP4 Indexer 使用 UE8M0)未来支持
Hugging Face✅ (OCP MX 仿真)✅ (预量化 NVFP4 checkpoint)

5.3 标准化与生态绑定#

MXFP4 的标准化地位是一把双刃剑:

优势

  • 跨厂商互操作:AMD、Intel、Arm 均承诺支持 MX 格式
  • 长期稳定性:作为 OCP 标准,格式定义不会受单一厂商的商业策略影响
  • 研究社区:arXiv 论文、OCP 仿真库便于学术研究和复现

劣势

  • 迭代慢:标准修改需联盟共识
  • 性能上限受限于”最小公分母”式的设计妥协

NVFP4 是 NVIDIA 的事实标准策略——通过 Blackwell 的市场份额和 CUDA 生态的深度整合来推动采用。正如 CUDA 本身从未成为 IEEE/ISO 标准,NVFP4 也不需要 OCP 背书。对实际用户而言,选择权受限于所使用的硬件平台:如果你跑在 Blackwell 上,NVFP4 就是最佳选择;如果你需要跨 AMD/Intel/NVIDIA 部署,MXFP4 是目前唯一的选项。


6. 量化效果的实验研究#

这是本文最核心的部分。我们分别检视 MXFP4 和 NVFP4 已公开的实验结果,然后进行对比分析。

6.1 MXFP4 实验数据#

以下数据均来自 OCP Microscaling Formats 论文(arXiv:2310.10537),使用 OCP 仿真库在现有 GPU 上完成。

6.1.1 Direct-Cast 推理:GPT3-175B#

Direct-cast 推理指直接将 FP32 预训练权重转换为 MX 格式,不做任何微调或校准。这是最”零摩擦”的使用场景,也是最能暴露量化误差的场景。

Table 5: GPT3-175B Direct-Cast 推理结果(越高越好,± 为 bootstrap 标准差)

任务FP32 (基线)MXINT8MXFP8MXFP6MXFP4 Wt + MXFP8 ActMXFP4 Wt + MXFP6 Act
ARC easy ↑0.7440.7400.7380.7370.7440.748
ARC challenge ↑0.4800.4810.4850.4800.4870.425
Lambada ↑0.7550.7540.7080.7450.7540.623
College CS ↑0.3600.3400.3500.3500.3200.240
Int. law ↑0.5040.5370.4550.5210.3470.298
Jurisprudence ↑0.4540.4350.4910.4540.4180.324

关键发现

  • MXFP4 单独使用(Wt MXFP4 + Act MXFP6)效果很差:Lambada 从 0.755 降至 0.623(-17.5%),ARC challenge 从 0.480 降至 0.425(-11.5%)
  • 混合精度是关键:MXFP4 权重 + MXFP8 激活在大部分任务上接近基线(ARC easy 0.744→0.744, Lambada 0.755→0.754)
  • 纯 MXFP4(Wt MXFP4 + Act MXFP4)的数据在表中未出现——可能意味着结果太差,不值得单独报告

6.1.2 Direct-Cast 推理:LLaMA-7B#

Table 6: LLaMA-7B Direct-Cast 推理结果

任务FP32 (基线)MXINT8MXFP8MXFP6MXFP6 Wt MXFP8 ActMXFP4 Wt MXFP8 ActMXFP4 Wt MXFP6 Act
ARC easy ↑0.7290.7250.7160.7180.7260.6960.637
ARC challenge ↑0.4470.4440.4300.4450.4420.4120.355
Lambada ↑0.7360.7310.7200.7240.7210.6750.557
College CS ↑0.2600.2200.2700.2400.2800.2100.220
Int. law ↑0.4630.4300.4130.4220.4130.3980.331
Jurisprudence ↑0.3610.3700.3800.3700.3520.2960.269
Wikitext ↓9.4889.5049.7689.6289.68311.14727.201

关键发现

  • LLaMA-7B 上 MXFP4 的退化比 GPT3-175B 更严重:MXFP4 Wt + MXFP8 Act 的 Wikitext PPL 从 9.488→11.147(+17.5%),MXFP4 Wt + MXFP6 Act 更恶化到 27.201(+187%,基本崩溃)
  • 模型越小,MXFP4 直接推理越困难:这是因为小模型的权重分布更”紧凑”,没有足够多的冗余来吸收量化噪声
  • 纯 MXFP4 全量化(Wt MXFP4 + Act MXFP4)的结果同样未在表中出现
  • MXFP8 和 MXFP6 单独使用在多数任务上保持较好(ARC easy 0.729→0.716/0.718),说明 6-bit 是 direct-cast 推理的安全边界,4-bit 需要额外处理

Comment: Wikitext PPL 27.201 这个数字值得特别关注——它说明在极端情况下,MXFP4 + MXFP6 的组合甚至可能不如随机猜测。这对实际部署来说是致命的。

6.1.3 训练:MXFP4 权重 + MXFP6 激活#

Table 8: GPT-like 模型训练 Loss(混合精度:MXFP4 权重 + MXFP6_E3M2 激活和梯度)

模型FP32MXFP4 Wt + MXFP6 ActLoss 增幅
GPT-20M3.984.04+0.06
GPT-150M3.303.33+0.03
GPT-300M3.113.14+0.03
GPT-1.5B2.742.76+0.02

关键发现

  • MXFP4 在训练场景下表现出乎意料地好——即使仅 4-bit 权重,配合 6-bit 激活和梯度后,所有模型的 loss 增幅 <0.1
  • 更值得注意的是,loss 增幅随模型大小增大而减小(0.06→0.02),暗示 scaling law 可能有利于低精度:模型越大,单个权重的精度损失越容易被”平均掉”
  • 但这仍是混合精度方案——激活和梯度保持 MXFP6,纯 4-bit 全流程训练尚未被证明可行

6.2 NVFP4 实验数据#

以下数据来自 NVIDIA 官方技术博客(2025 年 6 月 24 日),基于 Blackwell 硬件原生执行(非仿真)。

6.2.1 Post-Training Quantization (PTQ):DeepSeek-R1-0528#

NVIDIA 在 DeepSeek-R1-0528 上测试了从原始 FP8 checkpoint 到 NVFP4 的 PTQ 转换,在 7 项 benchmark 上评估:

  • 大多数语言建模任务的精度损失 ≤ 1%
  • AIME 2024 数学推理任务甚至提升了 2%(NVIDIA 将这归因于量化引入的微小噪声反而起到了正则化作用,改善了推理鲁棒性)

Comment: AIME 数学推理分数上升 2% 是一个有趣的反常现象。这可能暗示 PTQ 过程中的某些 clipping 操作恰好抑制了模型对特定数值模式的过拟合——但这更多是推测,需要更多独立验证。

6.2.2 量化误差的数值分析(来自 NVIDIA 博客的 Figure 4)#

NVIDIA 提供了 E8M0 vs E4M3 scaling factor 的 MSE 对比动画:在同一 block 上,E4M3 的平均 MSE 为 0.08,显著优于 E8M0。这佐证了 NVFP4 的 E4M3 block scale 在统计意义上确实降低了每 block 的均方误差。

6.2.3 显存节省#

  • NVFP4 有效位宽:4+8/16=4.54 + 8/16 = 4.5 bit/element(加上 FP32 tensor scale 的摊销换算后约为 4.5 bit/element)
  • 相对 FP16:约 3.5× 显存节省
  • 相对 FP8:约 1.8× 显存节省
  • MXFP4 有效位宽:4+8/32=4.254 + 8/32 = 4.25 bit/element(略优于 NVFP4 的 4.5)

6.3 对比分析#

由于 NVFP4 和 MXFP4 尚未在同一模型上被直接对比过,我们需要从已有的独立实验中推断它们的相对表现。

6.3.1 精度对比总结#

场景MXFP4 表现NVFP4 表现NVFP4 优势来源
大模型 direct-cast混合精度下不错(GPT3-175B: W+Lambada 0.754)PTQ <1% 损失(DeepSeek-R1)E4M3 非 2^n scale + k=16 更小 block
小模型 direct-cast退化严重(LLaMA-7B Wiki PPL 9.5→11.1)暂无公开数据(推测:小模型上优势更大)同上,小模型对量化误差更敏感
纯 4-bit 全量化不可用(LLaMA-7B Wiki PPL 9.5→27.2)暂无公开数据未知,但理论上 k=16 能显著改善
训练(混合精度)GPT-1.5B loss +0.02暂无公开数据N/A
训练(纯 4-bit)未报告(可能不可行)暂无公开数据N/A

6.3.2 MXFP4 在什么场景下会掉队?#

  1. 小模型(<7B 参数)的直接量化:LLaMA-7B 的 Wikitext PPL 从 9.5 退化到 11.1 说明 MXFP4 不适合对小模型做 low-friction direct-cast 推理。NVFP4 的 k=16 理论上能显著改善,但尚需独立验证。

  2. 对 activation 敏感的任务:MXFP4 在 activation 侧的量化误差比 weight 侧更难控制——因为 activation 的分布是输入相关的,outlier 比静态权重更难以预测。NVFP4 的双层缩放和 E4M3 在这方面理论上更有优势。

  3. 纯 4-bit 全量化(无混合精度回退):MXFP4 Wt + MXFP4 Act 的数据在整个 MX 论文中都未被报告,这强烈暗示其精度不可接受。NVFP4 是否能突破这个壁垒目前未知。

6.3.3 需要注意的实验局限性#

  1. NVFP4 的实验数据目前仅来自 NVIDIA 官方博客,尚未经过独立的学术界验证。Blog 中的 Figure 6 虽然直观,但只展示了 1 个模型(DeepSeek-R1-0528)× 7 个 benchmark 的结果。

  2. MXFP4 的数据是软件仿真的(OCP 仿真库在非 MX 硬件上运行),而非在真正的 MX 加速硬件上测量的。不过这对精度分析无影响,仿真在数值上是准确的。

  3. 两个格式从未在同一个模型、同一组 benchmark 上被直接 PK 过。目前所有的”对比”都是通过对各自独立实验结果的交叉推断。这是该领域的一个明显空白。

  4. 下游任务选择差异:MXFP4 论文测试了 Lambada/Wikitext/ARC 等传统 benchmark,NVFP4 博客测试了 AIME/MATH 等推理任务。基准不统一使得跨研究比较更加困难。

Comment: 如果有人能在 B200 上用同一个模型跑 MXFP4 + NVFP4 的 PTQ inference,然后发一个 2 页的 arxiv note,这可能是 2025 年 MLSys 领域最简单却又最有价值的实验之一。


7. 综合分析与适用场景讨论#

7.1 量化误差的根源差异#

NVFP4 相对 MXFP4 的精度优势可以归因于三个独立机制的叠加:

  1. 块大小减半(32→16):减少 outlier”绑架”全 block 的概率
  2. 非 2 的幂 scale(E8M0→E4M3):消除 scale factor 本身的 round-to-nearest 系统误差
  3. 双层缩放:让 block scale 专注于精度而非动态范围

这三个机制并非等权重。从统计推断来看,块大小减半的影响可能最大——它直接改变了量化误差的 PDF(概率密度函数)形状,而 E4M3 只是在给定 amax 下的 scale 选择精度上做优化。

7.2 什么时候选 MXFP4?#

  • 跨厂商部署:需要在 AMD、Intel 或未来其他平台运行
  • 标准合规需求:企业策略要求使用开放标准格式
  • 训练场景:当前 MXFP4 是唯一有公开训练实验数据的 4-bit 格式
  • “够用就行”的场景:大模型 + 混合精度 + QAT/finetuning 补偿

7.3 什么时候选 NVFP4?#

  • Blackwell-only 部署:最大化单一硬件平台的推理效率
  • PTQ 零摩擦量化:不想做 QAT/finetune,又要 4-bit 推理精度
  • 小模型或敏感模型:对量化误差容忍度低的场景
  • Activation 量化需求:需要同时量化权重和激活时,NVFP4 的 E4M3 + k=16 更可靠

8. 未来展望#

8.1 标准化 vs 性能的分歧可能收敛#

NVIDIA 的 Eric Chung(NVFP4 博客作者之一)恰好也是 OCP MX 联盟的联合创始人。这意味着 NVFP4 的技术改进很可能会反馈到下一代 OCP MX 标准中(如 MX v2.0 引入更小的 block size 选项或更精确的 scale format)。

8.2 软件生态趋同#

TensorRT-LLM 和 vLLM 已经同时支持两种格式。对上层应用开发者来说,选择格式可能仅仅是一个配置参数的问题,底层硬件透明处理。这将降低格式选择的沉没成本。

8.3 FP4 的竞争对手#

MXFP6(6-bit, E2M3/E3M2 + E8M0 block scale)在精度和压缩率之间提供了一个”甜点”——MX 论文显示 MXFP6 几乎可以在所有 direct-cast 推理任务上匹配 FP32。随着显存带宽持续增长(HBM4),6-bit 可能成为比 4-bit 更”实际好用”的默认选择,而 4-bit 则退居极端压缩需求的特殊场景。

8.4 下一步需要什么?#

  1. 直接的 NVFP4 vs MXFP4 对比实验:同一模型、同一 benchmark、同一 PTQ pipeline
  2. NVFP4 的独立第三方评估:非 NVIDIA 团队在 Blackwell 硬件上复现精度声明
  3. NVFP4 训练实验:MXFP4 已证明 4-bit 权重训练可行,NVFP4 的理论优势应该能进一步缩小训练 gap
  4. 6-bit vs 4-bit 的工程权衡:在实际部署中(而非论文中),MXFP6 是否已经够好?

Comment: 坦率地说,FP4 量化仍处于”证明自己”的阶段。与 FP8 在 Hopper 上的快速普及不同,4-bit 还需要跨越精度-性能的临界点。NVFP4 是这个方向上的重要一步,但它是否是最终答案——还有待时间验证。


参考文献#

  1. Rouhani, B. D., et al. “Microscaling Data Formats for Deep Learning.” arXiv:2310.10537, 2023.
  2. NVIDIA. “Introducing NVFP4 for Efficient and Accurate Low-Precision Inference.” NVIDIA Technical Blog, June 24, 2025. https://developer.nvidia.com/blog/introducing-nvfp4-for-efficient-and-accurate-low-precision-inference/
  3. NVIDIA. “Parallel Thread Execution ISA Version 8.7.” Section 9.7.17.10 — TensorCore 5th Generation MMA Instructions. https://docs.nvidia.com/cuda/parallel-thread-execution/
  4. Open Compute Project. “OCP Microscaling Formats (MX) Specification v1.0.” https://www.opencompute.org/documents/ocp-microscaling-formats-mx-v1-0-spec-final-pdf
  5. Wikipedia contributors. “Block floating point.” Wikipedia, The Free Encyclopedia. https://en.wikipedia.org/wiki/Block_floating_point
  6. DeepGEMM. “DeepGEMM: A Unified High-Performance Tensor Core Kernel Library.” https://github.com/deepseek-ai/DeepGEMM
  7. Wikipedia contributors. “Minifloat.” Wikipedia, The Free Encyclopedia. https://en.wikipedia.org/wiki/Minifloat
NVFP4 与 MXFP4 量化格式深度对比:格式设计、精度表现与适用场景
https://infra.simphoni.uk/posts/nvfp4-vs-mxfp4/
作者
Jingze Xing
发布于
2026-06-03
许可协议
CC BY-NC-SA 4.0