pub fn dequant_nvfp4_e8m0_to_f32(
packed: &[u8],
scales: &[u8],
n: usize,
k: usize,
) -> Result<Vec<f32>>Expand description
Unpack packed E2M1 [n, k/2] + E8M0 scales to f32 [n, k].
Block size is n*k / scales.len() (DSV4 infers; GPU lander requires 32).
Even flat index = low nibble, odd = high nibble.