Expand description
Host launch for K3 CUDA gated-NoPE MLA decode (mla_decode PTX module).
Two kernels, one token: maybe_rope (NoPE skips rotate), then SDPA + gate.
CPU oracle: atlas_core::kimi_k3::mla_decode_token. BoundLayer serve
FullAttention default is this launch (K3_CUDA_MLA=0 keeps CPU).
Structs§
- K3Mla
Decode Kernels - MlaDevice
Kv - Device-resident MLA KV. Append is one-row D2D/H2D; SDPA reads the buffer.
Host
MlaKvremains the CPU oracle. Do not re-upload[0..T]each token.
Constants§
- MODULE
- PTX module stem =
kernels/gb10/kimi-k3/bf16/mla_decode.cu. - ROPE_
ENTRY - SDPA_
ENTRY
Functions§
- launch_
k3_ mla_ decode_ token - One-token CUDA gated-NoPE MLA. Updates
q/k(rope) andkv(append). - launch_
k3_ mla_ decode_ token_ on_ device - Device-resident KV: rope stays on device, append is one row, one D2H (output).