Module mla_cuda

Module mla_cuda 

Source
Expand description

Host launch for K3 CUDA gated-NoPE MLA decode (mla_decode PTX module).

Two kernels, one token: maybe_rope (NoPE skips rotate), then SDPA + gate. CPU oracle: atlas_core::kimi_k3::mla_decode_token. BoundLayer serve FullAttention default is this launch (K3_CUDA_MLA=0 keeps CPU).

Structs§

K3MlaDecodeKernels
MlaDeviceKv
Device-resident MLA KV. Append is one-row D2D/H2D; SDPA reads the buffer. Host MlaKv remains the CPU oracle. Do not re-upload [0..T] each token.

Constants§

MODULE
PTX module stem = kernels/gb10/kimi-k3/bf16/mla_decode.cu.
ROPE_ENTRY
SDPA_ENTRY

Functions§

launch_k3_mla_decode_token
One-token CUDA gated-NoPE MLA. Updates q/k (rope) and kv (append).
launch_k3_mla_decode_token_on_device
Device-resident KV: rope stays on device, append is one row, one D2H (output).