Module kimi_k3

Module kimi_k3 

Source
Expand description

Kimi K3 host graph. This slice is KDA only.

K3-DECISION: KDA is a new backend. Do not copy GDN / Mamba-2 / Qwen3-Next / glm5next_kda kernels into kernels/gb10/kimi-k3/. CUDA: kda_decode.cu (default; K3_CUDA_KDA=0 CPU escape).

Re-exports§

pub use attnres::AttnResHub;
pub use attnres::attnres_blend;
pub use attnres::attnres_mix;
pub use attnres::attnres_softmax_mix;
pub use cache::HybridCache;
pub use cache::LayerCache;
pub use cache::MlaKv;
pub use expert_backend::ExpertBackendKind;
pub use expert_backend::MmapExpertStore;
pub use expert_backend::PrefetchPlanner;
pub use expert_backend::kind_from_env;
pub use kda::KDA_L2_EPS;
pub use kda::KdaConfig;
pub use kda::KdaState;
pub use kda::cuda_kda_enabled;
pub use kda::kda_decode_token;
pub use kda::kda_from;
pub use latent_moe::LatentMoeConfig;
pub use latent_moe::latent_moe_forward;
pub use latent_moe::mix_routed_experts;
pub use latent_moe::moe_from;
pub use latent_moe::sigmoid_topk;
pub use layer::K3Graph;
pub use layer::K3LayerSpec;
pub use layer::MixerKind;
pub use layer::MlpKind;
pub use mla::MlaConfig;
pub use mla::cuda_mla_enabled;
pub use mla::gated_mla_attend;
pub use mla::mla_decode_token;
pub use mla::mla_from;
pub use situ::situ_glu;
pub use situ::situ_glu_vec;
pub use situ::softcap;

Modules§

attnres
Block AttnRes CPU reference.
cache
Hybrid cache: paged MLA KV + KDA recurrent/conv state.
expert_backend
Expert storage backend for K3 routed MXFP4 packs.
kda
Kimi K3 KDA CPU reference — a new backend, not GDN / Mamba-2.
latent_moe
Stable LatentMoE CPU reference.
layer
One K3 decoder layer as host graph data: mixer + MLP + AttnRes sites.
mla
Gated NoPE MLA CPU reference.
situ
SiTU-GLU CPU reference.