Expand description
Kimi K3 host graph. This slice is KDA only.
K3-DECISION: KDA is a new backend. Do not copy GDN / Mamba-2 /
Qwen3-Next / glm5next_kda kernels into kernels/gb10/kimi-k3/.
CUDA: kda_decode.cu (default; K3_CUDA_KDA=0 CPU escape).
Re-exports§
pub use attnres::AttnResHub;pub use attnres::attnres_blend;pub use attnres::attnres_mix;pub use attnres::attnres_softmax_mix;pub use cache::HybridCache;pub use cache::LayerCache;pub use cache::MlaKv;pub use expert_backend::ExpertBackendKind;pub use expert_backend::MmapExpertStore;pub use expert_backend::PrefetchPlanner;pub use expert_backend::kind_from_env;pub use kda::KDA_L2_EPS;pub use kda::KdaConfig;pub use kda::KdaState;pub use kda::cuda_kda_enabled;pub use kda::kda_decode_token;pub use kda::kda_from;pub use latent_moe::LatentMoeConfig;pub use latent_moe::latent_moe_forward;pub use latent_moe::mix_routed_experts;pub use latent_moe::moe_from;pub use latent_moe::sigmoid_topk;pub use layer::K3Graph;pub use layer::K3LayerSpec;pub use layer::MixerKind;pub use layer::MlpKind;pub use mla::MlaConfig;pub use mla::cuda_mla_enabled;pub use mla::gated_mla_attend;pub use mla::mla_decode_token;pub use mla::mla_from;pub use situ::situ_glu;pub use situ::situ_glu_vec;pub use situ::softcap;
Modules§
- attnres
- Block AttnRes CPU reference.
- cache
- Hybrid cache: paged MLA KV + KDA recurrent/conv state.
- expert_
backend - Expert storage backend for K3 routed MXFP4 packs.
- kda
- Kimi K3 KDA CPU reference — a new backend, not GDN / Mamba-2.
- latent_
moe - Stable LatentMoE CPU reference.
- layer
- One K3 decoder layer as host graph data: mixer + MLP + AttnRes sites.
- mla
- Gated NoPE MLA CPU reference.
- situ
- SiTU-GLU CPU reference.