nemo_automodel.components.models.kimi_k3.multimodal
nemo_automodel.components.models.kimi_k3.multimodal
Native top-level Kimi K3 vision-language model.
Module Contents
Classes
Functions
Data
API
Bases: KimiK3ForCausalLM
Kimi K3 MoonViT3d tower, projector, and native KDA/MLA language model.
ModelCapabilities
mm_projector
state_dict_adapter
vision_tower
Encode packed pixel_values using grid_thws image/video geometry.
Expand image placeholders in [batch, sequence] text tensors.
Run text-only or multimodal K3 inputs.
classmethod
classmethod