nemo_automodel.components.models.glm5_next.vision
nemo_automodel.components.models.glm5_next.vision
GLM-5.3 image encoder with checkpoint-compatible module names.
Module Contents
Classes
Functions
Data
API
Bases: Module
Bidirectional per-image attention over [vision_tokens, hidden].
Attend within each cu-seqlens segment and return [tokens, hidden].
Bases: Module
Pre-norm bidirectional vision transformer block.
Transform [vision_tokens, hidden] without cross-image attention.
Bases: Module
Clamped SwiGLU vision feed-forward block.
Transform [tokens, vision_hidden] with clamped SwiGLU.
Bases: Module
Patch encoder returning image features in the language hidden size.
Return the patch embedding dtype.
Encode flattened patches using grid metadata [images, (t,h,w)].
Initialize vision parameters without materializing outside buffer_device.
Raw and merged vision token representations.
Bases: Module
Conv3d patch projection from [patches, C*T*P*P] to vision hidden.
Project flattened patches to [vision_tokens, vision_hidden].
Bases: Module
Post-downsample projection in the text hidden dimension.
Project downsampled image tokens [tokens, text_hidden].
Bases: Module
Two-axis rotary frequencies used by the vision transformer.
Map H/W ids [tokens, 2] to frequencies [tokens, head_dim/2].
Return per-frame attention boundaries [segments + 1].
Return block-major H/W positions [vision_tokens, 2].