nemo_automodel.components.models.nemotron_parse.model
nemo_automodel.components.models.nemotron_parse.model
Module Contents
Classes
Data
API
Bases: PretrainedConfig
Configuration class for NemotronParse model.
Bases: MBartPreTrainedModel
Transformer decoder consisting of config.decoder_layers layers.
Bases: PretrainedConfig
Configuration class for NemotronParse vision encoder (RADIO-based).
Bases: HFCheckpointingMixin, NemotronParsePreTrainedModel, GenerationMixin
NemotronParse model for conditional generation tasks.
Bases: PreTrainedModel
Abstract class to handle weights initialization.
Bases: PretrainedConfig
Configuration class for NemotronParse text decoder (mBART-based).
Bases: Module
Vision encoder using RADIO model with custom neck.
Encode document images into visual tokens.
Parameters:
Tensor of shape [batch, channels, height, width]. When the image processor normalizes inputs, values must already contain that external normalization.
Accepted for model interface compatibility and currently unused.
Accepted for model interface compatibility and currently unused.
Accepted for model interface compatibility and currently unused.
Additional model arguments accepted for interface compatibility.
Returns:
A DonutSwinModelOutput whose last_hidden_state has shape [batch, image_tokens, hidden].