bridge.recipes.qwen_vl.gb200.qwen35_vl#

GB200 functional recipes shared by Qwen3.5/Qwen3.6-VL 35B-A3B.

Module Contents#

Functions#

qwen35_vl_27b_pretrain_16gpu_gb200_bf16_mock_config

Return Qwen3.5-VL 27B language-and-projector pretraining for sixteen GB200 GPUs.

_apply_qwen35_vl_35b_a3b_gb200_functional_defaults

Apply shared settings for bounded GB200 functional runs.

qwen35_vl_35b_a3b_sft_8gpu_gb200_bf16_functional_config

Return shared Qwen3.5/Qwen3.6-VL 35B-A3B SFT for eight GB200 GPUs.

qwen35_vl_35b_a3b_peft_8gpu_gb200_bf16_functional_config

Return shared Qwen3.5/Qwen3.6-VL 35B-A3B LoRA for eight GB200 GPUs.

Data#

API#

bridge.recipes.qwen_vl.gb200.qwen35_vl.qwen35_vl_27b_pretrain_16gpu_gb200_bf16_mock_config() megatron.bridge.training.config.ConfigContainer#

Return Qwen3.5-VL 27B language-and-projector pretraining for sixteen GB200 GPUs.

This keeps the dense pretraining objective and trainable-parameter contract from the H100 recipe while using the measured GB200 execution layout. In particular, deterministic mode must remain opt-in: Qwen3.5’s Gated DeltaNet replaces its fused FLA kernels with a torch-native reference path when deterministic mode is enabled.

bridge.recipes.qwen_vl.gb200.qwen35_vl._apply_qwen35_vl_35b_a3b_gb200_functional_defaults(
cfg: megatron.bridge.training.config.ConfigContainer,
) None#

Apply shared settings for bounded GB200 functional runs.

bridge.recipes.qwen_vl.gb200.qwen35_vl.qwen35_vl_35b_a3b_sft_8gpu_gb200_bf16_functional_config() megatron.bridge.training.config.ConfigContainer#

Return shared Qwen3.5/Qwen3.6-VL 35B-A3B SFT for eight GB200 GPUs.

bridge.recipes.qwen_vl.gb200.qwen35_vl.qwen35_vl_35b_a3b_peft_8gpu_gb200_bf16_functional_config() megatron.bridge.training.config.ConfigContainer#

Return shared Qwen3.5/Qwen3.6-VL 35B-A3B LoRA for eight GB200 GPUs.

bridge.recipes.qwen_vl.gb200.qwen35_vl.__all__#

[‘qwen35_vl_27b_pretrain_16gpu_gb200_bf16_mock_config’, ‘qwen35_vl_35b_a3b_peft_8gpu_gb200_bf16_func…