Model CoverageOmniQwenQwen3-Omni-30B-A3B-Instruct

Qwen3-Omni-30B-A3B-Instruct

View as Markdown

Qwen3-Omni is Alibaba Cloud’s omnimodal model supporting text, image, audio, and video inputs in a single unified architecture with a MoE language backbone. NeMo AutoModel supports supervised ASR fine-tuning of its audio-capable Thinker stack.

Set up NeMo AutoModel with the latest container or follow the installation instructions.

Fine-Tune Qwen3-Omni-30B-A3B-Instruct

From the repository root, run:

uv run automodel --nproc-per-node=8 examples/vlm_finetune/qwen3/qwen3_omni_moe_30b_te_deepep.yaml

Choose a Workflow

GoalStart Here
Supervised fine-tuning (SFT) - Qwen3-Omni 30B with TE + DeepEPUse qwen3_omni_moe_30b_te_deepep.yaml. Dataset: MedPix-VQA.
ASR SFT - Qwen3-Omni 30B-A3BUse ami_sft.yaml. Dataset: AMI.
ASR SFT - Qwen3-Omni 30B-A3BUse multi_en_sft.yaml. Dataset: Multi-corpus English mixture.

Fine-Tuning

See the VLM / Omni Fine-Tuning Guide and Qwen3-Omni ASR Fine-Tuning Guide.

Model Reference

Model Architecture

PropertyValue
TaskOmnimodal (Text/Image/Audio/Video)
ArchitectureQwen3OmniForConditionalGeneration
Parameters30B total / 3B active
Hugging Face OrganizationQwen

Available Models

ModelHF ID
Qwen3-Omni 30B A3B InstructQwen/Qwen3-Omni-30B-A3B-Instruct