Qwen2.5-VL-3B-Instruct

View as Markdown

Qwen2.5-VL is Alibaba Cloud’s vision language model series supporting image and video understanding. It features dynamic resolution processing and integrates with the Qwen2.5 language backbone.

Set up NeMo AutoModel with the latest container or follow the installation instructions.

Fine-Tune Qwen2.5-VL-3B-Instruct

From the repository root, run:

uv run automodel --nproc-per-node=8 examples/vlm_finetune/qwen2_5/qwen2_5_vl_3b_rdr.yaml

Choose a Workflow

GoalStart Here
Supervised fine-tuning (SFT) - Qwen2.5-VL 3B on RDR ItemsUse qwen2_5_vl_3b_rdr.yaml. Dataset: rdr-items.

Model Reference

Model Architecture

PropertyValue
TaskImage-Text-to-Text
ArchitectureQwen2_5VLForConditionalGeneration
Parameters3B
Hugging Face OrganizationQwen
  • Qwen2_5VLForConditionalGeneration - Qwen2.5-VL
  • Qwen2VLForConditionalGeneration - Qwen2-VL

Available Models

ModelHF ID
Qwen2.5-VL 3B InstructQwen/Qwen2.5-VL-3B-Instruct