Appendix A#
RAG values.YAML for Helm Deployment.
Note
Please replace the node name in the node-selector field to the host name of a node in the cluster. This will allow all non NIM-LLM pods to be scheduled on a single node. Makes it easy to scale the NIM-LLM pod later on.
# Custom values for 2 GPU deployment with RTX Pro 6000 GPUs
# This configuration allocates 2 full GPUs across key services on RTX Pro 6000 nodes
# Using Nemotron 49B version 1.5 NIM
# Allocate 2 GPUs to the main LLM NIM for Nemotron 49B v1.5
nim-llm:
enabled: true
image:
repository: nvcr.io/nim/nvidia/llama-3.3-nemotron-super-49b-v1.5
tag: "1.14.0"
resources:
limits:
nvidia.com/gpu: 2
memory: 128Gi # Increased from 96Gi
requests:
nvidia.com/gpu: 2
memory: 128Gi # Increased from 96Gi
model:
name: "nvidia/llama-3.3-nemotron-super-49b-v1.5"
env:
- name: NIM_MODEL_NAME
value: "nvidia/llama-3.3-nemotron-super-49b-v1.5"
- name: NIM_MODEL_PROFILE
value: "610f006b15f3adbdb072da0b4155d8a772332cf1768fb7389ef92a83c31c26dc"
# - name: NIM_HTTP_MAX_WORKERS
# value: "10"
# Keep other services on single GPU
nvidia-nim-llama-32-nv-embedqa-1b-v2:
enabled: true
nodeSelector:
kubernetes.io/hostname: pdx-2852-w01-lr6
resources:
limits:
nvidia.com/gpu: 1
requests:
nvidia.com/gpu: 1
text-reranking-nim:
enabled: true
nodeSelector:
kubernetes.io/hostname: pdx-2852-w01-lr6
resources:
limits:
nvidia.com/gpu: 1
requests:
nvidia.com/gpu: 1
# Disable VLM if not needed to save GPU resources
nim-vlm:
enabled: false
ingestor-server:
nodeSelector:
kubernetes.io/hostname: pdx-2852-w01-lr6
# Keep ingestion services on single GPU each
nv-ingest:
nodeSelector:
kubernetes.io/hostname: pdx-2852-w01-lr6
paddleocr-nim:
nodeSelector:
kubernetes.io/hostname: pdx-2852-w01-lr6
resources:
limits:
nvidia.com/gpu: 1
requests:
nvidia.com/gpu: 1
nemoretriever-graphic-elements-v1:
nodeSelector:
kubernetes.io/hostname: pdx-2852-w01-lr6
resources:
limits:
nvidia.com/gpu: 1
requests:
nvidia.com/gpu: 1
nemoretriever-page-elements-v2:
nodeSelector:
kubernetes.io/hostname: pdx-2852-w01-lr6
resources:
limits:
nvidia.com/gpu: 1
requests:
nvidia.com/gpu: 1
nemoretriever-table-structure-v1:
nodeSelector:
kubernetes.io/hostname: pdx-2852-w01-lr6
resources:
limits:
nvidia.com/gpu: 1
requests:
nvidia.com/gpu: 1
milvus:
standalone:
nodeSelector:
kubernetes.io/hostname: pdx-2852-w01-lr6
resources:
limits:
nvidia.com/gpu: 1
redis:
image:
repository: redis
tag: 8.2.1