Appendix A#

RAG values.YAML for Helm Deployment.

Note

Please replace the node name in the node-selector field to the host name of a node in the cluster. This will allow all non NIM-LLM pods to be scheduled on a single node. Makes it easy to scale the NIM-LLM pod later on.

# Custom values for 2 GPU deployment with RTX Pro 6000 GPUs
# This configuration allocates 2 full GPUs across key services on RTX Pro 6000 nodes
# Using Nemotron 49B version 1.5 NIM

# Allocate 2 GPUs to the main LLM NIM for Nemotron 49B v1.5
nim-llm:
 enabled: true
 image:
   repository: nvcr.io/nim/nvidia/llama-3.3-nemotron-super-49b-v1.5
   tag: "1.14.0"
 resources:
   limits:
     nvidia.com/gpu: 2
     memory: 128Gi  # Increased from 96Gi
   requests:
     nvidia.com/gpu: 2
     memory: 128Gi  # Increased from 96Gi
 model:
   name: "nvidia/llama-3.3-nemotron-super-49b-v1.5"
 env:
   - name: NIM_MODEL_NAME
     value: "nvidia/llama-3.3-nemotron-super-49b-v1.5"
   - name: NIM_MODEL_PROFILE
     value: "610f006b15f3adbdb072da0b4155d8a772332cf1768fb7389ef92a83c31c26dc"
   # - name: NIM_HTTP_MAX_WORKERS
   #   value: "10"

# Keep other services on single GPU
nvidia-nim-llama-32-nv-embedqa-1b-v2:
 enabled: true
 nodeSelector:
   kubernetes.io/hostname: pdx-2852-w01-lr6
 resources:
   limits:
     nvidia.com/gpu: 1
   requests:
     nvidia.com/gpu: 1

text-reranking-nim:
 enabled: true
 nodeSelector:
   kubernetes.io/hostname: pdx-2852-w01-lr6
 resources:
   limits:
     nvidia.com/gpu: 1
   requests:
     nvidia.com/gpu: 1

# Disable VLM if not needed to save GPU resources
nim-vlm:
 enabled: false

ingestor-server:
 nodeSelector:
   kubernetes.io/hostname: pdx-2852-w01-lr6
 # Keep ingestion services on single GPU each
 nv-ingest:
   nodeSelector:
     kubernetes.io/hostname: pdx-2852-w01-lr6
   paddleocr-nim:
     nodeSelector:
       kubernetes.io/hostname: pdx-2852-w01-lr6
     resources:
       limits:
         nvidia.com/gpu: 1
       requests:
         nvidia.com/gpu: 1
   
   nemoretriever-graphic-elements-v1:
     nodeSelector:
       kubernetes.io/hostname: pdx-2852-w01-lr6
     resources:
       limits:
         nvidia.com/gpu: 1
       requests:
         nvidia.com/gpu: 1
   
   nemoretriever-page-elements-v2:
     nodeSelector:
       kubernetes.io/hostname: pdx-2852-w01-lr6
     resources:
       limits:
         nvidia.com/gpu: 1
       requests:
         nvidia.com/gpu: 1
   
   nemoretriever-table-structure-v1:
     nodeSelector:
       kubernetes.io/hostname: pdx-2852-w01-lr6
     resources:
       limits:
         nvidia.com/gpu: 1
       requests:
         nvidia.com/gpu: 1
   
   milvus:
     standalone:
       nodeSelector:
         kubernetes.io/hostname: pdx-2852-w01-lr6
       resources:
         limits:
           nvidia.com/gpu: 1
   
   redis:
     image:
       repository: redis
       tag: 8.2.1