udpate vllm

This commit is contained in:
Woochangho
2025-03-19 09:41:23 +09:00
parent 760e6f6475
commit 4237d55396
+17 -10
View File
@@ -1,27 +1,34 @@
servingEngineSpec:
modelSpec:
- name: "llama3"
- name: "qwen"
repository: "vllm/vllm-openai"
tag: "latest"
modelURL: "meta-llama/Llama-3.1-8B-Instruct"
modelURL: "Qwen/Qwen2.5-Coder-14B-Instruct"
replicaCount: 1
requestCPU: 10
requestMemory: "16Gi"
requestCPU: 16
requestMemory: "32Gi"
requestGPU: 1
pvcStorage: "50Gi"
pvcStorage: "10Gi"
pvcAccessMode:
- ReadWriteMany
storageClass: "nfs"
vllmConfig:
enableChunkedPrefill: false
enablePrefixCaching: false
maxModelLen: 24576
maxModelLen: 4096
dtype: "float16"
extraArgs: ["--disable-log-requests", "--gpu-memory-utilization", "0.8"]
hf_token: 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
extraArgs:
[
"--disable-log-requests",
"--gpu-memory-utilization",
"0.95",
"--download-dir",
"/data/qwen",
]
routerSpec:
# -- The docker image of the router. The following values are defaults:
repository: "lmcache/lmstack-router"
tag: "latest"
enableRouter: true