udpate vllm

This commit is contained in:
Woochangho
2025-03-19 09:41:23 +09:00
parent 760e6f6475
commit 4237d55396
+17 -10
View File
@@ -1,27 +1,34 @@
servingEngineSpec: servingEngineSpec:
modelSpec: modelSpec:
- name: "llama3" - name: "qwen"
repository: "vllm/vllm-openai" repository: "vllm/vllm-openai"
tag: "latest" tag: "latest"
modelURL: "meta-llama/Llama-3.1-8B-Instruct" modelURL: "Qwen/Qwen2.5-Coder-14B-Instruct"
replicaCount: 1 replicaCount: 1
requestCPU: 10 requestCPU: 16
requestMemory: "16Gi" requestMemory: "32Gi"
requestGPU: 1 requestGPU: 1
pvcStorage: "50Gi" pvcStorage: "10Gi"
pvcAccessMode:
- ReadWriteMany
storageClass: "nfs"
vllmConfig: vllmConfig:
enableChunkedPrefill: false enableChunkedPrefill: false
enablePrefixCaching: false enablePrefixCaching: false
maxModelLen: 24576 maxModelLen: 4096
dtype: "float16" dtype: "float16"
extraArgs: ["--disable-log-requests", "--gpu-memory-utilization", "0.8"] extraArgs:
hf_token: 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 [
"--disable-log-requests",
"--gpu-memory-utilization",
"0.95",
"--download-dir",
"/data/qwen",
]
routerSpec: routerSpec:
# -- The docker image of the router. The following values are defaults:
repository: "lmcache/lmstack-router" repository: "lmcache/lmstack-router"
tag: "latest" tag: "latest"
enableRouter: true enableRouter: true