udpate vllm
This commit is contained in:
@@ -1,27 +1,34 @@
|
||||
servingEngineSpec:
|
||||
modelSpec:
|
||||
- name: "llama3"
|
||||
- name: "qwen"
|
||||
repository: "vllm/vllm-openai"
|
||||
tag: "latest"
|
||||
modelURL: "meta-llama/Llama-3.1-8B-Instruct"
|
||||
modelURL: "Qwen/Qwen2.5-Coder-14B-Instruct"
|
||||
replicaCount: 1
|
||||
|
||||
requestCPU: 10
|
||||
requestMemory: "16Gi"
|
||||
requestCPU: 16
|
||||
requestMemory: "32Gi"
|
||||
requestGPU: 1
|
||||
|
||||
pvcStorage: "50Gi"
|
||||
pvcStorage: "10Gi"
|
||||
pvcAccessMode:
|
||||
- ReadWriteMany
|
||||
storageClass: "nfs"
|
||||
|
||||
vllmConfig:
|
||||
enableChunkedPrefill: false
|
||||
enablePrefixCaching: false
|
||||
maxModelLen: 24576
|
||||
maxModelLen: 4096
|
||||
dtype: "float16"
|
||||
extraArgs: ["--disable-log-requests", "--gpu-memory-utilization", "0.8"]
|
||||
hf_token: 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
|
||||
|
||||
extraArgs:
|
||||
[
|
||||
"--disable-log-requests",
|
||||
"--gpu-memory-utilization",
|
||||
"0.95",
|
||||
"--download-dir",
|
||||
"/data/qwen",
|
||||
]
|
||||
routerSpec:
|
||||
# -- The docker image of the router. The following values are defaults:
|
||||
repository: "lmcache/lmstack-router"
|
||||
tag: "latest"
|
||||
enableRouter: true
|
||||
|
||||
Reference in New Issue
Block a user