楼主,今天我看到这个,你试过吗? 1CatAI/1Cat-vLLM: V100 / SM70-focused vLLM engineering fork for modern LLM inference. https://share.google/ltDrm9bzMUKScR6xR
@BingoW 我的升级路线是 mi50 32g x2 → 2080ti 22g x2 → 4080s 32G x2 → pro6000 96G 。感受就是欲望永无止境。4080s 32g 跑 27b 还是慢,预填充两三千,解码六七十。换 pro6000 感觉就是翻倍多一点,显存用不完。
# 我也试了一下,2 张 T4 卡,启动参数如下: export CUDA_VISIBLE_DEVICES=0,1 /opt/llama.cpp/build/bin/llama-server \ --host 0.0.0.0 \ --port 8000 \ --metrics \ --verbosity 3 \ -m /var/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-IQ4_XS.gguf \ --alias Qwen3.8-27B \ --n-gpu-layers all \ --split-mode layer \ --tensor-split 1,1 \ --ctx-size 131072 \ --parallel 1 \ --predict 8192 \ --batch-size 4096 \ --ubatch-size 1024 \ --flash-attn on \ --cache-type-k q4_0 \ --cache-type-v q4_0 \ --cache-prompt \ --temp 1.0 \ --top-p 0.95 \ --top-k 20 \ --min-p 0.0 \ --load-mode mmap # 结果 Prefill:70.50 tok/s Decode:13.51 tok/s 1024 tokens:75.8s 这速度几乎是无法生产的,大佬看看这堆废铁( nvidia Tesla T4 16GiB )还有必要跑吗,但使用 8 张卡跑四个实例并行是不是也是可以?