32G 显存 Qwen3.8-27B-GGUF 配置分享

查看 443|回复 43
paranoiagu   
楼主,今天我看到这个,你试过吗?
1CatAI/1Cat-vLLM: V100 / SM70-focused vLLM engineering fork for modern LLM inference. https://share.google/ltDrm9bzMUKScR6xR
BingoW   
如果是单卡 4080s 32G 情况会更好吗?我本人是 2080ti 22G 的卡,再考虑要不要升级
strobber16   
建议上 kvarn 试下
zzutmebwd   
今晚要发布高度稀疏的 3.8 flash next 了,源神启动!
zzutmebwd   
@BingoW 我的升级路线是 mi50 32g x2 → 2080ti 22g x2 → 4080s 32G x2 → pro6000 96G 。感受就是欲望永无止境。4080s 32g 跑 27b 还是慢,预填充两三千,解码六七十。换 pro6000 感觉就是翻倍多一点,显存用不完。
SSang
OP
  
@paranoiagu 他这个是用来跑原生 tensor 模型的,好像最少也得 64G 显存吧。玩不起,32G 还是老老实实 gguf 吧
SSang
OP
  
@strobber16 主要不是显存不够,是 prefill 太慢了
SSang
OP
  
@zzutmebwd 有些过于富有了,只能说玩 V100 的都是穷人
paranoiagu   
@SSang 看了介绍好像可以 awq 量化模型,但是有人反应上下文不够长,我今天试试
ljian6530   
# 我也试了一下,2 张 T4 卡,启动参数如下:
export CUDA_VISIBLE_DEVICES=0,1
/opt/llama.cpp/build/bin/llama-server \
  --host 0.0.0.0 \
  --port 8000 \
  --metrics \
  --verbosity 3 \
  -m /var/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-IQ4_XS.gguf \
  --alias Qwen3.8-27B \
  --n-gpu-layers all \
  --split-mode layer \
  --tensor-split 1,1 \
  --ctx-size 131072 \
  --parallel 1 \
  --predict 8192 \
  --batch-size 4096 \
  --ubatch-size 1024 \
  --flash-attn on \
  --cache-type-k q4_0 \
  --cache-type-v q4_0 \
  --cache-prompt \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 20 \
  --min-p 0.0 \
  --load-mode mmap
# 结果
Prefill:70.50 tok/s
Decode:13.51 tok/s
1024 tokens:75.8s
这速度几乎是无法生产的,大佬看看这堆废铁( nvidia Tesla T4 16GiB )还有必要跑吗,但使用 8 张卡跑四个实例并行是不是也是可以?
您需要登录后才可以回帖 登录 | 立即注册

返回顶部