我目前机箱和电源( 850w )都只支持单卡,目前是 2080ti 22G 魔改,能跑 4bit 量化版本 但是 KV 不够了,上下文太短。想换卡,换 3090 24G 还是 4080s 32G 魔改呢?后者比前者贵 5000 左右,要不要换呢?还是说等老黄的大饼(显存内存一体笔记本)还是加预算上 mac 呢?如果不本地部署,买订阅也够用 4 、5 年。但是未来不好说啊,自己能有一个推理和执行 skills 准确率 80%以上的大模型真的很香 本地化, 显存, 大模型
你们单卡 24GB 怎么跑起来的?量化多少上下文多少? 我这边测试 4*24GB 刚刚跑起来,速度还特别慢 ``` docker run -itd --name Qwen3.8-27B-8bit --gpus all --ipc=host -v /data/models/btbtyler09_Qwen3.8-27B-GPTQ-8bit:/models -p 8000:8000 vllm/vllm-openai:v0.27.1-x86_64-ubuntu2404 --model /models --served-model-name Qwen3.8-27B --port 8000 --api-key 6f08cbed -tp 4 --gpu-memory-utilization 0.98 --kv-cache-dtype fp8 --max-model-len 262144 --max-num-seqs 6 --enable-chunked-prefill --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --enable-prefix-caching --enable-prompt-tokens-details --enable-force-include-usage ```
850W 电源,270KP+Z890 ,拆分成双槽 PCIE5.0 x 8 ,插 2 块 5060TI 16G ,跑 27b q4 ,23token/s 。 估计是双槽通讯延迟损耗 + 5060TI 位宽太小导致的,图隐私,倒也是能用。 要体验更好,最好单卡 32G 以上吧,70ti 80ti 那种。