32G 显存 Qwen3.8-27B-GGUF 配置分享

查看 445|回复 43
SSang
OP
  
@chengsitom 一天 4 度左右吧
SSang
OP
  
@catazshadow 确实是这样。V100 Q4 有时候也能 1000 多,应该不是算错,感觉是合理峰值。Q5 性能确实比 Q8 还更差,Q8 偶尔还能上 100.
realJamespond   
32g 可以跑 udq6kl,kvq8,mtp3,c64k
jhytxy   
只能跑 q4 的话建议用 gemma4 qat
qat 版本训练的时候就针对小显存,q4 量化的性能可以和 q8 打
catazshadow   
@SSang 可以找个带 switch 的 PCIe 扩展板上 4 卡,V100 好像玩的人比 T10 多一点
GuardX   
话说 5070 12G 能跑吗
SSang
OP
  
@realJamespond udq6kl,kvq8,mtp3,c64k 这个配置你主要是用在什么场景?
我这里的话 c64k 太小了,写代码一直在那 compact ,然后 kvq8 100tok/s 的 prefill 速度我写代码平均 ttft 都要 100 多秒,有点难受。
SSang
OP
  
@jhytxy 是 gemma4-31B 吗?我看 AA 上面的 Intelligence Index 还蛮低的,满血才 30 分,上一代的 qwen3.6-27B 满血都有 38 分了。他的 Q4 的会比 Qwen3.8-27B 的 Q8 量化还厉害吗?
上一代的 Qwen3.6-27B-Q4 对我来说也是不可用的状态。3.8 我这几天用下来感觉是达到可用水平了。
SSang
OP
  
@catazshadow hh ,我也在考虑,但是现在好像 nvlink 都还是挺贵的状态。
这个 T10 是 Tesla 还是 Turing 啊?
SSang
OP
  
@GuardX 12G 能跑 q2 吧,上下文应该能到 128k ,不行就将降低到 64k ,kv 应该也只能跑 q4 ( q8 理论占用就要 8G 显存了),但我觉得 q2 写代码的话还是不太行的,你日常对话玩玩还行。
您需要登录后才可以回帖 登录 | 立即注册

返回顶部