32G 显存 Qwen3.8-27B-GGUF 配置分享

查看 444|回复 43
lyonll   
hello 劣化是怎么测的呢,试试 kv 用 turbo3 试试呢
  --cache-type-k turbo3 `
  --cache-type-v turbo3 `
我试了 5060ti 16G 不开多模态 q3 能开到 161k 35tok/s 左右,但是不好测效果
SSang
OP
  
@GuardX 反正我看了其他的帖子基本上也是这个结论:「 Q4 及以上质量良好,Q4 以下断崖式下降」
SSang
OP
  
@lyonll 我有空也测测 turbo3 ,但其实 q4 我觉得就已经有些不太行了。
我就是体感劣化,有的是很明显的劣化的,就是很简单的任务,比如我让他改一个前端展示从 ID 改成获取名称展示,改了量化之后他直接开始一直循环不输出结果,这种就是明显的劣化了。
我 q8 跑就是很慢,但是基本上任务都能完成,但是 q4 还是会有概率出现乱回答或者死循环。
---
然后还有就是我个人感觉本地部署 prefill 速度比 decode 速度重要,decode 只要有 10tok/s 就有一点安慰作用了,但是我要是等几分钟他还在那转圈,就会开始怀疑是不是模型挂了还是报错了。
(我之前其实是有算过的,特别是长上下文编码的场景,prefill 速度会很大程度决定任务的总耗时,100k 左右的上下文,基本上要缓存命中到 98% 以上,decode 速度才会对总耗时有些影响)
catazshadow   
@SSang 图灵,相当于 2080 这代
nvlink 自己玩玩用不上,PCIe 就足够了,我这个甚至是跨了 NUMA 节点的 PCIe 通信。T10 也没有 nvlink 。
nvlink 黄鱼上 300 块一个桥接器简直就是抢钱
SSang
OP
  
@catazshadow 噢噢,就是直接 pcie 拆分 4 卡的是吧。确实 pcie 也听够了,我之前搞过一个 pcie x1 拆分 4 卡的,当时也测不出有什么差距,但后来不知道被我丢哪去了。
catazshadow   
@SSang 垃圾佬服务器主板上直插的,甚至都不全是 x16 的槽
realJamespond   
我这边是双 3090 有 50ts 左右,c64k 一般用在主 agent 分配任务给子 agent + 任务列表 修改多个文件还行。子 agent 不会被主 agent 上下文影响。
ashong   
7900xtx 现在跑 unsloth/ud-q5-k-xl 或者 unsloth/ud-q5-k_m
cache-kv  q8_0 上下文 140k
或者
cache-kv bf16 上下文 100k
lyonll   
@SSang 期待测试 turbo3 的结果
我用 turbo3 可以节省很多显存,看原理好像很强 几乎没有降智的感觉
不过就是一直没合并到主线,因为好像 turbo3 目前只针对特定平台
wises   
最近想买显卡的心越来越重, 一个消费级别小主机, 配了 48G DDR5 内存, 跑了下 qwen3.5/3.6 - 27B/35B 全卡那里却显卡了. 不知道买 24G 显存的显卡是否可以?
您需要登录后才可以回帖 登录 | 立即注册

返回顶部