可能很快就能实现 token 自由了

查看 91|回复 8
作者:davinci21s   
qwen3.8 开源,性能比肩 opus4.6 ,之后出现几百个版本。
目前量化版本从 1bit 到 16bit ,最低 8G 内存 mac 即可运行
想要获得不错的体验建议 3080 以上显卡
传送门:
https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
🎉 16G 丐版 M1  部署 Qwen 3.8-27B 实测报告:
不出意外,打字机效果,不过智商还可以😄
📊 实测配置与数据
设备:MacBook Pro ( M1 / 16GB )
模型:Qwen3.8-27B ( UD-Q2_K_XL ,9.15GB )
GPU:全层 Metal 卸载
内存:稳定在 11 GB 左右
首 Token 延迟:约 850ms
预填充速度:10 ~ 12.5 tok/s
生成速度:约 4 tok/s
几点调优心得👇🏻
[ol]

  • M1 的瓶颈主要是内存带宽
    M1 内存带宽仅 68 GB/s ,每生成一个 Token 必须将 9.15G 权重通读一遍。4 tok/s 已经榨干了 M1 物理带宽的 60% 极限!

  • 按场景切换思考模式
    Qwen3.8 原生自带深度思考链。日常对话通过调参关闭思考,跳过思考链直出答案,体验极其干脆;写复杂算法时开启思考,逻辑推导依然在线。

  • 用投机采样继续提速
    [/ol]
    叠加 --flash-attn on + -ctk q8_0 + --spec-type ngram-simple 投机采样,写代码与结构化文本时,速度能飙到 5.5+ tok/s
    结论:老 M1 还能再战三年!✌🏻

    qwen, 开源, 性能

  • wjxd   
    准备拿 win10 系统,amd 7900xt 20G ,跑 Qwen3.8-27B-UD-Q4_K_M.gguf
    siriusliangcn   
    我看 command code 套餐里上架了 qwen3.8:27b 模型,输入价格 0.4 刀,跟 DeepSeek-v4-flash 的波峰 0.44 波谷 0.22 不相上下。这种 27b 的模型真的能硬撼云端大模型了吗?
    没开源的时候,我就在想这个事情,但是看论坛里大家吹得那么牛,还是不太敢相信。
    davinci21s
    OP
      
    @siriusliangcn 有人和 sol 、fable5 、opus5 ,做过对比,基本吻合
    siriusliangcn   
    也就是说,真的有人愿意用 0.4 的价格使用 qwen3.8-27b ,也不用 0.44 的价格使用 ds4flash ?卧槽…ds 真的拉完了啊…
    levn   
    实现写 bug 自由还差不多
    minami   
    5.5+ tok/s 叫 token 自由,意义不亚于限速 10 kb/s 的百度网盘
    foryou2023   
    ds4 flash 要达到日常能用的标准,需要投入多少硬件成本呢
    ntdll   
    在 transform 架构没有改变的情况下,基本还是遵守一寸长一寸强的基本逻辑。
    参数量小,意味着其只有更为泛化的知识,因此非常依赖上下文给足背景信息,但是你在自己设备上跑,通常配置都很一般,导致上下文也很小。结果就是,LLM 大概率是输出正确的废话。也就是车轱辘话。
    您需要登录后才可以回帖 登录 | 立即注册

    返回顶部