我自己实验下来是可以的,我这里自己维护了一个不算小的项目。大概 20 万行代码,关于 Android 虚拟化的,一直 terra + luna 的组合。 实际编码长期 luna max ,terrain 做检查。 很多人说 luna 慢,但是我自己是通过 cpa 把订阅转出来了,统计出来也是 40~50 tokens/s 并没有慢的多离谱 sol 倒是隔三岔五有个位数的 tokens/s
max 思考时间太长,现在是 luna 开 low 给 sol 当小弟扫描代码,收集信息用。 慢主要不是 tps 低,主要是 max 级别思考多导致的时间长,所有模型随着思考级别升高都会用更多 token 思考,速度自然就慢了。