@ashong 有种说法是说,多模态模型对于视觉的理解,和第三方理解并文字化后输入,理解程度是指数级别的差距,但是不太懂这块,所以不敢下结论。 我的体感上确实多模态模型对于图片的认知会更好。比如我用 qwen3.8-27B 去给 H3 理解图片素材并喂提示词,效果远强于纯文本模型。