⚠️ 刚开始玩本地模型、预算又紧的人,最容易做错的一步,不是没上高配,而是先照着排行榜选模型。你手里只有一台普通电脑,看到别人晒旗舰配置,就开始怀疑自己是不是也得跟着买。可一旦选错,代价不是慢一点,而是本地部署都可能重来。只看排行榜,不看自己的电脑、预算和用途,这才是最贵的坑。

我现在越来越认同一句反常识判断:本地模型最容易踩的坑,不是模型不够强,而是你先按错了机器预算。本地模型最容易花错的钱,不是升级显卡,而是先照着别人的配置选错模型。拿 Qwen-Image-3.0 来说,我现在的判断很直白:Qwen-Image-3.0把提示词升级成规格文档[C002]。

我原来以为这次升级重点还是图更真、更好看。后来翻到 2026 年 7 月 21 日的官方博客才发现,核心不是画质,而是输入长度:Qwen-Image-3.0 支持 4.5k token 输入,这里的 token 你先当成“提示词能写多长”;它还放了一个用 3.7k token 描述、单次生成 3×3 复杂信息图的例子[C003]。这已经不是多写几句形容词,而是要把版式和文字密度一次讲清楚。

回头看上一代,落差就很明显了。Qwen-Image-2.0 的官方卖点还是 1k token 专业信息图;到 3.0,可执行指令长度直接拉到 4.5 倍,重点也从“图漂不漂亮”变成“需求能不能被完整执行”[C004]。官方给这代的总判断是“内容更丰富、细节更真、知识更深”(Qwen-Image-3.0: Rich Content, Authentic Details, Deep Knowledge)[C001],但对普通人更有用的翻译其实是:以后比的不是灵感,而是谁更会把需求写成结构化说明。

所以别把长提示词神化,也别一看到新模型就先怀疑自己电脑不够强。你要是平时只随手出氛围图,一句话就够,这种长输入未必值钱;但你要做九宫格说明图、课程图、产品演示图,能把长说明一次吃进去就很要命。准备装本地出图的人,先把这篇存住:先按你要出的图选模型,再决定要不要升级机器。

🤔 你现在选本地模型,会先看总榜,还是先看自己机器的 VRAM?