AI 图片为什么数不对数,以及怎样要出可用的人群
你要的是恰好三个,得到的却是五个。图像模型为什么不会数数,以及五种办法,拿到你真正想要的人群、队列或成组画面。

你写了“窗台上三支蜡烛”,结果出来四支。改成“恰好三支”,出来两支,再来又是五支。并没有什么坏掉。数数是图像模型在结构上就不擅长的事,明白原因之后,你就可以不再硬碰硬,而是绕开它。
为什么数量会漂移
图像模型不是一个物体一个物体地搭出画面,再核对总数。它是一次性细化整张画布,把每个区域拉向“符合这些词的图片通常的样子”。“三”这个词只是几十个词里一股很弱的推力,而在训练图片里,“蜡烛”这个词旁边很少标注有几支。
一和二这样的小数量最容易,因为它们是常见模式:一个主体,一对。再往上,模型靠的是纹理和节奏,而不是算术。一排窗户看起来对,是因为间距看起来对,而不是因为真有七扇。所以“几支”比一个它守不住的数字更管用。
什么时候要紧,什么时候不要紧
把你的场景分成两类。人群、森林、一碗水果,没人会去数,差两个也看不出来。产品照片、示意图、图标组、棋盘游戏,观众一眼就会数,数目不对就像出了错。只在后一类上花力气。
拿到想要数量的五种办法
1. 要得少一点,并给这一组起个名
模型处理“一对”和“一组三件”比处理光秃秃的数字更好,因为它们是单个概念,而不是算术。“一组三支蜡烛,高的、中等的和矮的”让每一支都有自己的身份,而身份比总数更容易保持。
2. 用位置来描述每个物件
不给数量,而是给每个物件一个位置。模型擅长左与右、前景与背景,当句子已经占满窗台的左、中、右时,它就很难再添上第四支蜡烛。
黄昏的窗台,最左边一支高高的白蜡烛,中间一支矮矮的琥珀色蜡烛,右边一支烟灰玻璃杯里的中等蜡烛,身后的窗户柔和虚化,暖色光线,4:5 竖构图3. 先小处生成,再拼合
如果一组图必须精确,比如五个图标或六张卡片,就把每一件作为单独的图片生成,再在你自己的编辑器里排版。这会多花几次渲染,但每次都是单一主体的任务,是最便宜、最容易成功的那种。草稿用 Still Lite,每次渲染 €0.30 起,只把选中的用 Still 做成品。
4. 人群有意保持模糊
对于背景里的人或物,描述密度而不是数量:“稀疏的人群”“零星散落”“摩肩接踵”。模型擅长密度,因为密度是一种纹理。加上数字,只会给它一个明显出错的机会。
5. 事后修正,而不是重抽
如果画面除了多出一个物件之外都对,别再掷骰子了。把这张渲染图作为参考图附上,要求同一场景“去掉第四支蜡烛”。模型会保留配色和布局,只需改动一处,这比重新抽一张划算得多。
工作室做不到的事
工作室里的任何工具都无法保证精确的数量,如今其他图像生成器也不能。更高的质量让细节更锐利,却不会教会算术。如果页面上的数字是硬性要求,就用分开的图片拼成这一组,或者自己画出最终版式,只用渲染图来定外观。可读的文字也一样,失败的原因相近,手和文字指南里有介绍。
一套快速流程
- 先判断有没有人会去数。没有就别操心。
- 如果有,就按位置描述物件,并给每一个配上自己的形容词。
- 便宜地渲染一小批草稿,数量不对的一眼淘汰。
- 差一点的失误从参考图出发修正,而不是从头再来。
- 需要精确的组,就分别生成各个部件,自己拼合。
把这些和重抽税一文中的习惯结合起来,大部分浪费的渲染就会消失,因为数错是最贵的重抽之一。按下 Generate 之前,你可以在模型页面看到每个模型的当前价格。
常见问题
AI 为什么会多画手指或物体?
模型一次性细化整幅画面,匹配的是局部模式而不是总数。手指、窗户、蜡烛都会重复出现,所以它一直重复到区域看起来满了为止,并不会追踪确切的数目。
换更好的模型能解决数数问题吗?
对一到三的小数量以及结果的干净程度有帮助。目前没有哪个模型能在此之外可靠地数数,所以按位置描述和自己拼合的办法仍然适用。
重抽和从参考图修改,哪个更便宜?
当画面除了一个物件之外都对时,从参考图修改通常更便宜,因为好的部分全部保留,只改一处。重抽会把好的部分和坏的部分一起丢掉。


