
你让 AI 画一只手,它给你六根手指。
你让 AI 画孤独,它给你一条空旷的路、一片冷色的天、远处一点光。每个元素都举着手说:老师,我是孤独。
前一个错得莫名其妙。后一个对得毫无意义。
这两样毛病,前一个你不能改。
六根手指是它出厂自带的。手有二十七块骨头,姿势几乎无穷,照片里还总被挡掉一半,训练时也没人会在照片边上注一句「左手侧握,三根手指被挡住了」。它心里没有一副骨架可以数数,你在提示词里写一百遍「五根手指」也拦不住。
能改的是后一个。它画得太对了,挑不出错,也不动人。你说不上哪儿不对,只知道这图一眼就是 AI 画的。
为了弄明白这件事,我让 AI 生成了六百多次。翻车的一张没删。
答案跟我原来想的正好相反。
它什么都没放弃。
人画画的时候,手只有一双,时间只有那么多,情绪也只在那一阵。每次都得克制和取舍,选了这个就得放掉那个。
为了留住那一刻的神情,打翻了颜料盒。
动作抓住了,构图上偏了半个身位。
颜色画痛快了,光影关系就顾不上了。

这些放弃留下的痕迹,就是我们说的味道。
我手机相册里最好的一张照片,是夜里抓拍的。噪点粗得能数出颗粒,人脸糊了半边。它不该好看,可它是那晚唯一没被我错过的一秒。
AI 没有这些困扰。结构、构图、颜色、细节,它能让所有指标同时及格。于是没有哪一项是突出的,样样都行,样样都不行。
它什么都没放弃,所以也什么都没留住。
我让它做旧,它把旧做成了装饰。
想清楚这层,我做的第一件事很自然:既然太完美,那就加点毛病。
加颗粒,加纸纹,提示词里写满「粗糙」「不完美」「手工感」「随手画的」。
有效果,但不理想。而且加得越多,越假。
最典型的一次,我想要手绘那股犹豫劲儿,写了「略有犹豫感的线条,允许重复的探索线」。它交回来的图,每个轮廓外面都整整齐齐跟着第二条线,间距均匀,从头到尾一致。
它把犹豫画成了千篇一律的花纹。

另一次我嫌画面太平,写了「可以有快速的斜排线」。它给了我一张建筑设计大师水准的手绘效果图:排线密集工整,物体底下配着淡蓝投影,透视一丝不苟。
这两张图的每一处都在证明同一件事:画它的人技术很好。
而技术很好,恰恰是我最不想要的。
它没有真的在犯错,它在模仿犯错的样子。像一个演员演紧张,手抖得很有节奏,咽口水的时机精准,每个细节都对,唯独不像。
栽了这两次我才回过神:我塞进去的全是形容词。
「左下角有块墨迹,右上角那根线画歪」,这是让它照着做,说得越准它做得越准。而「粗糙」「不完美」「未完成」只是我对结果下的判断。哪里粗糙,为什么没画完,我一个字也没交代。
交代不清的部分,它就自己编。编出来的,就是花纹和效果图。
松,不是拙。
于是我换了个说法。不再要求它画得不完美,改成告诉它这处不完美是怎么来的。
第一次试就见效。我把形容词全删了,只留一句:
你是一个生手,不会画的生手。
图立刻就变了。比例开始失准,透视会画错,圆画不圆,方画不方。歪是真的歪,因为它现在有理由歪:画的人不会画。
之前那些「粗糙」「随意」,它都是站在「我很会画」的位置上表演随意,怎么演都端着。
这是全天最好的一版。唯一的问题是不合我用:图带着孩子气,放在文章里像小学生作业。
我又补了一句限定:像一个会画画的人在几分钟内快速记下来的,形体比例基本准确,生手感来自速度而不是能力。
松,不是拙。 一字之差,画面完全不同。
理由还可以有很多种:
- 他画到一半分了神,焦点改过好几遍,背景还留着最初的底稿没擦
- 颜料快用完了,同一笔从厚重拖成干涩
它们有个共同点:说的都是画画那个人当时的处境,不是画面该长什么样。
处境定了,不完美自己就长出来了。
后来我发现这套写法有个现成的模板:剧本。
剧本从来不写「演得自然一点」。它写这个人是谁,此刻在什么处境里,急着要什么,手边只剩几分钟。剩下的表情、语气、小动作,演员自己会长出来,而且每一条都对得上。
好的提示词也是这样。别去描述你想要的成品,去交代那个动手的人和他的处境。
有些不完美不用求,工艺自带。
上面这些都是在跟模型讨价还价。还有一条更省事的路:挑一种本身就不规整的工艺。
比如手撕纸拼贴。纸撕开的口子是毛的,看得见纤维,边缘会翘,贴的时候会歪。这些不用我求,撕纸就是那样。

再比如孔版印刷,很多独立杂志用的那种印法。
它一次只认一种颜色。想印三色,纸就得进去三趟。每进去一趟,纸都可能挪那么一点点,于是色块和线条对不齐,差个一两毫米。
油墨还是半透明的。蓝压在黄上面,出来是第三种颜色。墨上得不匀的地方,会漏出一小块白纸。
这些「毛病」就是工艺,不是我编的。
模型未必知道那台机器怎么转。它只是见过足够多标着「孔版印刷」的图,把这四个字和错位、漏白、叠色记在了一起。
我打四个字,借走的是后面一整串毛病。
这里还有个小插曲。我第一版把孔版写成了「泛黄的纸,别用浓艳的颜色」,脑子里想的是旧印刷品那股陈味。我去查了资料,发现方向全反了:孔版常用未涂布、能吸墨的纸,不必泛黄,也不怕鲜艳。荧光粉红还是它的招牌专色,亮得超出普通四色印刷的范围,有人干脆拿它顶掉四色里的品红。
我凭印象写的「复古」,恰好是另一种风格的招牌。
做准一张,和做出十张。
说到这儿得澄清一句:我不是说具象化提示词不好。
如果我清楚知道墨迹该落在左下角、哪根线该歪,直接写出来当然最准。问题是这张图画完,这套提示词也跟着报废了。下一张换了画面,墨迹和歪线都得重新安家。
「赶时间的人」不会报废。画电脑、画街景、画一把椅子,他都赶时间,只是每次顾不上的地方不一样。
中途我还试过大家常用的一招,垫图:把之前画对的那张图直接塞给它,让它照着这张的路子再画。那一次比我改一整天词都准。参考图把构图、比例、笔触、纹理一股脑给了它,连猜都省了。
它也准得过头。下一张只换了主体,构图和风格还像从原图上揭下来又贴了一遍。
只做这一张,这叫准。要给一整篇文章配一套图,它就成了另一种假:每张都像原图换了张脸。
具体的要求告诉模型哪里该错。给它一个理由,是让它自己决定这回顾不上哪里。
这招不只能用在画上。
想要一张不像摆拍的照片,别写「自然一点」。写「朋友边走边拍的,另一只手还举着伞」。人没看镜头、构图偏了、画面有点糊,全都顺理成章。
做海报也一样。别写「不要太精致」,写「活动明早就开始,今晚必须送去印」。时间和地点一定写得最大,花边来不及收拾。
一天调了十四版,最后删回第一版。
还有一个更贵的教训,跟画法无关,跟人有关。
有一套涂鸦风格,我一天调了十四版。每次的动作都一样:看到一个毛病,加一条规则去治它。
太干净,加一条要求线条犹豫。
太机械,加一条要求速度不均。
嫌画面空了就让它多画点东西,等它真的画满了,我又回头补一条要求留白。
调到第十三版,画面已经变成了铅笔素描。又黑又密全是排线和调子,跟我最初想要的轻快涂鸦差出十万八千里。

最后是把整段规则删掉,退回早期那个只有几句话的版本,才对。
每条规则单独看都对。十四条放在一起,就像十四个人围着一张画指挥。前一个喊线条再松,后一个喊细节再多,第三个又嫌画面没留白。模型谁都不敢得罪,每个人都听了一点,最后谁也没听明白。
更麻烦的是,我每次不只改一件事。调到后面,连哪句话有用、哪句话把图带偏都看不出来。
调提示词这件事,出问题时先删。真要加,也一次只加一条。不然第十四版出了问题,你连该怪谁都找不到。
把一件事拆得越细越具体,谁都能做。能把一堆具体收进一个理由里,才是本事。
提示词能把它拉回来,但只能治标不能治本。
老实说,光靠提示词,这件事只能改善,做不到根治。
模型自带一套审美:主体默认摆中间,光默认打得好看,每个角落默认都要有东西。你只能往回拉,拉不到零。
给它一个理由,能把它从这套默认审美里拉出来一点,不能让它把学过的东西全忘掉。
还有最朴素的一条:真要写实,不如直接截图或垫图。画的价值恰恰在它不是照片。今天有整整一轮,我就是在把画往照片的方向修,修了十三次,最后删了。
说到底,我只是想让它别那么努力。
回头看这六百多次,管用的改动都在做同一件事:给模型一个停下来的理由。
它最大的毛病是画得「太完美」。每个物体都交代清楚,每个角落都填满,每处细节都收干净。而真正像人画的东西,往往赢在那些没画完的地方。
不要给完美加的瑕疵,要让瑕疵有一个不完美的理由。
这个理由可以来自一个人:他不会画,或者赶时间。也可以来自一样东西,一张被撕开的纸,一台总是跑偏的印刷机。
夜里最后一次,我把那一整段规则删掉,只留下最早写的几句话,敲了回车。
图出来的时候,桌沿是歪的,颜色涂出了线外,屏幕那一小块黄没涂满,露着一道白。
我把它拖进文章里。翻车的图也在文件夹躺着,六百多张,我没往下翻。
参考与延伸
这些资料支持文章里的判断,但它们各有各的边界,我把能证明和不能证明的分开写。
官方文档,能说明产品提供什么能力、官方推荐怎么用,不能说明模型内部到底怎么运作。
- OpenAI 的 GPT Image 2 提示指南与模型页:官方建议把真实感写成一个正在发生的拍摄场景,避免暗示棚拍精修,并建议从干净的基础提示开始、每次只改一处。文章里「给处境」和「一次只改一条」两个做法,跟官方经验一致。
- Google 的图像生成文档与提示指南:同时支持两件看似矛盾的事,没有参考图时把主体、动作、环境、构图写成一个完整场景,有参考图时用它做精确一致。这正是文章说的「两种输入各有各的活」。
- Midjourney 的 Raw 模式说明:官方直说标准模式会自动加入自己的创意处理。文章里「模型自带一套审美」不是我的猜测。
- Midjourney 的图像提示与风格参考:官方说明参考图会带入内容、构图、颜色、媒介和纹理。这是垫图控制力最强、同时最容易把下一张锁住的原因。
- Midjourney 的提示技巧:官方把孔版印刷、剪纸这类工艺直接列为有效的提示概念,旁证了叫一个工艺名就能带出整组痕迹。
研究,能说明当前模型在组合遵循和隐含语义上还有瓶颈,不能替我这六百多次实验下结论。
- ConceptMix:提示里的概念越多,模型的遵循能力下降得越明显。这跟十四条规则互相打架的现象一致,但它测的是概念数量,不等于十四句自然语言,只能算相邻证据。
- T2I-ReasonBench与R2I-Bench:模型确实能从一段处境里推出该有的画面,但这种能力有限也不稳定。所以「给个理由」有效,却不保证每次都灵。
- 审美对齐会收窄艺术表达(立场论文,附实验):模型会朝着惯常的漂亮结果回弹,对刻意粗糙的要求执行不足。对应文章里那句「拉得回来,拉不到零」。
- 自然科学插图基准:现在最强的几个模型仍难同时兼顾丰富和精确。这也是我不建议把这套方法用在解剖图、说明图上的原因。
工艺事实,用来核对孔版那一段。
- Stencil Wiki 的选机指南与套准说明:分色、装鼓、多次走纸和套准偏差都在这里。
- RISO 官方的油墨说明:油墨靠纸吸收干燥,所以用未涂布纸。我第一版写「泛黄的纸」就是栽在这里。
顺便说一句,这篇讲的是创作意义上的「取舍」,不是模型采样时的概率分布。两件事凑巧都能叫「选」,但不是一回事。