我朋友小张,是个勤勤恳恳的程序员。
他有个习惯,每学一个新技术就整理成信息图,发到群里。什么 Git 命令速查表、Python 常用库分类、K8s 架构一图流。他觉得这样方便自己复习,也方便别人。
上周他学完了一套新东西,想做一张信息图。六个区块,每个区块有标题、有代码片段、有简短说明,底部还要加个来源链接。
他先试了 GPT-Image-2,目前文生图排行榜第一。
图出来了。标题写对了,文字也基本没问题。毕竟是 2026 年了,写几个大字早就不是生图模型的难题。
但他盯着看了一会儿,发现了几个问题:六个区块的间距不太一样,有的挤有的松。第四个区块里的代码片段字号莫名比别的小了一号。整体看着就是哪里不对劲,那种「差一口气」的不对劲。
他改。跟 AI 说「把间距统一一下」。
AI 重新生成了一张。
间距好像均匀了一点,但第二个区块的配色变了,而且整张图的尺寸比上一张小了一圈。
他又改。
这次配色回来了,但底部链接消失了。
他换了 Nano Banana 2 试试。速度确实快,三五秒就出图。文字准确性也不错。但结构化排版的问题还是一样:六个区块的布局全凭 AI 感觉,间距不统一,对齐靠缘分。
他又试了 Midjourney。出图风格确实漂亮,但信息图需要的不是漂亮,是精确。
小张跟我说这件事的时候,语气是平静的。那种经历了五个阶段的平静:愤怒、否认、讨价还价、抑郁、接受。
「不是说现在的生图模型都能写字了吗?」他问我。
「能。」我说。「写标题、写大字,现在各家模型都很强了。GPT-Image-2 的文字渲染,中英文都接近完美。但你要的不是写字,你要的是排版:六个区块、网格布局、间距统一、代码高亮。这两件事差了十万八千里。」
下面这张图说得很直白,左边是生图模型的文字输出,右边是代码渲染的文字输出:

2026 年了,生图模型确实今非昔比。
LMArena 文生图排行榜上,GPT-Image-2 以创纪录的分差登顶,Recraft、FLUX 2、Midjourney 追在后面。英文文字渲染早就不是问题,顶级模型的中文也基本过关了,偶尔吞个字,但比两年前写甲骨文的时代强了不知道多少倍。
文字准确性这场仗,生图模型已经赢了。
但「排版」呢?
你让 AI 画一张海报,上面写三行大字,它现在大概率能写对。这我承认。
但你让它做一张信息图,六个区块、网格布局、每个区块里有标题有正文有代码、间距统一、配色协调、安全边距合理,
它就开始表演了。
不是表演做信息图。是表演「我觉得这大概是一张信息图吧」。
区块间距忽大忽小。字号不统一。你说要六个区块,它给你五个半。你说代码要等宽字体,它给你一种介于等宽和非等宽之间的、量子叠加态的字体。
而且最要命的是:你改不了。
GPT-Image-2 号称编辑精度大幅提升,确实比以前好了,但它本质上还是重新生成。你说改第三个区块的颜色,它大概率只改第三个区块。大概率。但不是百分之百。偶尔它会好心地帮你把第一个区块的字号也「优化」一下。偶尔会帮你把整张图的色温微调一点。连续改十几轮之后,风格会慢慢漂移,最后出来的图跟第一版已经不是同一张脸了。
就像你对一个画家说「帮我把左下角那朵花的颜色改成红色」,他说「好的」,改完之后你发现右上角的云也变了一点。你说「云不要动」,他又改,这次花和云都好了,但天空蓝了一个度。
每次修改都是一次抽卡。
小张抽了十五次卡。没有一次完美。
事情为什么会变得不一样
我这人有个毛病:每次看到一个明明不合理但所有人都习以为常的事情,就忍不住想,有没有什么歪门邪道能绕过去。
有一天我意识到一个极其反直觉的事实:
大模型最强的能力不是画图,是写代码。
尤其是写 HTML 和 CSS。
如果你不知道这两个词:HTML 是网页的骨架,决定「有什么内容」。CSS 是网页的衣服,决定「长什么样」。你现在看的这篇文章、刷的淘宝页面,全是这俩写出来的。
大模型写这玩意儿有多强呢?互联网上几十亿个网页的源代码全是它的训练数据。对它来说写 HTML,就像咱们说母语一样,不用想,张嘴就来。
字号、间距、颜色、渐变、阴影、圆角,CSS 精确到 0.1 像素。
0.1 像素啊朋友们。你用 Photoshop 手动拖都拖不到 0.1 像素。
那么问题来了:如果让 AI 写一个排版精美的 HTML 页面,然后把这个页面截图变成 PNG,会发生什么?
代码写什么,出来就是什么。每个字、每个像素、每个间距,100% 确定。
不用猜。不靠概率。跑一万次,出一万张一模一样的图。代码说了算。
我把这个思路做成了一个工具,叫 WebPress。
它以 Agent Skill 的方式工作。什么是 Agent Skill?简单说就是给 AI 装了个 App。你手机刚买来只能打电话,装了美团就能点外卖,装了高德就能导航。AI 也一样,装了这个 Skill 之后,它就突然学会做图了。
而且不是乱做。这个 Skill 里面塞了一整套专业设计规范:60-30-10 配色法则、安全边距规则、日式留白美学、Gestalt 视觉原则。AI 不是在瞎画,它是在按一套设计师的方法论在排版。
整个流程就三步,你说一句话,AI 自动写 HTML,然后渲染成 PNG:

小张看到这个工作流的时候,长出了一口气。
那口气里有释然,有感动,也有对那十五次抽卡的深切缅怀。
安装这件事,简单到有点侮辱智商
现在很多 AI 编程工具都支持 Agent Skill,Claude Code、Codex、OpenCode、Cursor、Antigravity,等等等等。
你需要做的事情只有一件:在对话框里打一句话。
帮我安装这个 skill:https://github.com/liustack/webpress
没了。
不用翻文档。不用配环境变量。不用去 Stack Overflow 上搜「为什么我的 npm install 又报错了」。
AI 自己就把代码拉下来、环境配好了。装完之后,你的 AI 助手就多了一项技能:做图。
准确地说,是做那种结构精确、排版可控、改哪里就动哪里的图。不是靠概率碰出来的图。是写出来的图。
怎么用:把嘴张开就行
我知道你想问什么:「那到底怎么用啊?是不是还得学什么命令?」
不用。
你只需要做一件你每天都在做的事:说话。
这是我最上头的功能:你可以直接跟 AI 说你想要什么风格。
这篇文章前面几张配图,就是它用「电影风格」做的。暗色调、衬线字体、克制的金色。
你说「换成时尚杂志风格」,同样的内容,变成了极简排版、大量留白、高级感扑面而来:

同一份内容,风格随你换。 而且每次换风格都不是重新碰运气,AI 只改 CSS 样式,内容结构纹丝不动。
小红书封面、推特配图、公众号头图,都是一样的玩法。你不需要懂什么「色相环」「互补色」「三分构图法」,用你的日常语言说就行,AI 自己翻译成设计语言。
不满意?直接说。
「标题再大一点。」改了。
「背景换成深色。」改了。
「加个副标题,把配色换成暖色调。」改了改了都改了。
说一句,改一处,秒出新版。改哪里就动哪里,别的地方纹丝不动。 这一点,用过生图模型改图的人应该最有体会:你只是想改个颜色,结果整张图面目全非。
而且,这里才是关键:你下次打开同一段代码重新渲染,出来的图和上次一模一样。不是差不多一样,是像素级一样。这就是代码渲染和概率生图的根本区别。
所有平台,一句话覆盖
这是另一个让我觉得非常爽的事情。
同一个主题,你只需要说一句「换成 XX 平台的尺寸」,它就给你重新适配。内置了 8 种预设,覆盖了你能想到的所有主流平台:
| 平台 | 尺寸 |
|---|---|
| OG 社交卡片 | 1200×630 |
| Twitter 配图 | 1200×675 |
| Banner 横幅 | 1600×900 |
| YouTube 缩略图 | 1280×720 |
| 公众号封面 | 900×383 |
| 信息图 | 1080×1350 |
| 海报 | 1200×1500 |
| 小红书封面 | 1080×1440 |
写一篇文章,配图可以一次性覆盖所有平台。
以前做这件事你得开四次 Photoshop,建四个画布,调四次尺寸,对四次参考线,导出四次,然后在第三次导出的时候发现第一张图的标题打错了一个字,于是你从头再来。
现在你说一句话。
就一句话。
说说局限
我不是那种只吹优点不说缺点的人。
这条路也有它不擅长的地方:
它不能画画。 你想要一张水彩风格的风景插图、一个 3D 渲染的产品模型、一张照片级的人像,这些事情它干不了。它做的是排版,不是绘画。想要画面感、想要艺术创意、想要摄影级真实感,生图模型仍然是更好的选择。
它需要一个能写代码的 AI。 你得用支持 Agent Skill 的编程工具,Claude Code、Codex、Cursor 这些。不能在 ChatGPT 的对话框里直接用。
复杂的图可能需要几轮调整。 虽然每次调整都是精确的、确定的,但 AI 第一次生成的排版不一定完全符合你的预期。好消息是:你说改哪里就改哪里,不会牵连其他部分。
说白了,WebPress 的甜区就是:信息密度高、结构化强、需要精确排版的图。 信息图、速查表、社交卡片、平台封面、技术海报。这些图的核心不是「画面」,是「排版」:标题多大、间距多宽、区块怎么分、颜色怎么配。
这些事情,代码比画笔擅长一万倍。
最后说两句
好吧我承认。
小张是我编的。
世界上可能有一千个小张,但这篇文章里的这个小张,不存在。那个花了一下午跟 AI 搏斗的人,是我自己。那十五次抽卡,是我自己抽的。那口充满缅怀的气,是我自己叹的。
但这重要吗?
不重要。
因为你读到这里,大概率是因为你也经历过类似的事情。你也试过让 AI 做一张信息图然后发现间距全乱了。你也试过改了一个地方结果三个地方都变了。你也在某个深夜对着一张「差一口气」的图,陷入过那种平静的绝望。
WebPress 做的事情其实很朴素:让 AI 做它最擅长的事(写代码),用浏览器做浏览器最擅长的事(渲染网页),然后截个图。
就是这么简单的一条路。但它绕开了生图模型最不擅长的领域:精确的、结构化的、可复现的排版。
有时候换条路不是因为原来那条走不通,是因为隔壁这条实在太顺了。
帮我安装这个 skill:https://github.com/liustack/webpress
下次需要做配图的时候,先想想:这张图的核心是「画面」还是「排版」?
如果是排版,别让 AI 猜像素了。
让它写代码。

