
DeepSeek-V4-Flash 什么都好:聪明,快,价格便宜到不像话。
然后你截了一张图贴给它。
你等它回答。它回了五个字:暂不支持图片。
你换个姿势再试,把图片拖进去。五个字。你把图片下载下来换个格式再贴。五个字。你开始怀疑问题出在自己身上,打开搜索引擎查「DeepSeek 看图」,搜到的每一条结果都在告诉你同一件事:它是个纯文本模型,只认字,不认图。跟一个人打电话差不多,你把图举到话筒前面,他只会说「我听不到颜色」。
能不能给它装一双眼睛?能。还免费。
我做了个工具叫 ModLens。装进你的 AI 工具,模型就能看图了。模型本身不用动。
装上之后能看什么
截图、照片、流程图、数据表,只要是图它都读。图上有字,字一句不落。图上有版面结构,上下左右不乱。128 个点挤在一张散点图里?后面有实测,它照样把目标点揪出来。
喂图的方式也随你:把图片文件拖进对话,或者最顺手的复制粘贴。
装好之后不用操心什么时候该叫它。对话里一出现图片,模型自己知道该找谁帮忙。
两步装好
第一步,领一个免费的看图引擎。 到 Google AI Studio 领一个免费的 Gemini api key(一串当通行证用的字符),三分钟,不用绑信用卡。连 key 都不想申请的话,装 Google 家的 Antigravity CLI 也行,拿现成的 Google 账号登录一次就能用,只是慢一些,后面细说。
第二步,剩下的全交给你的 AI。 把这句话发给它,领了 Gemini api key 的话,把 key 一起发:
按 https://github.com/liustack/modlens 的 INSTALL.md 安装并配置 modlens skill,完成后运行体检并把结果告诉我。
它会自己安装、自己配置、自己跑一遍体检,最后把结果汇报给你。你全程一行命令都不用敲,之后往对话里丢图就行。

装完是什么体验
以下全是原样实录,干活的都是纯文本的 DeepSeek-V4-Flash。
丢一张工作流程图进去,问图上画了什么。它先老实交代「我本身看不到图片」,然后自己调 ModLens 读图:四个节点、颜色、箭头方向,全部答对,25 秒。一个看不见图的模型,自己翻出放大镜把图看了。
一次贴三张水彩插画进去,想看它会不会乱。它回一句「三张图我逐张读取,稍等」,21 秒后逐张交卷:每张的画面、配色、风格一条条列清,连第一张「写作和终端两个意象放在一起」的设计意图都点了出来。

一张哈兰德和乔丹合影的推文截图。它读出的远不只「两个人在沙滩合影」:配文、发布时间、回复 2.9K、点赞 270K、浏览量 5M,连乔丹手腕上那块表都进了描述。表的品牌呢?分辨率不够,它写「无法确认品牌」。不瞎编,这一点我比什么都在意。

最后上压力测试。一张 128 个模型的智能对成本散点图,点密得看着眼晕。它读出标题、双轴、刻度,把高亮的 DeepSeek V4 Flash 从点堆里精准拎出来,坐标都对(成本约 $0.028,智能指数 50)。密集图表是识图最容易翻车的场景,这一关过了,日常截图更不在话下。

粘贴图片也行
最值得单独说的是粘贴图片。有些工具(比如把模型换成 DeepSeek 的 Claude Code)会在中间把图剥掉,界面只剩一个「不支持的图片」占位符,图没了。
ModLens 能把它找回来。下图是真实一幕:粘了两张图,界面只剩占位符,模型自己把图找了回来逐张读出,连 PPT 封面的配色色值都读对了。

这条路是怎么走通的,从「走不通」到翻盘的全过程,单独写了一篇:《在 Claude Code 用 DeepSeek-V4-Flash,真的没办法粘贴图片识图吗?》。万一哪天这条路不通了,把图片文件拖进对话窗口,永远是保底做法。
免费的底气:五条路,倒了就换
免费的东西,最怕哪天说没就没。所以 ModLens 不把命押在任何一家身上:看图的引擎有五家可选,随时能换。推荐的免费 Gemini api key,一张图 5 到 10 秒。免申请的 Antigravity CLI 慢一些(15 到 40 秒),额度按周发放,胜在什么都不用注册。此外通义千问、GLM4.7v 这类兼容 openai 接口的平台、Claude Code 也都支持。哪家出了问题,换一家接着用,你这边什么都不用改。
它不擅长什么
三件事先说清楚。说清楚了你反而敢用。
得装在电脑上的 AI 工具里。 Claude Code、Codex、Pi、OpenCode 这四款实测可用,同类工具原理相通。DeepSeek 官网那种网页聊天框,装不了。
速度够用,不算快。 一张图几秒到几十秒,日常问答够了。想做实时应用,不行。
读不准的地方会明说。 分辨率不够、内容拿不准,它标出来交给你判断,不会编一个像样的答案糊弄过去。
同一招也能给纯文本模型加上联网搜索能力:搜网页、读链接、查推特,写在姊妹篇《免费给你的 DeepSeek-V4-Flash 加上联网搜索能力》里。
按 https://github.com/liustack/modlens 的 INSTALL.md 安装并配置 modlens skill,完成后运行体检并把结果告诉我。
ModLens 这次重构,从想清楚到写完,用的也是我自己那套工作流 liustack:动手前用 shaping 把方向捋清楚,写代码时用 coding 守纪律。
一双眼睛,一句话装好,五条路随时能换。你的模型从此看得见。