深靛蓝横纹构成的高墙中央打开一扇亮蓝窗口,里面升着一轮橙色太阳

8 月 20 日,OpenRouter 上出现了一个新的匿名模型。代号 stealth/ox-alpha,江湖人称牛来。免费,能写代码,能看图,还能看视频。

就是不知道来自哪个厂商。「牛来」模型的系统提示也只允许它管自己叫 ox-alpha,再问就闭嘴。

和《牛来》电影的抽象不同,「牛来」模型的能力强到离谱。它多模态、百万上下文、速度快到屏幕都闪眼。

消息传开,AI 圈沸腾了。

正在推进收购 OpenRouter 的 Stripe 创始人 Patrick Collison,深夜发了一条帖子说:「非常惊艳。」 Patrick Collison 试了 ox-alpha,回了两个词:very impressive

硅谷投资人 Sriram Krishnan 也忍不住说:这种匿名宣发非常有有意思,比花大钱开发布会、发博客、贴跑分图管用得多。 蒙面投放已经成了新玩法,比发一天博客和技术报告管用

这一刻全世界都是狄仁杰,全世界都是福尔摩斯。

有人拿它断句习惯,对照 418 个已知道身份的模型。五十组刁钻的对比,Ox Alpha 和 GLM-5.3 五十组全中。Gemini 只中十一组,DeepSeek 中九组。

有人故意发错请求,看它报错时会怎么样。结果和智谱的接口一样。

还有人给它喂视频,计算每段视频多少画面。又和智谱的 GLM-V 系列完美对上。但谁也不敢包说这就是智谱的模型。

猜的人很多。有人赌小米,小米之前用过同一套匿名手法。有人赌月之暗面,因为文风像。有人赌微软。

后来 Google DeepMind 的员工发了一条充满暗示的帖子说:「要是这个 Ox Alpha 是我们早就认识的朋友呢?」。他又发了个「Gemini」来继续引导舆论。

马上被网友回怼:可悲,你们要靠炒作养活 Gemini。

DeepMind 员工发帖:如果 Ox Alpha 是我们一路交到的朋友

OpenCode 上,DeepSeek 连坐五十六天的头把交椅,当天被这「牛」给掀翻了。

8 月 21 日 OpenCode 用量:ox-alpha 2.6T,压过 DeepSeek Flash 的 2.5T

一个能装下整个世界的模型,却奈何不了一张 PNG。

过去一年,用 DeepSeek 或 GLM 写代码的人,经常在同一个地方被拦住:模型写完页面,你贴张截图让它检查,它只回一句,暂不支持图片。

业内把同时理解文字、图片和视频的能力叫作「多模态」。不懂这个词也没关系,它只意味着模型能直接看见截图,不用你先把画面翻译成一段话。

DeepSeek-V4-Flash 很聪明,也很便宜。智谱的主系列也擅长处理复杂的长任务。可这些模型都只接受文字。

GLM-5.2 发布当天,就有人在官方帖子下面问:为什么不支持图片。半个月后,Abacus 的创始人写,GLM-5.2 在真实工作里很难单独使用,因为它看不见图片。到了 GLM-5.3,官方仍然不支持多模态。

这不只是聊天少了一个功能。

有人把 GLM-5.2 接进 OpenCode。模型在工作途中找到一个需要查看截图的工具,图片一进入会话,整个对话便卡死。之后用户每发一句,它都重复同一条错误:这个模型不支持图片输入。

DeepSeek 还有一种更麻烦的情况。

DeepSeek 接进 Codex 后,图片没有进入模型,系统也没有明确报错。四十八秒后,它交来一份「Dify 核心功能全景」。那张截图和 Dify 没有关系。模型只是从对话里残留的几个词,编出了一张自己觉得应该存在的图。

GLM 看不见至少会停下来。看不见还继续说,用户就得先猜它到底看到了多少。

大模型会读几十万字,会改完整项目,会自己调用十几个工具。

可屏幕上的按钮歪了两厘米,它不知道。

DeepSeek-V4-Flash 看不见图片,但它不肯就这么停下。

有个用户让它从画面里找一艘飞船。它写了段小程序,把图片切成格子,再统计每一格有多少绿色。第二行有一格绿色占了 54%,它便认定飞船在那里,把那块区域裁了下来。

Flash 看不见飞船,对着颜色格子报绿占比

它从头到尾都没看见飞船。它看到的是一张绿色统计表。

还有一个办法更直接,也更贵。

我当时在测一个给客户做的 PPT 助手。品牌图、参考版式,Flash 一张不认。差不多同时,有人发现它会自己调用电脑上的 Fable 5 看图。没人教它这么做。Fable 5 是 Claude 家最贵的那档。

我回了一句:这属实是太奢侈了。

因为这个缘故,我也给这些纯文本模型做过识图工具。高峰期一周被下载八万八千次,GitHub 上也有三千七百多颗星。

ModLens,一周八万八千次下载

同一时期,社区里到处都在给纯文本模型加视觉。有人调用千问,有人调用 GLM-V,也有人给 Flash 配了一只很小的视觉模型。

办法很多,需求只有一个:让正在干活的那只模型,能看见图片。

智谱早有 GLM-V 系列,DeepSeek 也做过 OCR 和视觉尝试。可这些能力都在旁边的产品线上。Qwen、Kimi、MiniMax 和字节的旗舰早已支持图片,小米也有能看图的 MiMo-V2.5。大家日常拿来写代码、改项目的 GLM-5.2、GLM-5.3、DeepSeek-V4-Flash 和 V4-Pro,却仍然只接受文字。

是 DeepSeek 先开的第一枪。

8 月 21 日,DeepSeek 毫无症状的上线了带有视觉能力的 deepseek-v4-flash-vision-exp 模型。这是 DeepSeek 第一次给核心模型内置视觉传感器。DeepSeek OCR 系列不算。

DeepSeek 官方:Flash 的实验性视觉接口上线

DeepSeek 一如既往本色演出了价格屠夫的角色,对外宣传,deepseek-v4-flash-vision-exp 会把每一张图片统统压缩折算为最多 384 个 token 的价格。

而不久前,网络上还在流传着多模态对 DeepSeek 到底重不重要,会影不影响 AGI 的争论。

一个时代的落幕,也只是普通人平凡的一天。

8 月 26 的晚上,没有彩排,没有发布会。智谱在社交媒体贴了张图,然后发布了 GLM-5.3-Flash。

官方贴出的六张柱状图

旧的纯文本模型 GLM-5.3 依旧提供服务,各大技术社区照常刷着评测跑着分,程序员们依然在屏幕前表演着敲代码(划掉,也有人真的在写)。

可在大模型演进的历史进程里,DeepSeek V4 和 GLM-5 两条主力系列都没有视觉型号的时代,画上了句号。

陶杰在《杀鹌鹑的少女》里写过一段话。

当你老了,回顾一生,就会发觉:什么时候出国读书、什么时候决定做第一份职业、何时选定了对象而恋爱、什么时候结婚,其实都是命运的巨变。只是当时站在三岔路口,眼见风云千樯,你作出抉择的那一日,在日记上,相当的沉闷和平凡,当时还以为是生命中普通的一天。