神秘模型蒙娜丽莎现身Arena

代号“mona-lisa-1”的生图模型进入LM Arena盲测,并被检测出OpenAI来源信号。它可能是下一代GPT-Image,但现有证据还不足以确认具体型号。
神秘模型“蒙娜丽莎”现身Arena,下一代GPT-Image开始盲测?
代号为 “mona-lisa-1” 的神秘图像生成模型,近日进入 LM Arena 的匿名盲测列表,并被测试者发现带有与 OpenAI 工具相关的内容来源信号。
据 IT之家报道,这款模型最早于 2026 年 8 月 9 日被观察到;截至今天(8 月 13 日),OpenAI 仍未发布公告、模型卡、产品文档或上线计划,也没有确认它与 GPT-Image 2 的关系。
现阶段最合理的判断是:mona-lisa-1 大概率来自 OpenAI 的图像模型测试管线,但“下一代 GPT-Image”仍然只是高概率猜测,而不是已经坐实的产品结论。

一款只在盲测中出现的模型
mona-lisa-1 是一款身份尚未公开、目前仅在 LM Arena 匿名对战中出现的图像生成模型。 LM Arena 是一个通过用户两两比较模型输出、再根据偏好投票形成排名的公开竞技平台,其核心价值不是给模型做一次固定考试,而是收集大量真实用户在不同提示词下的主观选择。
匿名盲测是模型厂商在正式发布前验证用户偏好的常见方式。 测试期间,用户通常看不到模型的真实品牌或正式名称,只能比较两张生成结果并投票;厂商则可以借此观察模型在写实、人像、文字渲染、提示词遵循、图像编辑和审美风格等任务上的胜率。
GPT-Image 2 正式发布前也走过类似路径。 它曾以匿名身份进入 Arena 接受测试,随后才进入 OpenAI 的正式产品体系,因此“mona-lisa-1 先上竞技场、后等待官宣”的路线并不反常。
这次曝光最受关注的原因,是 GPT-Image 2 发布约三个月后仍处于竞技场第一梯队。 OpenAI 没有明显的排名压力,却再次放入一个新检查点,说明其图像团队可能不是在做简单修补,而是在测试足以影响用户偏好的新版本。
OpenAI来源信号,不等于模型身份证
OpenAI来源信号是写入生成内容、用于说明文件可能由OpenAI工具生成或导出的可验证信息。 爆料者 AiBattle 将“mona-lisa-1”生成的图片提交给 OpenAI 官方 Verify 工具后,检测到了与 OpenAI 相关的来源信号,这是目前指向其开发方的最强证据。
C2PA 是一套记录数字内容来源和编辑历史的开放技术标准。 它可以把生成工具、签名信息及部分处理记录封装进图片或音频文件,让验证工具判断文件是否携带受支持的内容凭证。
SynthID 是一种将机器可识别信号嵌入生成内容的水印技术。 与肉眼可见的角标不同,这类水印通常不会直接破坏画面观感,而是由专门工具进行检测;OpenAI 的 Verify 页面表示,其验证范围包含 C2PA 元数据及受支持的水印信号。
来源验证只能回答“可能由哪套工具链生成”,不能回答“具体是哪一个模型生成”。 OpenAI 官方说明明确强调,检测到受支持信号可以表明内容由 OpenAI 工具生成或导出,但验证结果本身不能识别底层使用了 GPT-Image 2、内部实验模型,还是某个尚未命名的检查点。
把水印检测结果直接等同于“GPT-Image 3 实锤”是不严谨的。 同一个内容导出管线可能服务多个模型,内部测试系统也可能统一添加来源凭证;反过来,图片经过截图、压缩、转码或平台二次处理后,元数据还可能被移除,导致来源信号无法检出。
目前可以确认和不能确认的信息如下:
| 判断 | 当前证据 | 可信度 | 主要限制 | |---|---|---:|---| | 模型与 OpenAI 工具链有关 | Verify 检出相关来源信号 | 较高 | 不能定位具体模型 | | 模型是 GPT-Image 2 的后续版本 | 命名方式、Arena测试路径、生成特征 | 中等 | OpenAI尚未确认 | | 正式名称是 GPT-Image 2.5 | 社区推测 | 较低 | 没有官方文档或产品标识 | | 正式名称是 GPT-Image 3 | 社区推测 | 较低 | 缺少版本号和发布时间证据 | | 即将接入 ChatGPT 或开放使用 | 暂无直接证据 | 较低 | 目前只见于盲测 |
它比GPT-Image 2强在哪里
mona-lisa-1 最明显的变化,是在部分样例中削弱了AI生图常见的“塑料感”。 多位测试者观察到,新模型在皮肤纹理、材质反光、环境光过渡和背景细节上更自然,画面不再像统一套了一层过度平滑的商业摄影滤镜。
所谓“塑料感”,本质上是局部纹理、光照和材质统计不一致造成的人工质感。 典型表现包括皮肤过度磨皮、头发形成规则块面、布料缺少真实纤维、金属与塑料共享同一种高光,以及主体清晰但背景像被算法随意糊掉。
mona-lisa-1 在细节密度上的提升,比单纯增加锐度更有价值。 @TimJayas 使用相同提示词与 GPT-Image 2 对比后,新模型在部分场景中生成了更丰富的微小结构和更自然的层次,而不是简单地给边缘加锐化或给画面堆高对比度。
真实感提升并不意味着稳定性已经过关。 现有反馈仍提到噪声、块状伪影和无必要文字等问题,说明模型可能在追求高频细节时引入了新的视觉错误;一张图乍看更“像照片”,放大后却可能出现皮肤纹理断裂、背景结构粘连或字符残片。
同提示词对比只能展示能力上限,不能代表平均成功率。 图像模型具有随机采样特性,同一个提示词连续生成四次,构图、人物姿态和局部质量都可能不同;如果只挑最好的一张对比,很容易把抽卡运气误认为模型升级。
| 对比维度 | mona-lisa-1 | GPT-Image 2 | 现阶段判断 | |---|---|---|---| | 产品状态 | Arena匿名盲测 | 已正式发布 | GPT-Image 2更成熟 | | OpenAI是否确认 | 否 | 是 | 神秘模型身份未定 | | 真实感 | 部分样例更自然 | 稳定,但偶有人工质感 | 新模型可能占优 | | 细节层次 | 部分测试更丰富 | 已有较强细节能力 | 需要大样本验证 | | 噪声与伪影 | 仍有测试者报告 | 正式版本相对可控 | 新模型尚未完全收敛 | | 文字生成 | 暂无系统数据 | 已具备较强文字渲染能力 | 无法下结论 | | 图像编辑 | 未知 | 已进入正式产品流程 | 暂无法比较 | | ChatGPT可用性 | 不可用 | 可用 | 神秘模型仅供盲测 | | 正式接口 | 未开放 | 已提供正式接入 | 暂无迁移条件 | | 价格 | 未公布 | 以官方当前定价为准 | 无法比较成本 |
真正需要看的不是单张照片
下一代生图模型的竞争重点,已经从“能不能画”转向“能不能稳定完成可交付任务”。 对开发者和专业用户来说,写实人像更漂亮当然重要,但真正影响生产效率的是连续角色一致性、复杂文字排版、局部编辑、参考图遵循和多轮修改。
复杂文字渲染仍是判断模型代际差异的关键压力测试。 一张包含菜单、海报标题、价格标签、品牌标识和多语言小字的信息图,可以同时检验字符正确率、布局理解、视觉层级和提示词遵循;模型即使能画出逼真的街景,只要招牌文字乱码,就很难进入广告与电商生产流程。
图像编辑能力比一次性生成更能决定模型的商业价值。 用户真正需要的往往不是“再生成一张”,而是保留人物、只换背景,固定构图、只改衣服颜色,或者删除画面中的一个物体且不改变其他区域;这要求模型理解哪些像素该动、哪些语义必须锁定。
角色和商品一致性决定了模型能否承担批量内容生产。 如果同一个人物换一个场景就变脸,同一双鞋换一个角度就改变结构,那么模型再有审美,也只能用于灵感草图,无法稳定生成系列海报、分镜或商品素材。
高分辨率不是唯一指标,单位时间内获得可用结果的概率更重要。 假设旧模型生成 10 张只有 3 张可用,新模型生成 10 张有 6 张可用,即使单次速度和价格不变,实际有效成本也会下降 50%;遗憾的是,mona-lisa-1 目前没有公开足以计算这一指标的数据。
Arena排名也有边界
LM Arena的结果更接近“用户偏好投票”,而不是完整的工程验收报告。 一张色彩更鲜艳、细节更密集的图片,可能在快速二选一时占优势,但它未必具有更准确的文字、更忠实的参考图遵循或更低的批量失败率。
竞技场排名会受到提示词分布和投票人群影响。 普通用户可能更偏爱电影感、强光影和高饱和度,设计师则更关注留白、可编辑性与品牌一致性;如果测试样本偏向审美生成,模型的工具属性就可能被低估。
匿名测试仍然是正式发布前很有效的产品信号。 它至少说明某个团队愿意把模型放到真实用户面前,与当前头部产品直接竞争,而不是只展示经过筛选的官方样片。
GPT-Image 2 当前仍稳居头部,意味着mona-lisa-1必须证明自己不是“少数样例更惊艳”。 如果新模型只是增加纹理、降低平滑感,却牺牲指令遵循和编辑稳定性,它更像一个风格偏好的检查点,而非真正的代际升级。
“GPT-Image 2.5”是合理猜测,但证据不足
mona-lisa-1 更像 GPT-Image 2 同代技术栈上的新检查点,而不一定是全新基础架构。 社区将其称作“GPT-Image 2.5”或“中杯版本”,主要依据是生成风格接近、知识范围传闻相似,以及升级集中在真实感和细节层面。
检查点是模型在某个训练阶段保存的一组参数状态。 同一个基础训练体系可以衍生多个检查点,它们可能分别偏向写实、文字渲染、编辑或低延迟,也可能经过不同的后训练与人类偏好优化。
现有知识截止时间传闻彼此冲突,因此不应被写成确定参数。 部分消息称其训练数据可能停留在 2025 年 5 月前后,另一些转述则称与 GPT-Image 2 相同、截至 2025 年 12 月;在没有官方模型卡和可复现实验前,两种说法都不能作为型号判断依据。
模型在图片里“自报家门”同样不是可靠证据。 生成模型可能根据提示词、训练语料或上下文写出某个产品名称,这与语言模型产生幻觉类似,不能替代服务端标识、签名信息和官方文件。
开发者现在不用急着改产品
mona-lisa-1 目前没有进入 ChatGPT、OpenAI 正式接口或 Codex 等产品通道。 这意味着开发者既无法稳定选择该模型,也不知道其价格、速率限制、输出尺寸、编辑能力、内容政策和服务等级。
现在最值得做的是整理一套自己的图像回归测试集。 一旦模型正式发布,开发团队可以用固定提示词和参考图,对人物一致性、中文文字、局部编辑、材质表现、失败率和生成延迟进行横向比较,而不是被社交平台上的几张精选图片带着走。
建议至少覆盖以下任务:
- 写实人物: 观察皮肤、头发、牙齿、手部和眼镜反射是否自然。
- 中文海报: 检查标题、小字、数字、标点及多行排版准确率。
- 商品结构: 检查鞋带、拉链、瓶盖、接口等结构是否保持一致。
- 多轮编辑: 连续修改背景、服装和光线,确认未指定区域是否漂移。
- 参考图遵循: 测试构图、身份、风格和色彩能否分别锁定。
- 批量稳定性: 每条提示词至少生成多次,统计可用率而非只看最佳结果。
- 内容凭证: 检查下载、压缩及发布到平台后,来源信息是否仍可验证。
价格和速度可能比画质差异更快决定产品是否迁移。 如果新模型质量只提高少量,却把生成延迟或单张成本推高一倍,它未必适合实时广告、游戏素材和大规模电商场景;如果它能在相近成本下把首轮可用率显著提高,才会对现有工作流形成真正冲击。
OpenAI正在把生图变成基础能力
mona-lisa-1 暴露出的方向,是 OpenAI 正在继续削弱“模型作品感”,让生成图片更像普通相机、设计软件和商业制作流程的自然产物。 这比继续堆叠某种固定审美更难,因为模型不仅要生成更多细节,还要理解哪些细节在物理和语义上应该存在。
来源验证会随着画面真实感提升而变得更重要。 当肉眼越来越难区分生成图与真实照片时,C2PA、水印和平台侧验证不再只是附加功能,而会成为新闻、广告、电商和社交平台的基础设施。
这次盲测更像一次产品路线预告,而不是一次正式发布。 它说明 OpenAI 的下一轮图像升级已经进入真实用户评估阶段,但在官方公布模型名称、系统卡、定价和接入方式之前,把它称为 GPT-Image 2.5、GPT-Image 3 或 GPT-Image 2 Mini 都为时过早。
对普通用户来说,现在可以关注;对开发者来说,现在应该测试思路,而不是押注型号。 真正值得等待的不是“蒙娜丽莎”这个代号揭晓,而是它能否在文字、编辑、一致性、速度和有效成本上同时超过 GPT-Image 2。
参考来源
- IT之家:神秘生图模型“mona-lisa-1”曝光——介绍模型进入 Arena 盲测、OpenAI 来源信号检测结果,以及与 GPT-Image 2 的初步对比情况。



