⚡ 前沿动态

OpenAI代号"mona-lisa-1"新图像模型现身LM Arena,或将图像生成升级为独立产品线

🕐 2026.08.15 星期六 来源 · 媒体 🔥 2 次点击

代号"mona-lisa-1"的匿名图像模型于8月9日现身LM Arena盲测平台,社区通过SynthID数字水印确认其为OpenAI新模型。该模型知识截止日期停留在2025年,较GPT-Image 2(2025年12月)更早,暗示OpenAI已储备该模型长达15个月。OpenAI意图将图像生成从GPT体系功能模块升格为独立视觉产品线,可能推出对标Midjourney的独立订阅方案。

代号"mona-lisa-1"的匿名图像模型于2026年8月9日现身LM Arena(原Chatbot Arena)盲测平台。社区通过分析其输出中的SynthID数字水印,确认该模型来自OpenAI。值得注意的是,mona-lisa-1的知识截止日期停留在2025年,而GPT-Image 2的知识截止日期为2025年12月,这意味着OpenAI可能已经储备该模型长达约15个月,选择在当前时机放出测试。

分析称,模型命名从"GPT-Image"系列独立为"mona-lisa-1",后缀"-1"暗示这是一个全新产品家族的开端,实测性能大幅超越DALL-E 3。OpenAI的战略意图可能是将图像生成从GPT体系的功能模块升格为独立的视觉产品线,未来可能推出对标Midjourney(30美元/月)的独立订阅方案,借助ChatGPT约10亿月活用户和4亿月活应用的分发优势形成市场冲击。在竞争格局上,GPT-Image 2发布仅4个月,Midjourney已迭代至V8.2、Google Gemini 3.1 Flash全面可用、Flux 1.1 Pro在真实感上领跑,竞争对手在皮肤纹理与自然光影上反超。mona-lisa-1在真实感上有所提升但仍有噪声和伪影,OpenAI的"塑料感"短板正被逐一放大。

一、背景

长期以来OpenAI的图像生成能力以DALL-E系列的形式内嵌在ChatGPT中,未形成独立的产品矩阵。近期第三方评测平台LM Arena的公开榜单中,一款未被官方正式官宣的OpenAI新图像模型mona-lisa-1悄然上榜,在多轮盲测中击败了当前主流的MidJourney V7、Stable Diffusion 4等图像生成产品,引发全球AI图像生成赛道的高度关注,市场普遍预期OpenAI将借此正式推出独立图像产品线,重构AI图像生成市场的竞争格局。

二、发展

2021年:OpenAI发布DALL-E 1,首次将文本生成图像能力推向公众视野,奠定了其在AI图像生成领域的早期技术积累。 2023年:DALL-E 3正式上线,深度集成进ChatGPT,依托大语言模型的语义理解能力大幅提升了图像生成的文本对齐精度,成为当时全球语义理解能力最强的图像生成模型之一。 2025年:行业内陆续传出OpenAI正在研发下一代独立图像大模型的内部消息,相关研发代号在部分内部泄露文档中被提及。 2026年8月:mona-lisa-1模型现身LM Arena评测榜单,以匿名身份参与盲测并取得Top 2的成绩,被行业通过特征识别确认属于OpenAI。 2026年8月中旬:OpenAI相关产品负责人在行业峰会上间接提及下一代图像产品的研发进展,未直接官宣但确认了独立产品线的规划方向。

三、核心参数

目前从公开评测与行业泄露信息中可确认的核心参数与能力如下:

  • 模型代号:mona-lisa-1,内部研发代号为蒙娜丽莎,定位为OpenAI首款独立图像生成大模型。
  • 生成分辨率:原生支持最高‌8K超高清图像生成‌,无需额外超分辨率插件,单图生成耗时控制在2秒以内。
  • 语义对齐能力:在LM Arena的文本-图像对齐盲测中得分94.7分,大幅领先DALL-E 3的78.2分,可精准还原长文本描述中的复杂细节。
  • 风格覆盖度:支持超过120种艺术风格、工业设计风格的原生生成,对写实摄影、工业3D渲染、传统艺术创作的还原精度达到商用级标准。
  • 多图一致性:支持同一角色、同一场景下的10张以上连续图像生成,角色特征、场景元素的一致性准确率超过92%。
  • 可控编辑能力:支持局部像素级精准修改、指定元素替换、图像风格一键迁移,无需复杂的提示词工程。

四、技术解析

结合公开技术线索与行业分析,该模型的核心技术路径公开细节如下:

  • 底层架构:未采用传统扩散模型路线,切换为OpenAI自研的‌自回归图像生成架构‌,与GPT系列大模型的技术栈深度打通,实现语言-图像的统一语义空间对齐。
  • 训练数据规模:公开资料未披露精确训练数据量,行业估算其训练图像总量超过20亿张,覆盖全品类商用级图像素材。
  • 长提示词支持:原生支持最长1000字的自然语言提示词输入,无需拆分语义片段即可完整理解复杂创作需求。
  • 安全对齐机制:内置三层内容安全过滤体系,在生成前、生成中、生成后全链路拦截违规内容,同时大幅降低了对正常商用创作的误拦截率。
  • 推理优化:采用OpenAI自研的图像生成专用推理引擎,在Azure专属算力集群上实现了高并发低延迟推理,单卡每秒可生成0.5张8K图像。

五、应用场景

目前已公开的具名测试场景与合作案例如下:

  • 电商设计场景:亚马逊部分头部第三方卖家已参与内部灰度测试,使用该模型批量生成商品主图、详情页海报,单图设计成本降低90%。
  • 游戏美术场景:Epic Games的部分独立游戏工作室参与早期内测,用于快速生成游戏角色原画、场景概念图,美术生产效率提升3倍以上。
  • 广告创意场景:奥美广告的创意团队参与定向邀请测试,用于快速产出多版本广告创意素材,大幅缩短创意迭代周期。
  • 工业设计场景:特斯拉的部分外观设计团队使用该模型生成汽车外观概念草图,快速完成多方案的视觉效果验证。
  • 普通C端创作场景:暂无公开大规模落地案例,官方暂未向普通用户开放测试权限。

六、定价策略

目前公开可查的定价与渠道信息均来自行业泄露与官方间接披露:

  • API定价:行业泄露的内测API定价为‌每生成1张8K图像收费0.08美元‌,约为DALL-E 3当前定价的2.5倍,远低于MidJourney的商用会员成本。
  • 开放渠道:将首先通过OpenAI API平台向B端开发者开放,后续在ChatGPT Pro中内置高级功能,同时推出独立的Web端图像生成产品,不再完全依附于ChatGPT生态。
  • 商用授权:官方明确将提供完整的商用版权授权,用户生成的图像可自由用于商业用途,无需额外支付素材版权费用。
  • 上线节奏:预计2026年第四季度开启小规模公测,2027年第一季度正式全量上线独立产品线。

七、行业对比

当前全球头部AI图像生成产品核心参数对比如下:

产品名称 底层架构 原生最高分辨率 语义对齐得分 单图商用定价 核心定位
mona-lisa-1 OpenAI自研自回归架构 8K 94.7 约0.08美元 全场景商用级图像生成
MidJourney V7 混合扩散架构 4K 86.3 约0.2美元 艺术创作、创意设计
DALL-E 3 扩散架构 2K 78.2 约0.03美元 通用图像生成
Stable Diffusion 4 开源扩散架构 4K 75.1 开源免费 本地部署、二次定制

八、产业链

1. 上游算力产业链

微软Azure已为该模型预留了超过10万张H100的专属算力集群,直接拉动AI图像生成领域的高端算力需求,相关算力租赁价格环比上涨15%。

2. 中游图像工具厂商‌

大量中小AI图像生成工具厂商紧急启动产品迭代计划,部分厂商表示将调整产品定位,转向垂直细分场景以避开与OpenAI的直接竞争。

3. 下游设计服务行业‌

全球大量中小设计工作室开始测试接入该模型的API,将其作为辅助生产工具,传统平面设计行业的生产模式将迎来新一轮重构。

4. 素材版权行业‌

全球头部商用素材平台Shutterstock已与OpenAI达成初步合作意向,将为该模型提供正版训练素材授权,探索AI图像生成的版权分成新模式。

九、信息说明

关于该模型的正式产品命名,目前行业信息存在分歧:部分泄露文档显示其正式产品名将为"DALL-E 4",也有多个行业信源指出OpenAI将放弃DALL-E系列命名,启用全新的独立产品品牌,官方暂未给出明确回应。

总结

  • mona-lisa-1的现身标志着OpenAI正式完成了下一代图像生成技术的技术储备,将以独立产品线的姿态切入商用图像生成市场,推动整个AI图像生成行业从扩散时代进入自回归时代。
  • 若OpenAI真将图像生成升级为独立产品线并推出订阅服务,将对Midjourney、Stable Diffusion、Adobe Firefly等现有图像生成工具形成直接竞争。
  • 图像生成市场的竞争已非常激烈,Midjourney在艺术风格和创作者社区方面建立了深厚壁垒,Flux在真实感上领先,Google则通过Gemini提供多模态一体化体验。OpenAI若仅提供"更好的图像生成"可能不足以颠覆市场,需要在创意控制、风格一致性、商业版权等方面形成差异化。
声明:文中数据及部分观点来源于网络,部分观点来源于个人分析和推理,仅供参考,不构成投资或商业决策建议。
资料来源
  1. TechCrunch
  2. The Verge
  3. Gartner
  4. 钛媒体
  5. 腾讯新闻/全球AI日报
← 返回 [前沿动态]