GPT Images 2.5 突发上线!
OpenAI 发布新一代图像生成模型 ChatGPT Images 2.5。官方表示,新模型重点提升了图片细节质量、生成速度、编辑精度以及多轮修改过程中的一致性,并新增 Sketch 手绘参考、创作模板、图片评论编辑等功能,让用户能够更接近专业
设计流程完成 AI 创作。
OpenAI 称,目前用户每周通过 ChatGPT Images 和 API 中的 GPT Image 系列模型生成超过 30 亿张图片。Images 2.5
的推出,意味着 OpenAI 希望进一步扩大 AI 图像工具在个人创作、营销设计、产品视觉等场景中的使用范围。
相比上一代 Images 2.0,Images 2.5 最大变化在于对「修改」的理解能力提升。
过去,AI 绘图通常更擅长从零生成一张图片,但当用户要求调整某个细节时,模型容易误改其他部分。例如修改人物服
装时,可能改变脸部特征;调整背景时,可能导致整体风格发生变化。OpenAI 表示,Images 2.5 在精准编辑方面进行
了优化,能够更准确执行用户指定的修改,同时保留原有主体、构图和视觉风格。用户可以针对产品、背景、文字等单
个元素进行调整,而无需重新生成整张图片。真就指哪打哪。
OpenAI 展示的案例中,一张人物照片可以被转换成不同场景和风格,例如将普通人物头像改造成复古摄影棚写真,或者
将宠物照片转换成新的视觉主题,同时保持原始人物和动物的关键特征。尝试了 Images 2.5 多个不同类型的生成任务。
比如在人像生成测试中,我尝试要求模型保持参考人物面部特征,生成一张高清摄影创意作品。
实际效果显示,Images 2.5 对参考人物特征的保留能力有所提升。模型能够在改变摄影风格、服装和环境的同时,让人
物身份保持较高一致性。而且现在,Images 2.5 也终于能够通过数字直观显示图片生成进度了。
根据网友的测试,甚至还能在生成图像期间玩贪吃蛇。
在街头摄影风格下,马斯克的「人生照片」也是有了。
除了人物,Images 2.5 对产品视觉设计的理解也有所增强。在一个商品设计测试中,我要求模型生成一只完全由柔软毛
绒材质构成的可乐罐。
在复杂视觉逻辑测试中,我尝试生成一个递归画面。提示词要求「一只橘猫坐在办公室椅子上拿着 iPad,iPad 屏幕中又
显示同一只猫拿着同一个 iPad,并不断循环」。
这种递归结构需要模型同时理解主体、屏幕内容以及重复关系。生成结果能够识别这种视觉嵌套关系,完成多层递归效
果。除了写实图片,Images 2.5 对复杂艺术风格的理解也有所提升。
和前代一样,Images 2.5 在中文这块表现亮眼。
整体来看,Images 2.5 的提升主要体现在三个方面。一是对复杂提示词的理解能力增强,能够同时处理多个风格、主体
和限制条件。二是参考图保持能力提升,人物、产品等核心元素在多次修改过程中更加稳定。三是编辑流程更加接近真
实设计工作,用户可以围绕同一张图片持续调整,而不是反复生成新的结果。
不过 Images 2.5 也不是没有缺点,比如噪点这一块依旧可以说是灾难级别的。
面向开发者,OpenAI 同步推出两个 API 图像模型。其中,GPT Image 2.5 Flare 是面向大多数应用场景的默认模型,在质量
编辑能力和速度方面进行了升级。OpenAI 表示,相比 GPT Image 2,该模型能够提供更高质量的图片,同时将延迟降低50%,
适用于社交内容、电商视觉、视觉搜索和大规模图片生成等场景。
另一款 GPT Image 2.5 Sunburst 则面向更高要求的创意工作流程,强调更精细的控制能力,适用于广告素材制作、高端产品
图片设计等场景。
目前,ChatGPT Images 2.5 已向 ChatGPT、ChatGPT Work 和 Codex 用户开放,覆盖桌面端、移动端和网页端。API 用户则
可以调用 GPT Image 2.5 Flare 与 GPT Image 2.5 Sunburst。
生活不需品
页:
[1]