ChatGPT Images 2.0 发布

OpenAI 推出了 ChatGPT Images 2.0,这是其图像生成系统的重大更新,提供了更高的精度、精细的风格控制,以及在众多全球语言中渲染复杂文本的能力。此版本将工具从简单的图像生成器转变为能够进行端到端资产创作的视觉思考伙伴,涵盖从研究与推理到精致最终视觉的全过程。

增强的精度和技术控制

ChatGPT Images 2.0 在遵循复杂提示和保持结构控制方面实现了显著更高的准确性。模型现在能够处理精细的布局和特定的技术要求,例如包括出血、裁切和安全边距线的专业印刷生产指南。

关键技术改进包括:

  • 灵活的宽高比:系统支持从宽阔的全景城市场景到垂直移动屏幕以及标准方形图像的广泛格式。
  • 多场景连续性:模型展示了在多个面板之间保持角色和叙事一致性的能力,如生成连贯的漫画页和叙事序列。
  • 复杂布局:它可以生成结构化的编辑内容,包括带有标题、标注、地图和统计数据的杂志风格信息图展开页。

多语言文本渲染与全球文字

版本 2.0 最突出的进步之一是能够在众多全球语言和文字中渲染可读且准确的文本。这消除了之前对非拉丁字符的限制,使得能够为不同地区创建面向市场的资产。

演示支持的文字和语言包括:

  • 东亚文字:日语、中文和韩语(包括用于酒店宣传册的高保真韩文字体)。
  • 南亚文字:印地语和孟加拉语。
  • 其他全球文字:阿拉伯语、天城文、斯拉夫文字(西里尔字母)和希腊语。

风格精致与写实

ChatGPT Images 2.0 扩展了其视觉词汇,以覆盖更广泛的风格光谱并提升保真度。模型可以在超写实摄影和高度风格化艺术之间切换,而不会失去结构完整性。

显著的风格能力包括:

  • 摄影写实:模型可以生成电影般的抓拍肖像、夜间闪光摄影(模拟胶片相机快照)以及纪录片风格的 35mm 黑白摄影。
  • 插画风格:在各种漫画风格(包括少年漫画和青年漫画)、独立漫画以及儿童图书插画方面具备高水平的熟练度。
  • 平面设计:能够使用大胆的排版和几何形态创建包豪斯风格海报、装饰艺术设计以及现代主义编辑布局。

视觉推理与智能

除了美学改进,ChatGPT Images 2.0 还集成了“思考模式”,充当视觉思考伙伴。这使得模型能够对请求进行推理,并将源材料转化为精致的视觉作品。

此集成智能的示例包括:

  • 教育可视化:生成复杂的数学证明(例如康托尔对角线证明)和教学布局,将抽象信息转化为清晰的视觉解释。
  • 研究翻译:将密集的研究论文(如原始 GPT-1 论文)转换为易于理解的会议风格信息图。
  • 情境准确性:利用最新的知识和搜索功能,根据当前真实世界信息生成准确的产品模型。

Sources