Загружаем каталог…
Загружаем каталог…
混元图像 3.5 预览版主打「画字更准」与「排版增强」,效果逼近 GPT Image 2 的九成,价格只要七分之一。作者拿它给一个虚构咖啡品牌做全套开业物料,从 Logo、产品图一路做到门店海报,中文排版到底能不能商用,这篇给出了实测答案。 这几天,我刷到 OpenRouter 官方发布的一张图。他们用同一句提示词让 20 个图像模型分别生图,按实际计费一算,发现最贵和最便宜的模型,价格竟然差了 22 倍。 22 倍!我第一反应是: 那便宜的模型和贵的模型,效果到底差多少? 可惜官方并没有给到非常详尽的横评,如果大家感兴趣的话,可以空了安排一下。 不过,要论生图的性价比,那还得看国产。 最近,腾讯上线了 混元图像3.5预览版 (Hy Image3.5 preview),主打「画字更准」和「排版增强」,可达到 GPT Image 2 九成以上的效果,价格却只要七分之一。 正好朋友最近搞了个咖啡新品牌「栖山咖啡」,我干脆给自己接了个活:用它做一整套开业物料。 中文排版能不能用、能不能反复改,干完这单自然有答案。 一手测评 新模型刚刚上线,在腾讯自家的设计 Agent Miora 上,甚至还可以免费白嫖一波。 1)品牌初建:直出Logo与产品图 一个品牌要立起来,Logo 和产品图是绕不开的基建。所以我先尝试用 Hy Image3.5 preview 做了一套品牌资产。 提示词: 极简矢量 Logo 设计,2×2 网格展示同一品牌的四种构图变体,白色背景。品牌:虚构咖啡品牌「栖山咖啡」,山形图标 + 中文品牌名。 四格分别为: 左上:拱形排列——山形图标居中在上,中文「栖山咖啡」沿拱形排在图标下方; 右上:图标与字标左右并置——左侧山形图标,右侧横排「栖山咖啡」; 左下:纯文字版——只有中文「栖山咖啡」,字重粗壮,无图标; 右下:带副标题版——山形图标 +「栖山咖啡」+ 下方小字「秋日市集限定」。 焦糖棕单色,扁平矢量,线条干净,无渐变无阴影。全中文,中文不得错字、缺笔、变形。1:1 方形。 3:4 竖版商品实拍图。一袋牛皮纸咖啡豆袋立于浅灰色无缝背景前,袋身正面贴米白标签:上半部分是山形 logo 与中文「栖山咖啡」,下半部分是中文「秋日市集限定 · 中深烘焙」。旁边一只白色陶瓷咖啡杯,杯身烫印同样的山形 logo 与「栖山咖啡」。商业棚拍质感,柔和顶光,纸张纹理与陶瓷釉面反光真实,85mm 镜头。避免塑料感、错误反射、明显 CGI 感。 可以看出来,这次混元的新模型在对细节的理解和把控上相当稳。 给到我的 LOGO 比我想象的有设计感,不是烂大街的随便敷衍两笔。 但光有基础包装不够,我又追加了一组专业的微距咖啡豆细节图。 提示词: 咖啡豆与陶瓷咖啡杯微距摄影:几颗烘焙咖啡豆散落在牛皮纸咖啡豆袋开口处,100mm 微距镜头,突出咖啡豆的油脂光泽、表面纹理、豆袋纸张纤维与麻绳捆扎细节,杯身釉面反光与细微使用痕迹。商业棚拍质感,柔和侧光,浅景深,RAW 照片质感,焦糖棕与米白色调。避免塑料感、错误反射、畸形结构及明显 CGI 感。3:4 竖版。 咖啡豆微距(Hy Image3.5 preview) 咖啡豆微距(GPT Image 2) 这张图,我分别用两个不同的模型都跑了一次。 Hy Image3.5 preview 的表现让我非常惊喜——不仅豆子的油脂、袋口的纸纤维、麻绳上的细节表现得淋漓尽致,连杯沿那点釉面反光都极其逼真。 我是真没看出来任何“AI 味”,甚至带了不少专业摄影师的布光风范。 不过对于“散落在开口处”这几个字,两个模型的理解不太一样。 2)产品图背景随意换:电商主图的生死线 海报做得再好,真实世界的活儿往往不会这么一路顺下来。我紧接着甩了一个常见难题:“手上只有一张产品图,能不能直接丝滑换背景出图?” 打底图,用的是刚刚的商品参考图。接下来,两个场景共用一段锁定描述,只换背景: 提示词: 场景1·咖啡馆吧台: 严格保留参考图中的白色陶瓷咖啡杯与牛皮纸咖啡豆袋不变:杯形、袋形、山形 logo、杯身烫印「栖山咖啡」、袋身中文标签「秋日市集限定 · 中深烘焙」,一字不错、一处不动。只更换场景:独立咖啡馆的木质吧台上,暖色吊灯照明,背景虚化出手冲吧台和咖啡师剪影,杯中有刚倒好的拿铁。写实摄影,85mm 镜头质感,保留材质真实纹理,避免塑料感、错误反射、明显 CGI 感。3:4 竖版。 场景2·居家晨光: 严格保留参考图中的白色陶瓷咖啡杯与牛皮纸咖啡豆袋不变:杯形、袋形、山形 logo、杯身烫印「栖山咖啡」、袋身中文标签「秋日市集限定 · 中深烘焙」,一字不错、一处不动。只更换场景:居家窗边的原木小桌上,清晨柔和的斜射光,旁边有一本翻开的书和一小盆绿植,窗外虚化成暖色光斑。写实摄影,50mm 镜头质感,保留材质真实纹理,避免塑料感、错误反射、明显 CGI 感。3:4 竖版。 结果极其惊喜。结构、包装上的中文、Logo 都保持的很稳定, 甚至连纸袋子上面那个不起眼的「S」包装小字,都被完好无损地保留了下来 。 不仅杯袋光影自然融入了新环境,不同光线下投射在不同台面上的阴影也模拟的很自然。 3)多约束海报直出:改字修图一条龙 搞定了产品,接着来做宣传海报。 如果不知道怎么写提示词也没关系,Hy Image3.5 preview 自带了一个非常贴心的功能:一键扩写提示词。 提示词: 请为这个咖啡品牌设计一张中文商业宣传海报,画面需体现品牌调性与产品特色。具体要求:整体风格温暖高级,色调以深棕、奶白与焦糖色为主,可加入咖啡豆、蒸汽、拿铁拉花等元素;构图采用主体居中或三分法布局,突出品牌 Logo 与核心视觉焦点;光线柔和自然,营造手冲咖啡的质感与氛围;画面上方或中央配置简洁有力的中文主标语与副标题,字体选用现代无衬线或书法体以适配品牌气质;预留产品名称与价格信息的位置。整体呈现出精致、有格调的商业广告效果。 第一版出图后,如果里面的细节文字不是特别满意,还可以直接在 Hy Image3.5 preview 里选择「文字替换」,修改对应的文字重新生成。 当然,也可以直接用自然语言去修改替换对应的画面。 整个修图过程,相当丝滑,除了要改的地方,其他一点没崩。 也算是真正实现“指哪打哪”了。 4)信息图:一张图塞进一本说明书 还记得当初让 GPT Image 2 一战成名的一个检验标准,就是中文高密度信息图。 所以这次,我干脆也来挑战一下 Hy Image3.5 preview 的能力边界,让他生成了一页「手冲咖啡指南」。 提示词: 请生成一张高密度信息图风格的说明书,主题为「手冲咖啡指南」。 要求:整体采用信息图(infographic)版式,信息层级清晰、图文密集而不杂乱;包含手冲咖啡的关键要素,如所需器具清单、咖啡豆与水的推荐比例、水温范围、研磨度、注水与闷蒸步骤流程、总萃取时间,以及常见风味影响因素。 视觉风格简洁现代,配色以咖啡棕、米白、深灰为主,搭配少量强调色;使用图标、数据标注、分步骤编号与流程箭头增强可读性。 版式适合竖版长图海报,文字为中文,标题醒目,重点数据突出显示。 手冲咖啡指南(Hy Image3.5 preview) 手冲咖啡指南(GPT Image 2) 事实证明,两个模型的表现都很不错,即使在复杂排版下,也没有出现文字变形或乱码的情况。 我甚至单独放大了 Hy Image3.5 preview 的小字细节,竟然也非常清晰准确,确实达到了 Image2 的九成功力。 这一步跨过去,这个模型在我这儿也算是真正的“能打”了。 5)换个画风做社媒海报 有了前面的资产,换个画风再发一轮社交平台,自然是水到渠成。 提示词: 请为「栖山咖啡」设计一张插画风格的秋日市集宣传海报。要求:整体采用温暖的手绘插画风,色调以秋日的橘棕、金黄、枫红与暖米色为主;画面可包含咖啡杯、落叶、南瓜、市集摊位、木质纹理等秋日元素,构图层次分明、留白舒适;搭配柔和光影与细腻的颗粒质感,营造温馨治愈、充满季节氛围的市集感;排版注重主标题与信息的清晰可读,融入品牌「栖山咖啡」的名称或标志,风格统一、富有手绘艺术气息。 这一组图我依然是用了两个模型来对比,毕竟 GPT Image 2 在生图的创造力和审美上一直都出了名的优秀。 但 Hy Image3.5 preview 的表现这次同样让我惊喜,在手绘插画上体现出了该有的温暖颗粒感与细腻光影。 而事实证明,参考图有时候确实会很大程度的限制模型的想象力。 6)市集现场手机抓拍 再来看看 Hy Image3.5 preview 在写实场景下的表现,结果也相当不错。 我试了两组写实抓拍:一张是秋日市集的现场,一张是情绪氛围感的人像。 提示词: 用手机拍摄的秋日市集现场,傍晚,从人群中微微仰拍,画面略微倾斜。画面中央是「栖山咖啡」的市集摊位:木质餐车上方挂着一块发光的中文灯牌「栖山咖啡 · 秋日市集」,高亮发光字体在傍晚天色中微微溢出光晕;摊位前两三个人排队,手持纸杯。暖色串灯、枫叶装饰,背景是虚化的市集人群。 画面存在噪点、轻微模糊、HDR 不均衡,亮部灯牌略过曝,暗部有细节丢失,真实随手拍风格,iPhone 实拍质感。除灯牌外不出现其他可读文字,中文不得错字、缺笔。3:4 竖版。 模拟市集现场手机抓拍 提示词: 一张情绪氛围人像:夜晚的市集街道,年轻的中国女性侧身回头看向镜头,背景是收摊中的市集,暖色串灯和路灯形成光斑与动态模糊。复古色调,富士胶片相机风格,粗颗粒感,85mm 镜头,浅景深。避免过度磨皮、避免塑料感。3:4 竖版。 收摊时的情绪片 第一张图里,过曝的光晕、噪点、色差都非常接近真实拍摄,镜头虚化得也很自然。 第二张图里,富士胶片的颗粒感、串灯拖出来的光斑、回头的那个角度,以及最考验 AI 的人手。都非常完美。 这种身临其境的烟火气,说是我亲自去现场拍的,你们估计都会信吧? 7)多参考修图 在修图这个场景,这次我也来了个猛的。 我一次性喂了 5 张参考图:现场抓拍、商品图、情绪片、毛线材质、毛绒玩偶,尝试让模型理解后生成最终的融合图。 提示词: 把图2的咖啡杯和图4的毛绒枫叶玩偶合体之后,放在图1市集摊位的木质餐车上,卡通眼睛看着镜头。参考图3中串灯的样式外观,将暖色小灯零散地漂浮在图1画面各处,把图1的餐车墙面材质整体换成图5的针织毛线材质。整体呈现梦核的怪诞感觉,色调保持秋日暖棕。 结果让人叹为观止:玩偶和咖啡杯成功合体上了餐车,玩偶长了双卡通眼睛盯着镜头;小灯散在画面各处,背景墙换成了针织毛线;而原来的灯牌和人群还在原位没动。 图片也按照参数自然调整为了 16:9 的横版。 这么天马行空的修图逻辑被稳稳接住,多图融合能细致到这个程度,是我完全没料到的。 8)彩蛋:顺手做了个经营小游戏UI 最后,再来个彩蛋。趁着手热,我顺便尝试做了一款横版经营手游的界面。 提示词: 20:9 横屏治愈系模拟经营手游主界面截图。背景:秋日市集里的一间木质咖啡小店,暖色灯光,柜台后有手冲吧台,窗外飘枫叶。UI:左上椭圆等级「Lv.12」;左侧细线图标纵列「订单·菜单·仓库·店员」;右侧 24% 复古纸片菜单+一张票券「开店 OPEN」;底部渐暗区一行中文台词「今天的第一杯,要加一份秋天吗」。手绘质感、纸张纹理,焦糖棕、暖沙色、墨绿、象牙白配色,UI 克制不挡景。全中文(票券英文除外),中文不得错字、缺笔。避免写实照片感、避免杂乱图标。 满满的氛围感这不就来了?直接拿去当游戏 Demo 的概念宣发图都毫不违和。 写在最后 说实话,折腾完这十多张图,如果非要问我最真实的感受是什么,绝对不是一句干巴巴的“AI终于能写对中文了”。 而是我作为创作者,长期以来养成的一个肌肉记忆被打破了。 以前用 AI 做商业图,画面再惊艳,只要碰到文字,我默认就是当没看见——反正最后都得进 PS 里抹掉重新排版。文字对以前的 AI 来说,就是个质感贴图。但这一次,一整套开业物料从头跑到尾,我居然没有打开过一次 PS 去抠字、补字。 当AI不需要你再去给它擦屁股的时候,它才算真正进到了工作流里。 不过,这次真正让我觉得有意思的,是我自己的心态变化。 以前用便宜的或者免费的AI图像模型,图一刷出来,我下意识的反应就是去找茬,看看哪里手画崩了,哪个字又拼成了乱码。 但这次用 Hy Image3.5 preview 跑图的时候,我盯着屏幕,脑子里盘算的竟然是:“哎,是不是我刚才给的提示词还不够准确?” 当你不再去挑工具的毛病,而是开始反思自己的想象力和表达能力时,这就说明这个工具已经跨过了及格线,把压力给到了人这一边。 如果你自己也做设计或者运营,Hy Image3.5 preview完全值得一试,我只有一句非常实在的建议: 趁Miora现在还在免费测试期,别去计算什么积分额度了。 平时那些脑洞太大、怕烧钱一直不敢跑的复杂场景,现在不拿去白嫖,还等什么呢? 本文由人人都是产品经理作者【沃垠AI】,微信公众号:【沃垠AI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。 题图来自Unsplash,基于 CC0 协议。
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
实测腾讯最新图像模型,GPT Image 2的最强国产平替来了. 混元图像 3.5 预览版主打「画字更准」与「排版增强」,效果逼近 GPT Image 2 的九成,价格只要七分之一。作者拿它给一个虚构咖啡品牌做全套开业物料,从 Logo、产品图一路做到门店海报,中文排版到底能不能商用,这篇给出了实测答案。 这几天,我刷到 OpenRouter 官方发布的一张图。他们用同一句提示词让 20 个图像模型分别生图,按实际计费一算,发现最贵和最便宜的模型,价格竟然差了 22 倍。 22 倍!我第一反应是: 那便宜的模型和贵的模型,效果到底差多少? 可惜官方并没有给到非常详尽的横评,如果大家感兴趣的话,可以空了安排一下。 不过,要论生图的性价比,那还得看国产。 最近,腾讯上线了 混元图像3.5预览版 (Hy Image3.5 preview),主打「画字更准」和「排版增强」,可达到 GPT…
Открыть источник