实用教程

Opus 5.5 和 Astra 谁更适合设计?用三个任务做选择

用同一需求、局部修改和可用交付比较 Opus 5.5 与 Astra。附 20 分验收表、完整提示词与单个可用结果的成本算法。

香水广告印稿与赭红色铅笔批注,呈现创意修改工作台。

可以把目前交给 Astra 的设计任务拿给 Opus 5.5 试一轮,但换工作流之前,要比较交付文件和返工量。一次有用的试用应包括提出创意、精确修改和可用交付三个环节。一张好看的截图只能回答其中一部分问题。

Anthropic 于 9 月 22 日发布了 Opus 5.5。编程成绩不能直接衡量广告质量。下面给的是一套对比方法,不是 Panelly 已完成的模型实测。

用同一个虚构项目开始

假设要推广一款蓝色折叠手机支架,受众是在小餐桌旁开视频会议的人。给两个模型相同的正面照片、折叠图和已知尺寸。这个练习唯一批准的卖点是支架能让手机立起来,不要增加充电、防水或虚构折扣。

开始前保存需求原稿。两边使用相同的素材、可用工具、输出格式和时间额度,并记录所用应用与模型设置。没有执行工具的网页聊天,与能够查看网页渲染结果的智能体相比,差异不只来自模型。

环节交付物能看出什么
创意三个广告方向,各含四格叙事是否换了说服思路,而不只是换形容词
修改只改支架颜色和最后的 CTA已通过的构图与商品事实能否保留
交付放入所选广告的响应式 HTML 概念页好看的提案能否变成可用文件

保留每轮第一次输出,包括失败结果。每轮只追加一次反馈;如果不限次数地补救,就很难判断哪个模型真正节省了时间。

评分前先定一票否决项

每项打 0–2 分:0 分代表不可用,1 分代表需要明确修正,2 分代表满足本次需求。先隐藏模型名称再评分。以下权重刻意让商品真实性高于装饰效果。

项目权重看什么证据
商品与批准卖点准确3外形、功能、文案与资料一致
创意思路不同2三个方向使用不同场景或顾虑
视觉层级清楚2能辨认商品、承诺和下一步动作
修改范围受控2只改变明确要求的细节
文件可以交接1文件能打开,移动端正常,链接符合要求

单项分数乘以权重,满分 20。即使画面得分很高,只要编造了商品功能,就不应通过。这是编辑验收方法,不是科学基准测试。团队使用时,可让另一位同事独立评分;意见不一致就回到具体作品上讨论。

可直接使用的对比提示词

为附件中的蓝色折叠手机支架提出三个广告方向。受众:在小餐桌旁开视频会议的人。已确认事实:它能让手机立起来。未知:充电、防水、价格。不要编造这些信息。
每个方向说明受众问题、视觉钩子、四格顺序和一个 CTA。三个方向的说服思路必须不同。随后推荐一个方向,用两句话解释取舍。
我选定后,请使用实际可用的工具制作指定交付物。如果无法渲染或查看结果,请明确说明。保留商品身份,标题和 CTA 可以直接包含在完整广告图里。
第一版之后,我会提出一次局部修改。请说明改了哪里,以及实际执行了哪些检查。没有执行的检查不要写成通过。

第二轮,两边使用完全相同的要求:“按提供的奶油白参考图修改支架颜色,把 CTA 改为‘查看支架’,保留相机角度、版式和其余文案。”如果某个输出没有可继续编辑图片的路径,就记录这一限制,不要悄悄换一道题。

算每个可用结果的成本

能拿到实际账单时就用账单。举个假设例子:六次尝试共花费 $3.60,得到三个通过验收的文件,平均每个 $1.20。另一个模型共花 $2.40,却只有一个结果可用,单个成本就是 $2.40。总费用更低,不一定代表可用结果更便宜。还要单独记录人工修正分钟数;订阅额度不是 API 账单。

保留现有 Astra 工作流作为基线。把选中的创意和商品参考图带到 Panelly 创作台,先制作完整广告,再通过聊天调整。这个交接流程不表示 Panelly 已提供这两个模型供用户切换。

常见问题

分数高就代表广告效果好吗?

不是。它衡量的是是否满足需求。点击、购买和受众反馈,需要流量条件可比的独立投放实验。

什么时候值得切换?

当某类任务持续以更少修改通过验收时,就切换这类任务。另一个模型仍然擅长的工作可以继续交给它,不必找一个适合所有任务的总冠军。

资料与延伸阅读

Four panels. One ad.

让下一张广告,从这里开始。

聊聊商品、卖点和使用场景,让 Panelly 帮你创作四格广告。

开始创作 ↗查看次数包