DesignGo Bench / v260916Machine review draft · 2026.09.23
Three models · twenty-five briefs · one review field

25 道题,
三种设计取向。

把同题产物放进同一个视觉坐标系:看见它们如何选择信息、建立焦点、表达概念,并完成真实媒介中的交付。

截图 + 差异清单 + 雷达图 + 逐题确认。评分结合代表性画面、完整文件和生成轨迹,不代替专业设计师盲评。

HierarchyReadabilityCompositionConceptFitDelivery
75组模型产物截图
25张同题并排对照
6项 Design 观察维度
01 / CONSISTENCY

GPT-6 Astra

偏向编辑式层级、证据组织与交付完整。跨题稳定,通常用留白和明确阅读路径降低复杂度。

02 / EXPRESSION

Claude Opus 4.8

偏向品牌气氛、情绪峰值和大胆构图。在活动与品牌题中更有张力,部分题目的交付媒介偏离要求。

03 / DENSITY

DeepSeek Flash

偏向高密度界面、深色工具感与直接业务判断。效率明确,个别题目的层级和成品打包仍需复核。

CORE FINDINGS / DesignGo Bench v260916:25 题 × 3 模型产物与轨迹审查

运行完成,
不等于设计通过。

这批样本能证明三个模型都完成了 25 题的运行链路,却不能直接得出 PDR 或专业设计排名。评审必须把“运行状态”、“交付形式”、“最终设计质量”和“真实修改能力”分开。

RUNNER COMPLETION75 / 75

所有 agent output、task completed 与 status 均显示成功。这只是运行器完成率,不是专业通过率。

ASTRA DELIVERY25 / 25

都能找到与题面一致的主要交付类型,且经常带 PDF、源文件和验证材料;这不直接代表内容或审美优胜。

CLAUDE FORMAT GAPS4 题

Q03、Q08、Q09 把演示文稿交成 HTML,Q25 缺要求的 AI 文件。视觉表现与媒介遵循需分开判断。

DEEPSEEK PACKAGE GAPS2 题

Q08、Q16 轨迹称已生成成品,但本地包和 file list 均缺主要输出;同时 Q01 保留了可复算的统计口径错标。

MEDIAN EXECUTION TIME68.8 / 13.8 / 9.9

Astra / Claude / DeepSeek 的单题中位分钟数。模型、工具环境与推理配置不同,不能直接换算性价比。

STEERING EVIDENCE0 有效回合

未发现统一、真实业务方反馈的 Steering / Adaptation 回合;目前不能给可修改性或修改成功率打有效分。

下一步如何正式验收

先修复交付缺口和题包冲突,再用不含模型名的成品做专家盲评;HTML 实测桌面/手机/无网与主交互,PPTX 打开编辑并对照 PDF,KV 在 Illustrator 中检查图层、文字和印刷色。

阅读口径:雷达分数是 1–5 分的机器初审,用于定位差异,不用于直接计算 PDR。长页面只截代表性首屏;Q14 使用轨迹真实渲染,Q16/Q17/Q25 已统一对比媒介。交互、动效和完整长页仍需单独走查。

总体与赛道雷达

全量 25 题

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash

Presentation 12 题

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash

Growth 10 题

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash

Brand 3 题

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q01

金融投资专项:增长人群与持续付费工作流判断

初审倾向:Astra
Q01 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra104.0 分钟 · 55 次轨迹动作 · 3 段符合
05理解任务

读取题目、约束与评审边界

14资料探索

盘点输入数据、素材与参考

10设计构建最负相关 / 风险

构建 Web 原型 + 可编辑工程包

20验证迭代最正相关

渲染、浏览器或文件检查

06交付收口

符合;index.html、workbuddy-finance-report.zip 等 3 项

路径观察长时深度迭代,验证调整占比最高;3 段会话续跑,有明确验证动作。

最正相关 · 验证迭代验证动作 20 次;信息可读 4.8、交付完成 4.8,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 10 次、相关三项均值 4.7,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.814.9 分钟 · 17 次轨迹动作 · 1 段符合
01理解任务最负相关 / 风险

读取题目、约束与评审边界

06资料探索

盘点输入数据、素材与参考

06设计构建最正相关

构建 Web 原型

04验证迭代

渲染、浏览器或文件检查

00交付收口

符合;index.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作。

最正相关 · 设计构建视觉层级 4.1、构图节奏 4.2、概念辨识 4.2,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.0 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash11.2 分钟 · 71 次轨迹动作 · 1 段符合,但数据错标
01理解任务

读取题目、约束与评审边界

21资料探索

盘点输入数据、素材与参考

25设计构建最正相关

构建 Web 原型

23验证迭代最负相关 / 风险

渲染、浏览器或文件检查

01交付收口

符合,但数据错标;index.html

路径观察快速成型,实作构建占比最高;单段会话完成,有明确验证动作;交付判定为“符合,但数据错标”。

最正相关 · 设计构建视觉层级 3.6、构图节奏 3.7、概念辨识 3.8,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 验证迭代虽有 23 次验证动作,最终仍保留统计口径错标,说明验证与事实校验脱节。

设计差异

  • Astra:编辑式留白与侧边导航最完整,结论先行,数据层级最稳。
  • Claude:证据密度高,蓝绿渐变建立专题感,但首屏焦点略分散。
  • DeepSeek:标题判断最强势、商务感明确;表内统计错标削弱可信度。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q02

Sales专项:增长子人群选择与产品、数据能力投入判断

初审倾向:Astra
Q02 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra98.6 分钟 · 63 次轨迹动作 · 3 段符合
05理解任务

读取题目、约束与评审边界

20资料探索最正相关

盘点输入数据、素材与参考

16设计构建最负相关 / 风险

构建 Web 原型 + PDF

17验证迭代

渲染、浏览器或文件检查

05交付收口

符合;index.html、opportunity-map.svg 等 3 项

路径观察长时深度迭代,资料盘点占比最高;3 段会话续跑,有明确验证动作。

最正相关 · 资料探索信息可读 4.7、场景适配 4.7,资料盘点是五阶段中与最终证据组织最同向的一段。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 16 次、相关三项均值 4.6,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.822.7 分钟 · 44 次轨迹动作 · 1 段符合
01理解任务最负相关 / 风险

读取题目、约束与评审边界

14资料探索

盘点输入数据、素材与参考

12设计构建最正相关

构建 Web 原型

16验证迭代

渲染、浏览器或文件检查

01交付收口

符合;index.html

路径观察常规节奏迭代,验证调整占比最高;单段会话完成,有明确验证动作。

最正相关 · 设计构建视觉层级 4.0、构图节奏 4.1、概念辨识 4.2,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务场景适配 3.9 是相对短板,前期目标或媒介理解没有完全转成最终适配。

DeepSeek Flash7.0 分钟 · 43 次轨迹动作 · 1 段符合
01理解任务

读取题目、约束与评审边界

14资料探索

盘点输入数据、素材与参考

11设计构建最正相关

构建 Web 原型

17验证迭代最负相关 / 风险

渲染、浏览器或文件检查

00交付收口

符合;index.html

路径观察快速成型,验证调整占比最高;单段会话完成,有明确验证动作。

最正相关 · 设计构建视觉层级 3.7、构图节奏 3.8、概念辨识 3.9,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 验证迭代虽有 17 次验证动作,信息可读 3.6/交付完成 3.6 仍是相对短板,验证方向与最终问题有脱节。

设计差异

  • Astra:增长选择被压成一句清晰结论,右侧深绿证据卡强化决策感。
  • Claude:研究目录完整、信息最密,视觉更接近分析工作台。
  • DeepSeek:深蓝汇报感强,管理判断清晰,但正文密度和字号偏紧。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q03

2026 年腾讯展台招标宣讲材料(新加坡 + 香港)

初审倾向:Astra
Q03 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra48.3 分钟 · 42 次轨迹动作 · 1 段符合
14理解任务最正相关

读取题目、约束与评审边界

02资料探索

盘点输入数据、素材与参考

12设计构建最负相关 / 风险

构建 演示文稿 + 可编辑工程包

09验证迭代

渲染、浏览器或文件检查

05交付收口

符合;Tencent_2026_Booth_Tender_Briefing_CN_EN.pdf、Tencent_2026_Booth_Tender_Briefing_CN_EN.pptx 等 3 项

路径观察常规节奏迭代,实作构建占比最高;单段会话完成,有明确验证动作。

最正相关 · 理解任务场景适配 4.8,前期对目标、媒介与约束的理解与最终适配最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 12 次、相关三项均值 4.7,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.810.3 分钟 · 16 次轨迹动作 · 1 段部分
05理解任务

读取题目、约束与评审边界

07资料探索

盘点输入数据、素材与参考

00设计构建最正相关

构建 Web 原型

04验证迭代

渲染、浏览器或文件检查

00交付收口最负相关 / 风险

部分;tencent-booth-briefing-2026.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“部分”。

最正相关 · 设计构建视觉层级 4.0、构图节奏 4.1、概念辨识 4.2,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付判定为“部分”,成品、格式或可编辑性缺口最集中地出现在交付收口。

DeepSeek Flash10.5 分钟 · 66 次轨迹动作 · 1 段部分
09理解任务

读取题目、约束与评审边界

32资料探索最正相关

盘点输入数据、素材与参考

19设计构建

构建 演示文稿

05验证迭代

渲染、浏览器或文件检查

01交付收口最负相关 / 风险

部分;Tencent_2026_AsiaFinTech_Booth_Tender_Briefing.pptx

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“部分”。

最正相关 · 资料探索信息可读 3.9、场景适配 4.0,资料盘点是五阶段中与最终证据组织最同向的一段。

最负相关 / 风险 · 交付收口交付判定为“部分”,成品、格式或可编辑性缺口最集中地出现在交付收口。

设计差异

  • Astra:以两块场地面积示意形成独特记忆点,中英层级清楚。
  • Claude:招标信息最齐全,网格与双站卡片稳健,但封面字量偏多。
  • DeepSeek:形式感最强,书法标题有地域气质;正式招标场景的可读稳定性稍弱。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q04

AI Native 一期验证总结汇报

初审倾向:Astra
Q04 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra34.5 分钟 · 38 次轨迹动作 · 3 段符合
04理解任务

读取题目、约束与评审边界

06资料探索

盘点输入数据、素材与参考

05设计构建最负相关 / 风险

构建 演示文稿

19验证迭代最正相关

渲染、浏览器或文件检查

04交付收口

符合;AI_Native_一期验证总结.pptx、AI_Native_一期验证总结.pdf 等 15 项

路径观察常规节奏迭代,验证调整占比最高;3 段会话续跑,有明确验证动作。

最正相关 · 验证迭代验证动作 19 次;信息可读 4.7、交付完成 4.7,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 5 次、相关三项均值 4.6,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.813.7 分钟 · 40 次轨迹动作 · 1 段部分
01理解任务

读取题目、约束与评审边界

20资料探索

盘点输入数据、素材与参考

07设计构建最正相关

构建 演示文稿

12验证迭代

渲染、浏览器或文件检查

00交付收口最负相关 / 风险

部分;AI-Native一期验证总结汇报.pptx

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“部分”。

最正相关 · 设计构建视觉层级 4.2、构图节奏 4.3、概念辨识 4.4,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付判定为“部分”,成品、格式或可编辑性缺口最集中地出现在交付收口。

DeepSeek Flash7.3 分钟 · 57 次轨迹动作 · 1 段部分
04理解任务

读取题目、约束与评审边界

05资料探索

盘点输入数据、素材与参考

16设计构建最正相关

构建 演示文稿

32验证迭代

渲染、浏览器或文件检查

00交付收口最负相关 / 风险

部分;AI_Native_一期验证总结汇报.pptx

路径观察快速成型,验证调整占比最高;单段会话完成,有明确验证动作;交付判定为“部分”。

最正相关 · 设计构建视觉层级 3.8、构图节奏 3.9、概念辨识 4.0,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付判定为“部分”,成品、格式或可编辑性缺口最集中地出现在交付收口。

设计差异

  • Astra:用“7天”和可行性标签把验证结论转成决策页,最像真实复盘。
  • Claude:蓝紫品牌感强,合作命题醒目,视觉更像产品发布。
  • DeepSeek:左右分屏把结论“可行”单独强调,结构直接但信息略碎。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q05

TDesign D2C 上线首月复盘汇报

初审倾向:Astra / Claude
Q05 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra42.8 分钟 · 42 次轨迹动作 · 3 段符合
04理解任务

读取题目、约束与评审边界

10资料探索

盘点输入数据、素材与参考

12设计构建最负相关 / 风险

构建 Web 原型 + PDF

11验证迭代

渲染、浏览器或文件检查

05交付收口最正相关

符合;index.html、review-1440-full-small.png 等 9 项

路径观察常规节奏迭代,实作构建占比最高;3 段会话续跑,有明确验证动作。

最正相关 · 交付收口交付状态“符合”,交付完成 4.7,收口阶段与最终可审阅性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 12 次、相关三项均值 4.6,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.89.1 分钟 · 17 次轨迹动作 · 1 段符合
01理解任务最负相关 / 风险

读取题目、约束与评审边界

08资料探索

盘点输入数据、素材与参考

02设计构建最正相关

构建 Web 原型

06验证迭代

渲染、浏览器或文件检查

00交付收口

符合;TDesign-D2C-首月复盘汇报.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作。

最正相关 · 设计构建视觉层级 4.3、构图节奏 4.4、概念辨识 4.5,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.2 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash4.7 分钟 · 36 次轨迹动作 · 1 段符合
01理解任务

读取题目、约束与评审边界

14资料探索

盘点输入数据、素材与参考

15设计构建最正相关

构建 Web 原型

06验证迭代

渲染、浏览器或文件检查

00交付收口最负相关 / 风险

符合;TDesign-D2C-首月复盘汇报.html

路径观察快速成型,实作构建占比最高;单段会话完成,有明确验证动作。

最正相关 · 设计构建视觉层级 3.9、构图节奏 4.0、概念辨识 4.1,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付完成 3.8,收口动作与成品格式、完整性或可编辑性的相对短板最相关。

设计差异

  • Astra:导航、核心结论、指标、风险形成稳定阅读链,会议适配最好。
  • Claude:状态色与卡片对比最丰富,风险扫描效率高,页面也最拥挤。
  • DeepSeek:视觉最克制,执行摘要突出,但缺少鲜明的关键数据峰值。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q06

TDesign 2026 H2 OKR 可视化汇报页

初审倾向:Astra
Q06 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra102.1 分钟 · 71 次轨迹动作 · 3 段符合
04理解任务

读取题目、约束与评审边界

08资料探索

盘点输入数据、素材与参考

31设计构建最负相关 / 风险

构建 Web 原型 + 数据表

22验证迭代

渲染、浏览器或文件检查

06交付收口最正相关

符合;index.html

路径观察长时深度迭代,实作构建占比最高;3 段会话续跑,有明确验证动作。

最正相关 · 交付收口交付状态“符合”,交付完成 4.8,收口阶段与最终可审阅性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 31 次、相关三项均值 4.7,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.813.8 分钟 · 24 次轨迹动作 · 1 段符合
01理解任务最负相关 / 风险

读取题目、约束与评审边界

07资料探索

盘点输入数据、素材与参考

07设计构建最正相关

构建 Web 原型 + 数据表

09验证迭代

渲染、浏览器或文件检查

00交付收口

符合;TDesign-2026H2-OKR.html

路径观察快速成型,验证调整占比最高;单段会话完成,有明确验证动作。

最正相关 · 设计构建视觉层级 4.1、构图节奏 4.2、概念辨识 4.2,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.0 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash4.1 分钟 · 35 次轨迹动作 · 1 段符合
01理解任务

读取题目、约束与评审边界

13资料探索

盘点输入数据、素材与参考

09设计构建最正相关

构建 Web 原型 + 数据表

11验证迭代

渲染、浏览器或文件检查

01交付收口最负相关 / 风险

符合;okr-2026-h2.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作。

最正相关 · 设计构建视觉层级 3.8、构图节奏 3.9、概念辨识 4.0,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付完成 3.7,收口动作与成品格式、完整性或可编辑性的相对短板最相关。

设计差异

  • Astra:把年度主题转成一句主张,H1/H2 卡片层级清楚。
  • Claude:全景式展示最轻盈,适合浏览;目标主次相对平均。
  • DeepSeek:状态标记和数字易扫读,标题较长,首屏叙事节奏较平。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q07

试玩卡换皮规范 2.0 沉淀

初审倾向:Astra
Q07 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra68.8 分钟 · 72 次轨迹动作 · 3 段符合
05理解任务

读取题目、约束与评审边界

05资料探索

盘点输入数据、素材与参考

11设计构建最负相关 / 风险

构建 Web 原型 + PDF + 数据表 + 可编辑工程包

35验证迭代

渲染、浏览器或文件检查

16交付收口最正相关

符合;试玩卡活动换皮设计规范2.0.html、试玩卡活动换皮设计规范2.0_完整交付包.zip 等 18 项

路径观察中长链路构建,验证调整占比最高;3 段会话续跑,有明确验证动作。

最正相关 · 交付收口交付状态“符合”,交付完成 4.9,收口阶段与最终可审阅性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 11 次、相关三项均值 4.8,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.822.1 分钟 · 64 次轨迹动作 · 1 段部分
01理解任务

读取题目、约束与评审边界

40资料探索

盘点输入数据、素材与参考

17设计构建最正相关

构建 图像物料

02验证迭代

渲染、浏览器或文件检查

04交付收口最负相关 / 风险

部分;未列出主产物

路径观察常规节奏迭代,资料盘点占比最高;单段会话完成,验证证据相对较少;交付判定为“部分”。

最正相关 · 设计构建视觉层级 2.3、构图节奏 2.6、概念辨识 2.9,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付判定为“部分”,成品、格式或可编辑性缺口最集中地出现在交付收口。

DeepSeek Flash44.9 分钟 · 245 次轨迹动作 · 1 段符合形式
01理解任务

读取题目、约束与评审边界

109资料探索

盘点输入数据、素材与参考

129设计构建最正相关

构建 图像物料

06验证迭代最负相关 / 风险

渲染、浏览器或文件检查

00交付收口

符合形式;fig-2.0-after-login-zones.png、fig-2.0-login-zones.png 等 5 项

路径观察常规节奏迭代,实作构建占比最高;单段会话完成,验证证据相对较少;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 3.4、构图节奏 3.5、概念辨识 3.6,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 验证迭代虽有 6 次验证动作,信息可读 3.4/交付完成 3.3 仍是相对短板,验证方向与最终问题有脱节。

设计差异

  • Astra:封面、设备 mockup 与量化变化形成完整规范文档感。
  • Claude:正文详尽但首屏近似纯文字稿,缺图示带来的理解效率。
  • DeepSeek:直接展示标注图,工程沟通有效;缺少文档封面和统一叙事。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q08

汪苏泷「罗曼宇宙」超级会员开卡礼设计提案

初审倾向:Astra
Q08 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra63.1 分钟 · 69 次轨迹动作 · 3 段符合
06理解任务

读取题目、约束与评审边界

08资料探索

盘点输入数据、素材与参考

23设计构建最负相关 / 风险

构建 演示文稿 + 数据表 + 可编辑工程包

25验证迭代最正相关

渲染、浏览器或文件检查

07交付收口

符合;罗曼宇宙_超级会员开卡礼_设计提案.pdf、罗曼宇宙_编辑资源与字体.zip 等 3 项

路径观察中长链路构建,验证调整占比最高;3 段会话续跑,有明确验证动作。

最正相关 · 验证迭代验证动作 25 次;信息可读 4.9、交付完成 4.9,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 23 次、相关三项均值 4.8,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.816.0 分钟 · 29 次轨迹动作 · 1 段部分
02理解任务

读取题目、约束与评审边界

14资料探索

盘点输入数据、素材与参考

06设计构建最正相关

构建 Web 原型

07验证迭代

渲染、浏览器或文件检查

00交付收口最负相关 / 风险

部分;roman-universe-proposal.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“部分”。

最正相关 · 设计构建视觉层级 4.2、构图节奏 4.3、概念辨识 4.4,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付判定为“部分”,成品、格式或可编辑性缺口最集中地出现在交付收口。

DeepSeek Flash28.2 分钟 · 123 次轨迹动作 · 1 段包内缺成品
01理解任务

读取题目、约束与评审边界

08资料探索

盘点输入数据、素材与参考

30设计构建最正相关

构建 图像物料

83验证迭代

渲染、浏览器或文件检查

01交付收口最负相关 / 风险

包内缺成品;bg_cover.png、bg_light.png 等 3 项

路径观察常规节奏迭代,验证调整占比最高;单段会话完成,有明确验证动作;交付判定为“包内缺成品”。

最正相关 · 设计构建视觉层级 3.9、构图节奏 4.0、概念辨识 4.1,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付判定为“包内缺成品”,成品、格式或可编辑性缺口最集中地出现在交付收口。

设计差异

  • Astra:像素字体、粉色系统与物料示意高度统一,概念最完整。
  • Claude:角色 IP 更亲和,品牌人格鲜明,视觉略偏卡通商品页。
  • DeepSeek:轨道宇宙最克制高级,空间氛围强,但礼盒物料感较弱。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q09

薛凯琪「LET ME LOVE YOU」巡演实体星光卡体系设计提案

初审倾向:Astra
Q09 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra88.0 分钟 · 82 次轨迹动作 · 3 段符合
09理解任务

读取题目、约束与评审边界

14资料探索

盘点输入数据、素材与参考

32设计构建最负相关 / 风险

构建 演示文稿 + 可编辑工程包

15验证迭代

渲染、浏览器或文件检查

12交付收口最正相关

符合;薛凯琪_星光卡体系设计提案.pptx、薛凯琪_星光卡_源文件与字体.zip 等 77 项

路径观察中长链路构建,实作构建占比最高;3 段会话续跑,有明确验证动作。

最正相关 · 交付收口交付状态“符合”,交付完成 4.8,收口阶段与最终可审阅性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 32 次、相关三项均值 4.7,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.815.0 分钟 · 34 次轨迹动作 · 1 段部分
01理解任务

读取题目、约束与评审边界

20资料探索

盘点输入数据、素材与参考

01设计构建最正相关

构建 Web 原型

12验证迭代

渲染、浏览器或文件检查

00交付收口最负相关 / 风险

部分;薛凯琪LETMELOVEYOU-星光卡体系设计提案.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“部分”。

最正相关 · 设计构建视觉层级 4.3、构图节奏 4.4、概念辨识 4.5,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付判定为“部分”,成品、格式或可编辑性缺口最集中地出现在交付收口。

DeepSeek Flash25.5 分钟 · 157 次轨迹动作 · 1 段符合形式
02理解任务

读取题目、约束与评审边界

13资料探索

盘点输入数据、素材与参考

49设计构建最正相关

构建 演示文稿

93验证迭代

渲染、浏览器或文件检查

00交付收口最负相关 / 风险

符合形式;薛凯琪_LET_ME_LOVE_YOU_星光卡体系设计提案.pptx

路径观察常规节奏迭代,验证调整占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 3.9、构图节奏 4.0、概念辨识 4.1,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付完成 3.8,收口动作与成品格式、完整性或可编辑性的相对短板最相关。

设计差异

  • Astra:首屏直接放实体卡组,收藏体系一眼可见,产品表达最具体。
  • Claude:深色星光系统最精致,奢华感强,但首屏没有完整卡组证据。
  • DeepSeek:封面克制、信息清楚,识别系统相对通用。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q10

Omega BI:茶饮经营异常分析与决策

初审倾向:Astra
Q10 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra84.7 分钟 · 84 次轨迹动作 · 5 段符合形式
08理解任务

读取题目、约束与评审边界

23资料探索

盘点输入数据、素材与参考

15设计构建最负相关 / 风险

构建 Web 原型 + PDF + 可编辑工程包

29验证迭代最正相关

渲染、浏览器或文件检查

09交付收口

符合形式;index.html、Omega-BI-prototype.zip

路径观察中长链路构建,验证调整占比最高;5 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 29 次;信息可读 4.7、交付完成 4.7,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 15 次、相关三项均值 4.6,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.821.3 分钟 · 56 次轨迹动作 · 1 段符合形式
01理解任务

读取题目、约束与评审边界

12资料探索最负相关 / 风险

盘点输入数据、素材与参考

24设计构建最正相关

构建 Web 原型

18验证迭代

渲染、浏览器或文件检查

01交付收口

符合形式;index.html、logo-wordmark-dark.svg 等 5 项

路径观察常规节奏迭代,实作构建占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 2.8、构图节奏 3.3、概念辨识 3.4,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 资料探索信息可读 2.6、场景适配 2.9;资料探索与最终证据组织之间存在损耗。

DeepSeek Flash19.1 分钟 · 142 次轨迹动作 · 2 段符合形式
02理解任务

读取题目、约束与评审边界

09资料探索

盘点输入数据、素材与参考

86设计构建最正相关

构建 Web 原型

36验证迭代

渲染、浏览器或文件检查

09交付收口最负相关 / 风险

符合形式;index.html

路径观察快速成型,实作构建占比最高;2 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 3.9、构图节奏 4.0、概念辨识 4.1,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付完成 3.8,收口动作与成品格式、完整性或可编辑性的相对短板最相关。

设计差异

  • Astra:浅色 3D 经营街区作为分析主场景,建筑节点、异常线索和右侧决策摘要建立了最直观的空间叙事。
  • Claude:沉浸启动层建立 3D 气氛,但遮挡主数据,首次进入成本高。
  • DeepSeek:数据密度与分析感最强,深色界面层级偏挤。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q11

零界:从门店地图定位经营异常

初审倾向:Astra
Q11 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra88.6 分钟 · 55 次轨迹动作 · 3 段符合形式
06理解任务

读取题目、约束与评审边界

06资料探索

盘点输入数据、素材与参考

13设计构建最负相关 / 风险

构建 Web 原型

26验证迭代最正相关

渲染、浏览器或文件检查

04交付收口

符合形式;index.html、favicon.svg

路径观察中长链路构建,验证调整占比最高;3 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 26 次;信息可读 4.7、交付完成 4.7,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 13 次、相关三项均值 4.6,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.814.2 分钟 · 33 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

10资料探索

盘点输入数据、素材与参考

05设计构建最正相关

构建 Web 原型

15验证迭代

渲染、浏览器或文件检查

02交付收口

符合形式;index.html

路径观察快速成型,验证调整占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.1、构图节奏 4.2、概念辨识 4.2,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.0 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash6.1 分钟 · 59 次轨迹动作 · 1 段符合形式
01理解任务

读取题目、约束与评审边界

16资料探索

盘点输入数据、素材与参考

21设计构建最正相关

构建 Web 原型

21验证迭代

渲染、浏览器或文件检查

00交付收口最负相关 / 风险

符合形式;index.html

路径观察快速成型,实作构建占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 3.9、构图节奏 4.0、概念辨识 4.1,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付完成 3.8,收口动作与成品格式、完整性或可编辑性的相对短板最相关。

设计差异

  • Astra:地图占主视区,异常、指标、提醒三层关系最自然。
  • Claude:运营工作台结构完整,筛选、排行和地图同屏但略显拥挤。
  • DeepSeek:放射式门店关系图有辨识度,地图真实性和空间定位较弱。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q12

AI 海报提示词模板库:把 12 套风格皮肤做成「提取 → 编辑 → 生成」一体的提示词工作台

初审倾向:Astra
Q12 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra140.0 分钟 · 80 次轨迹动作 · 5 段符合形式
16理解任务

读取题目、约束与评审边界

09资料探索

盘点输入数据、素材与参考

18设计构建最负相关 / 风险

构建 Web 原型

28验证迭代最正相关

渲染、浏览器或文件检查

09交付收口

符合形式;poster-workbench.html

路径观察长时深度迭代,验证调整占比最高;5 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 28 次;信息可读 4.9、交付完成 4.9,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 18 次、相关三项均值 4.8,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.819.2 分钟 · 32 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

15资料探索

盘点输入数据、素材与参考

07设计构建最正相关

构建 Web 原型

09验证迭代

渲染、浏览器或文件检查

00交付收口

符合形式;海报提示词工作台.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.2、构图节奏 4.3、概念辨识 4.4,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.1 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash17.8 分钟 · 107 次轨迹动作 · 2 段符合形式
01理解任务

读取题目、约束与评审边界

34资料探索

盘点输入数据、素材与参考

46设计构建最正相关

构建 Web 原型

26验证迭代最负相关 / 风险

渲染、浏览器或文件检查

00交付收口

符合形式;poster-prompt-workbench.html

路径观察快速成型,实作构建占比最高;2 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 2.4、构图节奏 2.6、概念辨识 2.8,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 验证迭代虽有 26 次验证动作,信息可读 2.5/交付完成 2.5 仍是相对短板,验证方向与最终问题有脱节。

设计差异

  • Astra:海报预览是主角,左侧提取流程与右侧结果形成清晰工作流。
  • Claude:12 风格与参数同屏,专业工具感最强,也带来明显认知负担。
  • DeepSeek:界面骨架清楚但首屏内容稀薄,难证明“12风格一体化”。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q13

热点运营|可复用的互动测试类 H5 产品形态

初审倾向:Astra
Q13 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra118.7 分钟 · 74 次轨迹动作 · 3 段符合形式
07理解任务

读取题目、约束与评审边界

05资料探索

盘点输入数据、素材与参考

22设计构建最负相关 / 风险

构建 Web 原型

34验证迭代最正相关

渲染、浏览器或文件检查

06交付收口

符合形式;index.html、relaxed.png 等 27 项

路径观察长时深度迭代,验证调整占比最高;3 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 34 次;信息可读 4.8、交付完成 4.8,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 22 次、相关三项均值 4.7,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.839.1 分钟 · 63 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

27资料探索

盘点输入数据、素材与参考

09设计构建最正相关

构建 Web 原型

26验证迭代

渲染、浏览器或文件检查

00交付收口

符合形式;index.html

路径观察常规节奏迭代,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.3、构图节奏 4.4、概念辨识 4.5,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.2 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash30.8 分钟 · 155 次轨迹动作 · 2 段符合形式
01理解任务

读取题目、约束与评审边界

45资料探索

盘点输入数据、素材与参考

70设计构建最正相关

构建 Web 原型

37验证迭代最负相关 / 风险

渲染、浏览器或文件检查

02交付收口

符合形式;index.html

路径观察常规节奏迭代,实作构建占比最高;2 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.0、构图节奏 4.1、概念辨识 4.2,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 验证迭代虽有 37 次验证动作,信息可读 3.9/交付完成 3.9 仍是相对短板,验证方向与最终问题有脱节。

设计差异

  • Astra:插画与中秋语气最亲和,入口 CTA、品牌与结果想象完整。
  • Claude:暗金月相有高级感,仪式感强,普通运营用户的亲和力较低。
  • DeepSeek:月相图形最简洁,标题与 CTA 清楚,系统性略弱于 Astra。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q14

TDesign D2C 数据盘点宣发页(Insight 洞察报告页)

初审倾向:Astra / Claude
Q14 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra100.1 分钟 · 84 次轨迹动作 · 3 段符合形式
09理解任务

读取题目、约束与评审边界

13资料探索

盘点输入数据、素材与参考

27设计构建最负相关 / 风险

构建 Web 原型

30验证迭代最正相关

渲染、浏览器或文件检查

05交付收口

符合形式;index.html

路径观察长时深度迭代,验证调整占比最高;3 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 30 次;信息可读 4.8、交付完成 4.8,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 27 次、相关三项均值 4.7,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.837.2 分钟 · 78 次轨迹动作 · 1 段符合形式
08理解任务

读取题目、约束与评审边界

33资料探索最负相关 / 风险

盘点输入数据、素材与参考

20设计构建最正相关

构建 Web 原型

17验证迭代

渲染、浏览器或文件检查

00交付收口

符合形式;index.html

路径观察常规节奏迭代,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.4、构图节奏 4.5、概念辨识 4.6,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 资料探索未见强负向质量证据;信息可读/场景适配均值 4.3,资料投入未继续拉开优势,主要是效率风险。

DeepSeek Flash25.9 分钟 · 219 次轨迹动作 · 1 段符合形式
04理解任务

读取题目、约束与评审边界

71资料探索

盘点输入数据、素材与参考

103设计构建最正相关

构建 Web 原型

37验证迭代最负相关 / 风险

渲染、浏览器或文件检查

04交付收口

符合形式;index.html、kv-poster.jpg

路径观察常规节奏迭代,实作构建占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.1、构图节奏 4.2、概念辨识 4.3,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 验证迭代未见强负向质量证据;验证动作 37 次,信息可读/交付完成均值 4.0,主要风险是继续验证的边际收益。

设计差异

  • Astra:留白、主标题和 3D KV 平衡最好,宣发与数据可信感兼具。
  • Claude:KV 冲击最强,数字叠在复杂背景上,部分文字对比不稳定。
  • DeepSeek:证据链前置,数据模块更像专题报告,首屏传播峰值较弱。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q15

王者赛宝「幸运大抽奖」活动页 · 周年庆赛事新一期

初审倾向:Astra
Q15 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra63.2 分钟 · 61 次轨迹动作 · 3 段符合形式
04理解任务

读取题目、约束与评审边界

11资料探索

盘点输入数据、素材与参考

19设计构建最负相关 / 风险

构建 Web 原型

20验证迭代最正相关

渲染、浏览器或文件检查

07交付收口

符合形式;index.html、review.html 等 5 项

路径观察中长链路构建,验证调整占比最高;3 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 20 次;信息可读 4.8、交付完成 4.8,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 19 次、相关三项均值 4.7,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.813.5 分钟 · 36 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

22资料探索

盘点输入数据、素材与参考

05设计构建最正相关

构建 Web 原型

08验证迭代

渲染、浏览器或文件检查

00交付收口

符合形式;index.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.3、构图节奏 4.4、概念辨识 4.5,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.2 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash15.6 分钟 · 115 次轨迹动作 · 1 段符合形式
01理解任务

读取题目、约束与评审边界

50资料探索最负相关 / 风险

盘点输入数据、素材与参考

33设计构建最正相关

构建 Web 原型

29验证迭代

渲染、浏览器或文件检查

02交付收口

符合形式;index.html、states.html 等 11 项

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.1、构图节奏 4.2、概念辨识 4.3,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 资料探索未见强负向质量证据;信息可读/场景适配均值 4.1,资料投入未继续拉开优势,主要是效率风险。

设计差异

  • Astra:主奖池、奖励、任务和 CTA 的层级最平衡,游戏感成熟。
  • Claude:奖励展示最突出,任务和入口很多,视觉负荷最高。
  • DeepSeek:宝箱与任务卡关系清楚,卡片感偏重,画面整合度略低。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q16

游戏人生 × QQ音乐超会「游戏豪礼」福利推广 · 欢乐斗地主同系列

初审倾向:Astra
Q16 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra56.4 分钟 · 56 次轨迹动作 · 5 段符合
05理解任务

读取题目、约束与评审边界

02资料探索

盘点输入数据、素材与参考

17设计构建最负相关 / 风险

构建 Web 原型 + 可编辑工程包

14验证迭代

渲染、浏览器或文件检查

18交付收口最正相关

符合;hlddz-mobile.html、qqmusic.html 等 25 项

路径观察中长链路构建,实作构建占比最高;5 段会话续跑,有明确验证动作。

最正相关 · 交付收口交付状态“符合”,交付完成 4.7,收口阶段与最终可审阅性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 17 次、相关三项均值 4.6,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.813.8 分钟 · 31 次轨迹动作 · 1 段符合
01理解任务最负相关 / 风险

读取题目、约束与评审边界

14资料探索

盘点输入数据、素材与参考

07设计构建最正相关

构建 Web 原型

09验证迭代

渲染、浏览器或文件检查

00交付收口

符合;doudizhu-banner-750x750.png、doudizhu-banner-330x510.png 等 6 项

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作。

最正相关 · 设计构建视觉层级 4.2、构图节奏 4.3、概念辨识 4.4,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.1 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash9.3 分钟 · 59 次轨迹动作 · 1 段包内缺成品
01理解任务

读取题目、约束与评审边界

28资料探索

盘点输入数据、素材与参考

20设计构建最正相关

构建 Web 原型

10验证迭代

渲染、浏览器或文件检查

00交付收口最负相关 / 风险

包内缺成品;banner-square.html、banner.html 等 3 项

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“包内缺成品”。

最正相关 · 设计构建视觉层级 3.9、构图节奏 4.0、概念辨识 4.1,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付判定为“包内缺成品”,成品、格式或可编辑性缺口最集中地出现在交付收口。

设计差异

  • Astra:信息完整、角色和奖品关系清楚,CTA 留白合理。
  • Claude:角色表现最鲜明、促销冲击强,规则信息相对少。
  • DeepSeek:奖品卡和人物细节丰富,层级稍碎,首屏阅读路线较长。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q17

试玩卡新英雄换皮——杨戬

初审倾向:Claude
Q17 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra81.9 分钟 · 95 次轨迹动作 · 3 段符合形式
04理解任务

读取题目、约束与评审边界

05资料探索

盘点输入数据、素材与参考

27设计构建最负相关 / 风险

构建 Web 原型 + 数据表 + 可编辑工程包

36验证迭代

渲染、浏览器或文件检查

23交付收口最正相关

符合形式;yangjian-reskin-v2.zip、yangjian-assets.zip 等 19 项

路径观察中长链路构建,验证调整占比最高;3 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 交付收口交付状态“符合形式”,交付完成 4.5,收口阶段与最终可审阅性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 27 次、相关三项均值 4.4,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.822.8 分钟 · 69 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

36资料探索

盘点输入数据、素材与参考

16设计构建最正相关

构建 图像物料

05验证迭代

渲染、浏览器或文件检查

11交付收口

符合形式;03b-video-cover-600x300.jpg、02-home-bg-1125x2160.jpg 等 11 项

路径观察常规节奏迭代,资料盘点占比最高;单段会话完成,验证证据相对较少;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.5、构图节奏 4.6、概念辨识 4.7,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.4 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash18.2 分钟 · 136 次轨迹动作 · 1 段部分
01理解任务

读取题目、约束与评审边界

68资料探索最正相关

盘点输入数据、素材与参考

60设计构建

构建 图像物料

06验证迭代

渲染、浏览器或文件检查

01交付收口最负相关 / 风险

部分;02-首页背景图-750x1440.webp、05-小程序分享大图-500x400.png 等 5 项

路径观察快速成型,资料盘点占比最高;单段会话完成,验证证据相对较少;交付判定为“部分”。

最正相关 · 资料探索信息可读 2.7、场景适配 3.0,资料盘点是五阶段中与最终证据组织最同向的一段。

最负相关 / 风险 · 交付收口交付判定为“部分”,成品、格式或可编辑性缺口最集中地出现在交付收口。

设计差异

  • Astra:英雄和标题有明确安全区,整体偏品牌海报。
  • Claude:标题利益点最直接,画面与活动目标结合最好。
  • DeepSeek:保留大量纯色空间便于固定 UI 叠加,但独立设计表现最弱。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q18

Omega:选对 Free / Pro,理解自己的权益

初审倾向:Astra
Q18 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra61.0 分钟 · 68 次轨迹动作 · 3 段符合形式
06理解任务

读取题目、约束与评审边界

10资料探索

盘点输入数据、素材与参考

18设计构建最负相关 / 风险

构建 Web 原型

27验证迭代最正相关

渲染、浏览器或文件检查

07交付收口

符合形式;index.html

路径观察中长链路构建,验证调整占比最高;3 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 27 次;信息可读 4.7、交付完成 4.7,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 18 次、相关三项均值 4.6,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.88.7 分钟 · 21 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

07资料探索

盘点输入数据、素材与参考

03设计构建最正相关

构建 Web 原型

08验证迭代

渲染、浏览器或文件检查

02交付收口

符合形式;index.html

路径观察快速成型,验证调整占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.0、构图节奏 4.1、概念辨识 4.2,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务场景适配 3.9 是相对短板,前期目标或媒介理解没有完全转成最终适配。

DeepSeek Flash9.3 分钟 · 59 次轨迹动作 · 1 段符合形式
02理解任务

读取题目、约束与评审边界

28资料探索最正相关

盘点输入数据、素材与参考

10设计构建

构建 Web 原型

18验证迭代最负相关 / 风险

渲染、浏览器或文件检查

01交付收口

符合形式;index.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 资料探索信息可读 3.9、场景适配 4.1,资料盘点是五阶段中与最终证据组织最同向的一段。

最负相关 / 风险 · 验证迭代虽有 18 次验证动作,信息可读 3.9/交付完成 3.9 仍是相对短板,验证方向与最终问题有脱节。

设计差异

  • Astra:浅色语气更像权益教育,渐进式选择路径最友好。
  • Claude:深色产品感强,首屏信息密度较高。
  • DeepSeek:紫色 CTA 醒目,Free/Pro 层级直接,整体更像营销落地页。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q19

共创赛季 01:命题成片挑战 · 活动参与页

初审倾向:Astra
Q19 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra65.0 分钟 · 50 次轨迹动作 · 3 段符合形式
11理解任务

读取题目、约束与评审边界

09资料探索

盘点输入数据、素材与参考

09设计构建最负相关 / 风险

构建 Web 原型

18验证迭代最正相关

渲染、浏览器或文件检查

03交付收口

符合形式;index.html、hero-art.svg 等 6 项

路径观察中长链路构建,验证调整占比最高;3 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 18 次;信息可读 4.7、交付完成 4.7,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 9 次、相关三项均值 4.6,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.86.9 分钟 · 16 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

06资料探索

盘点输入数据、素材与参考

03设计构建最正相关

构建 Web 原型

05验证迭代

渲染、浏览器或文件检查

01交付收口

符合形式;index.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.2、构图节奏 4.3、概念辨识 4.4,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.1 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash5.2 分钟 · 39 次轨迹动作 · 1 段符合形式
01理解任务

读取题目、约束与评审边界

17资料探索最正相关

盘点输入数据、素材与参考

07设计构建

构建 Web 原型

14验证迭代

渲染、浏览器或文件检查

00交付收口最负相关 / 风险

符合形式;index.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 资料探索信息可读 3.9、场景适配 4.0,资料盘点是五阶段中与最终证据组织最同向的一段。

最负相关 / 风险 · 交付收口交付完成 3.8,收口动作与成品格式、完整性或可编辑性的相对短板最相关。

设计差异

  • Astra:命题、利益点和视觉样例形成连续参与叙事。
  • Claude:金色 CTA 与活动信息最显眼,流程更像任务页。
  • DeepSeek:模块化最强,信息清楚但首屏的情绪张力稍弱。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q20

共创赛季 01:命题成片展映与拍同款页

初审倾向:Astra
Q20 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra62.1 分钟 · 51 次轨迹动作 · 3 段符合形式
04理解任务

读取题目、约束与评审边界

09资料探索

盘点输入数据、素材与参考

12设计构建最负相关 / 风险

构建 Web 原型

19验证迭代最正相关

渲染、浏览器或文件检查

07交付收口

符合形式;index.html、fall.svg 等 6 项

路径观察中长链路构建,验证调整占比最高;3 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 19 次;信息可读 4.7、交付完成 4.7,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 12 次、相关三项均值 4.6,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.811.7 分钟 · 29 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

14资料探索

盘点输入数据、素材与参考

03设计构建最正相关

构建 Web 原型

10验证迭代

渲染、浏览器或文件检查

01交付收口

符合形式;index.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.2、构图节奏 4.3、概念辨识 4.4,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.1 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash5.8 分钟 · 54 次轨迹动作 · 1 段符合形式
01理解任务

读取题目、约束与评审边界

15资料探索

盘点输入数据、素材与参考

11设计构建最正相关

构建 Web 原型

22验证迭代

渲染、浏览器或文件检查

05交付收口最负相关 / 风险

符合形式;index.html

路径观察快速成型,验证调整占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 3.9、构图节奏 4.0、概念辨识 4.1,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付完成 3.8,收口动作与成品格式、完整性或可编辑性的相对短板最相关。

设计差异

  • Astra:大标题与首个作品封面形成内容入口,浏览路径清楚。
  • Claude:大画面沉浸感强、按钮明确,命题教育被压到次层。
  • DeepSeek:先解释拍同款方法,理解成本低,内容展映感相对不足。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q21

支付成功页摇优惠入口重设计

初审倾向:Claude
Q21 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra68.3 分钟 · 61 次轨迹动作 · 1 段符合形式
04理解任务

读取题目、约束与评审边界

05资料探索

盘点输入数据、素材与参考

22设计构建最负相关 / 风险

构建 Web 原型

23验证迭代最正相关

渲染、浏览器或文件检查

07交付收口

符合形式;index.html、payment.html 等 16 项

路径观察中长链路构建,验证调整占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 23 次;信息可读 4.6、交付完成 4.6,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 22 次、相关三项均值 4.5,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.811.7 分钟 · 25 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

03资料探索

盘点输入数据、素材与参考

04设计构建最正相关

构建 Web 原型

16验证迭代

渲染、浏览器或文件检查

01交付收口

符合形式;index.html、render-full.png 等 8 项

路径观察快速成型,验证调整占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.5、构图节奏 4.6、概念辨识 4.7,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.4 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash5.6 分钟 · 50 次轨迹动作 · 1 段符合形式
01理解任务

读取题目、约束与评审边界

16资料探索

盘点输入数据、素材与参考

19设计构建最正相关

构建 Web 原型

13验证迭代

渲染、浏览器或文件检查

01交付收口最负相关 / 风险

符合形式;index.html、00_workbench.png 等 9 项

路径观察快速成型,实作构建占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 3.4、构图节奏 3.5、概念辨识 3.6,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付完成 2.8,收口动作与成品格式、完整性或可编辑性的相对短板最相关。

设计差异

  • Astra:入口最克制,能保护支付成功主任务,设计说明完整。
  • Claude:摇动按钮与优惠卡的情绪反馈最强,入口存在感可能偏高。
  • DeepSeek:标注工作台利于评审,但首屏展示的成品感不如前两版。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q22

摇优惠许愿功能全链路体验设计

初审倾向:Astra
Q22 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra92.6 分钟 · 73 次轨迹动作 · 5 段符合形式
12理解任务

读取题目、约束与评审边界

16资料探索

盘点输入数据、素材与参考

12设计构建最负相关 / 风险

构建 Web 原型 + 可编辑工程包

27验证迭代最正相关

渲染、浏览器或文件检查

06交付收口

符合形式;index.html、wish-experience-q01.zip 等 3 项

路径观察长时深度迭代,验证调整占比最高;5 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 27 次;信息可读 4.7、交付完成 4.7,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 12 次、相关三项均值 4.6,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.87.6 分钟 · 6 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

01资料探索

盘点输入数据、素材与参考

02设计构建最正相关

构建 Web 原型

02验证迭代

渲染、浏览器或文件检查

00交付收口

符合形式;index.html

路径观察快速成型,实作构建占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 3.3、构图节奏 3.5、概念辨识 3.2,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务场景适配 3.1 是相对短板,前期目标或媒介理解没有完全转成最终适配。

DeepSeek Flash2.4 分钟 · 6 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

01资料探索

盘点输入数据、素材与参考

02设计构建最正相关

构建 Web 原型

02验证迭代

渲染、浏览器或文件检查

00交付收口

符合形式;wish-feature-design.html

路径观察快速成型,实作构建占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 2.8、构图节奏 3.0、概念辨识 2.8,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务场景适配 2.9 是相对短板,前期目标或媒介理解没有完全转成最终适配。

设计差异

  • Astra:把许愿包装成“愿望靠近”的轻产品体验,情感与行动兼顾。
  • Claude:更像方案说明页,规则充分,用户流程的沉浸感不足。
  • DeepSeek:文档式卡片清楚,但视觉过于理性,缺少许愿反馈的期待感。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q23

TDesign D2C 1.0 发布海报

初审倾向:Claude
Q23 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra47.2 分钟 · 48 次轨迹动作 · 3 段符合
08理解任务

读取题目、约束与评审边界

05资料探索

盘点输入数据、素材与参考

15设计构建最负相关 / 风险

构建 Web 原型

17验证迭代最正相关

渲染、浏览器或文件检查

03交付收口

符合;index.html、tdesign-d2c-1.3.0.png

路径观察常规节奏迭代,验证调整占比最高;3 段会话续跑,有明确验证动作。

最正相关 · 验证迭代验证动作 17 次;信息可读 4.5、交付完成 4.5,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 15 次、相关三项均值 4.4,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.89.3 分钟 · 26 次轨迹动作 · 1 段符合形式
02理解任务

读取题目、约束与评审边界

14资料探索最负相关 / 风险

盘点输入数据、素材与参考

02设计构建最正相关

构建 Web 原型

08验证迭代

渲染、浏览器或文件检查

00交付收口

符合形式;d2c-release-poster.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.5、构图节奏 4.6、概念辨识 4.7,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 资料探索未见强负向质量证据;信息可读/场景适配均值 4.4,资料投入未继续拉开优势,主要是效率风险。

DeepSeek Flash9.4 分钟 · 84 次轨迹动作 · 1 段符合形式
04理解任务

读取题目、约束与评审边界

30资料探索最负相关 / 风险

盘点输入数据、素材与参考

31设计构建最正相关

构建 Web 原型

19验证迭代

渲染、浏览器或文件检查

00交付收口

符合形式;poster.html

路径观察快速成型,实作构建占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.1、构图节奏 4.2、概念辨识 4.3,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 资料探索未见强负向质量证据;信息可读/场景适配均值 4.1,资料投入未继续拉开优势,主要是效率风险。

设计差异

  • Astra:信息清晰、数字突出,偏数据海报,发布会氛围较弱。
  • Claude:深色发光系统与升级 CTA 完整,发布感和记忆点最强。
  • DeepSeek:赛博仪表盘冲击强,数字很多,品牌蓝与层级稍显拥挤。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q24

buddii-bar「小黑条」腾讯 28 周年概念提案页

初审倾向:Astra / DeepSeek
Q24 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra45.3 分钟 · 42 次轨迹动作 · 3 段符合形式
04理解任务

读取题目、约束与评审边界

08资料探索

盘点输入数据、素材与参考

08设计构建最负相关 / 风险

构建 Web 原型

17验证迭代最正相关

渲染、浏览器或文件检查

05交付收口

符合形式;index.html

路径观察常规节奏迭代,验证调整占比最高;3 段会话续跑,有明确验证动作;交付判定为“符合形式”。

最正相关 · 验证迭代验证动作 17 次;信息可读 4.8、交付完成 4.8,检查迭代与最终稳定性最同向。

最负相关 / 风险 · 设计构建未见强负向质量证据;构建动作 8 次、相关三项均值 4.7,这是高分条件下的投入效率风险,不是明显画面缺陷。

Claude Opus 4.88.6 分钟 · 19 次轨迹动作 · 1 段符合形式
01理解任务最负相关 / 风险

读取题目、约束与评审边界

10资料探索

盘点输入数据、素材与参考

00设计构建最正相关

构建 Web 原型

07验证迭代

渲染、浏览器或文件检查

01交付收口

符合形式;index.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.3、构图节奏 4.4、概念辨识 4.5,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 理解任务未见强负向质量证据;场景适配 4.2 仅是六维中的相对低点,属于高分条件下的理解边界风险。

DeepSeek Flash9.9 分钟 · 78 次轨迹动作 · 1 段符合形式
01理解任务

读取题目、约束与评审边界

33资料探索最负相关 / 风险

盘点输入数据、素材与参考

18设计构建最正相关

构建 Web 原型

25验证迭代

渲染、浏览器或文件检查

01交付收口

符合形式;proposal.html

路径观察快速成型,资料盘点占比最高;单段会话完成,有明确验证动作;交付判定为“符合形式”。

最正相关 · 设计构建视觉层级 4.4、构图节奏 4.5、概念辨识 4.6,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 资料探索未见强负向质量证据;信息可读/场景适配均值 4.4,资料投入未继续拉开优势,主要是效率风险。

设计差异

  • Astra:产品大图、留白和主张最平衡,提案可信度高。
  • Claude:黑底荧光最像概念发布,视觉氛围强,产品细节被弱化。
  • DeepSeek:主张“每一次呼吸都看得见”最有记忆,产品与语义结合最好。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash
Q25

KM 26 周年接力活动主视觉设计

初审倾向:Claude
Q25 三模型并排截图

生成轨迹体验地图

将真实 trace 动作归类到五个阶段。绿色表示与成品优势最同向,橙色表示最负相关或最值得警惕的阶段;判断结合阶段动作、六维成品表现与交付证据,是观察性关联,不作因果解释。

01 理解任务02 资料探索03 设计构建04 验证迭代05 交付收口
GPT-6 Astra72.4 分钟 · 78 次轨迹动作 · 5 段部分待验
03理解任务

读取题目、约束与评审边界

16资料探索

盘点输入数据、素材与参考

17设计构建最正相关

构建 PDF + 可编辑工程包

17验证迭代

渲染、浏览器或文件检查

25交付收口最负相关 / 风险

部分待验;KM26_KV_RGB_layers.pdf、KM26_KV_live-text.svg 等 9 项

路径观察中长链路构建,实作构建占比最高;5 段会话续跑,有明确验证动作;交付判定为“部分待验”。

最正相关 · 设计构建视觉层级 4.7、构图节奏 4.6、概念辨识 4.5,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付判定为“部分待验”,成品、格式或可编辑性缺口最集中地出现在交付收口。

Claude Opus 4.812.3 分钟 · 27 次轨迹动作 · 1 段部分
01理解任务

读取题目、约束与评审边界

02资料探索

盘点输入数据、素材与参考

05设计构建最正相关

构建 图像物料

08验证迭代

渲染、浏览器或文件检查

11交付收口最负相关 / 风险

部分;KM26-KV.svg、KM26-KV.png 等 3 项

路径观察快速成型,验证调整占比最高;单段会话完成,有明确验证动作;交付判定为“部分”。

最正相关 · 设计构建视觉层级 4.7、构图节奏 4.8、概念辨识 4.9,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付判定为“部分”,成品、格式或可编辑性缺口最集中地出现在交付收口。

DeepSeek Flash43.4 分钟 · 274 次轨迹动作 · 2 段部分待验
03理解任务

读取题目、约束与评审边界

81资料探索

盘点输入数据、素材与参考

99设计构建最正相关

构建 图像物料

71验证迭代

渲染、浏览器或文件检查

20交付收口最负相关 / 风险

部分待验;km-logo-white.png、km-logo-blue.png 等 10 项

路径观察常规节奏迭代,实作构建占比最高;2 段会话续跑,有明确验证动作;交付判定为“部分待验”。

最正相关 · 设计构建视觉层级 4.4、构图节奏 4.5、概念辨识 4.6,构建阶段与这三项成品表现最同向。

最负相关 / 风险 · 交付收口交付判定为“部分待验”,成品、格式或可编辑性缺口最集中地出现在交付收口。

设计差异

  • Astra:友好、知识接力概念清楚,插画系统易延展。
  • Claude:数字 26、光轨和接力动作形成最集中主视觉,周年感最强。
  • DeepSeek:速度感与年轻化最强,元素较多,对多尺寸延展要求更高。

逐题雷达

视觉层级信息可读构图节奏概念辨识场景适配交付完成GPT-6 AstraClaude Opus 4.8DeepSeek Flash