Episode 001
同一份网站需求,装 3 个 UI Skill,结果真的更好吗?
用同一份中文网页任务,对比无 Skill 基线、frontend-design、design-taste-frontend 与 UI UX Pro Max 的首轮公开结果。
一句话结论同一份网页任务装上三种 UI Skill 后,首轮最高三组只差 1 分,低于至少 3 分才算赢的胜负线,因此这轮没有明确赢家。
- 核验日期
- 2026-07-19
- 胜负线
- 分差 3 分及以上才算明确胜负
- 最高分差
- 最高三组只差 1 分
- 功能失败
- 规定浏览器检查中的失败为 0
本集视频
四组真实截图








完整分数
组别总分十秒能否看懂(编辑代评)核心动作手机与可访问性工程视觉适配
无 Skill 基线902020201515
frontend-design892020191515
design-taste-frontend862020201412
UI UX Pro Max892020201415
- 无 Skill 基线:总分最高,但领先幅度不足以形成明确赢家。
- frontend-design:只在手机与可访问性代理检查里少 1 分。
- design-taste-frontend:功能项没掉分,但工程与视觉适配拉开了差距。
- UI UX Pro Max:与 frontend-design 并列第二,功能失败记录同样为 0。
方法
四组都接收同一份中文单页任务:为虚构整理服务制作带真实文案、价格、预约按钮、表单、FAQ、手机布局和 reduced-motion 的网页。
- 四组都接收同一份中文任务说明,不把换题误当成 Skill 差异。
- 首轮只记录 90 分主量表:十秒能否看懂(编辑代评)、核心动作、手机与可访问性、工程、视觉适配。
- 浏览器检查覆盖 1440x1000 与 390x844 两个视口,共 8 张首屏截图。
- 规定浏览器检查中的功能失败为 0,覆盖按钮、表单、FAQ、锚点、控制台、横向滚动与 reduced-motion。
- 只有当分差至少 3 分时才算形成明确胜负,这轮最高三组只差 1 分。
限制
- 模型标识未保留,无法核验四组模型配置是否一致,也不能把差异归因到模型或 Skill。
- 理解度 20 分来自编辑内部检查,不是真实读者测试。
- 稳定性 10 分尚未运行,所以这不是长期稳定性结论。
- 功能失败 0 只覆盖规定检查项,不证明后端预约送达、所有辅助技术都可用或上线后长期稳定。
Skill 来源说明与原作者来源
原作者来源已核验。
原作者来源已核验。
原作者来源未核验;本页只引用本站公开实测。
公开结果保留了分数、边界、浏览器检查与无明确赢家的结论。
你可以怎样复用这套方法
如果你也想比较 UI Skill,不要只看截图或 Demo。把下面 7 步固定下来,再决定哪些结论值得继续复测。
- 先写一份固定 Brief:把真实文案、必须工作的按钮、表单、FAQ、手机布局和 reduced-motion 一次写清楚。
- 在看结果前先锁评分表:明确要看哪几项,以及什么分差才算形成明确胜负。
- 每组隔离运行并保留原始记录:至少记下 Skill、模型标识、输入、输出、截图和修改文件。
- 桌面和手机一起查:不要只看首屏,还要查按钮、表单、键盘、控制台、锚点和横向滚动。
- 把功能检查写成固定清单:空表单报错、有效提交、本地成功态、FAQ、reduced-motion 都要过。
- 至少重复三次再谈稳定性:单次跑赢不代表长期更稳,也不能直接当推荐榜。
- 把原作者来源、本站实测和真实用户反馈分开记:来源身份、单轮输出和长期使用不要混成一个结论。
公开证据入口
保留原始公开证据路径,便于回看同一轮记录。
保留原始公开证据路径,便于回看同一轮记录。