小白我要学实用 Agent 教程与工具实测
目录

Episode 001

同一份网站需求,装 3 个 UI Skill,结果真的更好吗?

用同一份中文网页任务,对比无 Skill 基线、frontend-design、design-taste-frontend 与 UI UX Pro Max 的首轮公开结果。

一句话结论同一份网页任务装上三种 UI Skill 后,首轮最高三组只差 1 分,低于至少 3 分才算赢的胜负线,因此这轮没有明确赢家。

核验日期
2026-07-19
胜负线
分差 3 分及以上才算明确胜负
最高分差
最高三组只差 1 分
功能失败
规定浏览器检查中的失败为 0

本集视频

四组真实截图

完整分数

组别总分十秒能否看懂(编辑代评)核心动作手机与可访问性工程视觉适配
无 Skill 基线902020201515
frontend-design892020191515
design-taste-frontend862020201412
UI UX Pro Max892020201415
  • 无 Skill 基线:总分最高,但领先幅度不足以形成明确赢家。
  • frontend-design:只在手机与可访问性代理检查里少 1 分。
  • design-taste-frontend:功能项没掉分,但工程与视觉适配拉开了差距。
  • UI UX Pro Max:与 frontend-design 并列第二,功能失败记录同样为 0。

方法

四组都接收同一份中文单页任务:为虚构整理服务制作带真实文案、价格、预约按钮、表单、FAQ、手机布局和 reduced-motion 的网页。

  • 四组都接收同一份中文任务说明,不把换题误当成 Skill 差异。
  • 首轮只记录 90 分主量表:十秒能否看懂(编辑代评)、核心动作、手机与可访问性、工程、视觉适配。
  • 浏览器检查覆盖 1440x1000 与 390x844 两个视口,共 8 张首屏截图。
  • 规定浏览器检查中的功能失败为 0,覆盖按钮、表单、FAQ、锚点、控制台、横向滚动与 reduced-motion。
  • 只有当分差至少 3 分时才算形成明确胜负,这轮最高三组只差 1 分。

限制

  • 模型标识未保留,无法核验四组模型配置是否一致,也不能把差异归因到模型或 Skill。
  • 理解度 20 分来自编辑内部检查,不是真实读者测试。
  • 稳定性 10 分尚未运行,所以这不是长期稳定性结论。
  • 功能失败 0 只覆盖规定检查项,不证明后端预约送达、所有辅助技术都可用或上线后长期稳定。

Skill 来源说明与原作者来源

你可以怎样复用这套方法

如果你也想比较 UI Skill,不要只看截图或 Demo。把下面 7 步固定下来,再决定哪些结论值得继续复测。

  • 先写一份固定 Brief:把真实文案、必须工作的按钮、表单、FAQ、手机布局和 reduced-motion 一次写清楚。
  • 在看结果前先锁评分表:明确要看哪几项,以及什么分差才算形成明确胜负。
  • 每组隔离运行并保留原始记录:至少记下 Skill、模型标识、输入、输出、截图和修改文件。
  • 桌面和手机一起查:不要只看首屏,还要查按钮、表单、键盘、控制台、锚点和横向滚动。
  • 把功能检查写成固定清单:空表单报错、有效提交、本地成功态、FAQ、reduced-motion 都要过。
  • 至少重复三次再谈稳定性:单次跑赢不代表长期更稳,也不能直接当推荐榜。
  • 把原作者来源、本站实测和真实用户反馈分开记:来源身份、单轮输出和长期使用不要混成一个结论。

公开证据入口