大模型生成
采用统一的 Prompt 集、数据输入与运行条件,对每个模型独立生成 3 轮,并汇总平均结果。
采用统一的 Prompt 集、数据输入与评测标准,对比主流大模型在 ToC 用户场景和 ToD 专业生成场景中的 A2UI 生成质量、响应速度与 Token 消耗,为模型选型与实际应用提供参考。
| 提示词 | gemini-3.5-flash | claude-opus-5 | gpt-5.6-sol | claude-opus-4-8 | gemini-3.1-flash-lite | qwen3.7-max | deepseek-v4-pro | qwen3-coder | gpt-5.4-mini | claude-sonnet-5 | gemini-3.1-pro | gemini-2.5-pro | kimi-k2.6 | gemini-2.5-flash | glm-5.2 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
采用统一的 Prompt 集、数据输入与运行条件,对每个模型独立生成 3 轮,并汇总平均结果。
真机原生渲染并采集最终截图。
计算锚点命中、数据一致、结构、交互、耗时与 Token;并由大模型对有效截图进行专业 UI 质量盲评。
是否真正理解用户想要什么,核心信息是否覆盖。
sum(anchor_weight * anchor_hit) / sum(anchor_weight)
关键信息是否完整,展示的数据是否正确。
sqrt(info_coverage * data_accuracy)
页面能否正常显示、结构是否完整、交互是否可用。
sqrt(info_coverage * (0.5 * basic_usability + 0.5 * ui_quality))
用户发出请求到收到第一段内容的耗时。
first_token_time - request_time
输入 Token 与输出 Token 的总和。
input_tokens + output_tokens
是否按照要求生成了功能完整、视觉专业的页面。
sqrt(feature_completion * ui_quality)
能否准确修改指定内容,同时保持其他部分不变。
sqrt(edit_completion * (0.5 * component_retention + 0.5 * data_retention))
生成页面与设计稿在布局、样式和内容上的相似度。
clamp(ms_ssim, 0, 1)
从发起请求到完整页面生成结束耗时。
generation_completed_time - request_time
输入 Token 与输出 Token 的总和。
input_tokens + output_tokens