能力排名

ToC 用户场景

ToC model rankings across five raw metrics

ToD 专业生成场景

ToD model rankings across five raw metrics

生成效果

提示词gemini-3.5-flashclaude-opus-5gpt-5.6-solclaude-opus-4-8gemini-3.1-flash-liteqwen3.7-maxdeepseek-v4-proqwen3-codergpt-5.4-miniclaude-sonnet-5gemini-3.1-progemini-2.5-prokimi-k2.6gemini-2.5-flashglm-5.2

评测环境

模型列表

15 models
Google 5
gemini-3.5-flash
gemini-3.1-pro
gemini-2.5-pro
gemini-2.5-flash
gemini-3.1-flash-lite
Anthropic 3
claude-opus-5
claude-opus-4-8
claude-sonnet-5
OpenAI 2
gpt-5.6-sol
gpt-5.4-mini
中国厂商 5
qwen3.7-max 阿里
qwen3-coder开源 阿里
deepseek-v4-pro开源 DeepSeek
glm-5.2开源 智谱
kimi-k2.6开源 月之暗面

评测流程

3 steps
STEP 01

大模型生成

采用统一的 Prompt 集、数据输入与运行条件,对每个模型独立生成 3 轮,并汇总平均结果。

STEP 02

渲染与截图

真机原生渲染并采集最终截图。

STEP 03

指标评估

计算锚点命中、数据一致、结构、交互、耗时与 Token;并由大模型对有效截图进行专业 UI 质量盲评。

评估规则

10 metrics

ToC 用户场景

意图理解能力

是否真正理解用户想要什么,核心信息是否覆盖。

sum(anchor_weight * anchor_hit) / sum(anchor_weight)
0–100%越高越好
数据准确性

关键信息是否完整,展示的数据是否正确。

sqrt(info_coverage * data_accuracy)
0–100%越高越好
UI可用度

页面能否正常显示、结构是否完整、交互是否可用。

sqrt(info_coverage * (0.5 * basic_usability + 0.5 * ui_quality))
0–100%越高越好
首 Token 响应时间(TTFT)

用户发出请求到收到第一段内容的耗时。

first_token_time - request_time
越低越好
Token 总消耗

输入 Token 与输出 Token 的总和。

input_tokens + output_tokens
Token越低越好

ToD 专业生成场景

UI 生成能力

是否按照要求生成了功能完整、视觉专业的页面。

sqrt(feature_completion * ui_quality)
0–100%越高越好
UI 编辑能力

能否准确修改指定内容,同时保持其他部分不变。

sqrt(edit_completion * (0.5 * component_retention + 0.5 * data_retention))
0–100%越高越好
UI 稿还原能力

生成页面与设计稿在布局、样式和内容上的相似度。

clamp(ms_ssim, 0, 1)
0–100%越高越好
生成速度

从发起请求到完整页面生成结束耗时。

generation_completed_time - request_time
越低越好
Token 总消耗

输入 Token 与输出 Token 的总和。

input_tokens + output_tokens
Token越低越好

5 项指标雷达图

外圈 = 更优

TTFT 与 Token 总消耗经反向归一化处理:原始值越低,雷达位置越靠外。