简介
2026 年 8 月发布的 LLM 生成界面评估基准,用确定性标注替代噪声较大的人工标签。SchemaGUI 从参数化 UI schema 合成中英文指令与函数调用真值,并在六类场景、五个模型上分别衡量可行性、几何控制与布局复杂度。
内容总结
SchemaGUI 带来的新信号:
1. 确定性评估:从界面 schema 直接生成精确函数调用真值,不依赖主观截图标注
2. 双语覆盖:在六类代表性中英文 GUI 任务中,每个场景、每种语言评估 1,000 个实例
3. 拆分能力维度:分别衡量 schema 可行性、几何控制与整体 GUI 质量,而不是压缩成单一视觉指标
4. 揭示空间瓶颈:模型规模扩大后,结构有效性提升快于精确坐标控制,密集网格和多区域布局尤其困难
5. 推理模式发现:thinking mode 消耗更多 token,却通常降低 GUI 分数,对较小模型影响更明显
1. 确定性评估:从界面 schema 直接生成精确函数调用真值,不依赖主观截图标注
2. 双语覆盖:在六类代表性中英文 GUI 任务中,每个场景、每种语言评估 1,000 个实例
3. 拆分能力维度:分别衡量 schema 可行性、几何控制与整体 GUI 质量,而不是压缩成单一视觉指标
4. 揭示空间瓶颈:模型规模扩大后,结构有效性提升快于精确坐标控制,密集网格和多区域布局尤其困难
5. 推理模式发现:thinking mode 消耗更多 token,却通常降低 GUI 分数,对较小模型影响更明显
标签
ui-generationbenchmarkschema-drivenspatial-reasoningbilingual