自动应用 HCI 原则:用 Skills 按需构建生成式 UI
一篇提出用机器可读 skills 指导 Agent 生成任务专属界面的观点论文。它通过人机共享工作区连接对话、任务拆解和 UI 状态,并用可审查的 skill 文件编码可用性启发式、无障碍标准、认知负荷建议与混合主动交互原则。
AUV-Bench:用户界面审美理解与生成评测
2026 年 9 月提出的 UI 评测基准,在 1,395 个可执行 Web 界面上统一测试审美评分、问题诊断、界面修复与文本生成 UI,并用 660 个受控退化案例配对诊断和修复,检验模型能否把设计判断转化为有效的界面修改。
Elicitive User Interfaces:让用户参与塑造生成式界面
2026 年 9 月的人机交互论文,提出在生成界面的同时生成询问方式,帮助用户表达尚未说出的偏好。论文给出六维设计空间,并用 Ditto 原型实现嵌入界面的提问、备选方案和可编辑控件,通过两项用户研究观察其效果。
GUIDE:由设计师持续校准生成式界面
2026 年 9 月的人机交互论文,介绍在 Figma 中帮助设计师约束生成式界面的 GUIDE 系统。它把画布修改用于优化生成提示,并调整设计一致性评分模型,以项目参考界面为依据筛选候选页面。
用 Generative UI 构建定制化学习交互
Google Research 于 2026 年 9 月发布的论文,研究如何用 Gemini 生成定制化 STEM 模拟。该教师主导流程先把学习目标转成带脚手架的多关卡界面,再从视觉、解题逻辑、遥测反馈和交互机制四个方面检查并迭代修复实际运行的 HTML 与 JavaScript。
IWC-Bench:从软件测试视角评估 Web 应用生成
2026 年发布的 LLM 生成 Web 应用评测基准,通过代码覆盖率引导 browser agent 探索可运行应用。IWC-Bench 对应用进行插桩,把交互轨迹抽象为状态转换图,并基于 369 条真实需求与 5,088 项验收标准分别评估视觉美感、可用性和需求一致性。
用小模型成本实现接近前沿质量的声明式 UI 生成
2026 年 9 月 Harness4GenUI 论文,研究小语言模型能否基于受控组件目录生成面向生产的 A2UI。作者在任务管理与云控制台两个场景中,对比训练数据策略、模型规模、组件目录规模、成本、延迟、数据绑定正确性和渲染质量。
EvoGenUI-Bench:评测多轮 Generative UI 助手的界面维护能力
2026 年 8 月发布的 Generative UI 基准,检验 LLM 助手能否随着用户需求持续变化,维护同一个可执行 Web 界面。EvoGenUI-Bench 包含 150 个五轮任务,覆盖信息呈现、有状态交互和工具驱动的外部状态,并结合截图、DOM、源码、操作轨迹与运行日志进行浏览器实测。
Maru:用信息架构实现持续对齐的生成式 UI
2026 年 8 月的 HCI 论文,将信息架构作为 Generative UI 的共享状态。Maru 捕捉用户如何划分、排序、命名和确定信息优先级,把这些选择转化为可持续规则,并在后续多轮界面生成中复用,而不是每次都从提示词重新推断结构。
SchemaGUI:面向可控 GUI 生成的 Schema 驱动评估基准
2026 年 8 月发布的 LLM 生成界面评估基准,用确定性标注替代噪声较大的人工标签。SchemaGUI 从参数化 UI schema 合成中英文指令与函数调用真值,并在六类场景、五个模型上分别衡量可行性、几何控制与布局复杂度。
RAGE-Vis:面向图表编辑的关系感知生成式界面
ChinaVis 2026 论文,提出用于自然语言图表编辑的 Generative UI。RAGE-Vis 将位图图表转换为可编辑的参数化表示,解析复合请求,并针对表达不完整的编辑意图生成层级面板,让全局与局部控件保持联动。
LEGOUI:用 UI-DSL 积木实现透明、可控的界面生成
2026 年 8 月 HCI 论文,提出面向早期设计探索的分阶段 Generative UI 框架。LEGOUI 用带来源追踪的 UI DSL 记录提示中提取和模型推断的设计决策,允许用户在布局、交互、关系与样式阶段接受、拒绝或补充决策,并从持续演化的规范渲染界面。
超越单一评审:用社会化 Persona 小组评估 Generative UI
2026 年 7 月论文,提出 ESPP 生成式界面评估方法,用一组有证据支撑、心理特征多样的 Persona 取代单个 LLM judge。评审者先独立评价界面截图,再通过有界信任机制交换意见,最后以社会权重聚合结果。
Design Theater:生成式 UI 的设计说法兑现了吗?
2026 年 7 月论文,提出一套基准,用来检查 Generative UI 工具向用户解释的设计理由,是否真正落实在生成界面中。研究覆盖五款工具生成的 120 个界面,以及结构、样式和功能三类共 24 项任务。
MV-Bench:多模态大模型的协调式多视图界面构建基准
2026 年 7 月论文,评估多模态大模型能否根据视觉设计生成可执行的多视图可视化界面。MV-Bench 以 Tableau 工作簿作为结构化真值,同时衡量视觉还原、数据绑定、联动交互与代码可执行性。
通过强化学习检测 UI 设计原则违规
2026 年 7 月论文,研究如何用轻量视觉语言模型评审生成式 Web 界面。作者整合了 WCAG 2.2 无障碍、欺骗性设计和认知可用性三类共 19 项原则,并在约 10,000 个注入且验证过违规项的生成页面上训练模型。
TaskArtisan:为 LLM 辅助分析设计可组合的生成式组件
2026 年 7 月 HCI 论文,研究 Generative UI 如何让冗长、多步骤的聊天式分析流程更容易回顾和复用。TaskArtisan 支持用户创建分析组件,并将其组合成顺序或扇出式工作流,再通过 12 人对照实验与传统聊天机器人进行比较。
AI Prototyper:基于分解方法与 LLM 的 Figma GUI 原型插件
2026 年 7 月论文,提出 AI Prototyper:一个开源 Figma 插件,可把自然语言描述转成完全可编辑的界面原型。系统先把需求拆成可审核的功能列表,再从固定的 32 个基础组件中检索并生成符合 schema 的实例,最后用 auto-layout 渲染为原生 Figma 图层。
Spatula:探索按需生成的原位界面与属性控制交互
2026 年 7 月 HCI 论文,提出 Spatula:一个由 LLM 驱动、可直接在动态图形画布上生成情境化控件的系统。其弹性属性控制空间支持渐进发现、多层精度、语义分组编辑,以及按需扩展新控件。
重新思考 GenUI 的界面:两种设计路径的对照
2026 年 6 月 HCI 论文,对比 Generative UI 工具常见的自由提示、纵深推进和高保真生成模式,与结构化输入、广度优先和低保真探索方案。研究通过 24 名 UX 设计师和产品经理的对照实验,揭示早期设计探索中的具体取舍。
The Missing Layer:为什么 EdTech 需要设计时 Generative UI,而不只是运行时个性化
2026 年 6 月 arXiv 论文,已被 AIED NextGen Learning Interfaces Workshop 接收。论文认为,自适应教育不应只在学习者运行时用 AI 个性化内容,而应在课件创作阶段使用 Generative UI,让教师先验证无障碍、多模态和不同带宽条件下的界面表达。
TaskLens:为学习专业创作软件生成任务条件化支架界面
DIS 2026 / arXiv 论文,提出 TaskLens:一种用 LLM 为复杂创作工具生成任务条件化支架 UI 的方法。系统会识别工作流阶段与领域概念,选择相关工具,生成实现代码,并在 Blender 等软件中生成逐步暴露高级功能的界面。
FlowEval:基于参考界面的生成式 UI 评估方法
一项由 Apple 研究人员参与的生成界面评估工作,重点判断生成 UI 能否支持真实用户流程。FlowEval 在参考网站和生成版本上执行经过验证的任务,用相似度指标比较导航轨迹,并检验这些分数与 UI 专家判断的一致性。
Macaron-A2UI:面向个人 Agent 的生成式 UI 模型
2026 年新近发布的 arXiv 论文,聚焦个人 Agent 的运行时 Generative UI。作者认为纯文本聊天已成为复杂 Agent 任务的瓶颈,并提出大规模 Generative UI 语料与 A2UI-Bench,训练模型同时生成自然语言和可执行的轻量 UI 动作,用于确认、偏好细化和多目标协同。
生成式用户界面的高效个性化
一篇聚焦 GenUI 核心难题之一“个性化”的 arXiv 新论文。作者让多位受训设计师对同一批 600 个生成界面进行成对判断,证明设计偏好存在明显分歧,并提出一种样本效率更高的偏好建模方法,在个性化界面生成上优于基线评估器和直接提示方式。
MAIC-UI:用生成式 UI 制作交互式课件
这篇新近 arXiv 论文提出了一个面向教育课件的零代码 GenUI 系统。MAIC-UI 可把教材、PPT 和 PDF 转成交互式学习页面,使用 generate-verify-optimize 流程提升教学准确性,并支持 click-to-locate 增量编辑,而不是每次都高成本整页重生。
Generative UI as an Accessibility Bridge:来自 C2C 电商的启示
arXiv / CHI 2026 workshop 论文,讨论运行时 Generative UI 如何弥补用户生成型电商内容中的无障碍缺口。作者基于面向盲人、低视力用户和老年用户的六项研究,将适配界面、音频引导和 HTML 再生成视为由策略驱动的无障碍干预,而不只是界面个性化。
What does Generative UI mean for HCI Practice?
CHI EA 2026 workshop paper from Microsoft Research and academic HCI researchers on how AI-generated interfaces may reshape design methods, workflows, and user experiences. It is useful because it frames GenUI as a practice-level shift for researchers, designers, developers, and product teams, not only a model-output technique.
Software as Content:动态应用作为人机 Agent 交互层
2026 年 arXiv 论文指出,纯聊天并不适合结构化且有状态的人机 Agent 协作。作者提出 Software as Content:让动态生成的 agentic 应用成为主要交互层,跨轮次持续存在,并通过可操作控件而不是线性文本来承载协作。
钥孔效应:为什么聊天界面会在数据分析中失效
2026 年 arXiv 论文指出,聊天并不是多步骤、有状态分析工作的理想默认界面。论文从认知科学角度解释线性对话为何会失效,并把 Generative UI 等混合交互模式定位为恢复可见性、空间记忆与用户控制权的实际路径。
作为可塑软件设计方法的渐进式界面生成
2026 年 arXiv 论文,提出“渐进式界面生成”设计方法:在生成过程中插入中间界面层,让用户能逐步发现和控制定制选项,而不是只面对一个巨大的提示框或复杂菜单。
AlignUI: A Method for Designing LLM-Generated UIs Aligned with User Preferences
2026 arXiv paper on aligning LLM-generated interfaces with user tasks and preferences. The authors collect 720 UI-control preferences from 50 users across image-editing tasks, use that dataset to guide model reasoning, and evaluate generated UIs with 72 additional users.
Generative UI:大语言模型是有效的 UI 生成器
Google Research 论文,首次系统阐述了 Generative UI 理念。论文定义 Generative UI 是"AI 模型生成的,不仅是内容,还有整个用户体验"。实验证明,在正确的提示和工具下,大语言模型可为任意提示生成高质量的自定义交互界面,44% 的情况下效果可与人类专家相当。论文还发布了 PAGEN 数据集,用于生成界面的评估。
用设计师反馈改进用户界面生成模型
一篇研究如何用符合专业设计实践的反馈来训练 LLM 界面生成器的论文。作者邀请 21 名设计师,比较排序、文字评论、草图标注和直接修改四种反馈方式,再用这些数据改进能够生成可渲染界面的代码模型。
面向语言模型的生成式界面
ACL 2026 Findings 论文提出一种新范式:LLM 不再只返回文本,而是主动生成面向任务的界面。论文结合面向界面的结构化表示与迭代优化,并报告在人类评测中,生成式界面在信息密集和探索型任务上相较纯对话方案最高获得 72% 的偏好提升。
迈向生成式用户界面设计的工作定义
DIS 2025 会议论文,通过文献调研和案例分析,首次提出 Generative UI(GenUI)的工作定义。研究指出 GenUI 是"设计时人机协作生成界面、运行时用户与 AI 生成界面交互"的一种新型界面创建模式。论文总结出 GenUI 的五个关键特征:协同创建、设计空间扩展、表现流动性、情境适应、生成优先。
基于生成式 AI 的可生成和可变换用户界面
CHI 2025 文章,提出利用 AI 根据用户任务生成"可生成和可变换的用户界面"。作者设计了任务驱动的数据模型,让 LLM 解析用户提示并生成 UI 规范,然后映射为具体界面。实验证明,该方法能够动态生成表单、可视化等界面元素,支持用户通过自然语言修改界面。
BISCUIT:在计算笔记本中用短暂 UI 支架辅助 LLM 生成代码
Apple 研究团队发表于 VL/HCC 2024 的论文,提出 BISCUIT:在 JupyterLab 中于用户意图和 LLM 生成代码之间加入一层短暂的 UI 支架。系统不是直接从提示跳到源代码,而是先生成临时交互控件,帮助用户理解选项、细化需求,并在真正产出代码前探索变量空间。