List पर वापस जाएँ
📄Papers

FlowEval: Reference-Based Evaluation of Generated User Interfaces

Wu J. et al.
2026-05

परिचय

Apple से जुड़ी यह research जाँचती है कि generated interfaces वास्तविक user journeys को कितना support करते हैं। FlowEval reference websites और उनके generated analogs पर validated tasks चलाता है, reference-based similarity metrics से navigation traces की तुलना करता है, और जाँचता है कि ये scores expert UI judgments से कितने मेल खाते हैं।

सारांश

FlowEval क्या नया संकेत देता है:

1. Interaction-first evaluation: केवल screenshots या code correctness पर निर्भर रहने के बजाय पूरे task flows मापता है
2. Trusted references: Generated sites की तुलना जाने-पहचाने high-quality interfaces से लिए गए traces से करता है
3. Automatable method: तुलनीय interaction sequences इकट्ठा करने के लिए computer-use agents और navigation tasks इस्तेमाल करता है
4. समझने योग्य diagnostics: Trace similarity बता सकती है कि generated flow reference experience से कहाँ अलग होता है
5. Human alignment evidence: Reference-based metrics और generated UIs के expert evaluations के बीच मजबूत correlation रिपोर्ट करता है

Tags

ui-evaluationinteraction-flowscomputer-use-agentsbenchmarkhuman-evaluation
मूल लेख पढ़ें

मिलते-जुलते लेख

📄Papers

LEGOUI: Designing with UI-DSL Bricks for Transparent, Controllable Generation

अगस्त 2026 का HCI paper, जो शुरुआती design ideation के लिए staged Generative UI framework पेश करता है। LEGOUI prompt से मिले और model द्वारा अनुमानित फैसलों को provenance-aware UI DSL में दर्ज करता है, users को layout, interaction, relation और style stages में फैसले स्वीकार, अस्वीकार या जोड़ने देता है, और बदलती specification से interface render करता है।

genuiui-dsldesign-time
लेखक Zhou Y. et al. · 2026-08
और पढ़ें
📄Papers

Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation

जुलाई 2026 का paper, जो ESPP नाम की evaluation method पेश करता है। यह एक LLM judge की जगह evidence-grounded और मनोवैज्ञानिक रूप से विविध personas का panel रखता है। Panelists generated-interface screenshots को स्वतंत्र रूप से rate करते हैं, bounded-confidence mechanism के जरिए राय साझा करते हैं, और उनके scores को social weighting के साथ जोड़ा जाता है।

genuiui-evaluationhuman-preferences
लेखक Wu Z. et al. · 2026-07
और पढ़ें
📄Papers

Design Theater: A Benchmark for Generative UI

जुलाई 2026 का paper, जो यह जाँचने के लिए benchmark पेश करता है कि Generative UI tools users को बताए गए design rationales सच में लागू करते हैं या नहीं। पाँच tools से बने 120 interfaces और 24 structural, styling व functional tasks में यह study बताए गए design decisions और generated result के बीच अंतर मापती है।

genuiui-evaluationdesign-rationale
लेखक Imteyaz K. et al. · 2026-07
और पढ़ें

Generative UI resources का curated संग्रह।

बनाया गया ❤️ community द्वारा