परिचय
जुलाई 2026 का paper, जो यह जाँचने के लिए benchmark पेश करता है कि Generative UI tools users को बताए गए design rationales सच में लागू करते हैं या नहीं। पाँच tools से बने 120 interfaces और 24 structural, styling व functional tasks में यह study बताए गए design decisions और generated result के बीच अंतर मापती है।
सारांश
1. Rationale-to-interface evaluation: जाँचता है कि generated design explanations असली UI में दिखाई देते हैं या नहीं
2. तीन requirement classes: Structural, styling और functional implementation quality को अलग-अलग मापता है
3. Cross-tool benchmark: पाँच Generative UI tools से बने 120 interfaces का मूल्यांकन करता है
4. ठोस failure evidence: औसतन 25% से अधिक बताए गए rationales लागू नहीं मिले; functional requirements में यह आँकड़ा 34% तक पहुँचा
5. UX principle coverage: मापता है कि tools prompts में मौजूद design principles को पहचानकर लागू करते हैं या नहीं