多模态大模子在把柄静态截图生成网页代码(Image-to-Code)方面已展现出不俗智力,这让很多东谈主对 AI 自动化前端成立充满期待。
但是,一个网页的着实价值远不啻于其静态布局。用户的点击、筛选、表单提交,乃至游戏中的每一步操作,都组成了其中枢的交互功能。这些动态、有气象的交互逻辑,恰正是传统静态评测无法涉及的盲区。
为了填补这一关节空缺,上海东谈主工智能实验室聚首浙江大学等机构的征询者,建议了IWR-Bench——一个旨在更真的地评估 LVLM 交互式网页重建智力的评测基准。

IWR-Bench 的中枢转动在于,它不再提供静态截图,而是条目模子不雅看一段纪录了齐全用户操作经过的视频,并联结网页所需的一王人静态资源(如图片、图标、子视频等),去相识并复现通盘页面的动态行为。任务的复杂性跨度很大,检朴单的浏览功能,到需要逆向工程游戏限定的 2048、订机票等愚弄。
这项任务的难度远超预期。在对 28 个主流模子的全面测试中,即即是分解最好的模子 GPT-5,其详细得分也仅有 36.35 分。这一摈弃明晰地指出了刻下模子的中枢短板,IWR-Bench 不仅为规模提供了一个更具挑战性的新主义,也为改日的征询指出了一个新的主义。
中枢亮点:
首个视频输入的交互网页重建评测:从" image-to-code "迈向" video-to-code ",对网页事件驱动逻辑的生成建议刚性条目
真的场景、齐全资源:113 个网站任务、1001 次交互作为;提供一王人静态资源并匿名化定名,靠拢真的成立
自动化 Agent-as-a-Judge:用编程代理复现作为轨迹,双重评分同期评估功能正确性(IFS)与视觉保真度(VFS)
28 个 LVLM 系统测评:最好模子总分 36.35%,IFS 仅 24.39%、VFS 为 64.25%;通用多模态模子权贵优于"视频专长"模子

△10 个代表性模子在 IWR-Bench 任务上的评测总览掩饰全面的真的宇宙网页任务
现存的网页代码生成基准(如 Design2Code、WebSight)主要聚焦于静态截图转代码(image2code),而 IWR-Bench 则专注于动态视频转可交互网页代码 ( video2code ) :
传统任务: 给 AI 一张网页截图 → 生成 HTML/CSS 代码
IWR 任务: 给 AI 一段用户操作视频 + 网页静态资源 → 生成包含齐全交互逻辑的代码
值得一提的是,每个任务都提供了齐全的静态资源(图片、图标、视频等),何况整个文献名都经过匿名化解决(如 logo.png → asset_001.png),迫使模子必须依靠视觉匹配而非语义推理。静态资源的引入,也为平直基于渲染摈弃而非 HTML 代码进行评测提供了关节匡助。
下图为 IWR-Bench 任务和评测总览,模子输入包括 ( a ) 用户交互视频, ( b ) 爬取的静态资源的缩略图与文献旅途,条目模子输出 html 代码。评测时,通过 agent 在浏览器上基于 ( c ) 标注的操作轨迹进行操作,以完竣基于查验点的自动化评分。

IWR 任务对模子的三大中枢挑战包括:
多模态相识:从视频帧精确捕捉布局、文本与组件气象
多模态推理:在技巧序列中推息交互逻辑与因果相干,并将视频元素与静态资源可靠匹配与绑定
高档代码生成:将预见出的气象机与事件逻辑完竣为可脱手的前端代码

IWR 任务的范围和掩饰范围如下:
113 个来自真的网站的任务,分歧率掩饰桌面与移动端(19 种,移动占 10.62%)
共 1001 个交互作为,平均每任务 8.9 步;其中 620 个视觉查验点、403 个逻辑断言
复杂任务包含 2048、扫雷等齐全游戏逻辑与 GUI 重建
评测框架和目的
IWR-Bench 选拔了一套严格的自动化评测契约,通过编程代理(基于 browser-use 库)来模拟真的用户的网页操作。
评测经过
操作奉行:代理按照预界说的作为序列操作生成的网页
功能考据:查验每个操作是否能正确奉行,以及逻辑断言是否餍足
视觉对比:在关节查验点截图,与参考页面进行多维度对比
双重评分体系
交互功能分数(IFS):掂量功能正确性
筹画告捷完成的操作占总操作数的比例 , 操作失败包括浏览器奉行失败、逻辑断言失败
SOTA 模子 GPT-5 的 IFS 仅为 24.39%
视觉保真度分数(VFS):掂量视觉收复度 - 联结初级特征(OCR 文本同样度、DINO 结构同样度)
交融高档评估(由 Gemini-2.5-Pro 进行合座评判)
SOTA 模子 GPT-5 的 VFS 为 64.25%
评测摈弃

△IWR-Bench 在 28 个模子上的评测摈弃
征询东谈主员从中取得了三个关节发现。
当先,功能完竣是最大瓶颈。
整个模子的 VFS 都权贵高于 IFS,这揭示了一个中枢问题:
模子大略较好地复现静态视觉后果,但在生成事件驱动逻辑方面严重不及。
举例,GPT-5 大略达到 64.25% 的视觉保真度,但功能正确性仅为 24.39% ——这意味着即使页面"看起来对",现实操作时有 75% 以上的功能无法时常责任。
其次,thinking 版块带来部分普及。
" thinking "版块模子多量分解更好:
Claude-Sonnet-4 ( thinking ) vs. 世俗版:34.62 vs. 34.00
Claude-Opus-4 ( thinking ) vs. 世俗版:34.13 vs. 33.33
Gemini-2.5-Pro ( thinking ) vs. 世俗版:30.36 vs. 30.31
但普及幅度有限,证据基础模子智力如故决定性身分。
另外,目下的独到视频相识模子后果不如通用多模态模子。
挑升针对视频相识磨砺的模子(如 VideoLLaMA3、InternVideo)分解垫底,而通用的多模态大模子分解更优。这标明,该任务与传统的视频理奉命务具有权贵的各异性。
IWR-Bench 的推出,绚烂着 AI 从"看懂静态网页"到"相识动态交互"的关节一步。36 分的收获告诉咱们:这条路还很长。这不仅是对 AI 多模态智力的一次全面体检,更是为多模态智力通晓指明了下一阶段的攻坚主义。
IWR-Bench 由上海东谈主工智能实验室聚首浙大、2077AI、港汉文、斯坦福等单元共同完成,第一作家陈杨是浙江大学硕士生,通信作家为上海东谈主工智能实验室沈宇帆、石博天。
论文陆续:
https://arxiv.org/abs/2509.24709
代码地址:
https://github.com/L-O-I/IWR-Bench
数据地址:
https://huggingface.co/datasets/IWR-Bench/IWR-Bench
样子主页:
https://l-o-i.github.io/IWR-Bench/
一键三连「点赞」「转发」「防卫心」
宽贷在挑剔区留住你的念念法!
— 完 —

� � 点亮星标 � �
科技前沿进展逐日见开云kaiyun