Beyond a Single Judge: The Evidence-Grounded, Social-Weighted Persona Panel for Generative UI Evaluation
超越单一评判者:用于生成式UI评估的社会角色面板模拟
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 该研究针对GenUI评估问题,提出三阶段ESPP方法,通过多样化角色面板提升评估保真度,揭示用户子群体的结构性分歧,代码已公开。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
超越单一评判者:用于生成式UI评估的社会角色面板模拟
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 该研究针对GenUI评估问题,提出三阶段ESPP方法,通过多样化角色面板提升评估保真度,揭示用户子群体的结构性分歧,代码已公开。
缓解临床分布偏移下医学视觉-语言模型的类别尾部覆盖不足问题
机构 * Indian Institute of Technology Indore(印度理工学院印多雷分校)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.LG
AI总结 本文针对临床分布偏移下医学VLMs的类别尾部覆盖不足问题,提出CALCoDe方法,在多个偏移场景和骨干网络上实现了所有设置下边际和最差类别覆盖度均达0.95的最优表现。
Comments 26 pages; supplementary material included
AREA3D: 带有统一前馈3D感知和视觉-语言引导的主动重建代理
机构 * Southern University of Science and Technology(南方科技大学) ; Harvard University(哈佛大学) ; California Institute of Technology(加州理工学院) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 AREA3D通过统一前馈3D感知与视觉-语言引导,实现高效主动3D重建,尤其在稀疏视角下提升重建精度。
Journal ref Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister. The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)), 2026
形式主义陷阱:社会负荷下作为评判者的大语言模型是否会被共识模仿蒙蔽?
机构 * University of Waterloo(滑铁卢大学)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 该研究提出Agentic形式主义陷阱与评估失调指数,通过多领域轨迹分析揭示作为评判者的大语言模型易受句法触发影响,且该漏洞与领域无关,需架构特定的警戒过滤器。
更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制
机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) ; Zhejiang University(浙江大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)
AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。
Comments 9 pages, 4 figures, 6 tables. Preprint
SatEdit:基于VLM引导的区域标注的掩码条件卫星图像编辑
专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV
AI总结 SatEdit是基于VLM引导区域标注的卫星图像编辑框架,通过未标注图像构建监督信号,经LoRA微调后在对比中实现最高掩码区域语义对齐,为卫星图像编辑提供了数据高效的可行方案。
Comments 14 pages, 5 figures
用于持续指令微调的渐进式多模态对齐
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences(中国科学院脑科学与智能技术卓越创新中心) ; Kyoto University(京都大学) ; Migu Culture Technology Co.,Ltd.(咪咕文化科技有限公司) ; State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与类脑智能技术国家重点实验室)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 针对多模态持续指令微调中投影器级遗忘问题,提出渐进式多模态对齐框架PMA,以亚线性参数增长平衡稳定性与可塑性,在多基准实验中提升了现有方法性能且适配多种MLLM主干。
Comments Accepted by ACM MM2026
注意力头中的角色断裂:理解和检测视觉语言模型中的幻觉
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract,abstract_cn);分类 cs.CV
AI总结 该研究提出注意力头的角色断裂现象,构建无需微调的轻量级线性检测器,在6个VLMs和4个基准上平均AUROC达93.23,可检测VLM幻觉并支持干预操作。
MoRoute:面向上下文多模态视频生成的动态路由
机构 * Sun Yat-sen University(中山大学) ; HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。
Comments Project page: https://orange-3dv-team.github.io/MoRoute/
WorldDiT:用于世界和动作建模的统一扩散架构
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.LG
AI总结 研究提出WorldDiT统一扩散架构,结合动作生成与视觉世界建模,不依赖大型预训练VLM动作主干,在四个LIBERO模拟套件中表现出色,处于帕累托前沿,为未来扩展研究提供了低于十亿参数的基线。
Comments 9 pages, 4 figures
教会视频生成器记忆:为不可见状态演化引出动态记忆
机构 * Applied Intuition(应用直觉) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对视频生成模型在观测中断时状态冻结的问题,提出ReMind框架,通过面向记忆的数据构建、事件感知训练和缓存适配,利用KV缓存机制实现动态记忆,在STEVO-Bench和恢复任务上取得最佳成绩。
裁决式字幕生成:用于严格零样本图像字幕生成的多智能体对齐评分与共识蒸馏束仲裁
机构 * AI Platform OneNexus, OneMount(OneMount AI平台OneNexus) ; School of Electronic Engineering, Soongsil University(崇实大学电子工程学院) ; MoAdata(MoAdata公司) ; University of Economics Ho Chi Minh City (UEH)(胡志明市经济大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出裁决式字幕生成多智能体框架,通过多阶段对齐评分与共识蒸馏重排序,在不微调IFCap的情况下,显著提升COCO等数据集的零样本图像字幕生成性能,且可跨数据集迁移。
面向距离的软提示学习用于多模态愉悦-唤醒估计
机构 * Graduate School of Automobile and Mobility(汽车与移动研究生院) ; Department of Automobile and IT Convergence(汽车与IT融合系)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出一种多模态框架,通过引入距离感知的软提示学习,提升多模态愉悦-唤醒估计的精度,在无约束场景中取得良好效果。
Comments 8pages
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 5294-5301
基于Aries实验框架重新思考智能体服务系统的AI云基础设施
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 该研究针对自主智能体对传统LLM服务的挑战,提出Aries全栈实验框架,通过实验揭示服务系统的关键瓶颈,探讨智能体原生服务系统的设计愿景。
ZeroR@CHiPSAL 2026:用于尼泊尔表情包分类的对比学习两阶段视觉-语言适配
机构 * Pulchowk Campus, Institute of Engineering, Tribhuvan University(特里布万大学工程学院普尔乔克校区)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 该研究针对尼泊尔表情包多模态仇恨言论与情感检测任务,适配RA-HMD框架,采用两阶段视觉-语言对比学习方法,取得两项任务的优异排名,为低资源南亚语言适配大模型提供了见解。
Comments 9 pages, 2 figures, system description paper for the CHiPSAL 2026 shared task at LREC 2026
Journal ref Proceedings of the Second Workshop on Challenges in Processing South Asian Languages (CHiPSAL 2026) @ LREC 2026, pages 275-283, Palma, Mallorca, Spain, 16 May 2026. ELRA Language Resources Association (ELRA). ISBN 978-2-493814-66-1
PMC-InterCPT:重新思考用于多模态持续预训练的医学交错数据
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Sun Yat-sen University(中山大学) ; InfiX.ai ; PolyU-Daya Bay Technology and Innovation Research Institute(PolyU-大亚湾技术与创新研究院)
专题命中 VLM训练与架构 :LLaVA(abstract)
AI总结 针对医学多模态持续预训练中图像-文本对数据存在的上下文缺失、结构噪声等问题,提出PMC-InterCPT交错语料库,通过恢复缺失标题、清洗文本、重建交错样本及LLM监督过滤,结合模态感知重采样,有效提升医学与通用多模态性能。
FriendBench:人类与多模态大语言模型的二元熟悉度推理基准
机构 * Fluid Concepts Research(流体概念研究机构)
专题命中 其他VLM :multimodal large language model(title);分类 cs.CV、cs.AI
AI总结 该研究推出FriendBench基准,通过20秒二元破冰对话片段推断两人熟悉度,对比7家公司26个模型与人类的表现,发现模型与人类准确率无统计差异但先验倾向不同,且仅人类能从可见行为中获益,同时发布了相关资源。
Comments 15 pages, 3 figures
用于小样本遥感场景分类的局部一致直推式信息最大化
机构 * ICTEAM, UCLouvain(天主教鲁汶大学 ICTEAM 研究所)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 针对小样本遥感场景分类问题,提出LC-TIM方法,融合多源遥感基础模型亲和图,建立首个直推式小样本遥感场景分类基准,实验表明其性能优于现有方法。
Comments Accepted at ECCVW2026